Uploads from Ганна Пилєва: про дані, технології і карʼєру в ІТ

Watch and track your favorite playlist.

Curated by: Ганна Пилєва: про дані, технології і карʼєру в ІТ (218 videos)


Currently Playing: Топ 5 питань на співбесіді ML-Engineer і як їх не завалити

*Безкоштовний міні-курс «Як увійти в ML з потенціалом ЗП до $12к/міс»* 👉 https://www.dataloves.academy/mini-courses/yak-uviyti-v-ml Топ-5 питань, які ставлять на кожній співбесіді ML-Engineer — і як на них відповідати, щоб потрапити в топ-20% кандидатів. Ці питання повторюються знову і знову — у FAANG, в українських продуктових компаніях і скрізь між ними. Я проходила понад 100 співбесід, зокрема в Meta і Google, і знаю, де люди найчастіше зафейлюють. *Що дізнаєтесь у відео:* — Bias vs Variance Tradeoff: як пояснити глибоко, а не поверхнево — Як зменшити bias і variance — конкретні техніки з прикладами — Overfitting: що це, чому виникає і як боротися (регуляризація, dropout, early stopping) — Feature Engineering: чому 80% цінності — в даних і ознаках, а не в архітектурі — Метрики оцінки моделі та парадокс accuracy — на прикладі з медициною — ML System Design і MLOps: що треба знати навіть джуніору у 2026 році — Як відповідати на питання про зарплату і не м'ятися — Як правильно розподілити час на підготовку до ML-співбесіди *Таймкоди:* 0:00 Вступ: чому ці 5 питань повторюються скрізь 0:42 Питання 1. Bias-Variance Tradeoff 2:03 Як правильно відповідати на Bias-Variance 3:15 Техніки зменшення bias і variance 5:46 Ансамблеві методи: Bagging і Boosting 7:30 Курс Machine Learning для людей 10:08 Питання 2. Overfitting і як з ним боротися 10:49 Регуляризація L1 та L2 11:24 Dropout та ранній стоп 13:18 Шаблон ідеальної відповіді про overfitting 14:17 Питання 3. Feature Engineering 18:38 Як відповідати з прикладом з практики 20:14 Питання 4. Метрики оцінки моделі та парадокс accuracy 21:49 Як вибирати метрики під конкретну задачу 22:28 Питання 5. ML System Design і MLOps 25:14 Бонус: питання про зарплату на співбесіді 27:11 Як розподілити час на підготовку 29:03 Головна помилка на ML-співбесіді *КУРСИ ТА НАВЧАННЯ* Курс "Machine Learning для людей" 👉 https://www.dataloves.academy/courses/machine-learning Курс "Аналітик даних в IT" 👉 https://www.dataloves.academy/courses/analitik-danih 📌 *Підпишіться на канал для чесних інсайтів про кар'єру в IT, Data Science та Machine Learning* 💬 *Напишіть у коментарях: ви вже ходили на співбесіди на позицію ML-Engineer або Data Scientist? Як це пройшло?*

Video Transcript

Топ-пять питань, які завжди ставлять на співбесідах-інженерів та датасаєстів. Найм в AIML зріс на 88% за рік у 2025 році. Мl-інженери отримують на 12% більше за колег на інших IT-ролях. А ще цікавий факт, що половина назв шиї і вакансій не існувала ще рік тому. І при цьому при всій різноманітності компанії від Fang, тобто Facebook, Apple, Amazon, Nvidia, Google до українських продуктових компанії є п'ять питань, які повторюються знову і знову. Я це знаю, тому що я інженер з досвідом понад років IT і я проходила більше 100 співбесід за свою кар'єру, в тому числі в компанію Mме і в тому числі в компанію Google. Якщо ви зможете відповісти на оці п'ять питань впевнено і глибоко, ви вже в топ-20% кандидатів. Тож давайте розберемо, що це за питання і як на них відповідати. Перше питання - це bias variance tradeof. Це питання ставлять майже на кожній співбесіді і більшість кандидатів відповідають доволі поверхнево. Баяс - це помилка від надмірного спрощення. Тобто модель недонавчилася, вона не вловила всі патерни, вона надто тупенька. Варіанс - це помилка від надмірної чутливості до навчальних даних. Тобто модель перенавчилася, вона надто заточилася до навчальних даних. І вона фактично як той студент, який завчив всі білети. А якщо йому попадеться щось нове, то він не зможе в дати відповідь, тому що він тупо завчив відповіді на всі білети до екзамену. Модель просто все запам'ятала. Аналогія до студента із високим Баяз - це людина, яка прочитала лише зміст підручника і відповідає дуже загально на будь-яке питання. Ну, а звисоким варіанansс - це студент, який ідеально все завчив прямо слово в слово, але крок вправо-вліво він вже губиться і взагалі нічого не може сформулювати. Ідеальний студент глибоко зрозумів концепції для того, щоб і узагальнювати, і відповідати точно. І оце буде нашою ідеальною моделлю в машинному навчанні, яку ми завжди намагаємося досягнути. Як відповідати правильно на співбесіді на оце питання bias variance tradeof? В першу чергу ми маємо показати, що ми розуміємо, що це за терміни і сказати, що high bias - це коли модель надто спрощено сприймає задачу і не донавчилися. А high variance - це коли модель перенавчилася. Далі маємо розказати, як зменшити bias і як зменшити варіанс. І також маємо зазначити, що чим більший варіанс, тим менший баяс. Тобто чим більше модель запам'ятовує дані, тим менше вона буде помилятися, принаймні на тренувальному наборі даних. Але нам все ж таки треба баланс. І от ми маємо досягнути цього балансу, де модель і достатньо добре розуміє дані, і достатньо добре генералізує. На практиці, як цього можна досягнути? Наприклад, з допомогою кросвалідації, коли ми ділимо наші дані на декілька фрагментів і навчаємо, наприклад, на чотирьох фрагментах, перевіряємо на п'ятому і так проходимося по всім комбінаціям з чотирьох і одного фрагментав, щоб всі наші дані побували і в тренуванні, і всі дані побували в тесті. Тоді ми можемо перевірити на всьому різноманітті наших даних, а як модель вміє передбачати і узагальнювати. Ну і техніки, як нам зменшити баяс, ускладнити модель. Тобто, якщо модель надто тупенька, треба аби в неї було більше потужності для того, щоб вона змогла розв'язати цю задачу, бо схоже, що в даних задача складніша, ніж та, яку може затащити поки що ця модель. Ми можемо або, якщо ми використовуємо просту архітектуру, наприклад, лінійну регресію, ми можемо додати ознак, ми можемо додати поліноміальних ознак, ми можемо використати іншу архітектуру, наприклад, дерева прийняття рішень або написати кастомну Neural Network і подивитися, як це вплине на якість моделі відносно тої метрики точності, яку ми використовуємо в цій задачі. Ми можемо також зменшити регуляризацію, бо регуляризація, е, - це спеціальний інструмент, який нам дозволяє підвищити генералізацію. І фактично це інструмент для спрощення моделі. А у нас, якщо хайбас, то вона і так занадто проста для цих даних. Ми можемо також модель довше тренувати. Тобто, якщо це кастомна нейронна мережа, часто ми її тренуємо по епохам, ми можемо просто продовжити тренування на більше епох і зазвичай за більшою кількістю епох модель донавчається. Але важливо її не перенавчити. Що нам робити, коли high variance, тобто модель перенавчилася? Нам, навпаки, треба модель спростити. Тут є такі техніки, як дропаут. Тобто ми фактично заплющуємо моделі очі в деяких місцях і вона не має можливості повністю запам'ятати всі дані. Також є регуляризація, коли ми штрафуємо модель занадто високі ваги. В ресрчі люди побачили, що коли надто високі ваги, то це означає, що модель вже так перенавчається. можемо додати даних, тому що тоді модель е потенційно не зможе запам'ятати аж всі дані. Тобто, якщо ми таким беремо кулемет і, е, стріляємо ним по 10ти рядочках в Екселі, то звісно, що модель зможе вивчити ці 10 рядочків. А якщо ми додамо, е, наприклад, хоча б 2 000 рядочків, то вже буде значно складніша моделі. Ми можемо також просто вибрати простішу архітектуру. Тобто, якщо ми обрали, наприклад, архітектуру типутрансформер, да, як прабатько chто GPT, для простої регресійної задачі може бути таке, що модель перенавчиться і, можливо, нам достатньо використовувати звичайну лінійну регресію і це буде ще і швидше на інференсі, тобто модель буде швидше видавати результат на етапі передбачення, коли ми її використовуємо в продакшені, і вона не перенавчиться. І також при відповіді на це питання обов'язково треба згадати про ансамблеві техніки. Є най серед найпопулярніших - це бегінг і бустінг. Беgінг - це коли ми беремо і сампліюємо з усього нашого набору даних під набори. І на кожному піднаборі ми навчаємо просту модель, а потім об'єднуємо результати цих простих моделей в загальну відповідь. Тобто вони ніби голосують, да, скільки ми будемо передбачати на нових даних. І таким чином ми маємо декілька не дуже розумних експертів, але разом вони можуть проголосувати за краще рішення. І беінг - це спосіб нам зменшити варіанс, тому що ми використовуємо простих експертів і потім беремо їх у сеередину метрику. І це нам дозволяє отримати таку модель, яка не перенавчається. А друга техніка популярна для ансамблювання - це бустинг. Бустинг - це коли ми навчили одну модель на даних, зафіксували, де вона помиляється, і потім навчаємо наступну модель. з акцентом на тому, щоб вона краще передбачала на даних, де попередня помилялася. І таким чином ми дуже сильно бустимо точність. І таким чином це техніка боротьби з high bias. І ми знижуємо bias. Тобто ми дозволяємо зробити більш точну модель, яка більш розумна. І в техніці буosting є такі відомі алгоритми. Це XG Boost, наприклад. Це бустинг, е, дерев Extreme Gradient Boosting. Він схильний перенавчатися, але тим не менш його дуже часто використовують на табличних даних і в багатьох сучасних навіть змаганнях, тому що він показує хороший баланс часто на доволі складних даних між тим, щоби модель і добре зрозуміла задачу, і не перенавчилася. Ну, але треба слідкувати за метриками на тренувальному і тестувальному наборі даних. Якщо ви зараз нічого не зрозуміли, це нормально. скоріш за все, ви на даний момент не дуже глибоко розумієтеся у машинному навчанні. Якщо це так, якщо ви хотіли би увійти в машинне навчання, почати працювати з тренуванням моделей машинного навчання, то запрошую вас ознайомитися з програмою мого курсу машини для людей. Це курс професія, який триває 8 місяців і це таке повноцінне навчання, де ми починаємо з основ машинного навчання. Разом з математикою я даю все з нуля. Ми навіть починаємо з програмування на Python. Якщо ви небагато програмували на Python, у вас буде можливість за там прискорено, але тим не менше в'їхати в синтаксис Python і потім почати використовувати машини навчання. Ми вчимося від роботи з табличними даними, від найпростіших технік, таких як лінійна та логістична регресія до складніших моделей, дерева. Оці самі ансамблеві методи ми розглядаємо. Ми вчимося, як воно все працює під капотом і потім переходимо до інших підходів і інших задач. Вивчаємо, як працювати з часовими рядами Serious Analis, як будувати кастомні нейронні мережі, як працювати з текстом, тобто вивчаємо, як раніше працювали з текстом через рекурентні мережі, як зараз працює з текстом, з трансформерами, як працювати з мовними моделями, великими ЛМАми. е, вивчаємо спеціальні технології для роботи з цими моделями. І також обов'язково у нас є модуль з деплойменту, де я розказую принципово, як деплоїти моделі, аби мої учні це розуміли. І вчимося писати, е, API та також деплойти модель зі спеціальним сервісом, де буде у моделі графічний інтерфейс. На виході ви будете мати аж три проекти готових в своє портфоліо і будете повністю готові до пошуку роботи. І власне багато моїх учнів знаходять роботу після мого навчання. Тож справді круте навчання, побудоване з мого досвіду, як машин інженера. Тож переходьте на мій сайт dataloves.academy. Там є повна інформація вичерпна про програму, про результати учнів, про те, які проекти створюють учні, можна подивитися. А якщо ви поки що не розумієте, для чого взагалі це машина навчання, то в мене є крутий безкоштовний міні-курс на три уроки, де я розказую, чим привабливалася ця сфера і кому вона може підійти та з чого в ній почати, от послідовно, що за чим вивчати. Також лишаю посилання на нього в описі під цим відео. А просто реєструєтеся і в Телеграмі переглядаєте і потім поділіться, будь ласка, зі мною в Інстаграмі, що ви з нього взяли. Можливо, це буде такий поворотний момент, коли ви вирішите, що machine learning - це ваш наступний крок в кар'єрі. А це насправді дуже крутий напрям, в якому високі зарплати, цікаві задачі. Ну, але, да, треба вміти відповідати на тріки питання, які ми сьогодні розглядаємо. Переходимо до наступного питання і це оверфітинг та як з ним боротися. Фактично ми вже відповіли на нього, коли дискутували про high variance, тобто коли модель перенавчилася. Але саме от в такому формулюванні, що таке оверфіг і як з ним боротися, ну, надзвичайно часто зустрічається питання. Просто це до смішного. А здається іноді, що от просто вивчаєш відповідь на це питання і все, це топперформер нане інтерв'ю. Але тим не менш люди часто варяться. І так, що таке перенавчання? Це коли модель чудово працює на тренувальних даних і погано на нових. Як з цим боротися? Тобто це у нас той самий студент, який завчив всі а білети, але коли якесь трошечки інше питання, то він зафейлить. Як боротися? Перше - це Ельванрегуляризація. В цьому питанні обов'язково я би її зазначила. це ласорегуляризація, яка штрафує великі ваги і зводить деякі до нуля, фактично відсіваючи непотрібні ознаки. Тобто іноді LV регуляризацію можуть навіть використовувати для feature selection, коли нам треба з, наприклад, 200 ознак обрати лише 10 найвпливовіших для нашої задачі. А друге - це L2 регуляризація Ridge. Вона стискає всі ваги, але не до нуля. Тобто вона робить модуль ваг менше. Наступна техніка спрощення моделі і відповідно зменшення перетренування - це дропаут. А під час тренування ми випадково вимикаємо, наприклад, 20 50% нейронів. Тобто заплющуємо в моделі трошки очі. І це як ніби ми готуємося до футбольного матча, але тренуємося без декількох гравців. Команда стає сильнішою, бо кожен вчиться грати різні ролі. Я не сильно експерт в футболі, чесно скажу, але мені здається, що це доволі робоча стратегія. Наступний підхід для боротьби з перенавчанням - це ранній стоп. Як я вже казала, коли ми довше навчаємо модель, вона у нас стає розумнішою і це хороший спосіб боротися з хаbias. Але якщо у нас модель перенавчається, то навпаки варто її раніше зупинити, щоб вона не перенавчилася. Просто зупиняємо тренування після там кількох ітерацій або епох. І можна навіть відстежувати, коли у нас там валідаційна помилка починає дуже сильно зростати. Що таке тренування і валідація? У нас завжди в машинному навчанні є набір даних, на яких ми тренуємося, і набір даних, які не бачила модель, на яких ми валідуємося. І якраз така розбивка нам дозволяє дізнатися, а як буде працювати модель на зовсім нових даних. Ми завжди модель машинного навчання тренуємо для того, щоб вона у нас передбачала на нових даних, да? Наприклад, от уявіть, що ви натренували модель вибору хлопця собі і ви натренували модель на певних даних, де був хлопець, були певні до нього критерії і був меч або не меч. І вам треба, бачачи нового кандидата, визначати, буде меч не меч. І от нам треба розуміти, модель просто запам'ятала навчальні дані, вона нам зараз видає якусь ахінею, чи вона таки грунтовно розуміє всю проблематику ситуації. І ще один спосіб боротьби з перетренуванням, який обов'язково треба згадати у відповідь на це питання - це кросвалідація. А як я вже розказувала, це ми перевіряємо модель на кількох розбивках даних і можна там детальніше заглибитися, що таке кросвалідація. До речі, в моєму курсільник для людей є окремий урок, присвячений кросвалідації. І ми обов'язково відпрацьовуємо все на практиці і дивимося, як це працює в експериментах та як впливає на якість моделі. Який може бути шаблон відповіді? А можна сказати, що перенавчання виникає, коли модель вивчає дані, в тому числі шум, але не вловлює закономірність і відповідно погано генералізує. І я можу запобігти цьому через регуляризацію, кросвалідацію, дропаут і ранній стоп, early stoping, а також через забезпечення достатньої кількості даних, бо збільшення детасету - це теж спосіб боротьби з перетренуванням. І обов'язково в цій відповіді зазначте, що в своєму останньому проекті я помітив перенавчання на 15-й епосі, валідаційний лос почав зростати. І я застосував, наприклад, ранній стоп + L2 регуляризацію. Це покращило результат на валідаційних даних на стільки-то відсотках. Оце буде ідеальна відповідь. Обов'язково підкріпляйте кейсом з практики. Це одразу показує, що ви не тільки навчалися на курсах, а ще й розв'язували реальні проекти. І це працює як, якщо ви вже маєте досвід в індустрії, так, якщо ви тільки завершили курси, але ви ж робили якісь проекти самостійно, ви маєте показати, з якими реальними ситуаціями ви стикалися. Третє питання, яке часто задають на інтерв'ю - це Feature engering. Доволі широка тема, насправді, але воно перевіряє, який у вас був досвід. Ви маєте показати, що ви взагалі знаєте про Future engніering і як ви його використовували у своїй практиці, як ви створювали нові ознаки. Світчинджен - це спосіб нам створювати нові ознаки, які потенційно покращать якість моделі. Зазвичай це задають в питаннях на позицію, яка передбачає роботу з табличними даними, наприклад, там Front detection, передбачення чарну клієнта або передбачення ЛТВ. І в таких задачах суть не в алгоритмі, а суть в тому, як ви заінженерите фічі з вашого розуміння задачі. І отакі задачі дуже класно розв'язують люди з попереднім бекграундом в аналітиці. Якщо ви хочете з аналітики свічнутися в machine learningг, то я вам надзвичайно рекомендую посидіти і прямо розв'язати можливо для свого портфоліо, якщо в вашому курсі не передбачені такі задачі. А одну з задач, які зараз користуються великим попитом, да, це fr detction, це передбачення чарно, передбачення ЛТВ. От щось на клієнтській аналітиці, де треба глибоке розуміння процесів і домену для того, аби побудувати модель. Бо зазвичай, коли у вас є вже класні дані, ви наінженерили класні фічі, ви їх зібрали з бази даних і сQльчиком витягнули, то потім ви тренуєте просто, ну, пробуєте декілька моделей, там, регресії пробуєте для відправної точки, потім пробуєте складніші моделі, пробуєте якийсь XG Boost, можливо будуєте якусь кастомну нейронку і у вас вже готова вирішена задача. Але якщо у вас дані таке собі і вони не описують повністю профіль клієнта, наприклад, який може бути потенційно, то навіть з найкращою моделлю ви класно не розв'яжете цю задачу. Ну, а взагалі, що в цьому питанні от точно варто згадати? Перше - це те, що ми можемо витягувати часові ознаки з дат. День, тижня, який це, наприклад, перший, другий, третій, сьомий або це будній день чи вихідний. Це може бути навіть година доби, да, якщо ми аналізуємо продажі, хочемо вловити динаміку, як протягом дня ідуть продажі. А чи це день святковий, який це сезон, високий чи низький, або там це літо-зима, тому що високий чи низький сезон - це ми вже вносимо своє розуміння домену, а а літозима - це модель сама може вивчити, який сезон є високий, а на який низький, коли у нас є достатньо багато даних. А ми можемо створювати інтерактивні ознаки, наприклад, ціна домножена на кількість. І вони будуть дійсно допоміжними. Тобто, якщо у вас є окрема ознака ціна, окрема кількість і окремо ви створите ознаку ціна домножена кількість і ви будете використовувати модель, наприклад, лінійної регресії, це буде хороший підхід, тому що оця інтерактивна ознака в даному випадку допоможе. Якщо ви використовуєте якусь кастомну нейронну мережу і ще і глибоку, то там не буде в цьому сенсу, тому що там і так переплітаються між собою ознаки в процесі навчання цієї нейронної мережі. Oneхоhingнкоing, наприклад, для категорій. Е, ну, це така дуже базова техніка, як нам можна включити в модель категоріальні, е, ознаки. Можна в якості фіченнериer використовувати PCA для зменшення розмірності. Можна використати feature importance. Також варто згадати про трансформації фічей. Тобто іноді ми можемо пролаграфувати таргет, наприклад, або зробити скейлінг наших фічей і розказати, як це буде працювати в цій задачі. Якщо ви цього, е, не знаєте, не розумієте, запрошую знову ж таки на мій курс, бо ми там багато працюємо з, е, різними способами fit engніering. Future engриerings - це не лише про feature generation, це є ще й про підготовку ознак для того, аби модель працювала краще. І для кожної моделі буде різна підготовка ознак, в тому числі підготовка категоріальних даних. Яким чином ми їх подаємо в модель - це теж частина fature engніering. Але, звісно, тут є і аналітична оця складова, про яку я проговорили. ваше вміння генерувати з розуміння домену нові ознаки. І також Future Selection навіть відноситься до FA engриering, тому що коли ви генерували, скажімо, 500 ознак, модель може бути заскладною. Та і нам, аби підтримувати це рішення, треба буде забагато ету щоразу обчислювати 500 ознак. І варто розказати також про те, що ви вмієте там future importance використовувати і фільтрувати з 500 ознак, наприклад, лі тільки 50 і потім вже робити prodдакш-модель, яка працює так само, як модель на 500 ознаках, але значно простіша, легша і інференс неї буде швидший, і підготовка ознак буде швидше на співбесіді. Як відповідати на таке питання? Обов'язково зазначте свій приклад з практики. Наприклад, у проекті прогнозування відтоку. Ви навіть можете не зазначати, це було комерційний проект чи ні. Це такий лайфхак. Якщо у вас немає комерційного досвіду, кажете, що у проекті протезування відтоку клієнтів я створив такі ознаки. Е, наприклад, кількість днів з останньої покупки, частота покупок цього клієнта, чи він оформив, наприклад, підписку, яко якщо у вас є підписка, чи він підв'язав картку і так далі, і так далі. От може бути багато різних ознак. Далі зазначаємо, наприклад, які ознаки виявилися найвпливовішими. І розкажіть, що от ви проаналізували і вирішили, що це доволі такий sense. І яку модель ви врешті отримали і чи ви її впровадили. Прям повністю покажіть, як ви вмієте доводити задачу до кінця. І це буде класна відповідь. Також можна розказати, яку саме модель ви використовували. Наприклад, ви там врешті використали градієнентний бустинг. І в даному випадку, оскільки питання було не саме про це, можна спитати, можливо вам цікаво, аби я більше розповів про те, які ще моделі я там пробував або пробувала. Це покаже інтерв'юєру, що ви розумієте, що в реальному машинінгу 80% цінності - це в даних і ознаках, а не в архітектурі моделі. Ну, принаймні, коли ми працюємо з табличними даними. Ну, насправді, навіть в комп'ютер Віжені і в роботі з текстовими даними теж є таке прислів'я в а статистиці: Garbage in, garbage out. Якщо ви даєте погані дані на вхід, то ви отримуєте поганий результат. І важливо показати, що ви в практиці вже з цим стикалися. До речі, гарний приклад, це якщо ви працюєте багато зтом GPT, як і я, то ви помічали, що якщо ми даємо надто загальний промт, то нам видає модель і надто загальний результат. І в роботі з більш широким набором моделе машинного навчання все так само. Четверте, а популярне питання на інтерв'ю - це метрики оцінки моделі і Paradкс accuracy. Теж надзвичайно часто зустрічається на інтерв'ю. І тут нам треба розказати про те, як оцінювати різні моделі. Зазвичай тут будуть питати, як оцінювати моделі класифікації, наприклад, бінарної класифікації. І обов'язково тут треба розказати про те, що таке precision recall і f1 score. Не буду зараз розказувати, бо це нам треба тут заглибитися сильно в теорію машинного навчання. Але суть в тому, що ви маєте показати на прикладі, чому звичайний accorac, тобто підрахунок, де ми вгадали кла, де не вгадали, не працює у задачах бінарної класифікації. Ну і та така вам трошки затравочка. Це от уявіть, що ми з вами класифікуємо, чи буде людина на основі аналізів, чи вона хвора на рак. І уявіть, що у нас 99% даних кажуть, що людина не хвора, бо в цілому у нас більше не хворих, ніж хворих. І 1% даних каже, що людина а таки хвора. І от уявіть, що ми всім людям передбачили, що вони не хворі і у нас точність буде 99%. Але чи це хороша модель? Точно ні. Тому що ми не вгадали тих людей, які були насправді хворі. І а у нас задача була така, щоби навчитися виявляти хворих. Тож тут є спеціальні підходи, як нам грамотніше оцінювати моделі в задачах, е, бінарної класифікації. Ну і є інші типи задач, про які тут може іти мова. Якщо ви йдете на співбесіду, де передбачається ваше розуміння, як будувати рекомендаційні системи, то там будуть говорити про метрики якості рекомендаційних систем. І треба підготуватися. Завжди вивчайте профіль компанії, чим вона займається, і вакансію. Можна прямо вакансію закинути в чат GPT і попросити його поміркувати, які можуть бути питання на співбесіді, щоб ви собі повторили, бо я вам скажу, що коли дуже багато досвіду, я працювала з різними різними задачами, я коли дубеу, мені реально стрмно не згадати, бо я вже стільки з усім працювала, що, ну, от реально з чимось працювала давніше, з чимось працювала прямо зараз. І бувало таке, що я просто не відповідаю на питання, бо, ну, ну це було так давно. Але от людині зараз це цікаво, щоб я розказала, як працює детально градієнтний бустінг під капот. І п'яте питання. Це може бути на ML System Design і ML Ops. Це питання часто зустрічається на Bit+ рівні, але також на Juniніор позицію може зустрічатися, тому що задача інтерв'юєра завжди - це виявити обмеження ваших знань. Це абсолютно нормально, що ви на щось не відповісте на інтерв'ю. І зазвичай джуніор фахівці дуже погано розбираються в деплойменті. І тому скоріш за все вам зададуть це питання і подивляться, ну, наскільки ви все-таки в ньому розбираєтеся. Спойлер: на даний момент в 2026 році все-таки Джуніору треба розбиратися, ну, хоча б базово в деплойменті, розуміти, які способи існують і бажано ще мати задеплоєну модель в своєму портфоліо, бо нікому зараз не треба людина, яка тільки вміє тренувати модельки в Юпітерноутбуці, адже, ну, базово це може зробити і Клод. Питання може бути таке, наприклад, спроектуйте рекомендаційну систему для Spotify. На українському ринку зазвичай питання все-таки буде формулюватися, виходячи з тої компанії, в яку ви співбесідуєтеся. Наприклад, ми там співбесідуємося в компанію VI і вам от кажуть: "От дивіться, у нас є така-то задача, у нас є такі-то обмеження, така-то ситуація, от як ви будете розв'язувати таку задачу?" І вам прямо треба розказати, як ви побудуєте систему. Можливо, там буде декілька-моделей, можливо, там будуть якісь челенджі. От максимально це розказати. Це покаже ваше розуміння, вашу глибину розуміння, як будувати системи. І це відноситься до ML system. Я обожнюю такі питання, бо одразу видно, як людина орієнтується в нових задачах або не орієнтується. Вот. А MLOPS - це вже про деплоймент, підтримку моделі і розуміння, що взагалі відбувається з моделлю після тренування. І тут ви маєте повністю розуміти, як от і до працювати з моделлю. Тобто спочатку ми там визначаємо проблему, потім будуємо data pйплаeline, потім вибираємо і тренуємо модель, проводимо експерименти, оцінюємо модель. А можливо там у нас будуть якісь офлайн метрики, можливо ми будемо проводити абетестування. Ми деплоємо модель, ми моніторимо якість моделі, визначаємо дрифт моделі, вміємо визначати і знаємо, що таке дрифт моделі. Там встановлюємо певні тригери для перенавчання і підтримка моделі. От що вона може включати? MLOPS також може включати ваше розуміння, а як версіонувати моделі, як версіонувати дані між експериментами, яким може бути CCD для моделей, які існують фічестори, взагалі для чого вони існують, що таке контейнеризація в процесі деплойменту mlмоделей. Я до слова все це розказую в себе на модулі з деплойменту в курсі з машини для людей. Запрошую прийти на мій курс, якщо ви хочете, наприклад, структурувати знання з мешнга. От там ви пройшли якийсь базовий курс, да, по емелю, але хочете дійти до рівня, де ви вмієте прямо самостійно розв'язати задачу і е вмієте її завести у продакшн, принаймні в базовому варіанті, і розумієте, що з нею взагалі робити після тренування. Оце у вас точно буде після мого навчання. Бонус. Ще одне питання, яке не можу лишити без уваги - це про зарплати. А значить для контексту, да, у нас машині deep learning інженер в Україні за даними доу отримає 2350 $. Це медіанна зарплата. Медіанна. Розуміємо, ті, хто трошки розуміються в аналізі даних, що це 50% людей отримують менше, 50% людей більше. Але тут виведу графік і покажу, що є люди, які отримують і 5, і 7 і більше тисяч доларів. Дата інженер, медіана зарплата 3525 - це значення, отримані на основі опитувань людей. Тобто виходить, що між різними опитуваннями можуть змінюватися ці значення, тому що різні люди заповнюють щоразу опитування. А в США медіана зарплата буде 260 000 на рік з бонусами. А в Google, наприклад, машиних Інженер буде отримувати від 199 до 743 000 $ на рік. Просто вдумайтеся в цю цифру. Реально в Open AI навіть є позиції, де пропонують мільйон тисяч доларів на рік. А, ну звісно, в Open AI складно потрапити, але це можливо. Є така перспектива, в якій ще сфері, в наймі, ви будете отримувати стільки грошей, навіть якщо ви живете в США і багато витрачаєте на те, щоб, ну, там жити, ну, більш ніж в Україні. Отак от. І на співбесіді у вас можуть задати питання про зарплату і ви маєте бути, а, готові до неї. Тому обов'язково аналізуйте ринок і заодно ви так покажете, що ви знаєте собі ціну. І найгірше, що може бути, коли у вас питають про зарплату, це ви таки починаєте м'ятися. Ну, я не знаю, там скільки спитати. От якщо у вас є ментор, е, як я є у своїх студентів на курсільоних для людей, запитайте в нього: "А скільки з вашим досвідом доречно просити зарплату?" Тому що якщо ви тільки починаєте мешнінгу, не факт, що у вас буде мінімальна зарплата, там типу 600 чи 800 $ла. Якщо у вас вже був попередній релевантний досвід, то у вас може бути зарплата і 10000, 10000 або можливо навіть дві, якщо ви робили щось дуже релевантне і суміжне. Але треба, аби якась досвідчена людина вам підказала. Загалом, як я раджу готуватися до machine learningнінг співбесіди. 35% часу на підготовку - це широта ель знань. 25% - це глибина у вашій спеціалізації. Спеціалізація з'являється з досвідом, але зазвичай на старті ви, коли проходите таке комплексне навчання, як, наприклад, моє, ви вже будете розуміти, що вам ближче вам робота з текстами, з таблицями чи з візуальною інформацією. Зазвичай це основні такі треки. Тобто, звісно, є там квантові комп'ютери, є робота з сч і з часу ви можете туди перейти, але я би починала свою кар'єру все-таки з вибору одного з треків, які є більш популярними, тому що там просто більше вакансій і ви швидше знайдете роботу. І 40% часу я б поділа на system design. Ну, system design - це те, що, знаєте, як талант не проп'єш, але якщо його нема, то нема. Тобто він напрацьовується лише в вашій практиці. І я, наприклад, в своєму курсі даю більше 23х задач. Студенти розв'язують. Це в лекціях і в домашніх роботах. Це величезний об'єм практики. Не навчитися просто неможливо, якщо ви робите домашки. Вот. Розв'язуйте задачі і тоді будете вміти відповідати на System Design Questions. Також я вам дуже рекомендую вчитися пояснювати концепції вголос, наприклад, перед дзеркалом. Наче ви когось навчаєте. Або прям візьміть і підіть когось нав навчіть. Знайдіть собі менці, якому будете там розказувати те, що ви вже знаєте. І також підготуйте два-три проекти з конкретним бізнес-ефектом, виміряних в цифрах. Я розумію, що це складно, якщо у вас не було ще, е, індустріального досвіду. А поміркуйте, можливо, це можуть бути проекти з фрілансу, це можуть бути задачі зг. Ну, якщо вже немає задач з бізнес-ефектом, то просто розказуйте про те, як ви розв'язали якусь задачу і за допомогою своїх знань ви змогли поліпшити значно модель. Тобто перша ітерація була там точні 60%, а ви змогли її потім підняти там до 87. Головна помилка на AL співбесіді - це зазубрити відповіді без розуміння, тобто бути як перенавчена модель машинного навчання. Інтер'єр це зможе виявити досвідчений. Я завжди йду вглиб. Я задаю питання і потім задаю уточнення, уточення, уточення, поки я не спущусь до обмежень знань кандидата. І якщо вони будуть надто рано, то це буде поганий сигнал. Тож розібрали з вами основні питання, які задають на кожному мишиньоних інтерв'ю. Сподіваюся, вам було корисно. Ставте лайк, якщо вам сподобалося це відео. Напишіть в коментарях, чи ви вже ходили на співбесіди на позицію машинок інженера, я інженер чи датаса scienтиста. І як це пройшло. А якщо ви хочете системно навчитися машинного навчання, так аби дійсно це вміти використовувати в своїх проєктах, то запрошую до навчання в моїй Data Loes Academy, де викладаю я і там більше 200 років в курсі про машини навчання. А все, побачимося в наступному відео.

Tracks in this Playlist