Машинне навчання

Глосарій

Сто тридцять шість понять курсу — українською та англійською, кожне на одне-два речення й з посиланням на тему, де його вводять. Термінологія складалась по ходу сорока лекцій; тут вона зведена докупи й узгоджена.

Курс писався сорока темами підряд, і термін уперше зʼявлявся там, де в ньому виникала потреба. Через це одне й те саме слово інколи вводиться в темі 04, а по-справжньому знадобиться аж у темі 34 — і згадати, що воно означало, буває ніде. Ця сторінка закриває саме цю дірку: тут зібрано всі поняття, які курс справді пояснює, а не згадує мимохідь.

Заголовок статті — українською, якщо український відповідник усталений (ознака, таргет, перенавчання), і англійською там, де українського немає або він гірший за оригінал (dropout, learning rate). Другий варіант завжди стоїть поруч, тож знайти термін можна з будь-якого боку.

Означення — одне-два речення без математики. Де без формули не обійтися, вона наведена в найпростішому вигляді, і кожен її символ названо словами.

Рядок унизу статті веде на тему, у якій поняття вводиться. Бурштинова врізка — попередження про типову плутанину.

ЛітераА

Агент · agent

Той, хто ухвалює рішення й вчиться на їхніх наслідках. Агент бачить стан — опис ситуації, у якій він зараз, — обирає дію, а середовище у відповідь повертає число (винагороду) і новий стан.

Два слова поруч. Ланцюжок таких переходів від початку до кінця — епізод: партія в шахи, поїздка робота від дверей до дверей, сесія користувача. А вся конструкція «стани, дії, винагороди, переходи» зветься марковським процесом ухвалення рішень: «марковський» означає, що стан містить усе потрібне для рішення й минуле вже не додає інформації.

Тема 39 · Навчання з підкріпленням

Активація, функція активації · activation function

Функція, крізь яку нейрон пропускає зважену суму своїх входів, перш ніж віддати результат далі. Без неї будь-яка кількість шарів згортається в один — тому саме активація, а не глибина, робить мережу здатною описувати криві межі.

Теми 30 · Нейрон і перцептрон, 33 · Активації та ініціалізація

Аномалія · anomaly, outlier

Обʼєкт, не схожий на решту вибірки. Слово покриває три різні речі — помилку в даних, рідкісну справжню подію й навмисне зловживання, — і від того, яка з них тобі потрібна, залежить і метод, і поріг, і ціна помилки.

Плутанина. «Дивне» й «шкідливе» — не одне й те саме. На дошці оголошень курсу найаномальніші рядки виявились чесними колекційними телефонами, а акуратно складене шахрайське оголошення не потрапило в жоден список.

Тема 14 · Пошук аномалій

Ансамбль · ensemble

Набір моделей, чиї відповіді зводять в одну — голосуванням більшості для класів або середнім для чисел. Виграш дає не кількість моделей, а їхня різноманітність: сто однакових копій дадуть рівно те саме, що одна.

Чому це працює. Теорема Кондорсе: якщо кожен учасник правий частіше ніж у половині випадків і помиляється незалежно від інших, точність більшості росте з кількістю учасників. Якщо ж кожен правий рідше ніж у половині — більшість помиляється дедалі впевненіше.

Тема 26 · Random Forest

ЛітераБ

Базова лінія · baseline

Навмисно дурна модель, яка не дивиться на ознаки взагалі: для класифікації — «завжди називай найчастіший клас», для регресії — «завжди називай середнє». Потрібна, щоб було з чим порівняти будь-яке отримане число.

Правило звіту. «Точність 94 %» не читається без другої половини — «а базова лінія дає 84 %». Якщо класів дуже нерівно, високий відсоток означає лише те, що один клас великий.

Теми 28 · Порівняння моделей, 29 · Наскрізний проєкт

Беггінг · bagging, bootstrap aggregating

Навчити багато однакових за типом моделей, кожну на своїй випадковій підвибірці з поверненням, і усереднити їхні відповіді. Прийом бʼє по дисперсії: окремі моделі гуляють від вибірки до вибірки, а їхнє середнє — уже майже ні.

Правопис. Канонічна назва одна — беггінг, із двома «г», як подвоєння в оригіналі (bagging); так пишуть теми 21, 25 і 26. Написання «бегінг» трапляється як варіант у сторонніх джерелах — це те саме слово.

Тема 26 · Random Forest

Бустинг · boosting

Ансамбль-конвеєр: моделі будуються по черзі, і кожна наступна вчиться не на початковій цілі, а на тому, що недорахували попередні. На відміну від беггінгу, бʼє по зміщенню й тому бере навмисно слабких учнів (weak learners) — дерева на три-вісім питань; крайній випадок, дерево з одним питанням, зветься пеньком (stump).

Головна відмінність від лісу. У лісі більше дерев ніколи не шкодить. У бустингу — шкодить: коли закономірність вибрана, наступні дерева вчаться на самому шумі, тому потрібна рання зупинка.

Тема 27 · Бустинг

Бутстреп · bootstrap

Витягування з наявних n обʼєктів рівно n штук із поверненням: хтось потрапляє двічі, хтось не потрапляє взагалі. Так з однієї вибірки роблять багато різних; у кожну потрапляє приблизно 63 % унікальних обʼєктів.

Тема 26 · Random Forest

ЛітераВ

Ваги · weights

Числа, які модель підбирає під час навчання; кожна вага показує, наскільки й у який бік своя ознака зсуває відповідь. Знак важливіший за величину: додатна вага означає «більше цієї ознаки — більше підстав сказати так».

Симптом перенавчання. Величезні ваги протилежних знаків, які майже гасять одна одну, — універсальний почерк перенавченої моделі: відповідь стає різницею двох гігантських чисел і тому нестійкою.

Теми 15 · Лінійна регресія, 23 · Регуляризація

Валідаційна вибірка · validation set

Частина даних, на якій ти обираєш між моделями й гіперпараметрами. Її дивляться десятки й сотні разів, тому її оцінка неминуче стає завищеною — і це нормально: її робота ранжувати варіанти, а не називати підсумкове число.

Тема 03 · Train / Validation / Test

Викид · outlier

Значення, помітно відірване від решти. Найпоширеніший спосіб їх позначити — правило міжквартильного розмаху; ще один — сильно скошений розподіл, який виправляють логарифмом замість видалення рядків.

Плутанина. Викид — не синонім помилки. Правило бачить лише те, що число велике; чи це одрук, чи справжнє рідкісне явище, розрізняє людина, яка дивиться на рядок цілком.

Теми 08 · Pandas і EDA, 09 · Передобробка даних

Вільний член · intercept

Доданок моделі, який не множиться на жодну ознаку: значення прогнозу, коли всі ознаки дорівнюють нулю. Потрібен, щоб пряма могла зсуватися вгору-вниз, а не була приречена проходити через початок координат.

Три назви одного числа. У лінійній та логістичній регресії курс зве його вільним членом, у нейроні — зсувом (bias). Це буквально та сама величина, просто в різних розділах вона отримала різні імена.

Тема 15 · Лінійна регресія

Винагорода · reward

Число, яким середовище оцінює зроблену агентом дію. Мета агента — не максимізувати його на кожному кроці окремо, а зробити якнайбільшою суму винагород за весь епізод; саме в цій різниці й полягає вся складність.

Пастка. Агент максимізує рівно те число, яке ви написали, а не те, що мали на увазі. Човен, якому нарахували очки за проміжні бонуси, навчився крутитись на місці замість того, щоб фінішувати.

Тема 39 · Навчання з підкріпленням

Витік даних · data leakage

Ситуація, коли до моделі під час навчання дісталась інформація, якої в момент реального прогнозу не існує: колонка-наслідок, підглянуте майбутнє або статистика, порахована разом із тестовими рядками.

Симптом один. Витік не дає ні помилки, ні попередження — він покращує метрику. Тому й діє правило: занадто добре — це помилка, поки не доведено протилежне.

Теми 03 · Train / Validation / Test, 08 · Pandas і EDA

Відношення шансів · odds ratio

Єдиний коректний спосіб прочитати коефіцієнт логістичної регресії: збільшення ознаки на одиницю множить шанси позитивного результату на сталу величину. Самі шанси — це відношення ймовірності події до ймовірності її відсутності.

Плутанина. Множник на шанси сталий, а зміна ймовірності — ні. Фраза «ознака додає 5 % імовірності» для логістичної регресії просто некоректна.

Тема 17 · Логістична регресія

ЛітераГ

Гіперпараметр · hyperparameter

Число або вибір, який людина задає до навчання й який керує тим, які параметри навчання знайде: кількість сусідів, глибина дерева, сила штрафу. Перевірка проста — чи змінилося б це число, якби алгоритмові дали інші дані.

Чому їх не вивчити разом із вагами. Гіперпараметр майже завжди керує складністю, а помилка на навчальних даних монотонно спадає зі складністю — тому такий підбір завжди впирався б у найскладніший варіант.

Тема 24 · Підбір гіперпараметрів

Градієнт · gradient

Не нове поняття, а просто список усіх похідних одразу — по одній на кожен параметр. Кожне число відповідає на побутове питання: якщо цей параметр трохи збільшити, помилка зросте чи впаде і наскільки різко.

Тема 16 · Градієнтний спуск

Градієнтний спуск · gradient descent

Спосіб навчати модель: порахувати градієнт, зсунути кожен параметр у бік, протилежний до його похідної, повторити. Довжину кроку задає окреме число — learning rate.

Не плутати зі зворотним поширенням. Це дві різні речі, які постійно змішують. Зворотне поширення лише рахує градієнт; градієнтний спуск бере готовий градієнт і робить крок. Замінити можна кожне окремо: спуск на Adam, а backprop — на чисельну похідну.

Тема 16 · Градієнтний спуск

ЛітераД

Дерево рішень · decision tree

Модель із послідовності питань виду «ознака не більша за поріг». Кожне питання ріже простір ознак навпіл лінією, перпендикулярною до осі, тож готова модель — це набір прямокутних плиток, у кожній з яких відповідь стала.

Головна вада. Дерево нестабільне за побудовою: два майже рівноцінні розрізи в корені відрізняються в третьому знаку, а виграє один — і вся структура під ним будується заново. Саме звідси й виріс беггінг.

Тема 25 · Дерева рішень

Дисбаланс класів · class imbalance

Ситуація, коли один клас трапляється значно рідше за інший: шахрайство, рідкісна хвороба, відмова обладнання. Чим рідкісніший позитивний клас, тим більше accuracy міряє розмір більшості замість якості моделі.

Тема 05 · Precision і Recall

Дисконтування · discounting

Знецінення майбутніх винагород: винагорода через кілька кроків входить у суму з меншою вагою, ніж негайна. Коефіцієнт дисконтування задає горизонт планування — маленький робить агента короткозорим, великий далекоглядним, але й повільнішим у навчанні.

Тема 39 · Навчання з підкріпленням

Дисперсія · variance

Одна з двох складових помилки: наскільки сильно навчена модель смикається від однієї навчальної вибірки до іншої. Велика дисперсія означає, що модель вивчила не залежність, а конкретні випадкові відхилення саме цих прикладів.

Це властивість процедури, а не однієї моделі. Побачити дисперсію на одному прогоні неможливо: вона проявляється лише в порівнянні кількох навчань на різних даних. Саме тому й існують бутстреп, беггінг і крос-валідація. У курсі те саме поняття інколи називають розкидом; канонічною тут вважаємо дисперсію, бо так називається сама тема 21.

Тема 21 · Bias-Variance

Дослідження і використання · exploration / exploitation

Конфлікт без ідеального розвʼязку: обрати дію, найкращу за поточними оцінками (використання), чи іншу, щоб уточнити її оцінку (дослідження). Кожен крок належить чомусь одному — не можна одночасно збирати врожай і перевіряти сусіднє поле.

Найпростіша стратегія. ε-жадібна: з малою ймовірністю ε обираємо випадкову дію, інакше найкращу. Нуль означає «застрягти на першій вдалій дії назавжди», одиниця — «мати найточніші оцінки й ніяк ними не користуватись».

Тема 39 · Навчання з підкріпленням

ЛітераЕ

Ентропія · entropy

Міра безладу в наборі: нуль, коли всі обʼєкти одного класу, максимум — коли класи порівну. Читається як середня кількість питань «так / ні», потрібних, щоб дізнатися клас навмання взятого обʼєкта. Дерево обирає розріз, який зменшує її найсильніше.

Тема 25 · Дерева рішень

ЛітераЗ

Залишок · residual

Різниця між справжнім значенням і прогнозом моделі. Знак має сенс: мінус означає, що модель переоцінила обʼєкт, плюс — що недооцінила. У бустингу залишок стає цільовою величиною для наступного дерева.

Теми 04 · Метрики регресії, 27 · Бустинг

Затухання градієнта · vanishing gradient

Головне обмеження глибоких мереж: щоб дійти до першого шару, градієнт множиться на похідну активації стільки разів, скільки шарів. Похідна сигмоїди ніде не більша за чверть, тож на десяти шарах до входу доходить приблизно мільйонна частка сигналу.

Що це означає на практиці. Перші шари глибокої сигмоїдної мережі не вчаться повільно — вони не вчаться взагалі й до кінця навчання лишаються з випадковими вагами. Ліки — ReLU, у якої похідна на додатній півосі дорівнює рівно одиниці.

Тема 33 · Активації та ініціалізація

Зворотне поширення помилки · backpropagation, backprop

Спосіб порахувати градієнт за один додатковий прохід мережею замість двох прогонів на кожну вагу. Уперед графом течуть значення, назад — похідні, тими самими ребрами; кожен вузол множить те, що прийшло справа, на свою власну похідну.

Увесь його математичний апарат — ланцюгове правило у двох реченнях: вплив уздовж шляху це добуток впливів на кожній ланці, а впливи вздовж різних шляхів додаються. Оскільки правило множить, а не додає, величина, що множиться сама на себе багато разів, або гасне до нуля, або вибухає — звідси й затухання градієнта, і дзеркальний до нього вибух, з яким борються обрізанням норми градієнта.

Не плутати з градієнтним спуском. Backprop — не алгоритм навчання, а спосіб дістати градієнт. Навчає модель градієнтний спуск або Adam. На мільйоні ваг backprop дає виграш у мільйон разів — і саме тому глибоке навчання взагалі можливе.

Тема 32 · Зворотне поширення

Згладжування Лапласа · Laplace smoothing, add-one smoothing

До кожного лічильника перед підрахунком часток додають однакове маленьке число. Без цього одне слово, якого не було в навчальній вибірці, обнуляє добуток і накладає вето на всі інші свідчення.

Ширший сенс. Це регуляризація: ми свідомо псуємо оцінку на навчальних даних заради кращої на нових. Те, чого ти не бачив, ти просто не бачив, — це ще не доказ неможливості.

Тема 19 · Наївний Баєс

Зміщення · bias

Систематична похибка: наскільки усереднена по всіх можливих навчальних вибірках модель промахується повз істину. Виникає, коли клас моделей у принципі не здатен описати справжню залежність — прямою не намалюєш хвилю, скільки даних не давай.

Одне англійське слово, дві українські назви. У парі «bias — variance» це зміщення: систематичний промах, який лікують ускладненням моделі. У нейроні те саме англійське слово означає зсув — окреме число, що додається до зваженої суми. Речі різні, і курс свідомо розводить їх двома словами.

Тема 21 · Bias-Variance

Значення Шеплі · Shapley values, SHAP

Чесний поділ прогнозу між ознаками, позичений з теорії кооперативних ігор: прогноз — це виграш команди, ознаки — гравці. Перебирають усі порядки, у яких гравці могли заходити в команду, і усереднюють приріст від приходу кожного.

Від чого залежить відповідь. Від фону — набору випадкових рядків, якими підмінюють «відсутні» ознаки, — і від складу ознак у моделі. Пояснення завжди відповідає на питання «чому порівняно з цим фоном», і фон варто називати вголос.

Тема 40 · Інтерпретованість

Зсув · bias

Окреме число нейрона, яке додається до зваженої суми входів завжди, незалежно від ознак. Воно задає, наскільки охоче нейрон каже «так», коли всі входи нульові, і геометрично рухає межу рішень паралельно самій собі.

Чому не «зміщення». Це та сама англійська літера bias, але зовсім інша річ: не системна похибка з розкладу помилки, а параметр моделі — рівно те, що в лінійній регресії зветься вільним членом. Курс розводить два поняття двома словами навмисно: зміщення зменшують складнішою моделлю, а зсув просто підбирають навчанням.

Теми 16 · Градієнтний спуск, 30 · Нейрон і перцептрон

ЛітераІ

Ієрархічна кластеризація · hierarchical / agglomerative clustering

Спочатку кожен обʼєкт — окремий кластер; далі найближча пара груп зливається, і так доти, доки все не стане однією групою. Результат — не набір міток, а дендрограма: дерево злиттів, у якому висота перемички дорівнює відстані між групами в момент злиття. Горизонтальний зріз на будь-якій висоті дає своє розбиття, тож кількість груп обирають після побудови, а не наосліп до неї.

Ціна. Потрібні всі попарні відстані, а їх приблизно квадрат від кількості обʼєктів: тисяча рядків — пів мільйона відстаней, сто тисяч — уже сорок гігабайтів. Це метод для тисяч рядків, не для мільйонів.

Тема 12 · Ієрархічна та DBSCAN

Індуктивне зміщення · inductive bias

Вбудована схильність архітектури до певного типу розвʼязків. Згортка перемагає на зображеннях не тому, що має менше параметрів, а тому, що серед мільйонів способів описати навчальні дані вона обирає ті, які поважають структуру зображення.

Теми 36 · Подвійний спуск, 37 · Подвійний спуск: математика

Інерція · inertia

Величина, яку мінімізує метод k-середніх: сума квадратів відстаней від кожної точки до центра її власного кластера. Що менша інерція, то щільніше точки тиснуться до своїх центрів.

Чому за нею не обирають кількість кластерів. Інерція завжди спадає, коли кластерів більшає, і при кількості центрів, рівній кількості точок, дорівнює нулю. Тому шукають не мінімум, а лікоть — місце, де крива з обриву переходить у пологий схил.

Тема 11 · Кластеризація k-means

Інженерія ознак · feature engineering

Побудова нових стовпців із наявних — переклад твого розуміння задачі на мову чисел. Сирі величини майже завжди безглузді без масштабу: коли числа різняться на порядки, їх ділять, коли живуть в одному масштабі — віднімають.

Найсильніший прийом — агрегат по групі. Розбити таблицю на групи, порахувати щось усередині кожної й приклеїти результат назад до кожного рядка. Найкраще працює групування за обʼєктом, що породжує рядки: продавець, користувач, магазин.

Тема 10 · Інженерія ознак

Ініціалізація Xavier і He · Xavier / Glorot and He initialization

Правила, за якими беруть початкові ваги мережі, щоб дисперсія сигналу не гасла й не вибухала з глибиною. Чим ширший шар, тим менші стартові ваги; He відрізняється від Xavier удвічі більшою дисперсією — це поправка на половину значень, яку зʼїдає ReLU.

Чому не нулі. З нульових ваг градієнт теж виходить нульовим, і мережа не зрушить жодною вагою. Однакові ненульові ваги теж не рятують: усі нейрони шару рахують те саме й отримують ту саму поправку — шар із тисячі нейронів працює як один.

Тема 33 · Активації та ініціалізація

Інтерпретованість · interpretability

Здатність пояснити, чому модель дала саме таку відповідь. Слово ховає чотири різні задачі — довіра користувача, налагодження моделі, вимога регулятора й наукове розуміння, — і метод обирають під питання, а не навпаки.

Межа, за якою пояснення перестає бути правдою. Ланцюжок такий: світ → дані → модель → пояснення. Пояснення бачить лише свого сусіда зліва, тому описує модель, а не світ. Кореляція не стає причиною від того, що її гарно намалювали.

Тема 40 · Інтерпретованість

ЛітераК

Калібрування · calibration

Властивість оцінки читатися буквально: якщо серед обʼєктів, яким модель дала 0.7, справді близько 70 % позитивних, модель калібрована. Потрібне скрізь, де число моделі йде далі в розрахунок ризику чи очікуваної вигоди.

Що калібрування не ловить. AUC залежить лише від порядку оцінок: піднеси всі ймовірності до квадрата — порядок збережеться, AUC не зміниться, а числа стануть відверто брехливими. Наївний Баєс — добрий класифікатор і поганий вимірювач імовірності саме через це.

Теми 05 · Precision і Recall, 38 · Справедливість моделей

Класифікація · classification

Задача, у якій передбачається одна з обмеженої кількості міток, і на кожну мітку в даних є достатньо прикладів. Тип задачі визначається не типом колонки, а парою «скільки різних значень» плюс «скільки даних».

Не плутати задачу з моделлю. Логістична регресія має в назві слово «регресія», але розвʼязує задачі класифікації. Збіг слів — історична випадковість.

Тема 02 · Дані: ознаки, таргет, типи задач

Кластеризація · clustering

Розкласти обʼєкти на групи так, щоб усередині групи вони були схожі, а між групами — різні, не маючи жодної правильної відповіді. Єдиної правильної відповіді тут не існує: ті самі дані можна законно розкласти і на два сегменти, і на пʼять.

Як перевіряти результат. Двома питаннями. Чи можу я описати кожну групу словами так, щоб людина з предметної області кивнула? І чи стійке розбиття — прибери десять відсотків рядків, перезапусти й подивись, чи лишилось воно тим самим.

Тема 11 · Кластеризація k-means

Конвеєр · Pipeline

Обʼєкт, що складає всі кроки передобробки й саму модель в один ланцюжок із двома методами: «вивчи все, що треба вивчити» і «застосуй вивчене». Тестова частина отримує лише друге — і підмішати в неї свою статистику вже нічим.

Це не турбота про красу коду. Конвеєр фізично унеможливлює витік: не існує способу випадково застосувати до тесту медіану, пораховану по тесту.

Тема 09 · Передобробка даних

Кореляція Пірсона · Pearson correlation

Число від −1 до +1, яке відповідає на одне питання: наскільки добре хмару точок можна замінити однією прямою. Плюс одиниця — точки на прямій, що йде вгору, мінус одиниця — униз, нуль — прямої, яка щось описує, немає.

Нульова кореляція означає «прямої немає», а не «звʼязку немає». Якщо підозрілі і найдешевші, і найдорожчі оголошення, пряма крізь таку хмару лежить горизонтально, і кореляція чесно повідомляє нуль. Вона не помилилась — ми поставили інше питання.

Тема 08 · Pandas і EDA

Крос-валідація · cross-validation

Замість одного розбиття прогнати всі по черзі й усереднити: дані ділять на кілька частин, кожна по черзі стає перевірочною, решта навчальною. Кожен обʼєкт рівно один раз побуває у валідації, і жоден рядок не пропадає.

Дивитись треба на два числа. Не лише на середнє по фолдах, а й на розкид між ними. Різниця між моделями має сенс лише тоді, коли вона більша за цей розкид: 0.812 ± 0.030 проти 0.818 ± 0.028 — це однакові моделі.

Тема 22 · Крос-валідація

Крос-ентропія · cross-entropy, log-loss, логарифмічна втрата

Функція втрат для класифікації. Штрафує тим сильніше, чим меншу ймовірність модель дала правильній відповіді: дав правильному класу 0.99 — заплатив 0.01, дав 0.5 — 0.69, дав 0.01 — 4.6. А впевнено помилитись коштує нескінченність.

Чому не квадратична помилка. Три причини, одна поверх одної. Квадрат карає впевнену помилку лише вчетверо сильніше за невпевнену, логарифм — необмежено, тому модель стає обережною. У парі з сигмоїдою похідна крос-ентропії скорочується повністю, і градієнт виходу дорівнює простій різниці «прогноз мінус правильна відповідь», тоді як у квадратичної лишається множник, який зануляє градієнт саме тоді, коли модель упевнено помилилась. І найглибша: квадратична помилка поверх сигмоїди не опукла, а крос-ентропія опукла завжди — тобто має рівно один мінімум.

Тема 31 · Нейронні мережі

ЛітераЛ

Лінійна регресія · linear regression

Найпростіша модель, яка описує відповідь як зважену суму ознак плюс вільний член. «Лінійна» вона за коефіцієнтами, а не за ознаками: додаси квадрат ознаки — отримаєш криву, і це все ще лінійна регресія.

Навіщо її знати, якщо вона рідко виграє. Це базова лінія, з якою порівнюють усе інше, і найдешевший спосіб зрозуміти механіку, яку далі побачиш скрізь: функція втрат, крок, перенавчання, регуляризація, припущення.

Тема 15 · Лінійна регресія

Лінійна роздільність · linear separability

Властивість даних, за якої існує хоч одна пряма (площина, гіперплощина), що ділить класи без жодної помилки. Правило перцептрона гарантовано знаходить таку пряму, якщо вона є, — і не зупиняється взагалі, якщо її немає.

Межа на чотирьох точках. Виключне «або» не розділити жодною прямою, і це не недолік навчання, а геометрія: відрізки між точками різних класів перетинаються. Двох прямих уже досить — саме тут закінчується один нейрон і починається мережа.

Тема 30 · Нейрон і перцептрон

Логістична регресія · logistic regression

Модель класифікації, яка передбачає не сам клас, а ймовірність позитивного класу: ту саму зважену суму ознак пропускають крізь сигмоїду. Її межа рішень завжди пласка, хоч крива ймовірності й вигинається.

Справжнє означення — через логіт. Логіт (logit) — це логарифм шансів, величина, яка розтягує тісний проміжок імовірності від нуля до одиниці на всю числову пряму. Модель лінійна саме за логітом, а не за ймовірністю, і сигмоїда лише повертає нас назад в імовірності.

Тема 17 · Логістична регресія

ЛітераМ

Матриця ознак · feature matrix, X та y

Форма, у якій дані потрапляють у будь-яку бібліотеку: двовимірна таблиця чисел, де рядок — один обʼєкт, а стовпець — одна ознака, і поруч одновимірний стовпчик відповідей тієї самої довжини. Домовленість не випливає з математики — її просто прийняли всі.

Дві тихі помилки. Одну ознаку подають стовпцем, а не рядком: інакше бібліотека не знає, чи їй дали тисячу обʼєктів з однією ознакою, чи один обʼєкт із тисячею. І гірша: якщо кількості рядків збіглися, а порядок ні, ніхто нічого не скаже, а модель вчитиметься на випадкових парах.

Тема 07 · NumPy для ML

Матриця плутанини · confusion matrix

Чотири числа, у яких міститься вся інформація про поведінку класифікатора при заданому порозі: влучання, хибна тривога, правильна тиша й пропуск. Будь-яка метрика класифікації — це просто дріб із цих чотирьох чисел.

Головне зауваження. Хибна тривога й пропуск — принципово різні події з різною ціною. Змішувати їх в одному показнику означає свідомо втрачати інформацію.

Тема 05 · Precision і Recall

Метод головних компонент · principal component analysis, PCA

Спосіб замінити багато стовпців кількома новими, викинувши якнайменше. Перша компонента — напрямок, у якому хмара точок витягнута найсильніше; друга — найбільшого з того, що лишилось, і перпендикулярна до першої.

Дві важливі обмовки. PCA не вибирає найкорисніші ознаки — він виготовляє нові як суміші старих, після чого таблиця стає нечитабельною. І він максимізує розкид, а не користь: ознака, за якою відрізняються шахраї, легко опиняється в компоненті, яку ти викинеш першою.

Тема 13 · PCA

Метрика · metric

Правило, що згортає весь стовпчик помилок в одне число, яке можна порівняти з іншим числом. Метрика — це не термометр збоку, а формулювання того, що ти вважаєш успіхом: обереш не те число — отримаєш не ту модель.

Метрика й функція втрат — різні ролі одного числа. Метрику обирають за зрозумілістю людині й рахують один раз наприкінці; функцію втрат — за зручністю для оптимізації й рахують тисячі разів під час навчання.

Тема 04 · Метрики регресії

Міжквартильний розмах · interquartile range, IQR

Ширина смуги, у якій живе середня половина значень: відстань між першим і третім квартилями. Викидами зазвичай вважають те, що відстоїть від цієї смуги більш ніж на півтора її розмаху в будь-який бік.

Чому саме середня половина. Вона не залежить від того, що коїться в хвостах — хоч постав найдорожчий телефон у мільйон гривень. Лінійка, якою ми міряємо викиди, сама від викидів не залежить. Множник півтора при цьому — домовленість, а не закон природи.

Тема 08 · Pandas і EDA

Момент · momentum

Надбудова над спуском, яка накопичує швидкість: нова швидкість — це більша частина старої плюс сьогоднішній градієнт, а параметр зсувається за швидкістю, а не за градієнтом. Стабільні напрямки підсилюються, метушливі гасяться самі.

Чому це працює. Уздовж пологого дна яру градієнт щокроку дивиться в один бік, тому доданки складаються й швидкість доростає приблизно до десятикратного градієнта. Упоперек яру знак міняється щокроку, сусідні доданки віднімаються, і накопичуватись нема чому.

Теми 16 · Градієнтний спуск, 34 · Оптимізатори

Мультиколінеарність · multicollinearity

Ситуація, коли ознаки дублюють одна одну — наприклад, площа в метрах і та сама площа у футах. Прогнози лишаються нормальними, а коефіцієнти стають сміттям: одній ознаці величезна додатна вага, другій така сама відʼємна.

Тема 15 · Лінійна регресія

ЛітераН

Навчальна вибірка · training set

Частина даних, на якій алгоритм підбирає параметри моделі. Помилка на ній вимірює запамʼятовування, а не розуміння, і тому не несе жодної інформації про якість: складніша модель завжди запамʼятовує краще.

Тема 03 · Train / Validation / Test

Навчання без учителя · unsupervised learning

Задачі, у яких правильної відповіді немає взагалі: кластеризація, зниження розмірності, пошук аномалій. Разом із колонкою відповідей зникає й метрика у звичному сенсі, і поділ на навчальну й тестову частини.

Теми 01 · Що таке машинне навчання, 11 · Кластеризація k-means

Навчання з підкріпленням · reinforcement learning, RL

Ніхто не каже агентові правильну відповідь — середовище лише зрідка повідомляє числом, наскільки вийшло. Зворотний звʼязок тут оцінювальний, а не інструктивний: дізнатись, чи була краща дія, можна лише спробувавши її.

Де це торкається всіх. RLHF — навчання на людському зворотному звʼязку: людям показують пари відповідей мовної моделі й питають, яка краща; на цих порівняннях вчать окрему модель винагороди, а вже її число модель максимізує.

Тема 39 · Навчання з підкріпленням

Навчання з учителем · supervised learning

Випадок, коли в даних уже є пари «обʼєкт → правильна відповідь», і модель вчиться відтворювати цей звʼязок. «Учитель» тут — не людина поруч із компʼютером, а сама наявність відповідей у таблиці: хтось їх колись проставив.

Тема 01 · Що таке машинне навчання

Наївний Баєс · naive Bayes

Класифікатор, який рахує ймовірність цілого обʼєкта як добуток імовірностей окремих ознак. «Наївність» — саме в цьому припущенні незалежності; воно хибне майже завжди, а метод усе одно працює, бо для рішення потрібен порядок, а не самі числа.

Думка, ширша за метод. Модель може бути корисною, будучи неправильною. Питання не в тому, чи правдива модель, а в тому, чи достатньо вона правдива для рішення, яке ти нею ухвалюєш.

Тема 19 · Наївний Баєс

Недонавчання · underfitting

Модель занадто проста для явища: помилка висока і на навчальних даних, і на нових, а розриву між ними майже немає. Пряма фізично не може бути крутою праворуч і пологою ліворуч — скільки їй даних не давай.

Лікується протилежним до перенавчання. Недонавченій моделі треба дати більше: гнучкості, ознак, часу навчання, слабший штраф. Додавання даних тут не допомагає взагалі — пряма, навчена на мільйоні рядків, лишається тією самою прямою.

Тема 20 · Перенавчання й недонавчання

Незвідний шум · irreducible error

Третій доданок помилки поряд зі зміщенням і дисперсією: усе, чого не можна передбачити за наявними ознаками в принципі. Це підлога, нижче якої не опуститься жодна модель, навіть ідеальна.

Практичний наслідок. Не полюй на нуль. Модель, що показала нульову помилку, майже напевно має витік, а не геніальність.

Тема 21 · Bias-Variance

Нейрон · artificial neuron

Дві дії й жодної більше: порахувати зважену суму входів зі зсувом і пропустити результат крізь одну функцію. Геометрично один нейрон ділить простір ознак навпіл пласкою межею й каже «так» усьому, що з одного боку.

Аналогія з живою клітиною поверхнева. Спільним лишається одне речення: «багато входів, один вихід, вихід залежить від зваженої суми». Зі сигмоїдою один нейрон — це дослівно логістична регресія, символ у символ.

Тема 30 · Нейрон і перцептрон

Неявна регуляризація · implicit regularization

Обмеження, яке виникає саме, з самого способу навчання, а не з дописаного штрафу. Градієнтний спуск із нульового старту на надпараметризованій задачі збігається саме до розвʼязку з найменшою нормою ваг — тобто до найгладшого з усіх ідеальних.

Тема 36 · Подвійний спуск

ЛітераО

Обʼєкт · instance, sample, row

Те, про що ми робимо висновок, — один рядок таблиці. Якщо рядок описує іноді оголошення, а іноді продавця з кількома оголошеннями, модель отримає суміш двох різних сутностей, і жодна метрика не покаже, що не так.

Тема 02 · Дані: ознаки, таргет, типи задач

Ознака · feature

Одна характеристика обʼєкта, виміряна однаково для всіх рядків, — стовпець таблиці, який подається моделі на вхід. Тип ознаки — це не тип даних у таблиці, а питання про те, які операції над значеннями мають зміст.

Більше ознак не означає краще. Кожна зайва колонка — це додатковий шанс, що модель знайде в ній випадкову закономірність. Серед пʼятдесяти стовпців чистого шуму найкращий випадково дає кореляцію більшу, ніж осмислена ознака «вік телефона».

Тема 02 · Дані: ознаки, таргет, типи задач

Оптимізатор · optimizer

Надбудова над спуском, яка не рахує градієнт і не чіпає мережу: вона отримує готовий градієнт і вирішує єдине питання — яким саме кроком зсунути кожен параметр. Кожен метод із родини лікує свою конкретну біду рельєфу.

Чого оптимізатор не робить. Не лікує затухання градієнта — цим займається вибір активації й ініціалізації. І не покращує узагальнення: швидше дійти до мінімуму навчальної втрати не означає краще працювати на нових даних.

Тема 34 · Оптимізатори

ЛітераП

Пакетна нормалізація · batch normalization, BatchNorm

Те саме вирівнювання, яке ми робимо з входом мережі, але всередині неї: шар бере поточну порцію прикладів, рахує по ній середнє й розкид кожної активації й приводить їх до спільної шкали. Придумана заради швидкості, регуляризує побічно.

Дві пастки. Нормалізоване значення прикладу залежить від того, з ким він потрапив у порцію, — на передбаченні порцій немає, тому статистики беруть накопичені, і забути перемкнути режим означає отримати в продакшені не те, що в зошиті. І ставити dropout перед пакетною нормалізацією не можна.

Тема 35 · Регуляризація мереж

Партія · mini-batch

Порція прикладів, за якою рахують один крок оновлення: не один обʼєкт і не вся вибірка, а кілька десятків. Компроміс між точністю напрямку й кількістю кроків, на якому працює практично весь сучасний код навчання.

Тема 16 · Градієнтний спуск

Передбачення · prediction

Відповідь про обʼєкт, не привʼязаний до моменту часу: фото котика лишається фото котика і вчора, і за рік. У таких задачах колонку з датою треба не просто не використовувати — її треба обовʼязково прибрати.

Чому дату прибирають. Дата — надзвичайно зручна ознака для запамʼятовування: кожен день утворює свою невелику групу рядків з однорідною відповіддю. Модель вивчає «14 березня — шахрайське» і не вивчає нічого іншого. Разом із датою прибирають і все, що її замінює: порядковий номер запису, автоінкрементний id.

Тема 02 · Дані: ознаки, таргет, типи задач

Передобробка · preprocessing

Перетворення таблиці, якою вона приїхала, у таблицю, з якою можна працювати. У передобробці немає операцій — є рішення: кожен виклик заповнення чи кодування — це припущення про світ, яке ти вносиш у дані власноруч.

Єдиний рядок без ціни. Усе, що вчиться на даних — медіана для заповнення, середнє й відхилення для масштабування, список категорій, межі викидів, — рахують лише на навчальній частині. Порядок «спершу поділ, потім навчання статистик» правильний завжди.

Тема 09 · Передобробка даних

Перенавчання · overfitting

Модель завчила шум разом із закономірністю: на навчальних даних вона ідеальна, на нових провалюється. Підступність у тому, що симптом виглядає як успіх — нуль помилки там, де ми міряли.

Діагноз ставлять за двома числами, не за одним. Помилка на навчальних даних і помилка на відкладених поруч: обидві високі й близькі — недонавчання; низька й висока з великим розривом — перенавчання. Одна цифра діагнозу не дає ніколи.

Тема 20 · Перенавчання й недонавчання

Перестановкова важливість · permutation importance

Перемішати значення однієї колонки між обʼєктами — так її звʼязок із відповіддю руйнується, а розподіл лишається тим самим — і подивитись, наскільки впала якість. Наскільки впала, настільки ознака й важлива.

Де ламається. На колонках-близнюках. Якщо ціна є в таблиці двічі, псування однієї нічого не змінює — модель бере те саме з другої, і кожна виглядає слабшою, ніж є. Перед тим як щось відкидати за важливістю, дивись на кореляційну матрицю й перемішуй корельовані колонки групами.

Теми 26 · Random Forest, 40 · Інтерпретованість

Перцептрон · perceptron

Нейрон із пороговою функцією замість плавної й правило навчання, у якому немає ні функції втрат, ні градієнта: відповів правильно — не чіпаємо нічого, помилився — зсуваємо ваги на вхід цього прикладу.

Обіцянка й межа. Правило гарантовано зупиняється, якщо дані лінійно роздільні, — і не зупиняється взагалі, якщо ні. Реальні дані роздільними бувають рідко: досить одного помилково розміченого рядка.

Тема 30 · Нейрон і перцептрон

Подвійний спуск · double descent

Форма кривої помилки, у якої не одне дно, а два. Класична U-подібна крива обривається на порозі інтерполяції різким піком, а далі, у надпараметризованій зоні, помилка знову спадає — і опускається нижче за найкращу класичну модель.

Чого це не скасовує. Компроміс зміщення й дисперсії лишається чинним; просто дисперсію тепер стримує не малий розмір моделі, а неявна регуляризація. Висновок не «беріть найбільшу модель», а «кількість параметрів перестала бути надійною мірою схильності до перенавчання».

Тема 36 · Подвійний спуск

Політика · policy

Правило, за яким агент обирає дію в кожному стані. Політика — це і є те, чого ми вчимо; усе решта — цінності, оцінки, моделі середовища — допоміжні конструкції, потрібні лише щоб її покращити.

Тема 39 · Навчання з підкріпленням

Поріг · threshold

Число, з яким порівнюють оцінку моделі, щоб отримати рішення. Значення 0.5 за замовчуванням — не закон природи, а зручна домовленість: поріг залежить не від моделі, а від того, скільки коштує кожен вид помилки.

Головна думка. Навчання моделі й вибір порогу — дві незалежні задачі. Першу розвʼязує алгоритм, другу — людина, яка знає предметну область. Модель тренують один раз, поріг переглядають щоразу, коли змінюється ціна помилки.

Тема 05 · Precision і Recall

Поріг інтерполяції · interpolation threshold

Точка, у якій кількість вільних параметрів дорівнює кількості навчальних прикладів. Розвʼязок, що проходить точно крізь усі точки, стає рівно один — і його якість справа випадку, бо вибору немає взагалі.

Пік не потребує шуму. Навіть на ідеально чистих даних єдиний інтерполюючий розвʼязок буває диким — просто тому, що він єдиний. Практичний висновок: обходь околиці порогу, бери або суттєво менше параметрів, або суттєво більше.

Теми 36 · Подвійний спуск, 37 · Подвійний спуск: математика

Порядкове кодування · ordinal encoding

«Пронумеруймо значення»: колонка була одна — колонка й лишилась. Правильний вибір лише там, де порядок справді є в самих значеннях і числа його не вигадують, а записують.

Що воно стверджує. Скажи вголос: що модель із кодом 2 удвічі більша за модель із кодом 1 і лежить рівно посередині між сусідами. І найгірше — числа беруться з абетки назв, а не зі світу: додай дешеву модель на літеру «D», і вона отримає найбільший код.

Тема 09 · Передобробка даних

Прогнозування · forecasting

Окремий випадок передбачення, у якому відповідь визначається саме положенням у часі. Розрізнити просто: якщо той самий обʼєкт трапиться через рік, відповідь буде та сама? Так — це передбачення; ні — це прогнозування, і колонка з датою стає головною.

Наслідок для поділу даних. Перевіряють не на випадкових рядках, а на останніх у часі: минуле в навчанні, майбутнє в тесті. Випадкове розбиття часового ряду вбиває задачу — модель прогнозує березень, «знаючи» вересень.

Тема 02 · Дані: ознаки, таргет, типи задач

Прокляття переможця · winner's curse

Кожна оцінка складається зі справжньої якості моделі й випадкового шуму. Беручи найкращу з багатьох таких оцінок, ти обираєш не лише найкращу модель, а й найудачливіший шум — тому найкраща оцінка при підборі систематично завищена.

Від чого залежить величина завищення. Не від кількості перебраних варіантів, а від кількості незалежних серед них і від шумності самої оцінки. Гладка сітка по одному гіперпараметру майже безпечна; небезпечно інше — багато незвʼязаних ручок, мала валідаційна вибірка й шумна метрика.

Теми 03 · Train / Validation / Test, 24 · Підбір гіперпараметрів

Прокляття розмірності · curse of dimensionality

У просторі багатьох ознак усі точки стають приблизно однаково далекими одна від одної: найближча майже така сама далека, як найдальша. А якщо найближчий сусід не ближчий за інших, слово «найближчий» перестає щось означати.

Чому це не лише про швидкодію. Кожна нова ознака додає до відстані ще один доданок, і окрема відмінність дедалі менше здатна змістити суму. Страждає будь-який метод, що міряє відстані: kNN, кластеризація, LOF.

Теми 13 · PCA, 18 · k найближчих сусідів

Проксі-ознака · proxy feature

Ознака, яка не називає групу прямо, але корелює з нею: поштовий індекс, назва школи, історія покупок. Прибравши явний стовпець із групою, ти не прибрав інформацію — лише позбавив себе можливості її виміряти.

Парадоксальний висновок. Щоб контролювати нерівномірність, ознаку групи треба знати — принаймні на етапі перевірки. Не щоб подавати її в модель, а щоб рахувати метрики окремо по групах.

Тема 38 · Справедливість моделей

Пропуск · missing value

Порожнє значення в таблиці. Головне питання не «скільки їх», а «чому саме ці рядки»: пропуск буває випадковим, повʼязаним з іншими стовпцями або повʼязаним із самим значенням, якого немає, — і останній випадок найгірший.

Сам факт пропуску буває ознакою. Якщо серед оголошень без ціни шахрайських більше половини, а серед решти восьма частина, порожнеча несе більше інформації, ніж багато справжніх колонок. Порядок, який рятує цю ознаку: спершу колонка-прапорець «значення немає», потім заповнення.

Теми 08 · Pandas і EDA, 09 · Передобробка даних

Пряме кодування · one-hot encoding

Колонка на кожне значення: у кожному рядку рівно одна одиниця, решта нулі. Нічого про порядок не стверджується — усі значення рівновіддалені одне від одного, і це чесно. Платять шириною таблиці.

Тема 09 · Передобробка даних

ЛітераР

Рання зупинка · early stopping

Найдешевший спосіб стримати модель: стежити за помилкою на валідації після кожної епохи й припинити навчання, коли вона розвернулась угору, тоді як навчальна ще спадає. Повертають при цьому найкращі ваги, а не останні.

Терпіння. Крива шумна, і одне випадкове погіршення ще нічого не означає, тому задають, скільки епох поспіль дозволено не покращувати рекорд. Занадто нетерплячий сторож спиняє навчання задовго до справжнього дна.

Теми 27 · Бустинг, 35 · Регуляризація мереж

Регресія · regression

Задача, у якій передбачається довільне значення з великого або неперервного діапазону. На кожне окреме значення прикладів немає й бути не може, тож знайдена закономірність поширюється на значення, яких модель не бачила, — саме це поширення й називають регресією.

Тема 02 · Дані: ознаки, таргет, типи задач

Регуляризація · regularization

Обмежити свободу моделі, щоб їй не було чим запамʼятати шум. Найпрозоріший спосіб — дописати у функцію втрат доданок, що росте разом із вагами: модель платить і за помилку, і за складність, тож божевільний розвʼязок стає просто невигідним.

Це обмін, а не покращення. Регуляризація купує зменшення дисперсії ціною збільшення зміщення, і вигідний він лише до певної межі — за нею починається недонавчання. Сила штрафу — гіперпараметр, а не константа.

Тема 23 · Регуляризація

Розвідувальний аналіз даних · exploratory data analysis, EDA

Етап, на якому в дані дивляться, перш ніж щось із ними робити, і жодного разу нічого не змінюють. Це не звітність, а страховка: дірку, помічену зараз, ти виправляєш за годину, а помічену після навчання — разом з усім, що встиг на ній побудувати.

Тема 08 · Pandas і EDA

ЛітераС

Сигмоїда · sigmoid

Функція, що плавно стискає будь-яке число у проміжок від нуля до одиниці, тому її вихід читається як імовірність. Обрана не тому, що схожа на сходинку, а тому, що вона обернена до логарифма шансів — логіта.

Чому її вигнали з прихованих шарів. Її похідна ніде не перевищує чверті, і на десяти шарах градієнт слабшає приблизно в мільйон разів. На виході бінарної класифікації вона живе спокійно: там вона не множиться багато разів, а в парі з крос-ентропією ще й скорочується повністю.

Теми 17 · Логістична регресія, 33 · Активації та ініціалізація

Сідлова точка · saddle point

Місце, де градієнт нульовий, але це не дно: в одних напрямках поверхня йде вгору, в інших — униз. У просторі з мільйоном вимірів сідел незрівнянно більше, ніж локальних ям, бо для справжньої ями схил має йти вгору в усіх мільйонах напрямків одразу.

Саме тут вирішує адаптивність. Простий спуск множить крихітний градієнт на крок і ледь повзе; адаптивні методи ділять цей самий градієнт на його ж власний масштаб і роблять повний крок. На одному й тому самому сідлі — пʼять кроків проти чотирьохсот вісімдесяти пʼяти.

Теми 16 · Градієнтний спуск, 34 · Оптимізатори

Спад ваг · weight decay

Стягування кожної ваги до нуля на кожному кроці навчання. Назва пояснюється поведінкою: ваги поступово спадають, а менші ваги означають менш різкі перепади виходу — тобто менше острівців навколо окремих точок.

Для Adam це не те саме, що L2. Дописати штраф у функцію втрат і відняти частку ваги після кроку — для простого спуску тотожні речі. Але Adam ділить крок на власний масштаб градієнта, і штраф із втрати проходить крізь це ділення: одне число сили штрафу перетворюється на різну силу для різних ваг. Оптимізатор, у якому спад ваг реалізовано окремо, зветься AdamW — і значення, підібране для одного, для другого не годиться.

Тема 35 · Регуляризація мереж

Стандартизація · standardization, z-оцінка

Від кожного значення відняти середнє колонки й поділити на її розкид. Результат читається як «на скільки розкидів це значення вище або нижче за типове»: нуль — рівно середнє, одиниця — на один розкид вище.

Альтернатива й чому вона гірша. Мінімакс втискає колонку рівно у відрізок від нуля до одиниці — виглядає охайніше, але один викид розтягує шкалу так, що решта даних тисне в кут. Стандартизація теж не любить викидів, але переживає їх спокійніше.

Тема 09 · Передобробка даних

Стандартна похибка · standard error, SE

Наскільки виміряна на тесті якість гуляла б, якби тестова вибірка була іншою. Головний наслідок — корінь у знаменнику: щоб зменшити похибку вдвічі, вибірку треба збільшити вчетверо.

Практичне застосування. Перш ніж радіти, що модель A дала 87 %, а модель B 86 %, порахуй SE. На двохстах обʼєктах похибка близько 2,4 відсоткового пункту — різниця в один пункт просто не існує.

Тема 03 · Train / Validation / Test

Стохастичний градієнтний спуск · stochastic gradient descent, SGD

Рахувати градієнт не по всій вибірці, а по одному прикладу чи невеликій партії — і одразу робити крок. Оцінка напрямку гірша, зате коштує в сотні разів дешевше, тому за той самий бюджет виходить у сотні разів більше кроків.

Головний висновок, і він контрінтуїтивний. Гірші кроки, зроблені частіше, перемагають кращі кроки, зроблені рідко. А шум від вибірковості виявився ще й корисним сам по собі: він не дає точці застрягти на плато й у дрібних ямках.

Тема 16 · Градієнтний спуск

Стратифікація · stratification

Різати не всю вибірку разом, а кожен клас окремо, і брати з нього рівно ту частку, яка потрібна. Коштує один аргумент, а прибирає цілий клас проблем: при рідкісному класі випадкове розбиття цілком може лишити тест узагалі без позитивних прикладів.

Теми 03 · Train / Validation / Test, 22 · Крос-валідація

ЛітераТ

Таргет, цільова ознака · target

Стовпець, значення якого ми хочемо вміти відновлювати для нових обʼєктів. Головне речення теми, і воно всупереч інтуїції: таргет — не властивість колонки, а наше рішення. Будь-яку колонку можна оголосити відповіддю, і задача зміниться повністю.

Правило про залишок. Щойно ти обрав таргет, перевір решту колонок одним питанням: чи були б вони відомі в момент, коли треба зробити передбачення? Ознака, якої в цю мить не існує, робить модель чудовою на історії і непридатною в житті.

Тема 02 · Дані: ознаки, таргет, типи задач

Теорема про відсутність безкоштовних обідів · no free lunch theorem

Якщо усереднити якість алгоритму по всіх мислимих задачах, усі алгоритми покажуть однаковий результат. Кожна модель — це припущення про те, як улаштований світ; виграє та, чиї припущення ближчі до твоїх даних.

Тема 28 · Порівняння моделей

Тестова вибірка · test set

Частина даних, яку не бачить ніхто до самого кінця; існує рівно для одного — дати одне число, яке ніщо не встигло зіпсувати. Торкаються її один раз, після того як усі рішення вже прийняті.

«А якщо тільки подивитись?» Не буває. Ти подивився й побачив, що модель провалюється на дорогих телефонах. Далі ти або щось зміниш — і тест зіпсовано, — або не зміниш, і тоді навіщо дивився.

Тема 03 · Train / Validation / Test

ЛітераУ

Узагальнення · generalization

Здатність працювати на нових даних, а не на тих, які модель уже бачила. Це єдине, що нас цікавить, і отримати його оцінку можна лише одним способом — відкласти частину даних убік і не давати моделі їх бачити.

Тема 03 · Train / Validation / Test

Універсальна апроксимація · universal approximation

Теорема про те, що мережа з одним прихованим шаром скінченної ширини здатна наблизити будь-яку неперервну функцію з якою завгодно точністю. Звучить як вирок усій подальшій науці, а на практиці з неї не випливає майже нічого.

Три застереження. Існування потрібних ваг не означає, що спуск їх знайде. «Скінченна ширина» не сказано яка — для деяких функцій вона росте експоненційно. І теорема про виразність, а машинне навчання — про узагальнення: та сама гнучкість дозволяє наблизити й будь-який шум.

Тема 31 · Нейронні мережі

ЛітераФ

Функція втрат · loss function

Число, яким алгоритм міряє, наскільки погана поточна модель, і від якого бере похідну. Обирають її не за зрозумілістю людині, а за зручністю для оптимізації: вона має бути гладкою й мати похідну скрізь.

Ландшафт, а не число. Функція втрат — це ціле поле значень: кожному набору параметрів відповідає своя висота. Задача навчання формулюється однією фразою — знайти найнижчу точку цього рельєфу, не бачачи карти.

Тема 16 · Градієнтний спуск

ЛітераЦ

Цільове кодування · target encoding

Замінити кожну категорію середнім значенням таргета всередині неї: одна колонка замість чотирьохсот, та ще й одразу «корисна». Прийом із вбудованою пасткою, а не просто ще один спосіб закодувати категорію.

Звідки береться витік. Якщо продавець подав рівно одне оголошення, «середнє по його оголошеннях» — це буквально таргет цього ж рядка. Ознака з чистої вигадки за наївного розрахунку виглядає сильнішою за все справжнє: карту «категорія → число» будують лише за навчальними рядками, а невідомим категоріям підставляють загальне середнє.

Тема 10 · Інженерія ознак

Цінність стану й дії · value function, V and Q

Скільки сумарної винагороди агент очікує отримати далі. Цінність стану відповідає на питання «наскільки хороша ця ситуація», цінність дії — «наскільки хороша ця ситуація, якщо спершу зробити ось цю дію».

Чому вчать саме цінність дії. Знаючи лише цінність станів, щоб обрати дію, треба вміти передбачити, куди вона приведе, — тобто мати модель середовища. Знаючи цінність дій, обирати просто: бери ту, у якої число найбільше.

Тема 39 · Навчання з підкріпленням

ЛітераЧ

Частинна залежність · partial dependence plot, PDP; ICE

Щоб дізнатись, як модель реагує на одну ознаку, ставлять їй одне й те саме значення всім рядкам вибірки, рахують прогнози й усереднюють. ICE — та сама процедура, але для кожного рядка окремо, без усереднення.

Дві незручності. Середня крива може не описувати жодного рядка — якщо криві ICE розходяться сильно, PDP читати вже небезпечно. І гірше: підставляючи ціну флагмана дешевій моделі, ми питаємо модель про комбінації, яких у даних не бувало.

Тема 40 · Інтерпретованість

ЛітераШ

Шар · layer

Кілька нейронів поруч: вони приймають один і той самий вхід, але мають різні ваги, тому дивляться на дані під різними кутами. Вхідний шар — самі ознаки, приховані шари творять усю роботу, вихідний формує відповідь під конкретну задачу.

Мовчазна помилка новачків. Забути активацію між шарами. Помилки не буде, втрата спадатиме, а мережа мовчки виявиться однією прямою — скільки б у ній не було шарів і параметрів.

Тема 31 · Нейронні мережі

Шум · noise

Усе, що впливає на відповідь, але не повʼязане з ознаками: подряпина на корпусі, продавець поспішає, інший поставив ціну із запасом. Шум реальний, він існує — і саме він непередбачуваний.

Скільки складності можна дозволити. Питання «яка модель складна?» не має відповіді без даних. Ті самі шістнадцять прикладів при малому шумі виправдовують многочлен сьомого степеня, а при великому — лише другого.

Тема 20 · Перенавчання й недонавчання

ЛатиницеюA–Z

Тут зібрано терміни, у яких англійська назва прижилась і українського відповідника або немає, або він гірший за оригінал. Окремий випадок — precision і recall: обидва українською зазвичай перекладають як «точність», що плутається з accuracy, тому курс свідомо лишає їх англійськими, а українською описує словами.

accuracy · частка правильних відповідей

Частка правильних відповідей серед усіх. Чесна метрика рівно в одному випадку: коли класи приблизно однакові за розміром і однаково важливі.

Чому вона бреше. При рідкісному позитивному класі accuracy вимірює рідкість класу, а не якість моделі. Модель, яка всім підряд пише «здоровий», дає 99,9 % правильних відповідей і не знаходить жодного хворого. Обидва числа правильні — просто друге дивиться на клас, заради якого систему й будували.

Тема 05 · Precision і Recall

Adam · adaptive moment estimation

Оптимізатор, який робить одразу дві речі: згладжує сам градієнт у часі (момент вирішує, куди йти) і ділить крок на власний масштаб градієнта кожного параметра (RMSProp вирішує, наскільки довгий крок робити).

Не «завжди найшвидший», а «майже ніколи не катастрофічний». Adam — розумне замовчування: він працює при майже будь-якому кроці навчання. Але простий спуск із моментом після налаштування часто дає кращий фінальний результат. Правило: прототип на Adam, фінальний прогін — на тому, що виграв у чесному порівнянні.

Тема 34 · Оптимізатори

AUC, ROC-AUC · площа під ROC-кривою

Ймовірність того, що випадково взятий позитивний обʼєкт отримає від моделі вищий скор, ніж випадково взятий негативний. AUC = 0.89 означає буквально: у 89 випадках зі ста модель поставить справжньому шахрайству вищий бал, ніж чесному платежу.

Правильний інструмент для одного питання й непридатний для іншого. AUC не залежить від вибору порогу — тому вона годиться для питання «яка модель краща» і геть не годиться для питання «який поріг узяти». Значення нижче 0.5 означає не безнадійну модель, а переплутані знаки.

Тема 06 · ROC та AUC

DBSCAN · кластеризація за щільністю

Кластер — це там, де густо. Метод не рахує центрів узагалі: він нарощує групу від сусіда до сусіда, куди б ланцюжок не тягнувся, тому знаходить смуги, кільця й підкови, з якими k-means не впорається.

Уміє казати «не знаю». Точку, яка не потрапила в жодну щільну область, DBSCAN позначає шумом — і це чесність, а не поразка. Головна вада дзеркальна до переваги: радіус околу один на весь простір, тож метод припускає, що всі справжні кластери мають приблизно однакову густину.

Тема 12 · Ієрархічна та DBSCAN

dropout · випадкове вимикання нейронів

На кожному кроці навчання частину нейронів тимчасово вимикають — ставлять їхній вихід у нуль. Наступного кроку жереб кидається наново. Жоден нейрон не може розраховувати на конкретного сусіда, тож мережа змушена тримати кілька надлишкових шляхів до відповіді.

Місце, де реалізації помиляються найчастіше. На передбаченні dropout вимикають — і сигнал одразу стає більшим, ніж той, під який мережа налаштовувалась. Масштабування обовʼязкове з одного з двох боків. Забудеш — точність майже не зміниться, а ймовірності стануть систематично заниженими, і ця помилка проживе в проєкті роками.

Тема 35 · Регуляризація мереж

Equality of Odds · рівність шансів на помилку

Дві рівності одночасно: серед тих, хто справді заслуговує позитивного рішення, шанс його отримати не залежить від групи; і серед тих, хто не заслуговує, шанс помилково пройти теж не залежить від групи.

Ліниві розвʼязки. Критерій ідеально виконують дві порожні позиції — «приймаємо всіх» і «не приймаємо нікого». Тому метрику справедливості завжди читають у парі з метрикою якості: розрив 0.00 при точності 0.63 гірший за розрив 0.04 при 0.82. Половина означення, залишена сама, зветься equal opportunity — рівність лише recall.

Тема 38 · Справедливість моделей

F1 і F-beta · гармонійне середнє precision і recall

Одне число замість двох, щоб моделі можна було впорядкувати. Гармонійне середнє, а не звичайне, бо воно притягується до меншого з двох: модель, яка провалила одну зі сторін, не має отримувати половину балів.

F-beta — та сама формула з ручкою важливості. Одиниця означає рівновагу, двійка — recall учетверо важливіший (медичний скринінг, шахрайство), пів — precision учетверо важливіший (спам-фільтри, автоматичні блокування). І окреме обмеження: у формулі немає правильно розпізнаних негативних узагалі.

Тема 05 · Precision і Recall

Isolation Forest · ізолювальний ліс

Скільки випадкових розрізів треба, щоб відрізати точку від усіх інших? Точка з гущі схована серед сотні таких самих, а точка осторонь відлітає з першим-другим розрізом. Глибина ізоляції, усереднена по сотні дерев, і є оцінкою.

Де ламається. Кожен розріз — умова про одну колонку, тобто лінія, перпендикулярна до осі. Аномалію, що лежить у «дірці» посеред хмари й не виходить за межі жодної ознаки окремо, метод бачить погано.

Тема 14 · Пошук аномалій

k-means · метод k середніх

Постав k центрів, припиши кожну точку до найближчого, перерахуй кожен центр як середнє своїх точок, повтори. Обидва кроки не збільшують інерцію, тому алгоритм завжди зупиняється за скінченне число кроків.

Дві межі методу. Він зупиняється в першій-ліпшій точці, де нічого вже не міняється, — це локальний мінімум, і різні старти дають різні відповіді. І кожна точка йде до найближчого центра, тому межа між кластерами завжди пряма, а сам кластер — приблизно кругла грудка: вкладені кільця він не розділить жодним k.

Тема 11 · Кластеризація k-means

kNN · k найближчих сусідів, k-nearest neighbours

Щоб оцінити новий обʼєкт, знайди k найсхожіших зі знайомих і подивись, чим виявились вони: для класів — голосуванням, для чисел — середнім. Ніякої іншої ідеї всередині немає, а моделлю працює сама таблиця.

Величина 1/k — це складність моделі. Один сусід дає рвану межу, що повторює кожну випадковість архіву; надто велике k стирає дрібні згустки. І прогноз регресії ніколи не вийде за межі найдешевшого та найдорожчого прикладу архіву — екстраполювати kNN не вміє принципово.

Тема 18 · k найближчих сусідів

L1-регуляризація · Lasso, ласо

Штраф — сума модулів ваг. Наслідок якісно інший, ніж у L2: частина ваг стає точно нулем, тобто модель заодно й безкоштовно робить відбір ознак.

Чому модуль обнуляє, а квадрат ні. Похідна квадрата біля нуля зникає — тиск слабшає рівно тоді, коли вага вже майже там. Похідна модуля стала завжди, тож вона доводить вагу до нуля й тримає її там: ознака, що пояснює дані слабко, просто не окупає власного штрафу.

Тема 23 · Регуляризація

L2-регуляризація · Ridge, гребенева регресія

Штраф — сума квадратів ваг. Чим більша вага, тим сильніше її тягне до нуля, тож метод нещадний до розгону й майже байдужий до дрібниць. Стискає всі ваги, але не обнуляє жодної: у моделі лишаються всі ознаки, просто кожна звучить тихіше.

Без спільного масштабу не працює. Штраф однаковий для всіх ваг і не питає, у чому виміряна ознака. Перепиши ту саму ознаку в тисячу разів дрібніших одиницях — її внесок у штраф впаде в мільйон разів, а модель не зміниться ні на гривню. Тому перед будь-якою регуляризованою моделлю ознаки зрівнюють.

Тема 23 · Регуляризація

learning rate · швидкість навчання, крок навчання

Число, що задає, наскільки великий крок робити. Похідна дає лише напрямок і крутизну, а довжину кроку призначаєш ти — і це найважливіший гіперпараметр усього градієнтного навчання.

Дві катастрофи й вузьке вікно між ними. Замалий крок працює правильно, просто повзе. Завеликий перестрибує дно й опиняється вище, ніж був, — далі похідна більша, крок довший, і все вибухає. Залежність не монотонна: спершу швидшає, потім різко гіршає.
Як це зветься в курсі. Канонічна назва одна — швидкість навчання: так термін уведено в темі 16, і це буквальний переклад rate. Варіант «крок навчання» ще трапляється як синонім, але покладатися на нього не варто: слово крок у курсі вже означає одну ітерацію спуску («за 40 кроків», «на кожному кроці»), тож «зменши крок навчання» читається двозначно. Зустрівши «крок навчання», читай його як швидкість навчання.

Теми 16 · Градієнтний спуск, 34 · Оптимізатори

LIME · локальне лінійне наближення

Навколо потрібної точки генерують хмару схожих рядків, питають у складної моделі прогноз для кожного й навчають на цій хмарі просту зважену лінійну модель. Її коефіцієнти й подають як пояснення.

Головна вада — нестабільність. Хмара генерується випадково, і два запуски на тому самому рядку можуть дати різні, іноді суперечливі пояснення. Для розмови з регулятором, якому потрібне відтворюване пояснення, це дискваліфікація.

Тема 40 · Інтерпретованість

LOF · local outlier factor, локальний фактор викиду

Питання не в тому, наскільки далеко сусіди, а в тому, наскільки далі, ніж у самих сусідів. У щільному районі порожнеча помітна, у розрідженому вона норма — і саме тому в назві стоїть слово «локальний».

Тема 14 · Пошук аномалій

MAE · mean absolute error, середня абсолютна помилка

Візьми помилку кожного обʼєкта, забудь про знак, порахуй середнє. Головна перевага — її можна прочитати вголос людині, яка ніколи не чула про машинне навчання: «модель помиляється в середньому на 600 гривень».

Питання, на яке вона відповідає. «Наскільки модель помиляється зазвичай». Кожна гривня промаху важить однаково, тож MAE стійка до викидів — і водночас позбавлена здатності бити тривогу через одну катастрофу.

Тема 04 · Метрики регресії

MAPE і SMAPE · середня абсолютна відсоткова помилка

Помилку кожного обʼєкта ділять на його власне значення й аж потім усереднюють — так промах у 600 гривень на телефоні за 12 000 і на телефоні за 1 500 перестає бути тим самим.

Де вона бреше — систематично. Маленький знаменник роздуває дешеві товари; нуль ламає її повністю (не «велика», а не існує); і вона несиметрична — карає завищення сильніше за заниження, тож модель, яку вчать під MAPE, тихо навчається занижувати. SMAPE перекошено в інший бік, а не полагоджено.

Тема 04 · Метрики регресії

MDI · mean decrease in impurity, важливість за приростом чистоти

Рейтинг важливості ознак, який дерева віддають безкоштовно: скільки безладу сумарно прибрали розрізи по цій ознаці. Дивитись першим зручно, приймати рішення на ньому одному — ні.

Дві відомі вади. Він завищує ознаки з великою кількістю різних значень — у неперервної колонки просто більше кандидатів на поріг. І рахується на навчальних даних, тому щедро оплачує розрізи, зроблені по шуму: чистий випадковий код на 1200 значень MDI піднімає на третє місце з семи.

Теми 26 · Random Forest, 40 · Інтерпретованість

MSE і RMSE · середня квадратична помилка й корінь із неї

Замість модуля беруть квадрат помилки. MSE читається погано — вона в «гривнях у квадраті», такої одиниці не існує; корінь повертає число в гривні, і виходить RMSE: «типовий промах моделі — близько 700 гривень».

Питання, на яке вона відповідає. «Наскільки страшно модель помиляється іноді». Квадрат карає великі промахи непропорційно: помилка в 12 разів більша коштує в 144 рази дорожче. Для звіту незамінна RMSE, для навчання беруть MSE — вона гладка, має похідну всюди й дешевша в обчисленні.

Тема 04 · Метрики регресії

OOB · out-of-bag, поза мішком

Приблизно третина обʼєктів не потрапляє в бутстреп-вибірку конкретного дерева. Зібравши для кожного обʼєкта голоси лише тих дерев, які його не бачили, отримаємо чесну оцінку якості — без окремої відкладеної вибірки й без повторного навчання.

Коли OOB бреше. Якщо в даних є групи повʼязаних записів — кілька транзакцій одного клієнта, кілька знімків одного пацієнта, — бутстреп розкидає їх, і «невидимий» обʼєкт насправді майже дублює побачений.

Тема 26 · Random Forest

precision · точність позитивного прогнозу

Якщо модель сказала «так», наскільки ймовірно, що вона має рацію. Метрика довіри до сигналу: важлива там, де хибна тривога дорого коштує — важливий лист у теці «спам», безпідставно заблокована картка.

Чому назва лишена англійською. Українською precision зазвичай перекладають як «точність» — і це плутається з accuracy, теж «точністю». Курс уживає англійську назву, а українською описує словами. І окремо: precision не визначена, коли модель не зробила жодного позитивного прогнозу, — це відсутність відповіді, а не поганий результат.

Тема 05 · Precision і Recall

PR-крива · precision-recall curve; average precision, AP

Залежність precision від recall, у якої кожна точка — один поріг. Площу під нею називають average precision — чесний підсумок якості ранжування, що не залежить від вибору порогу.

Коли брати її, а не ROC. Базовий рівень PR-кривої дорівнює частці позитивних і повзе вниз разом із нею. Тому вона бачить дисбаланс саме там, де ROC сліпа: precision змішує обидва класи в одному знаменнику, а обидві осі ROC лежать усередині свого класу.

Теми 05 · Precision і Recall, 06 · ROC та AUC

Q-навчання · Q-learning

Табличний алгоритм навчання з підкріпленням: після кожного кроку оцінку цінності дії зсувають у бік того, що показала реальність. Форма оновлення дослівно та сама, що й у багаторукого бандита, — «оцінка плюс крок помножити на несподіванку».

Тема 39 · Навчання з підкріпленням

· коефіцієнт детермінації

Метрика без одиниць, яка порівнює модель із найдурнішою можливою — з такою, що завжди називає середнє. Одиниця означає ідеальне влучання, нуль — «модель рівно така сама, як середнє», відʼємне значення — «гірша за середнє», і це трапляється легко.

Дві пастки. R² майже ніколи не спадає, коли додаєш нові ознаки — навіть коли ознака є чистим шумом; тому моделі з різною кількістю ознак чесно порівнювати лише за скоригованим R². І він рахується відносно середнього тієї вибірки, на якій ти міряєш: візьми тест із вужчим розкидом — і число впаде, хоч модель не змінилась.

Тема 04 · Метрики регресії

recall · повнота; sensitivity, чутливість, TPR

Яку частку справжніх позитивних випадків модель узагалі помітила. Метрика повноти охоплення: головна там, де пропуск катастрофічний — невиявлена пухлина, незнайдений дефект, шахрайський переказ, що пройшов.

Симетрія, заради якої їх наводять парою. Precision штрафується за хибні тривоги, recall — за пропуски. Кожна бачить рівно один вид помилки й повністю ігнорує другий, тому окремо взяте будь-яке з цих чисел легко зробити ідеальним.

Тема 05 · Precision і Recall

ReLU · rectified linear unit, випрямляч

Найпростіша можлива нелінійність: обрізати все відʼємне нулем. Похідна на додатній півосі дорівнює рівно одиниці — не «близько одиниці в найкращій точці», а одиниці скрізь, тому ланцюг градієнта перестає гаснути з глибиною.

Мертвий ReLU. Нейрон, у якого зважена сума відʼємна на всіх прикладах, більше не отримує градієнта — і не отримує його саме тому, що не оновлюється. Коло замикається назавжди. Убиває нейрони завеликий крок навчання, і метрики цього не покажуть, доки мертвих не стане більшість.

Тема 33 · Активації та ініціалізація

ROC-крива · receiver operating characteristic

Траєкторія точки з координатами FPR і TPR, коли поріг пробігає всі значення. Це не одна модель, а всі її можливі рішення одночасно — від «мовчати завжди» до «блокувати все».

Три орієнтири форми. Лівий верхній кут — існує поріг, за якого немає жодної помилки. Діагональ — випадкове вгадування. Нижче діагоналі — не безнадійна модель, а переплутані знаки: поміняй прогноз на протилежний, і крива віддзеркалиться.

Тема 06 · ROC та AUC

softmax · узагальнення сигмоїди на кілька класів

Бере кілька чисел, робить їх усі додатними й нормує так, щоб вони сумувалися в одиницю, — тобто перетворює виходи мережі на справжній розподіл імовірностей по класах.

Головне слово — «сумуються». Підняти ймовірність одного класу можна лише опустивши інші. Для задачі «одна правильна відповідь із десяти» це саме те, що треба; для задачі «які з десяти тегів підходять статті» — шкода, бо теги не змагаються, і там ставлять окрему сигмоїду на кожен вихід.

Теми 17 · Логістична регресія, 33 · Активації та ініціалізація

t-SNE і UMAP · нелінійні методи для картинки

Нелінійні способи вкласти багато ознак у площину: вони зберігають не загальний розкид, як PCA, а сусідство — щоб точки, близькі у вихідному просторі, лишились близькими й на малюнку. Групи на їхніх картинках виглядають набагато виразніше.

Ціна, про яку часто мовчать. Вони не дають перетворення: PCA видає формулу, яку можна застосувати до нового обʼєкта хоч через рік, а тут для нової точки доведеться рахувати все заново. І відстані між далекими групами на таких картинках нічого не значать. Правило: t-SNE та UMAP — для очей, PCA — для конвеєра.

Тема 13 · PCA

TPR і FPR · true / false positive rate

Дві частки, на яких тримається ROC. TPR — частка спійманих серед усіх справжніх позитивів (те саме, що recall). FPR — частка хибних тривог серед усіх справжніх негативів. Доповнення до FPR зветься специфічністю (specificity) — це здатність моделі не піднімати тривогу даремно.

Уся суть — у знаменниках. Кожна рахується всередині свого справжнього класу, тому жодна не знає, скільки в даних тих і тих. Саме тому ROC не змінюється, коли міняється співвідношення класів, — і саме тому вона нічого не каже про те, скільки сміття доведеться розгрібати.

Тема 06 · ROC та AUC

Чого тут немає. Понять, які курс лише згадує, не пояснюючи, — автоенкодера, HDBSCAN, методу опорних векторів, трансформера. Вони названі в тексті як орієнтири «куди дивитись далі», а не введені, тож і місця в глосарії їм немає.