Мережу навчили на даних, у яких мітки заздалегідь перемішали навмання — звʼязку між ознаками й відповіддю немає взагалі. Що станеться з навчальною втратою?
Чому так. Це і є той відомий експеримент: у практиці теми мережа на 1801 параметр досягла точності 1.0000 на 120 перемішаних мітках, а втрати 0.0128. На нових даних вона при цьому дала 0.7141 — гірше за найтупішу відповідь «усі чесні» (0.8372). Здатність запамʼятати весь набір закладена в архітектуру, і ніщо в градієнтному спуску не заважає мережею скористатись.
Питання 2 / 8
Під час навчання dropout із p = 0.3 вимикає частину нейронів. Що відбувається з тими самими нейронами на етапі передбачення?
Чому так. Dropout вимикає нейрони тимчасово, на один крок: наступного кроку жереб кидається наново, і жоден нейрон не зникає назавжди. На передбаченні працюють усі — а щоб наступний шар отримав сигнал того самого розміру, що й під час навчання, роблять масштабування: або множать виходи на 1 − p на передбаченні, або (частіше) ділять на 1 − p ще на навчанні.
Питання 3 / 8
Хтось реалізував dropout простою маскою без ділення на 1 − p і на передбаченні нічого не множив. Точність на тесті майже не змінилась. Чи все гаразд?
Чому так. У практиці теми ця помилка при p = 0.5 змінила точність із 0.8910 на 0.8897 — тобто ніяк. А крос-ентропія зіпсувалась із 0.2981 до 0.5132, і середній прогноз поїхав з 0.1582 на 0.1033 при справжній частці 0.1628. Мережа лишилась приблизно правою у відповідях «так / ні» й систематично неправою в упевненості. Саме тому таку помилку можна не помітити роками.
Питання 4 / 8
Спад ваг (weight decay) і L2-штраф у функції втрат — це один метод чи два різні?
Чому так. Для простого спуску крок w − η·(g + 2λw) тотожний кроку w − η·g − η·λ′·w: різниця лише в позначенні. В Adam доданок 2λw, потрапивши в градієнт, проходить крізь обидва накопичувачі й крізь ділення на √ŝ — і фактична сила стягування виходить різною для різних ваг. Саме заради цього й вигадали AdamW, у якому спад ваг віднімається окремим рядком.
Питання 5 / 8
Пакетна нормалізація на передбаченні працює так само, як на навчанні?
Чому так. На навчанні статистики беруться з поточної партії — саме через це той самий приклад отримує різні числа в різних партіях, і саме цей шум трохи регуляризує. На передбаченні партії може не бути взагалі (один приклад), тому використовують збережені статистики. Забути перемкнути режим — класична причина того, що модель у продакшені поводиться інакше, ніж у зошиті.
Питання 6 / 8
Валідаційна крива дійшла до мінімуму на 51-й епосі й далі повільно росте. Рання зупинка з терпінням 5 спинила навчання на 9-й епосі. Що це означає?
Чому так. У практиці теми терпіння 5 віддало ваги 4-ї епохи з валідаційною втратою 0.3629, тоді як на 51-й епосі досяжні 0.2637. Терпіння 10 і більше цей початковий шум перечікує й доходить до дна. Занадто нетерплячий сторож шкодить так само, як його відсутність: без зупинки взагалі втрата була б 0.4565.
Питання 7 / 8
Рання зупинка — це просто «поставити менше епох»?
Чому так. Число епох доводиться вгадувати до початку навчання, а мережа щоразу поводиться інакше — на новій задачі, з новою швидкістю навчання, з іншою ініціалізацією дно приходить в інший момент. Зупинка вимірює це на ходу. І друга половина, про яку часто забувають: вона повертає ваги найкращої епохи, а не останньої, інакше терпіння 20 означало б віддати модель, яка двадцять епох поспіль ставала гіршою.
Питання 8 / 8
Мережа перенавчається: розрив між навчальною й валідаційною втратою великий. Ти додав(ла) спад ваг, і розрив упав. Чи варто збільшувати λ далі, поки розрив не зникне зовсім?
Чому так. У практиці теми спад ваг 1.0 дав менший розрив, ніж 0.3 (0.0374 проти 0.0810), але гіршу точність на тесті (0.8962 проти 0.9103). Нульовий розрив легко отримати, зробивши модель настільки тупою, що вона однаково погана скрізь: при λ = 0.3 в інтерактиві лекції норма ваг стала нулем, і обидві помилки вийшли близько 48 %. Сила регуляризації — гіперпараметр із дном, а не величина, яку треба максимізувати.