Відповіді0 / 8
правильних: 0
Питання 1 / 8
Що таке зворотне поширення помилки?
Чому так. Backprop — це калькулятор градієнта, а не алгоритм навчання. Він постачає числа, а крок робить оптимізатор: градієнтний спуск, SGD з моментом, Adam. Замінити оптимізатор можна, лишивши backprop незмінним — і навпаки. Плутанина «backprop навчає мережу» заважає зрозуміти, що саме в конвеєрі можна міняти.
Питання 2 / 8
Що саме рахує зворотний прохід?
Чому так. Значення нейронів рахує прямий прохід, і саме тому backprop не може без нього обійтися: усі проміжні
a мусять бути вже пораховані й збережені. Зворотний прохід рухається тим самим графом по тих самих ребрах, але несе не числа-значення, а числа-похідні. Нові ваги теж не його робота — це вже крок спуску.Питання 3 / 8
У мережі мільйон ваг. Скільки прогонів мережі коштує один повний градієнт кожним із двох способів?
Чому так. Центральна різниця потребує двох прогонів на кожен параметр: один зі зсувом уперед, один назад. Мільйон ваг — два мільйони прогонів. Backprop коштує один прямий прохід плюс один зворотний, а зворотний приблизно дорівнює прямому за обсягом множень. Виграш дорівнює кількості параметрів — тут мільйон разів.
Питання 4 / 8
Чому чисельну похідну не використовують для самого навчання?
Чому так. Чисельна похідна не точніша — навпаки. У неї дві похибки одразу: відсікання (січна не збігається з дотичною) і округлення (різниця двох майже однакових чисел). Аналітичний градієнт з backprop точний з точністю арифметики. Чисельний тримають не заради точності, а заради незалежності: у ньому нема чого переплутати, тому ним перевіряють backprop.
Питання 5 / 8
Для якого класу обчислень працює зворотне поширення?
Чому так. Backprop — це зворотний режим автоматичного диференціювання, і йому байдуже, чи називається граф «нейромережею». Умова рівно одна: усі операції мають бути диференційовні. Саме тому сходинку перцептрона навчати градієнтом не вийде — її похідна нуль скрізь, і ланцюг множиться на нуль на першій же ланці.
Питання 6 / 8
У прикладі лекції мережа видала прогноз 0.2471 при правильній відповіді 1. Чому дорівнює дельта вихідного нейрона?
Чому так. Похідна крос-ентропії по прогнозу містить у знаменнику
ŷ(1−ŷ), а похідна сигмоїди дає рівно такий самий множник у чисельнику. Вони скорочуються начисто, і лишається чиста різниця ŷ − y = 0.2471 − 1 = −0.7529. Помножити ще раз на похідну сигмоїди — типова помилка: це подвійне врахування одного й того самого.Питання 7 / 8
Ти перевіряєш градієнт і береш крок h = 1e−16 замість 1e−5. Що станеться?
Чому так. Числа з рухомою комою тримають близько шістнадцяти значущих цифр. При
h = 1e−16 значення L(w+h) і L(w−h) стають однаковими бітово, різниця дорівнює нулю — і похідна теж. В інтерактиві 3 лекції це видно прямо: відносна різниця стрибає до 1.00e+0. Робочий діапазон вузький, приблизно від 1e−4 до 1e−6.Питання 8 / 8
Втрата на прикладі велика — 1.69, а градієнт по вазі першого шару дорівнює лише 0.004. Що це означає?
Чому так. Великий градієнт і велика втрата — різні речі. Градієнт по вазі першого шару множиться на похідну активації
1 − a², а на краях tanh вона падає майже до нуля. Модель помиляється жахливо і при цьому не знає, куди рухатись. Це і є затухання градієнта в мініатюрі, на одному нейроні.