Тест самоперевірки

Бустинг

Обери відповідь — і одразу побачиш пояснення. Помилитись тут корисніше, ніж на іспиті.

← до лекції
Відповіді0 / 8   правильних: 0
Питання 1 / 8

У випадковому лісі кількість дерев беруть просто побільше — зайві не шкодять. Чому в бустингу так робити не можна?

Чому так. Ліс усереднює незалежні моделі, і додаткові дерева лише зменшують дисперсію оцінки. Бустинг додає моделі одну до одної, тому кожне нове дерево збільшує складність ансамблю. Коли сигнал вичерпано, дерева починають вчити шум навчальної вибірки — в інтерактиві 3 лекції тестова помилка розвертається на 27-му дереві й доростає з 1 181 до 1 416 грн. Глибина дерев тут ні до чого: у бустингу вони якраз мілкі.
Питання 2 / 8

Чому в бустинг беруть навмисне слабкі дерева глибиною 2–4, а не сильні, як у лісі?

Чому так. Усереднення (ліс) гасить дисперсію учасників, тому туди вигідно брати глибокі дерева з малим зміщенням. Додавання (бустинг) дисперсію не гасить — вона накопичується разом із поправками, тому потрібні стабільні учасники, а зміщення прибирає сама довжина ланцюжка. Економія часу — приємний побічний ефект, а не причина. Взаємодії ознак ловлять якраз глибші дерева: пеньок бачить лише одну ознаку.
Питання 3 / 8

Оголошення: справжня ціна 15 200 грн, ансамбль після нульового кроку каже 5 350 грн, швидкість навчання 0.5. Перше дерево виділило це оголошення в окремий листок. Яким буде прогноз після першого дерева?

Чому так. Залишок дорівнює 15 200 − 5 350 = 9 850 грн. Дерево, у якого це оголошення сидить у власному листку, передбачить залишок точно, але додається воно з множником: 5 350 + 0.5 · 9 850 = 10 275 грн. Варіант «15 200» вийшов би при ν = 1, тобто якби поправку взяли цілком.
Питання 4 / 8

Що станеться із залишком того самого оголошення після другого дерева, якщо воно знову виділить його в окремий листок (ν = 0.5)?

Чому так. Якщо дерево вгадує залишок точно, після кроку лишається (1 − ν) від нього. Тобто кожен крок множить залишок на 0.5: 9 850 → 4 925 → 2 463 → 1 231 → 616. Це геометрична прогресія, а не сума часток: множники не додаються, вони перемножуються.
Питання 5 / 8

У чому саме полягає звʼязок «навчання на залишках» із градієнтним спуском?

Чому так. Для L = ½(y − F)² маємо ∂L/∂F = −(y − F) = −r. Отже, антиградієнт по прогнозу — це і є залишок, а правило F ← F + ν·h збігається з правилом спуску F ← F − ν·∂L/∂F. Різниця з темою 8 лише в тому, що рухається: там число (вага), тут функція (до ансамблю додається ціле дерево). Саме тому метод називають спуском у просторі функцій.
Питання 6 / 8

Ти зменшив learning_rate з 0.3 до 0.05 і лишив n_estimators=100. Помилка на нових даних стала гіршою. Що сталося?

Чому так. learning_rate і n_estimators — це одна ручка з двома кінцями: зменшив крок — пропорційно збільш довжину ланцюжка. В інтерактиві 2 лекції крок 0.3 доходить до дна за 9 дерев, а крок 0.05 — за 53. Зі 100 деревами перший давно на дні, а другий ще спускається. На якість learning_rate впливає й безпосередньо: у кроку 1.0 дно 1 359 грн проти 1 181 грн у кроку 0.1.
Питання 7 / 8

Ти будуєш криву тестової помилки, знаходиш її мінімум і береш ту кількість дерев. Що не так із цією процедурою?

Чому так. Щойно тестова вибірка бере участь у виборі гіперпараметра, вона перестає бути чесною оцінкою — це та сама пастка, що в темі про розбиття даних. Рання зупинка робиться по окремій валідації, а тест чіпають один раз наприкінці. У практиці різниця видна: рання зупинка по валідації дала 1 794 грн, а «ідеал», підглянутий у тест, — 1 744 грн, і ця друга цифра нікому не доступна чесним шляхом. По навчальній кривій шукати нічого: вона падає монотонно й ніколи не розвертається.
Питання 8 / 8

Чим ріст дерева «листям» у LightGBM відрізняється від росту «рівнями» в XGBoost і що з цього випливає на практиці?

Чому так. Ріст листям щоразу обирає найвигідніший листок у всьому дереві, тому одна гілка може піти глибоко, а інша лишитись коротка. За той самий бюджет листків це точніше — і саме тому легше перенавчається; стримує його num_leaves, а не глибина. Паралельним бустинг не буває в жодній бібліотеці: наступне дерево не існує, поки не готове попереднє. Гістограми сьогодні є в усіх трьох реалізаціях.