Чим гіперпараметр відрізняється від параметра моделі?
Чому так. Перевірка проста: спитай себе, чи змінилося б це число, якби ти дав алгоритму інші дані, не змінивши жодного рядка коду. Ваги логістичної регресії змінилися б — це параметри. А C = 1.0 так і лишилося б одиницею, бо його написала людина до першої ітерації. Навчання не має механізму, яким могло б підправити C зсередини.
Питання 2 / 8
Чому не можна підібрати k у kNN, мінімізуючи помилку на навчальній вибірці — так само, як підбирають ваги?
Чому так. У лекції це видно числами: при k = 1 точність на навчанні дорівнює 1.0000, бо найближчий сусід навчального оголошення — воно саме. А на відкладених даних це найгірший рядок таблиці, 0.8750. Гіперпараметр майже завжди керує складністю моделі, тому оптимізація по навчальній помилці не «іноді помиляється», а завжди впирається в найскладніший доступний варіант.
Питання 3 / 8
Ти перебрав 26 значень k і взяв те, що дало найкращу точність на тестовій вибірці. Що не так?
Чому так. Тестова вибірка існує рівно для одного: дати одне число, яке ніщо не встигло зіпсувати. Щойно ти обрав по ній хоч один гіперпараметр, інформація про неї просочилась у модель через твоє рішення. Це та сама помилка, що й вимірювання на навчанні, тільки поверхом вище. Правильно — підбирати крос-валідацією на навчальній частині, а тест відкрити один раз наприкінці.
Питання 4 / 8
Найкраща оцінка крос-валідації при підборі вийшла 0.9404. Що це число означає?
Чому так. Кожна оцінка складається зі справжньої якості та випадкового шуму розбиття. Беручи максимум із багатьох таких оцінок, ти обираєш заодно й найудачливіший шум — це прокляття переможця. У практиці той самий k = 3 на 280 відкладених оголошеннях дав 0.9071, тобто на 0.033 менше. Очікувану якість дає лише вимірювання, у якому підбір не брав участі.
Питання 5 / 8
Бюджет однаковий — 25 спроб. Сітка 5 × 5 проти випадкового пошуку. Скільки різних значень важливого гіперпараметра встигає перевірити кожен?
Чому так. Сітка ділить бюджет порівну між осями: 20 із 25 запусків повторюють ті самі пʼять значень важливого гіперпараметра при різних неважливих. У випадкового пошуку жодні дві точки не збігаються по жодній координаті, тож усі 25 значень різні. Саме тому при однаковому бюджеті він зазвичай виграє — не через везіння, а через покриття.
Питання 6 / 8
Чи правда, що повна сітка завжди краща за випадковий пошук, бо перебирає всі комбінації?
Чому так. «Повна» вона лише щодо власних вузлів, а не щодо простору: пік між стовпцями сітка просто не побачить. У практиці повна сітка зі 104 комбінацій коштувала 520 навчань, а випадковий пошук на 26 спробах — 130 навчань і знайшов ту саму комбінацію з тим самим числом 0.9404. Рівність бюджету — це коли рівна кількість навчань, а не кількість вузлів.
Питання 7 / 8
Навіщо потрібна вкладена крос-валідація, якщо в нас уже є звичайна?
Чому так. У звичайній схемі ті самі фолди й обирають переможця, і повідомляють його оцінку — тому вона завищена. У вкладеній зовнішній фолд не бере участі в підборі й тому чесний. На дошці оголошень середня внутрішня best_score_ була 0.9344, а чесна зовнішня — 0.9275: різниця 0.0069 і є те завищення, яке вкладеність прибирає. Коштує вона дорого: K × комбінацій × K навчань.
Питання 8 / 8
Ти перейшов з 5 фолдів на 10, щоб оцінка була точнішою. Що станеться з бюджетом і чи завжди це виправдано?
Чому так. Кількість згорток входить у бюджет лінійним множником: 216 комбінацій на 5 фолдах — це 1080 навчань, на 10 — уже 2160. Зі зростанням K зміщення оцінки падає, але моделі стають дедалі схожішими між собою, тож усереднення знімає дедалі менше шуму. Тому стандарт — 5 або 10, а не «якнайбільше»: 3 фолди для грубого відсіву й 10 для фінальної перевірки — цілком законна тактика.