Тест самоперевірки

Передобробка даних

Обери відповідь — і одразу побачиш пояснення. Помилитись тут корисніше, ніж на іспиті.

← до лекції
Відповіді0 / 8   правильних: 0
Питання 1 / 8

У колонці «ціна» 100 пропусків із 1 200 рядків. Серед рядків без ціни шахрайських 56 %, серед решти — 12.6 %. Що зробити першим?

Чому так. Значення ціни втрачене назавжди, а факт її відсутності — ні, і він повʼязаний із таргетом на 0.325. Заповнення цей факт знищує: після нього рядок не відрізнити від справжніх чотиритисячних оголошень. Тому прапорець робиться до заповнення. Видалення рядків тут теж дороге: разом зі 145 неповними рядками пішло б 60 шахрайських оголошень із 195.
Питання 2 / 8

Розподіл цін скошений праворуч: середнє 6 498 грн, медіана 4 000 грн. Чим краще заповнити пропуски в цій колонці і чому?

Чому так. 68.6 % оголошень дешевші за середнє — отже, «середнє оголошення» майже не трапляється, і сто його копій ставлять другий пік у розрідженій частині шкали, де справжніх оголошень утричі менше. Медіана 4 000 грн стоїть у густій частині. Нуль — найгірший варіант: він стверджує, що телефон роздають безкоштовно, і псує будь-яку арифметику.
Питання 3 / 8

Моделі телефонів закодували числами за алфавітом: Alfa A5 = 0, Alfa A7 = 1, Beta 12 = 2 і так далі. Що саме стверджує таке кодування?

Чому так. Порядкове кодування вносить у дані і порядок, і рівні кроки між значеннями. Перевірка проста: код каже, що Beta 12 (2) лежить рівно посередині між Alfa A5 (0) і Gamma X (4), тобто мала б коштувати 5 598 грн, а її медіанна ціна 4 215 — на третину менше. Гірше того, числа беруться з назв: додай модель «Delta Z», і вона за алфавітом дістане найбільший код.
Питання 4 / 8

Для якої з цих колонок порядкове кодування є правильним вибором?

Чому так. Ознака зі справжнім внутрішнім порядком зветься порядковою, і для неї числа порядок не вигадують, а записують. Для «моделі» порядку немає — алфавіт це властивість назв, а не телефонів. Для «міста» з високою кардинальністю проблема реальна, але порядкове кодування її не розвʼязує, а маскує: краще звести рідкісні значення в «інше». І ні, one-hot не завжди кращий — на порядковій ознаці він просто викидає інформацію про порядок.
Питання 5 / 8

Ціна вимірюється тисячами гривень, вік акаунта — сотнями днів. Навіщо приводити їх до спільного масштабу?

Чому так. У сирих одиницях відстань до оголошення А виходить 188, до Б — 860, тобто ближчим оголошується А. Але щоб це порахувати, довелось оголосити 860 гривень «більшими» за 186 днів. У частках власного розкиду 860 грн — це 0.10, а 186 днів — 0.46, і ближчим стає Б. Масштабування не прибирає викидів: найдорожчий телефон після стандартизації має z близько 10 і нікуди не дівається.
Питання 6 / 8

Мінімакс втиснув колонку цін у відрізок [0, 1] — і 81.7 % значень опинились нижче 0.1. Що сталося?

Чому так. Мінімакс ділить на розмах, а розмах визначають рівно два значення — мінімум і максимум. Один викид робить знаменник величезним, і вся решта таблиці тиснеться до нуля. Стандартизація в цій ситуації поводиться спокійніше: під |z| < 1 потрапляє 92.3 % оголошень. Рівномірність мінімакс нікому не обіцяв — він зберігає форму розподілу, лише міняє шкалу.
Питання 7 / 8

Ти заповнив пропуски медіаною всієї таблиці, масштабував колонки, а потім поділив дані на train і test. Що з цим не так?

Чому так. Тест має грати роль майбутнього, якого ще немає, — а тут він устиг вплинути на кожне число в навчальній частині. На нашій дошці правило з 60 підібраними порогами дає F1 0.643 при неправильному порядку і 0.483 при правильному: третини оцінки не існує. «Щоб було однаково» — саме та інтуїція, яка й створює помилку: train і test мусять бути в одній шкалі, але шкалу задає лише train, а тест її отримує.
Питання 8 / 8

Правило з 60 порогів, підібраних на всіх даних, дає на тесті F1 0.643; те саме правило, підібране лише на train, дає 0.483. На 20 різних поділах неправильний порядок завищив оцінку 20 разів із 20. Чому завищення завжди в один бік?

Чому так. Коли тестові рядки доступні під час підбору, правило їх частково запамʼятовує — і запамʼятовування ніколи не псує оцінку, воно її тільки покращує. Тому зсув односторонній. Розмір ефекту росте з кількістю вивчених чисел: спільні пороги (2 числа) завищують оцінку на 0.027, пороги на модель (12 чисел) — на 0.050, пороги на пару «модель + стан» (60 чисел) — на 0.147.