Тест самоперевірки

Дані: ознаки, таргет, типи задач

Обери відповідь — і одразу побачиш пояснення. Помилитись тут корисніше, ніж на іспиті.

← до лекції
Відповіді0 / 8   правильних: 0
Питання 1 / 8

У таблиці оголошень сім колонок. Що визначає, яка з них є цільовою ознакою?

Чому так. Таргет — не властивість колонки, а постановка задачі. Та сама таблиця з таргетом price дає регресію, з таргетом is_fraud — бінарну класифікацію, з таргетом condition — багатокласову, і жодне значення в ній при цьому не змінюється. Порядок колонок і їхній dtype до цього не мають стосунку.
Питання 2 / 8

Колонка memory_gb містить цілі числа 64, 128 і 256. Якщо взяти її таргетом, якою буде задача?

Чому так. Вирішує не тип значень, а їхня кількість: різних значень усього три, і на кожне припадає більш ніж двісті прикладів із 700. Це класифікація. Спокуслива відповідь «регресія, бо числа» — типова помилка: цілі числа самі по собі нічого не визначають, важливо, скільки їх різних і скільки даних на кожне.
Питання 3 / 8

Приріст кількості хворих за добу — це цілі числа, десятки тисяч можливих значень, а спостережень усього кількасот днів. Як ставити задачу?

Чому так. Правило «2–10 варіантів → класифікація» працює тільки разом із обсягом даних. Тут класів було б двадцять тисяч, а рядків кількасот — на клас припадає менше одного прикладу, вчити нічого. Закономірність доводиться поширювати на невидані значення, і це визначення регресії.
Питання 4 / 8

Та сама задача зі 100 класами. У першому випадку є мільярд рядків, у другому — 200. Що змінюється?

Чому так. При мільярді рядків на клас припадає десять мільйонів прикладів — закономірність появи кожного класу вивчається. При 200 рядках — по два приклади на клас, модель недонавчиться. Тип задачі визначається парою «скільки різних значень» плюс «скільки даних», а не одним із цих чисел окремо.
Питання 5 / 8

Колонка condition має значення «потертий», «добрий», «новий». Що втрачається, якщо закодувати її як звичайну категорію через get_dummies?

Чому так. Це порядкова ознака: новий кращий за добрий, добрий кращий за потертий. One-hot робить три незалежні прапорці й порядок зникає. Кодування числами 0, 1, 2 порядок зберігає — ціною допущення, що кроки між сусідами однакові; це допущення неточне, але майже завжди дешевше за втрату порядку.
Питання 6 / 8

Ти передбачаєш, чи оголошення шахрайське. У таблиці є колонка posted_at із датою публікації. Що з нею зробити?

Чому так. Це задача передбачення, а не прогнозування: оголошення шахрайське саме по собі, а не тому, що подане у вівторок. Модель дату не ігнорує — навпаки, кожен день дає їй маленьку однорідну групу рядків, яку легко завчити. На навчальних днях така модель виглядає чудово, на нових у неї не лишається нічого.
Питання 7 / 8

Модель із колонкою posted_at показує 89 % на навчальних днях і 57 % на нових; та сама модель без цієї колонки — 63 % і 61 %. Який висновок правильний?

Чому так. 89 % на своїх днях — це не якість, а завчені дні: на нових вона падає до 57 %, гірше за модель без дати з її 61 %. Друга модель слабша на навчанні, зате майже однакова на обох половинах — саме це й означає, що вона вивчила природу явища. Однаково погано на обох половинах чесно; добре тут і погано там — витік.
Питання 8 / 8

У таблицю додали ще п'ять колонок із бази — «на всяк випадок, раптом допоможуть». Що з цим не так?

Чому так. «Більше ознак завжди краще» — одна з найдорожчих хиб новачка. Ознаку варто додавати, коли є змістовна причина вважати, що вона впливає на таргет. Серед випадково доданих колонок легко трапиться така, що знає відповідь (як days_until_removed у практиці) — і метрика стане підозріло ідеальною, а модель непридатною.