Тест самоперевірки

Розвідка даних

Обери відповідь — і одразу побачиш пояснення. Помилитись тут корисніше, ніж на іспиті.

← до лекції
Відповіді0 / 8   правильних: 0
Питання 1 / 8

У таблиці 1 212 рядків. Стовпець «ціна» має 101 пропуск. Ти порахував частку шахрайських окремо серед рядків із ціною й без неї: 12.5 % проти 56.4 %. Що з цього випливає?

Чому так. Різниця в чотири з половиною рази на сотні рядків — це не шум, а поведінка: шахрай не називає ціну, бо саме ціна робить оголошення підозрілим. Тому відсутність значення сама по собі є ознакою й заслуговує на власну колонку. Заповнити середнім означало б цю ознаку знищити, а видалити рядки — викинути 57 шахрайських оголошень із 196, тобто майже третину всього рідкісного класу.
Питання 2 / 8

Правило міжквартильного розмаху з множником 1.5 позначило 78 оголошень як викиди. Серед шести найдорожчих — чотири однакові рядки: Gamma X 2017 року, стан «нове», 512 ГБ, від 82 до 95 тисяч. Що з ними робити?

Чому так. Правило міжквартильного розмаху нічого не знає про телефони — воно знає лише, що число велике. Чотири однакові рядки з тією самою рідкісною комбінацією — це не помилка введення, а справжнє явище ринку. Рішення «видалити чи лишити» змістове, а не технічне: число за межею — це привід відкрити рядок цілком, а не команда його прибрати.
Питання 3 / 8

Кореляція між ціною й таргетом «шахрайське» дорівнює −0.012. Частка шахрайських по десятих частинах ціни: 42.9 % у найдешевших, 2.7 % посередині, 18.0 % у найдорожчих. Як це пояснити?

Чому так. Кореляція Пірсона відповідає на одне питання: наскільки добре хмару точок можна замінити однією прямою. Через U-подібну хмару найкраща пряма проходить горизонтально, і кореляція чесно повідомляє нуль. Вона не помилилась — їй поставили не те питання. Правило просте: нульова кореляція означає «прямої немає», а не «звʼязку немає».
Питання 4 / 8

Стовпець «скарг» має кореляцію 0.887 із таргетом. Правило «є хоч одна скарга — оголошення шахрайське» ловить усі 196 шахрайських і помиляється лише на 22 чесних. Яка правильна реакція?

Чому так. Скарга зʼявляється після того, як покупець уже постраждав, — тобто в той самий момент, коли ставиться мітка «шахрайське». У робочому режимі модель бачить свіже оголошення, у якого скарг нуль завжди, і назве чесними всі. Правило, яке варто вивчити напамʼять: занадто добре — це помилка, поки не доведено протилежне.
Питання 5 / 8

Ти будуєш гістограму цін. На 4 кошиках найвищий стовпчик — найлівіший, і напрошується висновок «типова ціна близька до нуля». На 20 кошиках пік стоїть між 1 250 і 2 500 грн. Хто правий?

Чому так. Ширина кошика в 6 250 грн зсипає в один стовпчик і телефон за 300 грн, і телефон за 6 000 — висновок «пік біля нуля» створила розмітка осі, а не дані. Але й протилежна крайність хибна: на 80 кошиках сусідні стовпчики стрибають удвічі, і це вже випадковість, а не форма. Робочий діапазон широкий, але не безмежний — приблизно 15–40 кошиків на тисячу значень.
Питання 6 / 8

У колонці «памʼять_гб» тип виявився object, бо 215 рядків із 1 212 записані як «128 ГБ» замість «128». Чим небезпечний виклик pd.to_numeric(колонка, errors="coerce")?

Чому так. errors="coerce" означає «те, що не зміг прочитати, зроби пропуском». Виклик не падає, нічого не пише в консоль — і сьома частина стовпця тихо стає порожньою. Правильний порядок інший: спершу прибрати суфікс (.str.replace(" ГБ", "")), і лише потім переводити в число; тоді нових пропусків не зʼявиться жодного.
Питання 7 / 8

Кореляція «рік випуску ↔ ціна» по всій таблиці дорівнює 0.249. Якщо лишити тільки одну модель телефона й тільки чесні оголошення, та сама кореляція стає 0.840. Що змінилось?

Чому так. Медіанна ціна росте з роком приблизно однаково в обох випадках — сама залежність та сама. Змінився розкид навколо неї: поки в хмарі змішані шість моделей із різними рівнями цін, точки лежать далеко від будь-якої прямої. Кореляція міряє саме тісноту точок навколо прямої, а не силу залежності — тому вона й підскочила.
Питання 8 / 8

У таблиці 196 шахрайських оголошень із 1 212. Чому цю пропорцію треба знати до того, як обрано метрику якості?

Чому так. Дисбаланс задає нуль відліку. Частка правильних відповідей у 83.8 % виглядає як пристойний результат, хоча її дає константа, яка не дивиться на ознаки взагалі. Саме тому на нерівних класах міряють precision і recall: вони питають, скільки з упійманих справді шахраї і скількох шахраїв упіймано.