Тест самоперевірки

Кластеризація k-means

Обери відповідь — і одразу побачиш пояснення. Помилитись тут корисніше, ніж на іспиті.

← до лекції
Відповіді0 / 8   правильних: 0
Питання 1 / 8

Ти запустив KMeans двічі на тих самих даних і отримав два різні розбиття. Що це означає?

Чому так. Кожен крок k-means не збільшує інерцію, тому алгоритм неодмінно зупиняється — але в першій же точці, де ніщо не міняється. Таких точок багато, і різний старт приводить у різні. У лекції чотири старти на тих самих 1 100 оголошеннях дали інерцію 803.43, 805.58, 815.74 і 880.78. Ліки — n_init і фіксований random_state, а не пошук неіснуючої помилки.
Питання 2 / 8

Що робить крок «пересунути центри» в алгоритмі Ллойда з інерцією?

Чому так. Обидва кроки не збільшують інерцію, і саме тому алгоритм сходиться. Розподіл — бо кожна точка йде туди, де їй ближче. Пересування центрів — бо середнє арифметичне є точним розвʼязком задачі «знайти точку з найменшою сумою квадратів відстаней» (у лекції це виведено з похідної). Інерція може й не змінитись, якщо центр уже стояв у середньому, — але зрости не може.
Питання 3 / 8

Метод ліктя показує на k = 4, а найбільший середній силует — при k = 2. Що робити?

Чому так. Обидва критерії пораховані чесно й міряють різне: лікоть — щільність, силует — відокремленість. Розбіжність між ними нормальна, а третя метрика як арбітр лише додасть четверту думку. Правильна дія — визнати діапазон (тут 2–5, а не 30) і вибрати всередині нього за тим, з чим ти зможеш працювати. У лекції взято k = 3 і прямо сказано, що це рішення, а не відкриття.
Питання 4 / 8

У таблиці ціна в гривнях (розкид 8 685) і рік випуску (розкид 2.31). Що станеться, якщо подати їх у k-means без масштабування?

Чому так. Відстань складає квадрати різниць по всіх ознаках, тож доданок від ціни переважує доданок від року на кілька порядків. У лекції це видно на числах: без масштабування всі три кластери містять оголошення всіх років з 2017-го по 2024-й, а межі — просто цінові смуги (956 оголошень в одній купі, 8 в іншій). Збіг такого розбиття з масштабованим — на рівні випадкового.
Питання 5 / 8

Дані складаються з внутрішнього кола і кільця навколо нього. Що поверне k-means при k = 2?

Чому так. Кожна точка йде до найближчого центра, тому межа між кластерами k-means завжди пряма. У вкладених колах центри обох справжніх груп лежать в одній точці, і жодна пряма межа їх не розділить: у лекції на своїх місцях опинилось 60 % точок. Ані більший n_init, ані інший random_state цього не полагодять — не пощастило з методом, а не з налаштуваннями.
Питання 6 / 8

Скільки кластерів знайде k-means, якщо в даних насправді пʼять природних груп, а ти задав k = 3?

Чому так. k — це вхідний параметр, а не результат. Скільки попросиш, стільки груп і буде, навіть якщо в даних їх нема жодної. Саме тому вибір k — окрема робота (лікоть, силует, потреби задачі), а не щось, що станеться саме. Методи, які визначають кількість груп самі, влаштовані інакше: DBSCAN шукає згущення, ієрархічна кластеризація будує дерево, яке ріжуть на потрібній висоті.
Питання 7 / 8

Силует однієї точки дорівнює 0.05. Як це читати?

Чому так. Силует — це (b − a) / max(a, b), де a — середня відстань до своїх, b — до найближчих чужих. Значення біля нуля означає a ≈ b: точка лежить на межі, і її приналежність вирішує випадковість. Відʼємне значення означало б, що до чужих ближче, ніж до своїх. У лекції оголошення A9 має силует 0.205 — дорогий телефон старого року, який однаково погано підходить обом групам.
Питання 8 / 8

Кластеризація дошки оголошень знайшла сегмент, у якому шахрайських оголошень 20.6 % проти 12.6 % по всій дошці. Індекс Ренда з колонкою «шахрайське» — 0.007. Який висновок правильний?

Чому так. Індекс Ренда 0.007 означає збіг рівно такий, який дало б випадкове перемішування. Перекіс 20.6 % проти 6.8 % між сегментами є, але детектора з нього не виходить: precision 0.206 — це лише трохи краще за випадковий тик у стільки ж рядків (0.126), тобто з кожних пʼяти тривог чотири хибні. Причина не в невдалому k, а в ознаках: шахрайство тут — це відношення ціни до типової ціни такого самого телефона, і в колонках «ціна» та «рік» такого відношення просто немає. Кластеризація знаходить те, що є в геометрії даних, а не те, що тобі цікаво.