Тест самоперевірки

PCA — метод головних компонент

Обери відповідь — і одразу побачиш пояснення. Помилитись тут корисніше, ніж на іспиті.

← до лекції
Відповіді0 / 8   правильних: 0
Питання 1 / 8

Що робить PCA із сімома вихідними ознаками?

Чому так. PCA — це перетворення, а не відбір. Кожна компонента є сумою всіх вихідних ознак із власними вагами: перша компонента нашої дошки дорівнює 0.44·ціна + 0.57·типова + 0.57·каталог + 0.39·рік + … Тому після PCA у таблиці немає жодної вихідної колонки. Відбір ознак (feature selection) — це інша операція, і саме він залишає підмножину наявних стовпців.
Питання 2 / 8

Перша головна компонента — це:

Чому так. Перша компонента — напрямок найбільшої витягнутості хмари, і це напрямок, а не колонка з таблиці. Важливості для задачі PCA не знає взагалі: таргета він не бачить. І це не пряма, що мінімізує вертикальні відстані: PCA міряє відстані перпендикулярні, тому на тій самій хмарі це дві різні прямі.
Питання 3 / 8

Ти крутиш пряму навколо центру хмари. Розкид проєкцій зростає. Що в цей момент відбувається із сумою квадратів відстаней від точок до прямої?

Чому так. За теоремою Піфагора для кожної точки t² + d² дорівнює квадрату її відстані до центру, а ця відстань від кута прямої не залежить. Отже сума t² + сума d² — стала: у першому інтерактиві лекції вона дорівнює 32.00 при будь-якому куті. Тому «зберегти максимум розкиду» й «втратити мінімум» — одна задача, а не дві.
Питання 4 / 8

На нашій дошці власні числа після стандартизації такі: 2.796, 1.113, 1.076, 0.946, 0.669, 0.396, 0.010. Скільки компонент треба взяти, щоб зберегти щонайменше 90 % розкиду?

Чому так. Накопичена частка йде так: 39.9 %, 55.8 %, 71.1 %, 84.6 %, 94.2 %. Поріг 90 % проходимо лише на пʼятій компоненті. Дві компоненти, які можна намалювати, тримають 55.8 % — картинку в них будувати можна, але майже половину розкиду ти при цьому викидаєш.
Питання 5 / 8

Ти порахував PCA на сирій таблиці, де ціна в гривнях (розкид 8 689), а стан у балах від 1 до 4 (розкид 0.85). Перша компонента отримала вагу 0.758 у ціни й 0.000007 у стану. Що це означає?

Чому так. PCA максимізує розкид, а розкид міряється в одиницях самої ознаки. Гривні дають величезні числа, бали — крихітні, тому напрямок найбільшого розкиду майже точно збігається з ціною. Помилки в обчисленні немає: помилка в тому, що перед PCA не зробили стандартизацію. Після StandardScaler ваги стають 0.44 у ціни й 0.02 у стану, і компонента перестає бути переписаною ціною.
Питання 6 / 8

У нашій таблиці дві колонки корелюють на 0.989. Як це видно в результаті PCA?

Чому так. Дві майже однакові колонки означають, що хмара майже не має товщини в напрямку їхньої різниці. Саме цей напрямок PCA і ставить останнім: сьома компонента дорівнює 0.712·каталог − 0.702·типова й тримає 0.15 % розкиду. Колонок PCA не викидає — він лише перекладає надлишковість у компоненту з мізерною вагою.
Питання 7 / 8

PCA — метод без учителя, таргета він не бачить. Чи можна порахувати його на всіх даних до поділу на train і test?

Чому так. Витік — це будь-яке використання тестових рядків при підготовці даних, а не тільки підглядання відповідей. Ефект вимірюваний: частка розкиду тестових рядків, яку тримають дві компоненти, на наших даних дорівнює 54.6 % чесно проти 56.1 % з витоком, а на вибірці з 40 рядків — 53.4 % проти 62.8 %. Правильно класти StandardScaler і PCA у Pipeline разом із моделлю.
Питання 8 / 8

У площині перших двох компонент шахрайські оголошення розсипані так само, як чесні: медіана PC1 у них −0.38 проти −0.43. Який висновок правильний?

Чому так. PCA не знає, що ти шукаєш: він повертає напрямок найбільшої витягнутості хмари, а тут це «дорогий телефон проти дешевого». Сигнал про шахрайство в даних є — його видає відношення ціни оголошення до типової ціни такої самої моделі, — але відношення є дією нелінійною, а компоненти є лише зваженими сумами. Тому саме цю структуру PCA у принципі побачити не може.