Тест самоперевірки

Логістична регресія

Обери відповідь — і одразу побачиш пояснення. Помилитись тут корисніше, ніж на іспиті.

← до лекції
Відповіді0 / 8   правильних: 0
Питання 1 / 8

Модель навчена й більше не змінюється. Поріг зсунули з 0.5 на 0.8. Що станеться з recall і precision?

Чому так. Високий поріг означає, що модель оголошує позитивним лише те, у чому дуже впевнена. Хибних тривог стає менше — precision росте. Але частину справжніх позитивів вона тепер проґавить — recall падає. Варіант «обидві зростуть» спокусливий, бо «суворіше» звучить як «краще», але precision і recall дивляться в різні боки: одна рахує частку правильних серед піднятих тривог, друга — частку знайдених серед усіх справжніх позитивів.
Питання 2 / 8

У навченої моделі β₁ = 0.36 для ознаки «години підготовки». Як це правильно прочитати?

Чому так. Логістична регресія лінійна не за ймовірністю, а за логітом. Тому коефіцієнт діє на шанси, і діє множенням: odds(x+1)/odds(x) = e^β₁ = e^0.36 ≈ 1.43, тобто +43% до шансів. Перші два варіанти — найпоширеніша помилка: приріст імовірності не сталий, він великий посередині кривої і майже нульовий на хвостах.
Питання 3 / 8

Чому логістичну регресію не навчають на MSE, хоча технічно це можливо?

Чому так. Головна причина структурна: log-loss опукла завжди — у неї рівно один мінімум, — а MSE після сигмоїди має плато й локальні ями, і гарантії знайти глобальний мінімум немає. У практиці ми перевірили це тестом хорди: з 300 випадкових напрямків MSE вилізла над хордою у двох третинах, log-loss — у жодному. Друга причина мʼякша: MSE карає впевнену помилку лише вчетверо сильніше за невпевнену, логарифм — необмежено.
Питання 4 / 8

Ти написав(ла) градієнтний спуск без регуляризації, він збігся, але коефіцієнти не збігаються з LogisticRegression() зі стандартними налаштуваннями. Найімовірніша причина?

Чому так. LogisticRegression має penalty=ʼl2ʼ і C=1 за замовчуванням, тому вона розвʼязує іншу задачу — зі штрафом за великі ваги. Щоб порівняння було чесним, штраф треба вимкнути: penalty=None. Різні оптимізатори тут ні до чого: log-loss опукла, тому lbfgs і градієнтний спуск сходяться в ту саму точку, просто з різною швидкістю. І ознак sklearn сам не масштабує — це завжди твоя робота.
Питання 5 / 8

Класи виявилися лінійно роздільними: існує пряма, що ідеально розділяє їх. Що зробить логістична регресія без регуляризації?

Чому так. Правдоподібність у цьому випадку не має максимуму всередині простору параметрів. Роблячи сигмоїду дедалі крутішою, модель робить log-loss дедалі меншою — і так до нескінченності. На практиці оптимізатор або впреться в ліміт ітерацій, або видасть величезні коефіцієнти. Саме тому в логістичній регресії регуляризація потрібна частіше, ніж у лінійній, і саме тому вона увімкнена за замовчуванням.
Питання 6 / 8

Задача: 2% транзакцій шахрайські. Модель на порозі 0.5 дає accuracy 98% і не ловить майже нікого. Що це означає?

Чому так. Тривіальний класифікатор «завжди негативний» теж дає 98% — отже, число нічого не каже про модель. Модель, найімовірніше, чесно вивчила, що подія рідкісна, і її шкала впевненості просто зсунулася разом з апріорною ймовірністю. Лікування — знизити поріг (або class_weight=ʼbalancedʼ) і замінити метрику на precision, recall, F1 чи PR-AUC. Збільшення порогу зробило б лише гірше.
Питання 7 / 8

Два класи лежать так: один — щільна хмара в центрі, другий — кільце навколо неї. Що зробить логістична регресія на цих двох ознаках?

Чому так. Межа рішення — це множина точок, де логіт дорівнює нулю, тобто рівняння прямої (площини, гіперплощини). Крива ймовірності вигинається, а межа — ні. Плутанина між ними трапляється постійно. Вихід той самий, що й у лінійній регресії: додати похідну ознаку. Наприклад, x₁² + x₂² перетворює кільце на смугу, і задача стає лінійно роздільною.
Питання 8 / 8

Ти вмикаєш L2-регуляризацію. Одна ознака — дохід у гривнях (десятки тисяч), друга — вік у роках. Що станеться, якщо не стандартизувати ознаки?

Чому так. Штраф рахується від величини ваг, а величина ваг обернено повʼязана з масштабом ознаки: щоб дати той самий внесок у логіт, ознаці в десятках тисяч потрібен крихітний коефіцієнт. Крихітний коефіцієнт майже нічого не додає до Σβ² — отже, така ознака штраф фактично обходить, а вік платить за двох. Саме тому перед регуляризованою моделлю ознаки стандартизують завжди, а не «за бажанням».