Ти порахував по архіву, що 75% шахрайських оголошень містять слово «передоплата». Чи можна сказати, що оголошення зі словом «передоплата» шахрайське з ймовірністю 75%?
Чому так. Це і є розворот, з якого починається тема. Чисельник в обох дробах один (оголошення, які і шахрайські, і зі словом), а знаменники різні: «усі шахрайські» проти «усі зі словом». В архіві лекції вийшло 21/28 = 75% і 21/27 = 78% — числа близькі випадково. Останній варіант теж хибний: при частому шахрайстві відповідь може бути й більшою за 75%.
Питання 2 / 8
На дошці 10 шахрайських оголошень зі ста. Ознака спрацьовує на 8 із 10 шахраїв і помилково — на 2 із 10 чесних. Ознака спрацювала. Наскільки ймовірно, що оголошення шахрайське?
Чому так. Чесних девʼяносто, і 20% від девʼяноста дає 18 хибних тривог — більше, ніж усі 8 справжніх разом. Це рахунок з розділу 3 лекції й з першого інтерактиву. 80% — це P(ознака | шахрайство), тобто знову плутанина напрямків.
Питання 3 / 8
Ту саму модель із тією самою ознакою переносять на іншу дошку, де шахраїв не 10 зі ста, а 2. Що станеться зі змістом спрацювання ознаки?
Чому так. Апріорна ймовірність входить у формулу множником, і при рідкіснішому класі та сама ознака дає нижчу апостеріорну ймовірність — на другому інтерактиві це видно повзунком. Саме тому «модель сказала 90%» без відповіді на питання «скільки шахраїв на цій дошці?» не означає нічого.
Питання 4 / 8
Чому наївний Баєс роблять наївним — тобто чому припускають, що ознаки незалежні?
Чому так. Припущення беруть не тому, що воно правдиве, а тому, що воно перетворює нерозвʼязну задачу на добуток простих множників. У лекції це виміряно: «терміново» і «передоплата» стоять разом у 17 шахрайських оголошеннях, тоді як незалежність передбачає близько 14. Модель може бути корисною, будучи неправильною.
Питання 5 / 8
Наївне припущення хибне. Чому метод усе одно непогано класифікує?
Чому так. Наївний Баєс — добрий класифікатор і поганий вимірювач ймовірності: його predict варто брати всерйоз, а predict_proba — ні. Згладжування лікує зовсім іншу біду (нульові лічильники) і до залежності ознак стосунку не має.
Питання 6 / 8
Слово «чек» жодного разу не трапилось у шахрайських оголошеннях архіву. Що станеться без згладжування Лапласа з оголошенням «Терміново, лише передоплата, дешево, є чек»?
Чому так. Один множник-нуль зʼїдає весь добуток — це третій інтерактив лекції при α = 0. Помилки не буде: нуль — цілком коректне число, тому поломка тиха. При α = 1 те саме оголошення дає 0.57 на користь шахрайства.
Питання 7 / 8
Навіщо в наївному Баєсі згладжування Лапласа — параметр alpha?
Чому так. Це страховка від твердження «такого не буває ніколи», зробленого на скінченній вибірці. Точність від alpha не росте монотонно: завелике значення підтягує всі ймовірності одну до одної й стирає різницю між класами. З машинним нулем бореться інший інструмент — логарифми.
Питання 8 / 8
У тексті 300 слів, ймовірність кожного близько 0.01. Що станеться з прямим добутком і чим його замінюють?
Чому так. Найменше додатне число у float64 — близько 5·10⁻³²⁴, і 0.01 у степені 162 вже під ним. Логарифм перетворює множення на додавання, а порівняння не псує, бо він зростаючий: більшому добутку відповідає більший логарифм. Alpha тут не допоможе — вона про нульові лічильники.