На 10 000 обстежених припадає 10 хворих. Модель-порожнеча всім пише «здоровий». Які в неї accuracy і recall?
Чому так. TP = 0, FP = 0, TN = 9 990, FN = 10. Accuracy = 9 990 / 10 000 = 0,999, recall = 0 / 10 = 0. Обидва числа правильні й описують ту саму модель: перше рахує всі відповіді разом, друге дивиться лише на клас, заради якого систему й будували. Не визначена тут precision — у неї нуль у знаменнику.
Питання 2 / 8
Поріг зсунули з 0,5 на 0,8. Що обовʼязково станеться з recall?
Чому так. Підвищення порога може лише прибрати позитивні прогнози, а не додати їх. Отже TP не росте, FN не спадає — recall монотонно спадає з порогом. З precision так не можна: він зазвичай росте, але не обовʼязково монотонно, бо разом із FP зникають і TP.
Питання 3 / 8
Модель дає precision 1,00 і recall 0,02. Арифметичне середнє — 0,51, F1 — 0,039. Чому підсумком вважають саме друге число?
Чому так. Модель, яка знайшла 2% хворих, для скринінгу безкорисна, і половина балів їй не належить. Гармонійне середнє саме так і поводиться: воно різко падає, щойно одна зі сторін провалилась. TN у формулі F1 немає взагалі — це окрема її властивість, а не причина різниці.
Питання 4 / 8
У формулі F1 не зустрічається TN. Це вада чи властивість?
Чому так. Ігнорування TN зроблено навмисно й корисне саме там, де позитивний клас рідкісний. Але якщо класи рівноправні й тебе цікавить здатність моделі не піднімати тривогу, потрібна окрема метрика — specificity = TN / (TN + FP). Саме пара «recall + specificity» лежить в основі ROC.
Питання 5 / 8
Замовник вимагає recall не нижче 0,98. У практиці це зсунуло поріг із 0,50 на 0,29. Чим ми за це заплатили?
Чому так. Пропущених хворих стало 1 замість 7 — врятували шістьох. Але FP виріс із 26 до 69, тобто 43 зайвих обстеження на 6 знайдених хворих. Саме це відношення, а не абстрактне «recall 0,98», і треба нести замовнику: воно дозволяє ухвалити рішення.
Питання 6 / 8
У F-beta поставили β = 2. Що це означає?
Чому так. У формулі стоїть β², тому вага recall дорівнює 4. β = 2 — класика медичного скринінгу й антифроду, де пропуск дорожчий за хибну тривогу. Дзеркальний випадок β = 0,5 робить precision учетверо важливішим — це спам-фільтри й автоматичні блокування.
Питання 7 / 8
Позитивних у популяції 8%, вартість пропуску дорівнює вартості хибної тривоги (C_FN = C_FP). Де опиниться поріг, що мінімізує сумарні втрати?
Чому так. У практиці мінімум припадає на 0,66. Позитивних лише 8%, тому кожен крок порога вниз чіпляє хибні тривоги з великої маси негативів і рятує мало пропусків. Коли обидві помилки коштують однаково, вигідно мовчати частіше. Зі зростанням C_FN оптимум їде вліво: при відношенні 30 він уже 0,41.
Питання 8 / 8
Average precision дорівнює 0,30, а позитивних у вибірці 5%. Як це читати?
Чому так. На відміну від ROC, у PR-кривої базовий рівень не 0,5, а частка позитивних. При 5% випадковий класифікатор дає AP ≈ 0,05, тож 0,30 — це шестикратна перевага, хоч число й виглядає низьким. Порівнювати AP із 0,5 — типова помилка, яка спонукає викидати робочі моделі.