Курс AI / ML

Джерела

Усе, на що курс спирався. Лекції написані самостійно — джерела тут для орієнтування, перевірки й глибшого занурення.

← до списку тем

01 / Візуальні есеMLU-Explain

Проєкт Amazon Machine Learning University. Саме звідси взято підхід «пояснювати через інтерактив», який ми розвинули у своєму форматі. Матеріали поширюються за ліцензією CC BY-SA 4.0; наші лекції, написані з опорою на них, поширюються за тією самою ліцензією.

теманазвапосилання
03Train / Validation / Testmlu-explain.github.io/train-test-validation
05Precision і Recallmlu-explain.github.io/precision-recall
06ROC та AUCmlu-explain.github.io/roc-auc
07Лінійна регресіяmlu-explain.github.io/linear-regression
09Логістична регресіяmlu-explain.github.io/logistic-regression
13Bias-Variancemlu-explain.github.io/bias-variance
14Крос-валідаціяmlu-explain.github.io/cross-validation
17Дерева рішеньmlu-explain.github.io/decision-tree
18Random Forestmlu-explain.github.io/random-forest
31Нейронні мережіmlu-explain.github.io/neural-networks
36Подвійний спускmlu-explain.github.io/double-descent
37Подвійний спуск: математикаmlu-explain.github.io/double-descent2
38Справедливість моделейmlu-explain.github.io/equality-of-odds
39Навчання з підкріпленнямmlu-explain.github.io/reinforcement-learning

02 / ПершоджерелаНаукові статті

Роботи, у яких відповідні методи були вперше описані. Корисно прочитати, щоб побачити, як ідея виглядала до того, як стала розділом підручника.

темастаття
11On the Optimality of the Simple Bayesian Classifier under Zero-One Loss
P. Domingos, M. Pazzani, 1997
11Idiot's Bayes — Not So Stupid After All?
D. J. Hand, K. Yu, 2001
17Induction of Decision Trees
J. R. Quinlan, 1986
17A Mathematical Theory of Communication
C. E. Shannon, 1948
18Bagging Predictors
L. Breiman, 1996
18Random Forests
L. Breiman, 2001
28On Lines and Planes of Closest Fit to Systems of Points in Space
K. Pearson, 1901 — стаття, у якій PCA вперше сформульовано як задачу про найближчу пряму
28Analysis of a Complex of Statistical Variables into Principal Components
H. Hotelling, 1933 — звідси назва «головні компоненти» й формулювання через максимум дисперсії
30The Perceptron: A Probabilistic Model for Information Storage and Organization in the Brain
F. Rosenblatt, 1958 — стаття, у якій перцептрон описано вперше
30A Logical Calculus of the Ideas Immanent in Nervous Activity
W. McCulloch, W. Pitts, 1943 — перша формальна модель нейрона як логічного елемента
30Perceptrons: An Introduction to Computational Geometry
M. Minsky, S. Papert, 1969 — книжка, у якій розібрано межі одношарової конструкції, зокрема XOR
33Understanding the Difficulty of Training Deep Feedforward Neural Networks
X. Glorot, Y. Bengio, 2010 — стаття, у якій виведено ініціалізацію Xavier із вимоги сталої дисперсії
33Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification
K. He та ін., 2015 — ініціалізація He й пояснення, звідки в ній двійка
33Rectified Linear Units Improve Restricted Boltzmann Machines
V. Nair, G. E. Hinton, 2010 — робота, з якої ReLU увійшла в широкий ужиток
33Gaussian Error Linear Units (GELUs)
D. Hendrycks, K. Gimpel, 2016 — активація, що стоїть у трансформерах
34Some Methods of Speeding Up the Convergence of Iteration Methods
Б. Т. Поляк, 1964 — робота, у якій уперше описано метод «важкої кульки», тобто класичний момент
34Adaptive Subgradient Methods for Online Learning and Stochastic Optimization
J. Duchi, E. Hazan, Y. Singer, 2011 — AdaGrad і доведення, чому крок згасає як 1/√t
34Lecture 6e — RMSProp: Divide the Gradient by a Running Average of Its Recent Magnitude
T. Tieleman, G. Hinton, 2012 — RMSProp ніколи не публікували статтею, першоджерело — оці слайди курсу
34Adam: A Method for Stochastic Optimization
D. P. Kingma, J. Ba, 2014 — Adam і виведення корекції зміщення з формули для ковзного середнього
34Decoupled Weight Decay Regularization
I. Loshchilov, F. Hutter, 2017 — AdamW: чому спад ваг треба виносити з градієнта в саме правило кроку
34SGDR: Stochastic Gradient Descent with Warm Restarts
I. Loshchilov, F. Hutter, 2016 — звідси в ужиток увійшов косинусний розклад кроку
34The Marginal Value of Adaptive Gradient Methods in Machine Learning
A. C. Wilson та ін., 2017 — експерименти, з яких виросло твердження «налаштований SGD узагальнює краще за Adam»
38Equality of Opportunity in Supervised Learning
M. Hardt, E. Price, N. Srebro, 2016
36Reconciling Modern Machine Learning Practice and the Bias-Variance Trade-Off
M. Belkin та ін., 2019
36Deep Double Descent: Where Bigger Models and More Data Hurt
P. Nakkiran та ін., 2019
40A Value for n-Person Games
L. S. Shapley, 1953 — робота, у якій уперше доведено єдиність чесного поділу виграшу
40A Unified Approach to Interpreting Model Predictions
S. Lundberg, SI. Lee, 2017 — стаття, з якої почався SHAP
40«Why Should I Trust You?»: Explaining the Predictions of Any Classifier
M. T. Ribeiro, S. Singh, C. Guestrin, 2016 — LIME
40Greedy Function Approximation: A Gradient Boosting Machine
J. H. Friedman, 2001 — тут уперше описано графік частинної залежності (PDP)
40Peeking Inside the Black Box: Visualizing Statistical Learning with Plots of Individual Conditional Expectation
A. Goldstein та ін., 2013 — криві ICE
40Bias in Random Forest Variable Importance Measures
C. Strobl та ін., 2007 — про зсув MDI до ознак із великою кількістю значень
40Stop Explaining Black Box Machine Learning Models for High Stakes Decisions
C. Rudin, 2019 — аргумент на користь прозорих моделей там, де рішення зачіпає людину

03 / ПідручникиКниги

Наука про дані: машинне навчання та інтелектуальний аналіз данихВ. Б. Мокін, М. В. Дратований, 2024

Україномовний посібник. Орієнтир для загальної структури курсу та частини теорії.

The Elements of Statistical LearningT. Hastie, R. Tibshirani, J. Friedman

Класика статистичного навчання. Вільно доступна на сайті Стенфорду.

Reinforcement Learning: An IntroductionR. S. Sutton, A. G. Barto

Основний підручник з навчання з підкріпленням. Доступний вільно.

Fairness and Machine LearningS. Barocas, M. Hardt, A. Narayanan

Про справедливість моделей. Доступна онлайн.

04 / ІнструментиДокументація та практика

ресурсдля чого
scikit-learnДокументація з чудовими поясненнями теорії
NumPyДовідник з масивів
pandasРобота з таблицями
KaggleДатасети й ноутбуки для практики
sklearn.inspectionПерестановкова важливість, PDP та ICE «з коробки»
Interpretable Machine LearningC. Molnar — книжка-довідник з методів пояснення, вільно доступна онлайн

05 / ЛіцензіяУмови поширення

Коротко. Лекції курсу поширюються за CC BY-SA 4.0: можна вільно використовувати, змінювати й поширювати за умови збереження авторства та тієї самої ліцензії для похідних матеріалів.

Матеріали проєкту MLU-Explain поширюються за тією самою ліцензією CC BY-SA 4.0, і посилання на кожну статтю наведені в розділі 01.