Ця сторінка — не підсумок курсу, а домовленість перед ним. Компʼютерний зір виріс англійською, і майже кожен його термін приїхав до нас без багажу: словника немає, підручники розходяться між собою, а машинні переклади дають «конволюційні мережі» — слова, яких українською не існує.
Тому тут не переказ чужих визначень, а вибір. Для кожного поняття ми називаємо одну канонічну назву — ту, якої курс дотримуватиметься від першої теми до сорокової — і, якщо переклад спірний, поруч чесно перелічуємо інші вживані варіанти, щоб ти впізнав їх у чужому тексті.
ДомовленостіЯк ми називаємо спірне
Десяток рішень, з яких найчастіше починаються суперечки. Правило вибору просте й одне на всі рядки: беремо українське слово, коли воно зрозуміле без підказки, і лишаємо англійське, коли читач зустріне його як імʼя аргументу в коді — щоб між лекцією й документацією не було перекладацького шва.
| Англійською | Пишемо | Чому саме так |
|---|---|---|
| convolutional | згортковий | «Конволюційний» — калька без значення. Згортка вже є в українській математиці. |
| feature map | карта ознак | «Карта» жива в мові: карта висот, карта глибин. «Мапа» тягне англійське звучання. |
| padding | padding | Імʼя аргументу в кожній бібліотеці. Український опис — «доповнення країв» — даємо поруч. |
| stride | крок (stride) | «Крок» зрозумілий одразу, тож заголовок український, а оригінал іде в дужках — інакше не впізнаєш у коді. |
| bounding box | рамка (bounding box) | «Обмежувальна рамка» точна, але громіздка. bbox лишаємо для коду й імен полів. |
| backbone | backbone (кістяк) | Параметр у конфігах зветься саме так. «Хребет» буквальний, «кістяк» пояснювальний — але жоден не вживають. |
| neck / head | neck, head (шия, голова) | Та сама причина: у конфігах детекторів це назви полів. Українські слова тримаємо як пояснення. |
| upsampling | збільшення роздільності | Дія проста й називається українською без утрат. Те саме з downsampling — зменшення. |
| ground truth | еталонна розмітка | «Наземна істина» безглузда, «істина» надто гучна. У коді лишається gt. |
| skip connection | скіп-зʼєднання | «Пропускне» неоднозначне: пропускає чи пропускається. Прижилось саме скіп. |
| pooling | пулінг | «Підвибірка» й «агрегація» пробувались і не прижились у жодному тексті. |
| instance segmentation | instance segmentation | «Сегментація екземплярів» правильна, але в назвах моделей і в розмові звучить англійська. Ставимо обидві. |
ПокажчикАбетка
Літери, у яких щось є
А 3 терміни
Автоенкодер autoencoder
Мережа, яку вчать віддати на виході те саме зображення, що прийшло на вхід, — але змушують пропустити його крізь вузьке місце, шар із дуже малою кількістю чисел. Щоб пролізти крізь це горло, мережа мусить навчитися лишати тільки найважливіше.
Тема 37 · Автоенкодери й VAE
Вузьке місце (bottleneck) — найтонший шар посередині. Те, що в ньому лишилось, і називають латентним представленням зображення.
Атрозна згортка atrous / dilated convolution
Згортка з дірками: ядро бере пікселі не поспіль, а через один, через два, через чотири. Так воно охоплює значно ширшу ділянку кадру, не набираючи жодної зайвої ваги.
Тема 25 · FCN і DeepLab
Звідки назва. Від французького à trous — «з дірками».
Трапляється переклад «розріджена згортка»; ми кажемо атрозна, бо саме це слово стоїть
у назвах статей, а в коді відповідний аргумент зветься dilation.
Аугментація augmentation
Штучне розширення навчального набору: те саме фото віддзеркалюють, повертають, обрізають, притемнюють — і модель щоразу бачить його трохи іншим, а тому вчиться впізнавати предмет, а не запамʼятовувати картинку.
Тема 10 · Навчання CNN
Б 4 терміни
Багатоголова увага multi-head attention
Кілька механізмів уваги, що працюють на одному й тому самому вході паралельно: кожна «голова» вчиться дивитись на свій бік справи, а результати склеюють в один.
Тема 33 · Vision Transformer
Багатоміткова класифікація multi-label classification
Постановка, де одне зображення може отримати кілька міток одразу — «телефон», «зарядка», «є подряпини». Мітки не конкурують: кожна має власне число й власний поріг.
Тема 02 · Карта задач CV
Часта плутанина. У звичайній багатокласовій класифікації класи ділять між собою одиницю, і мітка на фото рівно одна. Тут фото може дістати чотири мітки або жодної.
Батч-нормалізація batch normalization, батчнорм
Шар, що на кожному кроці навчання приводить числа всередині мережі до спільного масштабу. Через це навчання йде швидше й помітно стійкіше до вибору кроку.
Тема 10 · Навчання CNN
Бітова глибина bit depth
Скільки біт відведено на одне число пікселя. Вісім біт дають 256 рівнів яскравості, від 0 до 255, — і саме тому в кожному підручнику зустрічається число 255.
Тема 01 · Зображення очима компʼютера
В 1 термін
Впевненість confidence score
Число від нуля до одиниці, яке детектор ставить поруч із кожною знайденою рамкою: наскільки він сам вірить, що там справді предмет, а не візерунок на столі.
Тема 02 · Карта задач CV · тема 17
Навіщо воно. Опустиш поріг упевненості — рамок побільшає, повнота зросте, точність упаде. Саме з цього компромісу й будується метрика AP.
Г 3 терміни
Генератор і дискримінатор generator, discriminator
Дві мережі, з яких складається GAN. Генератор малює підробки, дискримінатор вчиться відрізняти їх від справжніх фото, і кожен тисне на іншого доти, доки підробки не стають переконливими.
Тема 38 · GAN
Гістограма зображення image histogram
Стовпчикова діаграма: скільки пікселів припадає на кожен рівень яскравості. За її формою одразу видно, знімок темний, пересвічений чи блідий.
Тема 01 · Зображення очима компʼютера
Градації сірого grayscale
Одноканальне зображення, у якому кожен піксель — лише яскравість, без жодних відомостей про колір.
Тема 01 · Зображення очима компʼютера
Часта плутанина. Сірий не є середнім трьох каналів: зелений важить утричі більше за синій, бо око чутливіше саме до нього.
Д 6 термінів
Двоетапний детектор two-stage detector
Детектор, що працює у два заходи: спершу пропонує ділянки, де взагалі може щось бути, і лише потім розглядає кожну з них уважно.
Тема 18 · Двоетапні детектори
Детектор країв Кенні Canny edge detector
Класичний алгоритм пошуку контурів: рахує, де яскравість змінюється найрізкіше, лишає з кожного гребеня лише вершину й доводить лінії двома порогами, щоб слабкі краї не розсипались на крапки.
Тема 04 · Згортка вручну
Детекція обʼєктів object detection
Задача, де модель віддає список: для кожного знайденого предмета — рамка, мітка класу й число впевненості. Відповідає одразу на «що» і на «де».
Тема 02 · Карта задач CV · блок 4 цілком
Дифузійна модель diffusion model
Генеративна модель, яку навчили прибирати шум. Починають із чистого шуму й крок за кроком знешумлюють його, доки з нього не проступить зображення.
Тема 39 · Дифузійні моделі
Донавчання fine-tuning
Продовження навчання вже навченої мережі на своїх даних — зазвичай із дуже малим кроком, щоб підправити її під нову задачу й не зруйнувати те, що вона вже вміє.
Тема 11 · Перенос навчання
Інший вживаний варіант — «тонке налаштування». Ми кажемо донавчання: це саме навчання, тільки коротке й обережне.
Дропаут dropout
Під час навчання випадкову частину нейронів на кожному кроці вимикають. Мережа через це не може покластися на кілька окремих ознак і мусить шукати запасні.
Тема 10 · Навчання CNN
Е 2 терміни
Енкодер-декодер encoder–decoder
Будова з двох половин: перша поступово стискає зображення до компактного опису, друга розгортає з цього опису відповідь потрібного розміру — маску, глибину, нове зображення.
Тема 24 · U-Net
Еталонна розмітка ground truth
Правильна відповідь, з якою порівнюють прогноз моделі: мітки, рамки чи маски, проставлені людиною.
Тема 02 · Карта задач CV
Чому не «наземна істина». Буквальний переклад безглуздий, а
«істина» надто гучна для роботи, яку зробив утомлений розмітник о шостій вечора.
Кажемо «еталонна розмітка» або просто «розмітка»; у коді лишається gt.
З 6 термінів
Залишковий блок residual block
Блок, у якому вихід кількох шарів додається до їхнього ж входу. Мережі лишається вивчити тільки поправку до того, що вже прийшло, а не всю відповідь із нуля.
Тема 13 · ResNet і скіп-зʼєднання
Заморожування шарів freezing
Заборона змінювати ваги частини мережі під час навчання. Заморожену частину використовують як готовий видобувач ознак, а вчать лише те, що зверху.
Тема 11 · Перенос навчання
Згортка convolution
Операція, у якій маленька табличка чисел ковзає по зображенню і в кожному положенні видає одне число: наскільки цей шматок схожий на те, що табличка шукає.
Тема 04 · Згортка вручну · далі всюди
Згорткова нейромережа convolutional neural network, CNN
Мережа, головна частина якої складена зі згорткових шарів. З 2012 по 2020 рік — основний інструмент компʼютерного зору, і досі основний там, де мало даних.
Тема 09 · CNN цілком (від LeNet до VGG)
Не «конволюційна». Калька поширена в машинних перекладах, але українською нічого не означає. У курсі її немає жодного разу.
Згортковий шар convolutional layer
Шар, що застосовує до входу набір ядер і віддає стільки карт ознак, скільки в нього ядер. Ваги ядра ті самі для всього кадру — тому шар маленький, а працює скрізь.
Тема 07 · Згортковий шар
Спільні ваги (weight sharing). Саме з цього одного рішення випливає і мала кількість параметрів, і те, що ознака знаходиться в будь-якому кутку.
Зменшення і збільшення роздільності downsampling, upsampling
Дві протилежні дії над картою ознак: зробити її дрібнішою (пулінг або згортка з кроком 2) чи, навпаки, більшою (транспонована згортка або проста інтерполяція).
Тема 08 · Пулінг · тема 24 · U-Net
Чому переклали. Тут англійське слово нічого не додає: дія проста й називається українською без утрат. У коді відповідні шари звуться по-різному в кожній бібліотеці, тож єдиного імені аргументу, яке варто було б берегти, немає.
К 10 термінів
Канал channel
Одна площина чисел у зображенні або в карті ознак. Кольорове фото має три канали, а карта ознак усередині мережі — сотні.
Тема 01 · Зображення очима компʼютера · тема 07
Кандидат-область region proposal
Ділянка кадру, яку заздалегідь позначили як «тут може щось бути», щоб класифікатор не перебирав усе зображення підряд.
Тема 18 · Двоетапні детектори
Історія в одному рядку. Спершу кандидатів шукав Selective Search — злиття схожих ділянок без жодного навчання. Faster R-CNN замінив його окремою маленькою мережею, і саме це зробило детекцію швидкою.
Карта ознак feature map
Вихід згорткового шару: така сама таблиця чисел, як зображення, тільки в клітинці стоїть не яскравість, а сила відгуку ознаки — наскільки сильно тут «спрацювало» ядро.
Тема 07 · Згортковий шар
Карта, не мапа. «Карта» вже живе в українській у цьому самому значенні — карта висот, карта глибин, теплова карта. «Мапа» тягне за собою англійське звучання й нічого не додає.
Ключова точка keypoint
Наперед визначена точка на предметі, у якої є свій номер і свій сенс: суглоб людини, кут документа, кутик ока. Номер тут значущий — точка 3 завжди праве плече.
Тема 02 · Карта задач CV · тема 05
Коефіцієнт Дайса Dice coefficient
Міра збігу двох масок: подвоєна спільна площа, поділена на суму площ. Міряє те саме, що IoU, але мʼякше карає за похибку — і тому завжди трохи більший.
Тема 02 · Карта задач CV · тема 23
Колапс мод mode collapse
Хвороба GAN: генератор знаходить дві-три картинки, які надійно обманюють дискримінатора, і починає малювати тільки їх, забувши про різноманіття.
Тема 38 · GAN
Кольоровий простір color space
Спосіб задати колір числами: RGB, HSV, градації сірого. Те саме фото в різних просторах виглядає однаково, а числа в ньому геть різні.
Тема 01 · Зображення очима компʼютера · тема 03
Контрастне навчання contrastive learning
Навчання, у якому модель зближує представлення пари, що справді повʼязана (фото і його підпис), і розсуває пари, зібрані навмання.
Тема 36 · CLIP і мультимодальність
Край edge
Місце, де сусідні пікселі різко відрізняються яскравістю. Мовою чисел край — це не лінія й не контур, а великий стрибок між двома сусідами; величину цього стрибка називають градієнтом зображення.
Тема 01 · Зображення очима компʼютера · тема 04
Крок stride
На скільки пікселів ядро зсувається за один раз. Крок 1 — щільно, піксель за пікселем; крок 2 — через один, і карта ознак на виході виходить удвічі меншою.
Тема 07 · Згортковий шар
Чому в дужках. «Крок» зрозумілий одразу, тому заголовок
український. Але в коді аргумент зветься stride, тож оригінал ми
ставимо поруч завжди, а не лише при першій згадці.
Л 1 термін
Латентний простір latent space
Простір коротких описів, у які модель стискає зображення. Близькі точки в ньому означають схожі картинки, і тому по ньому можна ходити й дивитись, як одне зображення плавно перетікає в інше.
Тема 37 · Автоенкодери й VAE · тема 39
М 1 термін
Маска mask
Відповідь сегментації: масив розміру зображення, де кожній клітинці поставлено номер класу або позначка «належить предмету / не належить».
Тема 02 · Карта задач CV · блок 5
Н 1 термін
Навчена ознака проти придуманої learned vs hand-crafted feature
Два підходи до того самого. Раніше інженер сам вирішував, що рахувати на зображенні (гістограми, HOG, SIFT), і писав це руками. Тепер мережа виводить ознаки сама з даних, і саме це виявилось вирішальним.
Тема 05 · Класичні ознаки
О 4 терміни
Одноетапний детектор one-stage detector
Детектор, що видає рамки й класи за один прохід мережі, без окремого етапу пошуку кандидатів. Помітно швидший; історично був трохи менш точним, доки не зʼявився focal loss.
Тема 19 · YOLO · тема 20
Оператор Собеля Sobel operator
Пара маленьких ядер, що рахують, наскільки різко змінюється яскравість по горизонталі й по вертикалі. Найпростіший спосіб побачити краї на власні очі.
Тема 04 · Згортка вручну
Оптичний потік optical flow
Поле зсувів: куди перемістився кожен піксель або кожна ділянка між двома сусідніми кадрами відео. Показує рух там, де окремий кадр показує лише вигляд.
Тема 30 · Відео: трекінг
Оцінка глибини depth estimation
Задача, де модель віддає масив розміру фото, але в кожній клітинці не клас, а відстань від камери. Формою це сегментація, змістом — регресія на кожному пікселі.
Тема 02 · Карта задач CV
П 8 термінів
Патч patch
Квадратний шматочок зображення — скажімо, 16 на 16 пікселів, — який Vision Transformer перетворює на один токен і далі поводиться з ним так само, як мовна модель зі словом.
Тема 33 · Vision Transformer
Передтренована модель pretrained model
Мережа, уже навчена на великому чужому наборі — найчастіше ImageNet, — яку беруть як заготовку замість того, щоб починати з нуля.
Тема 11 · Перенос навчання
Перенос навчання transfer learning
Прийом: узяти мережу, навчену на чужій великій задачі, і пристосувати її до своєї маленької. Часто вистачає навчити один новий шар зверху.
Тема 11 · Перенос навчання
Інший вживаний варіант — «трансферне навчання». Ми беремо «перенос навчання»: воно прозоре — переносимо вивчене з однієї задачі на іншу.
Підпис до зображення image captioning
Задача, де вихід — не мітка й не рамка, а речення природною мовою, що описує фото.
Тема 28 · RNN у задачах зору
Піксель pixel
Найдрібніша клітинка зображення: однорідний квадратик одного кольору, для якого збережено числа. Від англійського picture element — «елемент зображення».
Тема 01 · Зображення очима компʼютера
Повнозвʼязний шар fully connected layer, dense
Шар, у якому кожен вхід зʼєднано з кожним виходом. Для зображення це відразу дві біди: неосяжна кількість ваг і повна втрата того, що сусідні пікселі — сусідні.
Тема 06 · Чому повнозвʼязна мережа не годиться
Позиційне кодування positional encoding
Додаткові числа, що повідомляють трансформеру, з якого місця кадру взято патч. Без них модель бачить мішок шматочків і не знає, який де лежав.
Тема 33 · Vision Transformer
Пулінг pooling
Зменшення карти ознак: беруть квадратик, зазвичай 2 на 2, і лишають від нього одне число — найбільше (max pooling) або середнє (average pooling).
Тема 08 · Пулінг і зменшення розмірності
Чому не переклали. «Підвибірка» й «агрегація» пробувались і не прижились у жодному живому тексті. А в сучасних мережах пулінг поступово витісняє згортка з кроком 2 — про це в самій темі.
Р 8 термінів
Рамка bounding box, bbox
Прямокутник зі сторонами, паралельними краям кадру, що обводить предмет. Задається координатами двох протилежних кутів — усього чотирма числами.
Тема 02 · Карта задач CV · тема 17
Канонічно — рамка. «Обмежувальна рамка» точна, але громіздка й
у реченні заважає. Скорочення bbox лишаємо для коду й імен полів у
форматах розмітки.
Рецептивне поле receptive field
Ділянка вхідного зображення, яка взагалі здатна вплинути на одне число в карті ознак. З кожним новим шаром вона росте: перший шар бачить 3 на 3 пікселі, десятий — пів кадру.
Тема 07 · Згортковий шар
Чому латинізм. «Рецептивний» усталений в українській нейрофізіології, звідки термін і прийшов у мережі. Вигадувати заміну немає сенсу.
Роздільна за глибиною згортка depthwise separable convolution
Згортка, розбита надвоє: спершу кожен канал обробляють окремо своїм ядром, потім змішують канали між собою згорткою 1 на 1. Дає майже те саме, коштує в рази менше.
Тема 14 · Inception, MobileNet, EfficientNet
Роздільність resolution
Скільки пікселів завширшки й заввишки має зображення. Фото 640 на 480 — це 307 200 пікселів, і саме з цього числа починається будь-яка оцінка вартості обчислень.
Тема 01 · Зображення очима компʼютера
Не «розширення». Це різні слова, і плутають їх постійно.
Розмиття за Гаусом Gaussian blur
Згортка з ядром, у якому центр важить найбільше, а краї — найменше. Прибирає дрібний шум і лишає великі форми; майже завжди стоїть першим кроком перед пошуком країв.
Тема 04 · Згортка вручну
Розмітка annotation, labelling
Правильні відповіді, проставлені людиною: мітки, рамки, маски, ключові точки. Найдорожча частина будь-якого проєкту зору — і саме вона зазвичай вирішує, яку постановку задачі ти можеш собі дозволити.
Тема 02 · Карта задач CV · тема 22
Розпізнавання дій action recognition
Задача, де класифікують не кадр, а відрізок відео: що саме робить людина. Потребує часового виміру — тривимірних згорток або двопотокової мережі, де одна гілка дивиться на картинку, а друга на рух.
Тема 31 · Дії у відео
Розпізнавання тексту OCR, optical character recognition
Знайти на зображенні текст і прочитати його. Складається з двох задач: детекції ділянок із текстом і перетворення картинки на рядок символів.
Тема 02 · Карта задач CV · тема 29
С 4 терміни
Самоувага self-attention
Механізм, у якому кожен елемент входу сам вирішує, на які інші елементи дивитись. На відміну від згортки, звʼязок не обмежений сусідством: перший патч може дивитись на останній без жодних проміжних шарів.
Тема 32 · Від згортки до уваги · тема 33
Про назву. «Увага до себе» звучить кумедно, тож лишаємо
самоувагу — коротку й уже вживану. Англійський запис self-attention
ставимо поруч завжди: у коді й статтях трапляється тільки він.
Семантична сегментація semantic segmentation
Задача, де кожному пікселю призначають клас. Два однакові предмети, що торкаються, зіллються в одну область — і жоден лічильник плям цього не виправить.
Тема 02 · Карта задач CV · тема 23
Скіп-зʼєднання skip connection
Провід в обхід кількох шарів: вхід додається до виходу або приклеюється до нього збоку. Через нього до перших шарів добирається градієнт, а до декодера — дрібні деталі, які встигли загубитись при стисканні.
Тема 13 · ResNet · тема 24 · U-Net
Чому не переклали. «Пропускне зʼєднання» неоднозначне — пропускає воно чи його пропускають? «Обхідне» ближче до суті, але не вживається ніде.
Спільні ваги weight sharing
Те саме ядро застосовують до всіх ділянок зображення. Тому згортковий шар має мало параметрів і знаходить ознаку хоч у центрі кадру, хоч у кутку.
Тема 06 · Чому повнозвʼязна мережа не годиться · тема 07
Т 3 терміни
Транспонована згортка transposed convolution
Операція, що збільшує карту ознак: кожен вхідний піксель ніби розмальовується ядром на більшій площі. Стандартна деталь декодерів у сегментації й генерації.
Тема 24 · U-Net
Не «деконволюція». Цю назву зустрінеш часто, але вона неправильна: операція не обертає згортку, а лише повертає розмір.
Трекінг tracking
Стеження за предметами у відео: рамкам присвоюють номери, і номер зберігається з кадру в кадр. Телефон, що був сьомим на першому кадрі, лишається сьомим і на сотому.
Тема 02 · Карта задач CV · тема 30
Тривимірна згортка 3D convolution
Згортка, ядро якої ковзає не тільки по висоті й ширині, а й по часу — тобто заразом по кількох сусідніх кадрах відео.
Тема 31 · Дії у відео
У 2 терміни
Увага attention
Спосіб дати моделі подивитись на всі частини входу одразу й самій вирішити, які з них зараз важливі, а які можна не брати до уваги.
Тема 32 · Від згортки до уваги
Упередженість датасету dataset bias
Систематичний перекіс у даних. Якщо в навчальному наборі мало певних людей, певного освітлення чи певних ракурсів, модель саме на них і працюватиме гірше — і сама тобі про це не скаже.
Тема 40 · Межі й етика CV
Ф 1 термін
Форма масиву shape
Трійка чисел «висота, ширина, канали», якою описують зображення в NumPy й далі скрізь. Перше, що варто надрукувати, відкривши незнайоме фото.
Тема 01 · Зображення очима компʼютера
Часта плутанина. Порядок саме такий: спершу рядки, потім стовпці. Ширина йде другою, хоча в побуті кажуть «640 на 480».
Я 2 терміни
Ядро kernel, filter
Маленька табличка чисел — 3 на 3, 5 на 5, — яку згортка прикладає до зображення. Її числа й є те, що згортковий шар вивчає під час навчання.
Тема 04 · Згортка вручну · тема 07
Ядро чи фільтр. Слова вживають як синоніми. У курсі «ядро» — це сама табличка, а «фільтр» — повний набір ядер на всі вхідні канали, тобто те, що дає одну карту ознак.
Якірна рамка anchor box
Заготовлений прямокутник наперед відомого розміру й пропорцій. Детектор не вигадує рамку з нуля, а вчиться підправляти найближчий якір — це виявилось значно легшою задачею.
Тема 18 · Двоетапні детектори · тема 19
Як казати. У коді й статтях — anchor box;
українською кажемо «якірна рамка» або просто «якір».
A–Z 40 термінів
AlexNet і VGG 2012, 2014
Дві мережі, з яких почалась сучасна історія. AlexNet виграла ImageNet 2012 і показала, що глибока згорткова мережа на відеокарті бʼє все попереднє. VGG звела будову до простого рецепта: багато однакових шарів 3 на 3 поспіль.
Тема 12 · AlexNet і VGG
Anchor-free без якірних рамок
Родина детекторів, що обходяться без заготовлених рамок: замість цього шукають центр предмета (CenterNet) або з кожного пікселя передбачають чотири відстані до сторін рамки (FCOS).
Тема 21 · Anchor-free
Чому англійською. «Безякірний» звучить прийнятно, але в назвах
моделей і в кожній статті стоїть anchor-free — саме за цим словом читач
шукатиме далі.
AP і mAP average precision, mean average precision
Головні метрики детекції. AP — площа під кривою «точність проти повноти» для одного класу, mAP — середнє AP по всіх класах. Часто усереднюють ще й по кількох порогах IoU.
Тема 02 · Карта задач CV · тема 17
Backbone кістяк мережі
Частина детектора чи сегментатора, що просто перетворює зображення на карти ознак. Зазвичай це готова класифікаційна мережа — ResNet, MobileNet — з відрізаним останнім шаром.
Тема 14 · Архітектури · блок 4
Чому не переклали. «Хребет» буквальний, «кістяк» пояснювальний,
але в конфігах моделей поле зветься backbone, і читач бачитиме саме це
слово щодня. Українське пояснення тримаємо поруч.
CLIP contrastive language–image pretraining
Модель, навчена на парах «фото плюс підпис» так, щоб зображення і його опис опинялись поруч у спільному просторі. Звідси класифікація без жодного навченого прикладу класу (zero-shot): достатньо написати назви класів словами.
Тема 36 · CLIP і мультимодальність
COCO і ImageNet набори даних
Два набори, на яких тримається галузь. ImageNet — мільйони фото й тисяча класів, звідси майже всі передтреновані ваги. COCO — фото зі складними сценами, рамками й масками, звідси майже всі числа про детекцію й сегментацію.
Тема 12 · AlexNet і VGG · тема 22
CRNN і CTC connectionist temporal classification
Звʼязка для читання тексту: згорткова частина дивиться на смужку зображення, рекурентна читає її зліва направо, а втрата CTC дозволяє навчати мережу, не вказуючи, де саме на картинці кожна літера.
Тема 29 · CRNN і розпізнавання тексту
DETR detection transformer
Детектор на трансформері, що віддає одразу цілий список передбачень фіксованої довжини й зіставляє його з розміткою попарно. Тому йому не потрібні ані якорі, ані NMS.
Тема 34 · DETR
EfficientNet і MobileNet економні архітектури
Дві мережі про економію. MobileNet розкладає згортку на дві дешевші частини, EfficientNet узгоджено збільшує глибину, ширину й розмір входу разом — замість того, щоб роздувати щось одне.
Тема 14 · Inception, MobileNet, EfficientNet
FCN і DeepLab fully convolutional network
Дві лінії семантичної сегментації. FCN першою прибрала з класифікаційної мережі повнозвʼязні шари й почала віддавати карту міток замість одного класу. DeepLab додав атрозні згортки й обробку в кількох масштабах одразу.
Тема 25 · FCN і DeepLab
FID Fréchet inception distance
Метрика для генерації: наскільки статистично схожа купа згенерованих зображень на купу справжніх. Окремій картинці FID не ставлять — він має сенс лише для набору.
Тема 02 · Карта задач CV · тема 39
Focal loss фокальна втрата
Функція втрат, що майже не звертає уваги на легкі приклади. Придумана для одноетапних детекторів, де фону в тисячі разів більше, ніж предметів, і легкі приклади заглушують решту.
Тема 20 · SSD і RetinaNet
Чому не переклали. Це імʼя конкретної функції з конкретної статті, а не назва класу явищ. У коді воно так і зветься.
GAN generative adversarial network
Пара мереж, що змагаються між собою: одна малює підробки, друга вчиться їх ловити. Українською — «породжувальна змагальна мережа», але в тексті майже завжди GAN.
Тема 38 · GAN
Сюди ж діпфейки (deepfake) — підмінені обличчя у відео. Про наслідки й про те, що з цим робити інженеру, — тема 40.
Grad-CAM gradient-weighted class activation mapping
Спосіб побачити, куди дивилась мережа: підсвічує ділянки зображення, що найбільше вплинули на обраний клас. Дає теплу карту поверх фото — не пояснення, а підказку, де шукати.
Тема 15 · Що бачить мережа
Карта активацій (activation map). Так називають самі значення в карті ознак, коли їх малюють як картинку. Grad-CAM зважує їх за впливом на клас.
Head голова
Остання частина детектора чи сегментатора, що з карт ознак робить власне відповідь: координати рамок, ймовірності класів, маску.
Тема 19 · YOLO · блок 4
Як казати. «Голова» зрозуміла й вживана, але в конфігах поле
зветься head. Тримаємо обидва слова поруч, як і з backbone.
HOG histogram of oriented gradients
Класична придумана ознака: зображення ділять на клітинки й у кожній рахують, куди переважно дивляться краї. Так у 2005 році навчились знаходити пішоходів.
Тема 05 · Класичні ознаки
Пастка середовища. В OpenCV 5 класу
cv2.HOGDescriptor більше немає — його викинуто разом із каскадами Хаара.
Демонстрації з підручників на цій версії не запустяться.
HSV hue, saturation, value — тон, насиченість, яскравість
Кольоровий простір, у якому «який це колір» відділено від «наскільки він яскравий». Через це виділити помаранчевий предмет одним порогом простіше, ніж трьома в RGB.
Тема 01 · Зображення очима компʼютера · тема 03
Inception GoogLeNet
Архітектура, де в одному блоці паралельно працюють згортки різного розміру — і дрібна, і велика, — а згортки 1 на 1 наперед зменшують кількість каналів, щоб це було по кишені.
Тема 14 · Inception, MobileNet, EfficientNet
Instance segmentation сегментація екземплярів
Задача, де вихід — окрема маска на кожен окремий предмет. На відміну від семантичної, розрізняє два однакові предмети, що торкаються один одного.
Тема 02 · Карта задач CV · тема 26
Про назву. Український відповідник правильний, але в назвах моделей і в розмові звучить англійський. Ставимо обидва, першим — англійський.
IoU intersection over union
Міра збігу двох рамок або двох масок: спільна площа, поділена на площу, яку вони накривають разом. Одиниця — ідеальний збіг, нуль — не торкаються зовсім.
Тема 02 · Карта задач CV · тема 17 · тема 23
Він же індекс Жаккара. У сегментації те саме число часто називають саме так. І ще: поріг 0.5 не означає «половина рамки збіглась» — для двох рамок однакового розміру це перекриття на дві третини площі.
Mask R-CNN 2017
Faster R-CNN із додатковою гілкою, що всередині кожної знайденої рамки домальовує маску предмета. Базовий спосіб робити instance segmentation.
Тема 26 · Instance segmentation
mIoU mean IoU
Середнє IoU по всіх класах — головна метрика семантичної сегментації.
Тема 02 · Карта задач CV · тема 23
Чому не «частка правильних пікселів». Модель, яка назве все зображення фоном, отримає 83 % правильних пікселів і нуль користі. mIoU так обманути не вийде.
Neck шия
Проміжна частина детектора між backbone і head, що змішує карти ознак різних масштабів — щоб і дрібні предмети, і великі бачились однаково добре. Найвідоміша — FPN, піраміда ознак (feature pyramid network).
Тема 19 · YOLO · тема 20
NMS non-maximum suppression, придушення немаксимумів
Прибирання дублікатів: із кількох рамок, що сильно перекриваються й описують той самий предмет, лишають одну — найвпевненішу, а решту викидають.
Тема 17 · Постановка детекції
Чому абревіатура. Український переклад існує й читається, але
функція в кожній бібліотеці зветься nms, тож заголовок лишаємо
англійський.
OpenCV бібліотека
Бібліотека для роботи із зображеннями: прочитати файл, змінити розмір, перевести в інший кольоровий простір, намалювати рамку поверх фото. У курсі — версія 5.
Тема 03 · OpenCV: базові операції
Головна пастка. OpenCV зберігає канали у зворотному порядку — BGR, а не RGB. Це найчастіша причина синіх облич на картинці.
Padding доповнення країв
Рамка з нулів навколо зображення, щоб згортка не зʼїдала краї й розмір виходу дорівнював розміру входу.
Тема 07 · Згортковий шар
Чому не переклали. Слово стоїть як імʼя аргументу в кожній
бібліотеці — padding='same'. Український заголовок означав би, що читач
не впізнає його в коді; опис «доповнення країв» даємо поруч.
Panoptic segmentation паноптична сегментація
Обʼєднання семантичної та instance в одну відповідь: кожен піксель отримує і клас, і номер предмета. Жоден піксель не лишається без відповіді й жоден не отримує двох.
Тема 02 · Карта задач CV · тема 27
Дві категорії, які вона мирить. Things — речі, які рахують поштучно (телефони, люди). Stuff — суцільна матерія, яку не рахують (стіл, небо, трава). Метрика зветься PQ, panoptic quality.
R-CNN, Fast R-CNN, Faster R-CNN 2013–2015
Три кроки однієї думки. R-CNN проганяв мережу окремо на кожній кандидат-області. Fast R-CNN — один раз на все фото, а ділянку вирізав уже з карти ознак (RoI pooling, згодом точніший RoI Align). Faster R-CNN навчив мережу пропонувати ділянки самостійно.
Тема 18 · Двоетапні детектори
ResNet residual network, 2015
Мережа зі скіп-зʼєднаннями, після якої глибина в сотню шарів перестала бути проблемою. Досі найчастіший backbone у детекції й сегментації.
Тема 13 · ResNet і скіп-зʼєднання
RGB і BGR red, green, blue
Три канали кольору: червоний, зелений, синій, кожен від 0 до 255. BGR — той самий набір у зворотному порядку, як його зберігає OpenCV.
Тема 01 · Зображення очима компʼютера
SAM segment anything model
Модель, що сегментує предмет за підказкою: клацнув точкою або обвів грубою рамкою — отримав акуратну маску, без жодного навчання на твоєму класі.
Тема 27 · Panoptic segmentation й SAM
SIFT і ORB детектори ключових точок
Класична пара: знаходять на зображенні прикметні місця й описують кожне числами (дескриптором) так, щоб те саме місце впізналось на іншому фото — під іншим кутом і в іншому масштабі. SIFT точніший, ORB швидший.
Тема 05 · Класичні ознаки
Що прийшло на зміну. В OpenCV 5 зʼявились навчені детектори ознак — ALIKED, DISK, LightGlue. Тема 05 саме на цьому й будує протиставлення придуманої ознаки та навченої.
SORT і DeepSORT simple online realtime tracking
Алгоритми трекінгу: беруть рамки готового детектора на кожному кадрі й зшивають їх у траєкторії. DeepSORT додає до цього зовнішній вигляд предмета, щоб не переплутати його з іншим після того, як він на секунду зник за перешкодою.
Тема 30 · Відео: трекінг
SSD і RetinaNet одноетапні детектори
Детектори, що передбачають рамки одразу на картах ознак кількох масштабів: на дрібній сітці — великі предмети, на густій — маленькі. RetinaNet додав focal loss і цим зрівнявся з двоетапними за точністю, лишившись швидким.
Тема 20 · SSD і RetinaNet
Stable Diffusion латентна дифузія
Дифузійна модель, що знешумлює не пікселі, а латентний простір автоенкодера — у десятки разів менший. Саме через це вона поміщається у звичайну відеокарту.
Тема 39 · Дифузійні моделі
Swin Transformer shifted window transformer
Трансформер, у якому увага рахується не по всьому зображенню, а всередині вікон, і вікна зсуваються від шару до шару. Так зʼявляється ієрархія масштабів, як у CNN, але без згорток.
Тема 35 · Swin і гібриди
U-Net 2015
Мережа для сегментації у формі літери U: ліва половина стискає зображення, права розгортає маску, а скіп-зʼєднання переносять дрібні деталі з ранніх шарів прямо в пізні, повз усе стиснення.
Тема 24 · U-Net
VAE variational autoencoder, варіаційний автоенкодер
Автоенкодер, який стискає зображення не в точку, а в хмарку. Через це з латентного простору можна брати випадкові точки й отримувати нові картинки, а не тільки відновлювати старі.
Тема 37 · Автоенкодери й VAE
ViT vision transformer
Трансформер для зображень: фото ріжуть на патчі, кожен патч стає токеном, далі працює звичайний трансформерний енкодер — той самий, що й у мовних моделях.
Тема 33 · Vision Transformer
YOLO you only look once
Сімейство одноетапних детекторів: одна мережа за один прохід ділить кадр на клітинки й одразу видає рамки з класами. Саме з YOLO детекція стала працювати в реальному часі.
Тема 19 · YOLO
НаостанокЯк цим користуватись
Якщо ти читаєш курс — повертайся сюди щоразу, коли слово в лекції здасться знайомим лише наполовину. Стаття коротка навмисне: вона не заміняє тему, а тримає межу поняття, щоб ти не плутав рамку з маскою, а ядро з фільтром.
Якщо ти прийшов із пошуку — бери англійський оригінал із заголовка і йди з ним у документацію: усі імена аргументів і полів у бібліотеках саме такі. А українська назва поруч потрібна, щоб про це можна було говорити вголос українською, не переходячи щодругого слова на англійську.