Обробка природної мови · Глосарій

Глосарій курсу

Сто дев'ять понять, якими говорить курс: українська назва, англійський оригінал, означення без математики — і чесна помітка там, де для української мови термін працює інакше, ніж для англійської.

ПЕРЕД ПОЧАТКОМЯк читати глосарій

Кожна стаття тут — це чотири речі. Назва українською й англійською поруч, бо працювати ти будеш з англомовною документацією, а думати українською. Означення на одне-два речення, без формул: якщо поняття без математики не пояснити, стаття каже про це прямо й відсилає до теми. Номер теми, де поняття розбирають докладно. І, де потрібно, нотатка — про плутанину з сусіднім терміном або про те, чим українська мова відрізняється від англійської саме в цьому місці.

Курс у роботі. Жодної з сорока тем ще не написано, тому посилань на теми тут немає — лише їхні номери й назви текстом («тема 12 · Word2Vec»). Глосарій написано наперед: він задає термінологію, якою теми говоритимуть, коли з'являться. Порядок тем — за планом курсу, і його видно на сторінці курсу.

ПРИНЦИПЯк обирали назви

Правило перше: українська назва, якщо відповідник усталений. Слово, речення, корпус, словник, частота, класифікація, переклад, схожість — усе це давно має українські назви, і вигадувати нічого не треба.

Правило друге: англійська назва, якщо української немає або калька гірша за оригінал. Термінологія обробки мови молода — більшість понять їй не старші за десять років, і частина з них ще не встигла обрости українськими відповідниками. Поганий переклад тут шкідливіший за чесне запозичення: він відрізає читача від документації й від пошуку.

Правило третє: обидві назви завжди поруч. Навіть там, де український відповідник очевидний, англійський стоїть поруч — щоб ти впізнав його в чужому коді.

Правило четверте: де переклад спірний, глосарій обирає один варіант і називає інші. Таких місць у цьому курсі більше, ніж у решті: української термінології обробки мови досі ніхто не звів докупи, тож нижче не переказ чужого словника, а рішення, яких курс триматиметься до кінця.

РІШЕННЯСпірні терміни: що обрано

Дванадцять місць, де вибір неочевидний. Стовпчик «чому» коротко — розгорнуте обґрунтування чекає в самій статті.

ОригіналНаш варіантЧому не інакше
tokenтокен«Лексема» вже означає словникову одиницю — це радше лема, а не шматок слова
embeddingембединг«Вкладення» зайняте математикою й читається як «внесок», «вбудовування» описує іншу дію
attentionувагаПряма й прозора назва; механізм уваги вже так і зветься
self-attentionself-attention«Самоувага» українською читається як риса характеру, а не як операція
transformerтрансформер«Перетворювач» — загальне слово для будь-чого, що щось перетворює
fine-tuningдонавчання«Тонке налаштування» плутають із добором гіперпараметрів, а це інша операція
subwordсубслово«Підслово» у теорії формальних мов означає просто фрагмент рядка
stemmingстемінгУкраїнського відповідника немає, а сама операція для української майже не працює
bag of wordsмішок слівМетафора точна: мішок не зберігає порядку — саме це модель і робить
promptпромпт«Запит» уже двічі зайнятий: пошуковим запитом і Query в увазі
hallucinationгалюцинаціяМетафора прижилась; «вигадка» натякає на намір, якого в моделі немає
beam searchbeam search«Променевий пошук» вводить в оману: нічого променевого там немає

ПОКАЖЧИКАбетковий покажчик

Українські назви

Англійські назви

Шукаєш за англійським словом? Частина понять живе під українською назвою: fine-tuning — стаття «Донавчання», embedding — «Ембединг», attention — «Увага», token — «Токен», bag of words — «Мішок слів», encoder / decoder — «Енкодер» і «Декодер», NER — «Розпізнавання іменованих сутностей», LLM — «Велика мовна модель», MLM — «Маскована мовна модель», perplexity — «Перплексія», vocabulary — «Словник моделі».

СТАТТІА — Ч

А

Авторегресія autoregression

Спосіб породжувати текст, коли модель передбачає лише наступний токен, спираючись на всі попередні, і одразу подає власний вихід собі ж на вхід. Так пишеться відповідь чат-моделі: слово за словом, зліва направо.

Де вводиться · тема 30 · GPT-родина

Не плутай. Авторегресійна модель бачить лише те, що ліворуч. Тому вона добре продовжує текст, але гірше «зважує» речення цілком, ніж двонаправлена модель на кшталт BERT — і навпаки.

Аналіз тональності sentiment analysis

Задача визначити, яке ставлення виражає текст: схвальне, зневажливе чи нейтральне. Класичний приклад — відгуки про товар.

Де вводиться · тема 36 · Аналіз тональності в бою

Пастка. Тональність живе не в словах, а в контексті. Сарказм, заперечення й галузевий жаргон ламають будь-який список «поганих» і «хороших» слів, а модель, навчена на відгуках про готелі, на відгуках про банки працює гірше.

Аналогія векторів word analogy

Перевірка, чи зберігає простір ембедингів співвідношення між поняттями: якщо від вектора «король» відняти «чоловік» і додати «жінка», найближчим має виявитись «королева».

Де вводиться · тема 14 · Арифметика векторів

Українська специфіка. Для української аналогії працюють гірше, ніж для англійської: одне слово розсипане на десятки словоформ, і різниця «королю — королеві» за відмінком змішується з різницею «король — королева» за змістом.

Б

Багатоголова увага multi-head attention

Кілька механізмів уваги, що працюють над тим самим реченням паралельно й незалежно; кожна «голова» вчиться помічати свій тип зв'язку — одна тримається за узгодження, інша за керування, третя за повтори.

Де вводиться · тема 23 · Multi-head і позиційне кодування

Термінологія. Частину механізму звемо голова (head) — і в цій статті, і всюди далі. «Головка» й «вузол» не вживаємо: голова вже усталена в перекладах і не плутається ні з чим іншим у курсі.

Багатомовна модель multilingual model

Одна модель, натренована одразу на текстах десятків мов зі спільним словником субслів — mBERT, XLM-R. Вона не має окремої «української частини»: усі мови ділять одні й ті самі ваги.

Де вводиться · тема 32 · Багатомовність і українська

Українська специфіка. Українська в таких моделях є, але її частка в тренувальних даних мала. Наслідок видно одразу: спільний словник ділить українські слова дрібніше за англійські, тож те саме за змістом речення коштує більше токенів — а отже, більше пам'яті, часу й грошей.

В

Вектор контексту context vector

Один вектор фіксованої довжини, у який енкодер стискає все вхідне речення, щоб передати декодерові.

Де вводиться · тема 18 · seq2seq

Звідки взялася увага. Саме цей вектор і є вузьке горло seq2seq: речення на сорок слів не влазить у ту саму довжину, що й речення на п'ять. З цієї проблеми виріс механізм уваги.

Векторна база vector database

Сховище, що зберігає ембединги разом із текстами й уміє швидко знаходити найближчі до заданого вектора — основа семантичного пошуку.

Де вводиться · тема 37 · Векторні бази й семантичний пошук

Велика мовна модель large language model, LLM

Мовна модель із мільярдами параметрів, натренована на дуже великому корпусі текстів. Від меншої вона відрізняється не будовою, а масштабом — і саме масштаб дає їй уміння, яких у малої немає.

Де вводиться · тема 38 · Що змінює масштаб

Не плутай. «Велика» тут — про кількість параметрів і обсяг тренувальних даних, а не про довжину тексту, який модель здатна прочитати за раз. Це різні речі: див. «Довжина контексту».

Вікно контексту context window

Скільки слів навколо цільового слова модель вважає його оточенням, коли вчиться на дистрибутивній гіпотезі. Типово два-п'ять слів ліворуч і стільки ж праворуч.

Де вводиться · тема 12 · Word2Vec

Не плутай. Вікно контексту в Word2Vec і довжина контексту трансформера — різні поняття з майже однаковими назвами. Перше — це кілька сусідніх слів під час навчання, друге — скільки тексту модель тримає на вході взагалі.

Г

Галюцинація hallucination

Впевнена відповідь моделі, не підкріплена ні даними, ні джерелом: вигаданий факт, неіснуюче посилання, неправильно названа дата. Ознака не помилки в коді, а самої природи моделі — вона породжує правдоподібне, а не правдиве.

Де вводиться · тема 40 · Межі мовних моделей

Ухвалено: галюцинація. Метафора наукового змісту не має — модель нічого не сприймає, тож і галюцинувати їй нічим. Але вона вже прижилась і українською, і в оригіналі, і замінювати її на «вигадку» гірше: вигадка натякає на намір, а наміру в моделі немає. Тому лишаємо назву, а в означенні кажемо точно. «Конфабуляція» точніша психологічно, але непрозора для читача.

Гейт gate

Вентиль усередині LSTM або GRU: маленький вузол, що вирішує, яку частку інформації пропустити далі, а яку забути. Не перемикач «так або ні», а плавний множник від нуля до одиниці.

Де вводиться · тема 17 · LSTM і GRU

Термінологія. Вживаємо і «гейт», і «вентиль» — обидва зрозумілі. «Ворота» не вживаємо: множина без однини незручна в реченні («вхідні ворота вирішують» звучить як про фортецю).

Д

Двонаправленість bidirectionality

Здатність моделі під час обробки слова бачити одночасно і те, що ліворуч, і те, що праворуч. Так працює BERT — і саме тому він не вміє продовжувати текст.

Де вводиться · тема 28 · BERT

Декодер decoder

Частина моделі, що породжує вихідну послідовність — переклад, відповідь, переказ — крок за кроком, спираючись на те, що вже написала, і на подання від енкодера.

Де вводиться · тема 24 · Енкодер, декодер, маскування

Ухвалено: енкодер і декодер. «Кодувальник» і «розкодувальник» не вживаємо: слово «кодування» в курсі вже зайняте кодуванням символів (UTF-8, Unicode) і позиційним кодуванням. Три різні «кодування» на одній сторінці — гарантована плутанина, а латинські корені її знімають.

Декодування decoding

Процедура, за якою модель обирає наступний токен із розподілу ймовірностей: узяти найімовірніший (жадібне декодування), тримати кілька версій відповіді одночасно (beam search) або тягнути навмання (семплювання).

Де вводиться · тема 18 · seq2seq

Важливо. Декодування — це не частина моделі, а спосіб її читати. Та сама навчена модель із різними стратегіями декодування дає помітно різні відповіді, і жодного перенавчання для цього не потрібно.

Дистрибутивна семантика distributional semantics

Підхід, що виводить значення слова з його оточення: слова, які трапляються в схожих контекстах, мають схоже значення. Коротко — «слово пізнається за компанією».

Де вводиться · тема 11 · Дистрибутивна семантика

Межа підходу. Оточення схоплює не лише значення, а й ставлення: антоніми («холодний» і «гарячий») стоять у майже однакових контекстах, тому їхні вектори виходять підозріло близькими.

Довжина контексту context length

Скільки токенів модель здатна тримати на вході за один раз. Усе, що не влізло, для неї просто не існує.

Де вводиться · тема 25 · Навчання трансформера

Українська специфіка. Довжину міряють у токенах, а не в словах. Українське речення в тому самому токенізаторі дає більше токенів, ніж англійське того самого змісту, — тож обмеження на практиці для української жорсткіше, ніж здається з документації.

Донавчання fine-tuning

Продовження навчання вже готової моделі на своїх, зазвичай невеликих, даних під конкретну задачу. Модель приходить із загальним знанням мови, а ти доучуєш її відрізняти скарги від подяк.

Де вводиться · тема 27 · Ідея передтренування, докладно — тема 29 · BERT у роботі

Ухвалено: донавчання. Слово каже рівно те, що відбувається: навчання, яке продовжили. Воно відмінюється, дає дієслово «донавчати» й дієприкметник «донавчений» — з калькою так не вийде. «Тонке налаштування» відкидаємо з конкретної причини: воно звучить як крутіння ручок, тобто як добір гіперпараметрів, а це зовсім інша операція, яку читач уже вивчив у курсі машинного навчання. Варіанти «файнтюнінг» і «тюнінг» лишаємо розмовними — у тексті курсу їх немає.

Донавчання на інструкціях instruction tuning

Донавчання мовної моделі на парах «прохання — гарна відповідь», щоб вона перестала просто продовжувати текст і почала виконувати те, що просять.

Де вводиться · тема 39 · Instruction tuning і RLHF

Чому це переломний момент. Модель, натренована передбачати наступне слово, на прохання «переклади це речення» природно відповідає продовженням на кшталт «на англійську або на польську». Донавчання на інструкціях і є те, що перетворює її на співрозмовника.

Дрейф домену domain shift

Ситуація, коли тексти, на яких модель працює в бою, поступово перестають бути схожими на ті, на яких її навчали: інша тематика, інша лексика, інший час.

Де вводиться · тема 36 · Аналіз тональності в бою

Е

Ембединг embedding

Вектор із кількох сотень чисел, яким модель подає слово, речення чи документ так, щоб близькі за змістом речі стояли поруч у цьому просторі. Числа не задають руками — їх знаходить навчання.

Де вводиться · тема 12 · Word2Vec, оцінка — тема 15 · Оцінка й упередженість ембедингів

Ухвалено: ембединг. Українського відповідника, який би прижився, немає, а всі кандидати гірші за запозичення. «Вкладення» вже зайняте математикою (вкладення одного простору в інший) і в побуті означає внесок чи додаток до листа — «вкладення слова» читається дивно. «Вбудовування» описує іншу дію: щось кудись вставили. «Занурення» звучить красиво, але нічого не пояснює. Пишемо з однією д: подвоєння в загальних назвах іншомовного походження не зберігаємо. У тексті вільно вживаємо описове «векторне представлення» — воно зрозуміле й не потребує пояснень.

Ембединг речення sentence embedding

Один вектор на ціле речення або абзац — так, щоб два переказаних різними словами речення опинились поруч. Основа семантичного пошуку.

Де вводиться · тема 37 · Векторні бази й семантичний пошук

Пастка. Просто усереднити ембединги слів — погана ідея: «собака вкусив листоношу» й «листоноша вкусив собаку» дадуть однаковий вектор. Потрібна модель, спеціально навчена саме на реченнях.

Енкодер encoder

Частина моделі, що читає вхідний текст цілком і перетворює його на внутрішнє подання — набір векторів, з якого далі працюють інші частини.

Де вводиться · тема 24 · Енкодер, декодер, маскування

З

Залишкове з'єднання residual connection

Обхідний шлях, яким вхід шару додається до його ж виходу. Завдяки цьому кожен шар вчить не всю відповідь, а лише поправку до неї — і глибока мережа навчається.

Де вводиться · тема 21 · Архітектура цілком

Спадщина. Термін «залишок» (residual) читач уже бачив у курсі машинного навчання. Тут це те саме поняття, просто в іншій ролі.

Заморожування freezing

Заборона змінювати частину ваг під час донавчання: нижні шари лишаються такими, якими прийшли, вчиться лише надбудова зверху. Швидше, дешевше й безпечніше, коли своїх даних мало.

Де вводиться · тема 29 · BERT у роботі

Запам'ятовування навчальних даних memorization

Здатність великої моделі відтворити шматок тексту, який траплявся в тренувальному корпусі, — зокрема адресу, телефон чи фрагмент захищеного авторським правом тексту.

Де вводиться · тема 40 · Межі мовних моделей

Чому це важливо інженерові. Донавчивши модель на внутрішніх документах компанії, ти не «навчив її стилю» — ти поклав ці документи всередину ваг, звідки їх можна витягнути питанням.

Здібності, що з'являються стрибком emergent abilities

Уміння, яких у меншої моделі не було зовсім, а в більшої вони раптом є — наприклад, розв'язати задачу за прикладом просто в тексті запиту, без жодного донавчання.

Де вводиться · тема 38 · Що змінює масштаб

Обережно. Частина таких «стрибків» — властивість метрики, а не моделі: якщо оцінювати відповідь як правильну лише цілком, плавне зростання виглядає як стрибок. Тема розбирає, які саме здібності витримують перевірку.

Зникомий градієнт vanishing gradient

Сигнал помилки, що згасає, поки йде назад крізь довгий ланцюг кроків, і до перших кроків доходить майже нулем. Через це проста рекурентна мережа не пам'ятає початок довгого речення.

Де вводиться · тема 17 · LSTM і GRU

Спадщина. Поняття введене в курсі машинного навчання, у темі про зворотне поширення помилки. Тут воно набуває нового змісту: у рекурентній мережі довжина ланцюга дорівнює довжині тексту, тож проблема вилазить одразу.

І

Інвертований індекс inverted index

Таблиця, у якій для кожного слова записано список документів, де воно трапляється. Саме так працює звичайний повнотекстовий пошук — і саме тому він швидкий.

Де вводиться · тема 09 · Пошук і схожість

Українська специфіка. Індексувати українські тексти по словоформах майже безглуздо: запит «купити машину» не знайде документ зі словом «машини». Індекс будують по лемах — тобто лематизація тут не покращення якості, а умова того, щоб пошук узагалі працював.

К

Класифікація текстів text classification

Задача віднести текст до однієї з наперед відомих категорій: спам чи не спам, скарга чи подяка, новина про спорт чи про політику.

Де вводиться · тема 06 · Класифікація текстів

Корпус corpus

Зібрання текстів, на якому вчаться або яке досліджують. Множина — корпуси. Корпус може бути й розміченим (кожен текст має мітку), і сирим.

Де вводиться · тема 01 · Чому текст складніший за таблицю

Українська специфіка. Термін давно усталений в українському мовознавстві — вигадувати нічого не треба. Проблема інша: українських корпусів на порядки менше, ніж англійських, і це відчувається в кожній наступній темі.

Косинусна близькість cosine similarity

Міра схожості двох векторів за напрямком, а не за довжиною: одиниця — дивляться однаково, нуль — нічого спільного. Стандартний спосіб порівнювати ембединги.

Де вводиться · тема 09 · Пошук і схожість

Чому саме напрямок. Довжина вектора документа залежить від того, наскільки він довгий; напрямок — від того, про що він. Порівнювати треба друге.

Крос-мовний перенос cross-lingual transfer

Ефект, коли модель, донавчену на розмічених даних однієї мови, застосовують до іншої — і вона працює, бо багатомовне передтренування поставило схожі за змістом слова різних мов поруч.

Де вводиться · тема 32 · Багатомовність і українська

Практичне значення для української. Це найдешевший спосіб зробити українську модель, коли українських розмічених даних немає: розмітити англійською, донавчити, застосувати. Працює не завжди й не однаково добре, але часто краще за нічого.

Л

Лема lemma

Словникова форма слова: та, під якою його шукають у словнику. Для іменника — називний відмінок однини («книжка»), для дієслова — інфінітив («читати»).

Де вводиться · тема 03 · Нормалізація

Лематизація lemmatization

Зведення кожної словоформи до її леми: «книжок», «книжкою», «книжці» стають «книжка». Робиться не обрізанням, а розбором — за словником і морфологічним аналізатором.

Де вводиться · тема 03 · Нормалізація

Українська специфіка — головне. Для англійської лематизація й стемінг дають майже однаковий результат, тому там частіше беруть дешевший стемінг. Для української це операції різної цінності. Українська змінює не лише закінчення, а й основу: «нога — нозі», «ходити — ходжу», «друг — друзі», «рука — руці». Обрізанням хвоста ці форми до спільного вигляду не звести. Тому для української лематизація — не покращення, а єдиний спосіб зробити нормалізацію правильно; ціна за це — потреба в морфологічному аналізаторі й у розв'язанні неоднозначності («мати» — це іменник чи дієслово, вирішує контекст).

М

Маскована мовна модель masked language model, MLM

Спосіб передтренування, коли в тексті ховають частину токенів і вчать модель відновлювати їх за оточенням з обох боків. Розмітки для цього не треба — текст сам собі й завдання, і відповідь.

Де вводиться · тема 28 · BERT

Маскування masking

Заборона моделі дивитися на певні позиції. Буває двох різновидів: причинна маска ховає майбутнє, щоб модель не підглядала відповідь; маска доповнення ховає порожні місця, якими вирівняли речення різної довжини в одному пакеті.

Де вводиться · тема 24 · Енкодер, декодер, маскування

Не плутай. Маскування в трансформері й маскування токенів у MLM — різні речі з однаковою назвою. Перше — те, чого не можна бачити; друге — завдання, яке треба розв'язати.

Машинний переклад machine translation

Задача перекласти текст з однієї мови іншою автоматично. Історично саме на ній обкатали енкодер-декодер, увагу й трансформер.

Де вводиться · тема 18 · seq2seq

Мішок слів bag of words

Подання тексту як набору слів із їхніми частотами, без жодної уваги до порядку. «Кіт з'їв мишу» і «мишу з'їв кіт» для нього — той самий текст.

Де вводиться · тема 04 · Мішок слів

Ухвалено: мішок слів. Назва усталена, і замінювати її нічим — метафора точна. Мішок не зберігає порядку: витрусив і дивишся, що там є. «Набір слів» відкидаємо, бо в українській це стійкий вислів зі значенням «беззмістовна балаканина» — двозначність саме там, де вона найшкідливіша.

Українська специфіка. Для англійської втрата порядку — велика втрата: там роль слова в реченні задає позиція. Українська кодує ролі закінченнями, тож «кіт з'їв мишу» і «мишу з'їв кіт» справді означають те саме, і мішок слів губить менше. Але натомість він набирає більше: кожна словоформа стає окремою колонкою, і словник розпухає в кілька разів проти англійського. Тому для української мішок слів майже завжди будують по лемах.

Мовна модель language model

Модель, що оцінює, наскільки ймовірний той чи інший текст, і вміє передбачити наступне слово. Усе інше — переклад, переказ, відповідь на питання — надбудова над цим одним умінням.

Де вводиться · тема 27 · Ідея передтренування

Модель винагороди reward model

Окрема модель, навчена на людських порівняннях («ця відповідь краща за ту») і далі використана як суддя замість людини — щоб оцінювати мільйони відповідей, яких людина не переглянула б ніколи.

Де вводиться · тема 39 · Instruction tuning і RLHF

Морфологія morphology

Будова слова: корінь, префікси, суфікси, закінчення — і те, як слово змінюється за відмінками, числами, особами.

Де вводиться · тема 01 · Чому текст складніший за таблицю

Українська специфіка. Англійська морфологія бідна: іменник має дві-три форми. Українська — багата: іменник має до чотирнадцяти форм, дієслово десятки. До цього додається узгодження: прикметник змінюється слідом за іменником («зеленого дерева», «зеленою фарбою»), тож те саме поняття розсипається на десятки різних рядків. Практично вся українська специфіка в цьому курсі виростає саме звідси.

Н

Негативне семплювання negative sampling

Прийом навчання Word2Vec: замість того щоб на кожному кроці перебирати весь словник, беруть одну правильну пару «слово — сусід» і кілька випадкових неправильних. Так навчання стає посильним.

Де вводиться · тема 12 · Word2Vec

Неоднозначність ambiguity

Властивість мови мати кілька прочитань там, де на письмі все виглядає однозначно. «Коса» — це зачіска, знаряддя чи смуга суходолу; «мати» — іменник чи дієслово.

Де вводиться · тема 01 · Чому текст складніший за таблицю

Чому це перша тема. У таблиці клітинка означає рівно те, що в ній написано. У тексті — ні. Уся подальша складність курсу росте з цього.

Нормалізація тексту text normalization

Зведення різних написань того самого до одного вигляду: єдиний регістр, прибрані зайві пробіли, однакові лапки й апострофи, іноді стемінг чи лематизація.

Де вводиться · тема 03 · Нормалізація

Українська специфіка — тиха пастка. Апостроф в українських текстах пишуть щонайменше трьома різними символами, і для комп'ютера «м'ясо» й «м'ясо» — різні слова. Те саме з латинською i замість української і та з російською и в українському тексті. Нормалізація Unicode й заміна символів-двійників для української обов'язкові — інакше словник тихо розпухає вдвічі, і жодної помилки при цьому не видно.

О

Обернена документна частота inverse document frequency, IDF

Число, що показує, наскільки слово рідкісне в колекції: чим у меншій кількості документів воно трапляється, тим воно цінніше для розрізнення. Друга половина TF-IDF.

Де вводиться · тема 05 · TF-IDF

Обробка природної мови natural language processing, NLP

Галузь, що вчить комп'ютер працювати з людською мовою — розуміти, класифікувати, перекладати, породжувати. «Природна» означає «людська», на противагу штучним мовам на кшталт Python.

Де вводиться · тема 01 · Чому текст складніший за таблицю

Термінологія. Українська назва вживається повністю («обробка природної мови»), скорочення — латинське, NLP. Кирилична абревіатура «ОПМ» не прижилась ніде, і читач не знайде за нею нічого.

П

Передтренування pre-training

Довге й дороге навчання моделі на величезному корпусі без розмітки, після якого вона вже знає мову взагалі. Робиться раз; далі ту саму модель донавчають під десятки різних задач.

Де вводиться · тема 27 · Ідея передтренування

Перенос навчання transfer learning

Загальний принцип: узяти модель, натреновану на одній задачі, і використати її знання для іншої. Передтренування з донавчанням — його найпоширеніший випадок в обробці мови.

Де вводиться · тема 27 · Ідея передтренування

Перплексія perplexity

Міра того, наскільки текст дивує мовну модель: приблизно між скількома варіантами вона вагається на кожному кроці. Перплексія 10 означає «модель наче обирає навмання з десяти слів»; менше — краще.

Де вводиться · тема 27 · Ідея передтренування

Ухвалено: перплексія. «Спантеличеність» і «розгубленість» описують емоцію, а не число, і в жодному інструменті так не називаються. Беремо запозичення, але в тексті завжди поруч пояснюємо словами.

Пастка. Перплексії двох моделей можна порівнювати, тільки якщо в них однаковий токенізатор. Для українських моделей із різними словниками субслів це порівняння часто нечесне.

Позиційне кодування positional encoding

Додаткова інформація про місце токена в реченні, яку домішують до його вектора. Без неї трансформер бачить речення як мішок слів: сам механізм уваги порядку не знає.

Де вводиться · тема 23 · Multi-head і позиційне кодування

Українська специфіка. Порядок слів в українській вільніший, ніж в англійській, — але не довільний: він передає, що в реченні нове, а що вже відоме («Книжку купив Іван» і «Іван купив книжку» відповідають на різні питання). Тож позиція для української несе інше навантаження, ніж для англійської, але аж ніяк не зайва.

Промпт prompt

Текст, який подають моделі на вхід, щоб дістати потрібну відповідь: завдання, контекст і, за потреби, приклади — усе однією стрічкою тексту.

Де вводиться · тема 39 · Instruction tuning і RLHF

Ухвалено: промпт. «Запит» відкидаємо не через смак, а через зайнятість: у цьому ж курсі «запит» — це пошуковий запит (тема 09) і Query в механізмі уваги (тема 22). Третє значення зробило б слово марним. «Підказка» неточна: підказка — це натяк, а промпт часто містить усе завдання цілком. «Промпт» відмінюється, дає «промптинг» і «промпт-інженерія» й точно збігається з тим, що читач побачить у документації.

Р

Регулярний вираз regular expression, regex

Формула-шаблон, що описує, який вигляд має шуканий рядок: номер телефону, дата, ідентифікатор. Не модель і не навчання — просто точний опис.

Де вводиться · тема 10 · Правила й регулярні вирази

Коли правила виграють. Там, де формат жорсткий і помилка дорога: ІПН, номер рахунку, дата в документі. Модель тут дає 98 % і непередбачувані 2 %, а регулярний вираз — 100 % або чесну відмову.

Рекурентна нейромережа recurrent neural network, RNN

Мережа, що читає текст по одному слову й несе із собою стан — коротку пам'ять про все прочитане раніше. Ті самі ваги застосовуються на кожному кроці.

Де вводиться · тема 16 · RNN для тексту

Розгортка в часі unrolling

Спосіб дивитися на рекурентну мережу як на довгий ланцюг однакових шарів — по одному на кожне слово. Саме в такому вигляді її й навчають зворотним поширенням.

Де вводиться · тема 16 · RNN для тексту

Розпізнавання іменованих сутностей named entity recognition, NER

Задача знайти в тексті імена людей, назви організацій, місця, дати — і сказати, що з них чим є.

Де вводиться · тема 33 · NER

Українська специфіка. Сутність у тексті майже завжди стоїть у непрямому відмінку: «у Києві», «з Оксаною», «до Львова». Знайти її — півсправи; щоб зіставити з довідником, форму треба звести до називного, а власні назви відмінюються не завжди так, як загальні. Тому для української оцінка на рівні сутностей і нормалізація знайденого — окрема робота, а не дрібниця.

Розріджена матриця sparse matrix

Матриця, у якій переважна більшість клітинок — нулі, тому в пам'яті зберігають лише ненульові. Матриця «документ — слово» саме така: у кожному тексті трапляється крихітна частка словника.

Де вводиться · тема 04 · Мішок слів

С

Самокероване навчання self-supervised learning

Навчання без людської розмітки, коли завдання роблять із самих даних: сховати слово й вимагати його відновити, взяти наступне речення як правильну відповідь. Саме воно зробило можливими великі моделі.

Де вводиться · тема 27 · Ідея передтренування

Семантичний пошук semantic search

Пошук за змістом, а не за збігом слів: запит «як повернути товар» знаходить документ «умови відмови від покупки», хоча спільних слів там немає.

Де вводиться · тема 37 · Векторні бази й семантичний пошук

Українська специфіка. Для флективної мови виграш семантичного пошуку більший, ніж для англійської: він не залежить від того, у якому відмінку стоїть слово в запиті й у документі. Там, де пошук по словах вимагає лематизації, ембединги дають це задарма.

Семплювання sampling

Вибір наступного токена навмання, згідно з імовірностями, які дала модель, — а не завжди найімовірнішого. Керується температурою (наскільки сміливо), top-k (з якої кількості найкращих варіантів тягнути) та top-p (тягнути з тих варіантів, що разом набирають задану частку ймовірності).

Де вводиться · тема 18 · seq2seq

Термінологія. «Семплювання» вже вжите в плані курсу («негативне семплювання»), тож тримаємось його. Описове «випадковий вибір» у тексті теж припустиме.

Словник моделі vocabulary

Повний список токенів, які модель узагалі знає. Усе, чого в цьому списку немає, вона побачити не здатна — або розкладе на дрібніші шматки, або замінить на позначку «невідоме».

Де вводиться · тема 02 · Токенізація

Українська специфіка. Якщо будувати словник зі словоформ, для української він виходить у кілька разів більшим за англійський при тому самому обсязі текстів: кожен іменник дає до чотирнадцяти рядків, кожне дієслово — десятки. Це головна причина, чому для української субслівна токенізація не розкіш, а необхідність.

Словоформа word form

Конкретний вигляд слова в тексті: «книжки», «книжкою», «книжці» — три різні словоформи однієї леми «книжка».

Де вводиться · тема 01 · Чому текст складніший за таблицю

Трійка, яку треба тримати нарізно. Токен — те, що бачить модель; словоформа — те, що стоїть у тексті; лема — те, що стоїть у словнику. Для англійської вони часто збігаються, для української майже ніколи.

Спецтокени special tokens

Службові позначки у словнику, яких у тексті немає: початок і кінець послідовності, межа між двома реченнями, заповнювач порожніх місць, позначка схованого слова. У BERT це [CLS], [SEP], [PAD], [MASK].

Де вводиться · тема 28 · BERT

Стемінг stemming

Грубе обрізання закінчень і суфіксів за набором правил, щоб різні форми слова стали однаковим рядком. Результат — не обов'язково справжнє слово: від «читання» може лишитись «чит».

Де вводиться · тема 03 · Нормалізація

Ухвалено: стемінг. Українського відповідника немає: «основоутворення» означає інше, «обрізання» описує дію, а не термін. Беремо запозичення з однією м.

Українська специфіка — і чому це важливо. Стемінг вигадали для англійської, де слово змінюється майже лише на хвості: play, plays, playing — обрізав і готово. Українська змінює й основу: «нога — нозі — ніг», «пекти — печу», «друг — друзі». Правила обрізання тут або лишають різні рядки для тих самих слів, або, навпаки, зліплюють різні слова в один пень. Тому для української стемінг — дешевий і поганий вибір; або лематизація, або одразу субслівна токенізація, яка знімає питання інакше.

Стоп-слова stop words

Дуже часті слова, які майже нічого не кажуть про зміст: прийменники, сполучники, займенники. Класичний прийом — викинути їх перед побудовою мішка слів.

Де вводиться · тема 03 · Нормалізація

Коли це шкодить. «Не» — стоп-слово в багатьох готових списках, а разом із ним із «мені не сподобалось» зникає весь зміст. У задачах тональності й у роботі з запереченнями стоп-слова прибирати не можна.

Субслово subword

Шматок слова, коротший за слово й довший за літеру: «пере», «плив», «емо». Сучасні моделі працюють саме такими шматками — так словник лишається малим, а незнайомих слів не буває взагалі.

Де вводиться · тема 02 · Токенізація, морфологічний бік — тема 13 · GloVe і FastText

Ухвалено: субслово, субслівна токенізація. «Підслово» відкидаємо з конкретної причини: у теорії формальних мов «підслово» — усталений термін для будь-якого суцільного фрагмента рядка, і читач-програміст прочитає його саме так. Префікс «суб-» в українській цілком робочий (субкультура, субтитри, субмарина) і дає прикметник «субслівний», якого «підслово» не дає без гризні.

Українська специфіка — чому це важливіше, ніж для англійської. Для англійської субслова — переважно економія: словник менший, рідкісні слова не губляться. Для української це спосіб узагалі впоратися з морфологією. Одна лема дає десятки словоформ; словник зі словоформ або велетенський, або дірявий. Субслова розв'язують це самі собою: «книжка», «книжки», «книжкою» діляться на спільний корінь плюс різні хвости, тож модель бачить зв'язок між формами, якого їй ніхто не показував. Побічний ефект теж є: український текст ділиться дрібніше за англійський, тож коштує більше токенів.

Сумаризація summarization

Задача стисло переказати довгий текст. Буває екстрактивна (вибрати найважливіші речення оригіналу) і абстрактивна (написати новий текст своїми словами).

Де вводиться · тема 35 · Сумаризація

Про написання. Одне «м»: за чинним правописом подвоєння приголосних у загальних назвах іншомовного походження не зберігається. Питання закрито для всього курсу — і в плані, і в переліку тем виправлено. Усталений мовознавчий синонім — «автоматичне реферування»; ми його згадуємо, але основною назвою лишається сумаризація, бо саме так термін уживають на практиці.

Т

Тематичне моделювання topic modeling

Пошук у великій колекції текстів прихованих тем — груп слів, що ходять разом, — без жодної розмітки. Модель не називає теми, вона лише дає списки слів; назву придумує людина.

Де вводиться · тема 08 · Тематичне моделювання

Токен token

Найменший шматок тексту, з яким працює модель. Це не обов'язково слово: залежно від токенізатора токеном буває ціле слово, його частина, розділовий знак або навіть один символ.

Де вводиться · тема 02 · Токенізація

Ухвалено: токен. «Лексема» відпадає: в українському мовознавстві це слово як словникова одиниця — тобто, по суті, лема. Назвати токен лексемою означало б зіштовхнути його з лематизацією, яка стоїть у сусідній темі. «Одиниця» надто загальна. «Токен» відмінюється, дає «токенізація» й «токенізатор» і збігається з тим, що написано в документації будь-якої бібліотеки.

Токенізація tokenization

Перетворення суцільного тексту на список токенів — перший крок будь-якої роботи з мовою. Спосіб різати визначає все, що буде далі.

Де вводиться · тема 02 · Токенізація

Українська специфіка. Різати по пробілах для української мало: апостроф усередині слова («з'їв») пробілом не є, дефіс іноді розділяє слова («синьо-жовтий»), а іноді ні («де-небудь»), і скорочення з крапками ламають розбиття на речення. Тому для української наївна токенізація по пробілах дає помітно гірший результат, ніж для англійської, — і саме тому в темі одразу переходимо до субслів.

Трансформер transformer

Архітектура, побудована на механізмі уваги замість послідовного читання. Обробляє всі слова речення одночасно, тому навчається на порядки швидше за рекурентну мережу. На ній стоять BERT, GPT і взагалі все сучасне.

Де вводиться · тема 21 · Архітектура цілком

Ухвалено: трансформер. «Перетворювач» відкидаємо: це загальне слово для будь-чого, що щось перетворює, і назвою конкретної архітектури бути не може. Пощастило з тим, що електричний прилад українською зветься «трансформатор», а не «трансформер», — тож зіткнення значень немає. Прикметник — «трансформерний».

У

Увага attention

Механізм, що дозволяє моделі на кожному кроці дивитися на всі слова вхідного тексту й самій вирішувати, які з них зараз важливі. Замість одного стисненого вектора — прямий доступ до всього речення.

Де вводиться · тема 19 · Механізм уваги

Ухвалено: увага. Українська назва прозора, вже вживана й нічим не зайнята, тож англійського варіанта тут не потрібно. Похідні: «механізм уваги», «ваги уваги», «голова уваги», «перехресна увага» (cross-attention). Виняток один — self-attention, який лишаємо латиною; чому саме, сказано в його статті.

Упередженість моделі bias

Систематичний перекіс у відповідях моделі, успадкований із даних: стійкі зв'язки між статтю й професією, між національністю й оцінкою. Модель не «вважає» так — вона відтворює те, що частіше траплялося в текстах.

Де вводиться · тема 15 · Оцінка й упередженість ембедингів, для великих моделей — тема 40 · Межі мовних моделей

Не плутай. Англійське bias у курсі машинного навчання означало ще дві різні речі: зсув у рівнянні нейрона й систематичну похибку моделі в розкладі «зсув — розкид». Тут — третє значення, суспільне. У тексті завжди кажемо, про яке саме йдеться.

Ф

Флективність inflection, fusional morphology

Властивість мови передавати граматичні значення зміною самого слова — закінченнями й чергуваннями в основі, а не окремими службовими словами. Українська флективна, англійська майже ні.

Де вводиться · тема 01 · Чому текст складніший за таблицю

Чому цей термін у глосарії взагалі є. Це корінь майже всіх українських особливостей курсу. З флективності випливає, що словоформ у кілька разів більше за леми; що стемінг не працює, а лематизація дорога; що субслівна токенізація стає необхідністю, а не оптимізацією; що n-грами й метрики на збіг слів (BLEU, ROUGE) занижують оцінку; що пошук по словах вимагає нормалізації. Кожен із цих наслідків розібрано у своїй темі — але причина в них одна.

Ч

Частота терміна term frequency, TF

Скільки разів слово трапилось у документі — зазвичай поділене на довжину документа, щоб довгі тексти не вигравали автоматично. Перша половина TF-IDF.

Де вводиться · тема 05 · TF-IDF

Чанкування chunking

Розбиття довгих документів на фрагменти такого розміру, щоб кожен влазив у модель і при цьому лишався самодостатнім за змістом. Робиться перед побудовою векторної бази.

Де вводиться · тема 37 · Векторні бази й семантичний пошук

Термінологія. У тексті вживаємо і «чанкування», і описове «розбиття на фрагменти». Розмір фрагмента — головна ручка якості всієї конструкції RAG: завеликий фрагмент розмиває зміст, замалий втрачає контекст.

СТАТТІA — Z

Терміни, для яких українська назва або не потрібна, або гірша за оригінал.

A

ANN approximate nearest neighbours · наближений пошук найближчих сусідів

Сімейство алгоритмів, що знаходять найближчі вектори не точно, а майже точно — зате в тисячі разів швидше. Саме на них стоять векторні бази.

Де вводиться · тема 37 · Векторні бази й семантичний пошук

Не плутай. Скорочення ANN в англомовних текстах означає ще й artificial neural network. У цьому курсі — тільки наближений пошук сусідів.

B

beam search променевий пошук

Стратегія декодування, за якої модель веде одночасно кілька найкращих варіантів відповіді й на кожному кроці лишає з них знову найкращі. Дає зв'язніший текст, ніж жадібний вибір по одному слову.

Де вводиться · тема 18 · seq2seq

Ухвалено: beam search латиною. Калька «променевий пошук» вводить в оману — нічого променевого в ньому немає, «beam» тут означає пучок утримуваних версій. Кількість версій звемо «ширина пошуку» (beam width). Українська назва в тексті з'являється один раз як довідка й далі не вживається.

BERT bidirectional encoder representations from transformers

Передтренована модель-енкодер, що читає речення в обидва боки й навчена відновлювати сховані слова. Текст вона не пише — зате дає сильне подання для класифікації, NER і пошуку відповіді в тексті.

Де вводиться · тема 28 · BERT, застосування — тема 29 · BERT у роботі

BIO-розмітка BIO tagging

Спосіб розмітити сутності в тексті потокенно: B — початок сутності, I — її продовження, O — слово поза сутністю. Так задача NER зводиться до звичайної класифікації кожного токена.

Де вводиться · тема 33 · NER

BLEU bilingual evaluation understudy

Метрика машинного перекладу: рахує, яка частка n-грам перекладу збіглася з еталонним перекладом людини.

Де вводиться · тема 18 · seq2seq

Українська специфіка. Метрики на збіг слів систематично занижують оцінку для флективних мов: правильний переклад, у якому слово стоїть в іншому відмінку, ніж в еталоні, зараховується як промах. Для української різниця між «поганим BLEU» і «поганим перекладом» більша, ніж для англійської.

BM25 best matching 25

Формула ранжування документів за запитом — стандарт повнотекстового пошуку. По суті це вдосконалений TF-IDF: він не дає частоті рости нескінченно й враховує довжину документа.

Де вводиться · тема 09 · Пошук і схожість

BPE byte pair encoding

Алгоритм побудови словника субслів: почати з окремих символів і багато разів склеювати найчастішу пару сусідів у нову одиницю. Що частіша послідовність, то раніше вона стає окремим токеном.

Де вводиться · тема 02 · Токенізація

Українська специфіка. BPE нічого не знає про морфологію, але на українських текстах він її частково відкриває сам: часті закінчення й корені склеюються в окремі токени просто тому, що часто трапляються. Межі при цьому не збігаються з морфемними — «книжкою» може розпастись не так, як розібрав би мовознавець.

C

CBOW continuous bag of words

Один із двох режимів навчання Word2Vec: за оточенням передбачити слово, що стоїть посередині. Швидший за skip-gram і краще працює на частих словах.

Де вводиться · тема 12 · Word2Vec

F

FastText

Розвиток Word2Vec, у якому вектор слова складають із векторів його символьних шматків. Тому модель дає вектор навіть слову, якого ніколи не бачила.

Де вводиться · тема 13 · GloVe і FastText

Українська специфіка. Для української це не дрібне поліпшення, а якісний стрибок: словоформи однієї леми ділять символьні шматки, тож «книжка» й «книжці» опиняються поруч самі собою, без жодної лематизації. Саме тому FastText довго був стандартним вибором для флективних мов.

G

GloVe global vectors

Спосіб побудувати вектори слів не з окремих вікон, а з повної таблиці «скільки разів слово A траплялося поруч зі словом B» по всьому корпусу.

Де вводиться · тема 13 · GloVe і FastText

GPT generative pre-trained transformer

Родина авторегресійних моделей-декодерів: передтренованих просто передбачати наступний токен. Саме з неї виросли сучасні великі мовні моделі.

Де вводиться · тема 30 · GPT-родина

GRU gated recurrent unit

Спрощена родичка LSTM: два гейти замість трьох і жодного окремого стану пам'яті. Менше параметрів, швидше навчання, якість часто така сама.

Де вводиться · тема 17 · LSTM і GRU

I

In-context learning навчання в контексті

Здатність великої моделі підхопити задачу з кількох прикладів, наведених просто в тексті запиту, — без жодної зміни ваг.

Де вводиться · тема 38 · Що змінює масштаб

Термінологія. Слово «навчання» тут оманливе: модель нічого не запам'ятовує, і після відповіді все зникає. Тому в тексті пишемо «навчання в контексті» лише поруч з англійською назвою й одразу пояснюємо, що ваги не змінюються.

L

LDA latent Dirichlet allocation · латентне розміщення Діріхле

Класична модель тем: припускає, що кожен документ — це суміш кількох тем, а кожна тема — свій розподіл слів, і відновлює обидві речі з текстів.

Де вводиться · тема 08 · Тематичне моделювання

LSTM long short-term memory · довга короткочасна пам'ять

Рекурентна мережа з окремим станом пам'яті й гейтами, які вирішують, що запам'ятати, що забути й що видати назовні. Придумана саме проти зникомого градієнта.

Де вводиться · тема 17 · LSTM і GRU

Про назву. «Довга короткочасна пам'ять» звучить як суперечність, і це не помилка перекладу: мережа має саме довшу коротку пам'ять, а не постійну.

N

n-грама n-gram

Послідовність із n сусідніх одиниць: «машинне навчання» — біграма зі слів, «нав» — триграма з літер. Найдешевший спосіб повернути мішку слів хоч трохи відомостей про порядок.

Де вводиться · тема 04 · Мішок слів

Українська специфіка. Словесні n-грами для української слабші, ніж для англійської, з двох причин одразу. Порядок слів вільніший, тож та сама думка дає різні біграми; а флексія множить кожну біграму на всі можливі поєднання форм. Символьні n-грами натомість для української працюють добре — вони самі схоплюють корені.

NMF non-negative matrix factorization · невід'ємна матрична факторизація

Розклад матриці «документ — слово» на дві менші матриці, усі числа в яких невід'ємні. Через заборону від'ємних чисел компоненти виходять схожими на теми, які можна прочитати.

Де вводиться · тема 08 · Тематичне моделювання

O

OOV out-of-vocabulary · позасловникове слово

Слово, якого немає у словнику моделі. Для словника зі слів це глухий кут: усі такі слова зливаються в одну позначку «невідоме» й стають нерозрізненними.

Де вводиться · тема 02 · Токенізація

Українська специфіка. Частка OOV для української вища, ніж для англійської, при тому самому розмірі словника — просто тому, що форм більше. Субслівна токенізація прибирає проблему як таку: незнайомого слова для неї не існує, є лише незнайома комбінація знайомих шматків.

Q

Query, Key, Value запит, ключ, значення

Три вектори, які механізм уваги робить із кожного токена. Запит питає «що мені зараз потрібно», ключ відповідає «що я можу запропонувати», значення — те, що насправді передається далі, якщо запит із ключем збіглися.

Де вводиться · тема 22 · Self-attention покроково

Термінологія. Українські назви вживаємо в поясненні, а в позначках і формулах лишаємо Q, K, V. Слово «запит» тут не має нічого спільного ні з пошуковим запитом, ні з промптом — про це в темі сказано прямо, бо це найчастіша плутанина.

Question answering відповідь на питання, QA

Задача дати відповідь на питання за текстом. Екстрактивна версія знаходить відповідь готовим фрагментом документа, генеративна — формулює її своїми словами.

Де вводиться · тема 34 · Question answering

R

RAG retrieval-augmented generation · генерація з пошуком

Конструкція з двох частин: спершу пошук знаходить у твоїх документах доречні фрагменти, потім модель відповідає, спираючись саме на них. Не архітектура моделі, а спосіб її обв'язати.

Де вводиться · тема 37 · Векторні бази й семантичний пошук

Навіщо. Модель знає лише те, що бачила під час навчання, і схильна вигадувати. RAG дає їй свіжі документи прямо в запит — і водночас робить відповідь перевірною: видно, з якого фрагмента вона взялася.

RLHF reinforcement learning from human feedback

Донавчання моделі за людськими вподобаннями: люди порівнюють пари відповідей, на цих порівняннях вчиться модель винагороди, а вже за нею навчанням із підкріпленням підганяють саму мовну модель.

Де вводиться · тема 39 · Instruction tuning і RLHF

Спадщина. «Навчання з підкріпленням» читач уже проходив у курсі машинного навчання — тут те саме поняття в новій ролі: винагороду дає не середовище, а модель, навчена на людських оцінках.

ROUGE recall-oriented understudy for gisting evaluation

Метрика сумаризації: рахує, яка частка n-грам еталонного переказу трапилась у переказі моделі.

Де вводиться · тема 35 · Сумаризація

Чому метрика погана. Хороший переказ можна написати зовсім іншими словами — ROUGE його покарає. Для української гірше вдвічі: навіть ті самі слова в іншому відмінку вже не збігаються. Тема розбирає, чим цю метрику доповнювати.

S

Scaling laws закони масштабування

Стійкі залежності між розміром моделі, обсягом даних, витраченими обчисленнями — і якістю. Головна їхня цінність у тому, що вони дають передбачати результат великого навчання за кількома маленькими.

Де вводиться · тема 38 · Що змінює масштаб

self-attention увага до себе

Механізм уваги, застосований реченням до самого себе: кожне слово дивиться на всі інші слова того самого речення й вирішує, з якими воно пов'язане. Основна операція трансформера.

Де вводиться · тема 22 · Self-attention покроково

Ухвалено: self-attention латиною. «Самоувага» українською читається як риса характеру, а не як операція, і в реченні поводиться погано. «Увага до себе» годиться для пояснення, але не як назва. Тому назва латинська, а поруч у тексті — пояснення «речення дивиться саме на себе». Для порівняння, cross-attention перекладається без проблем — «перехресна увага», і саме так ми його й звемо.

SentencePiece

Токенізатор, що працює з сирим текстом як із потоком символів, разом із пробілами, і не потребує попереднього розбиття на слова. Через це він однаково добре працює з мовами, де пробілів немає взагалі.

Де вводиться · тема 02 · Токенізація

seq2seq sequence to sequence · послідовність у послідовність

Схема, у якій модель приймає одну послідовність і видає іншу, можливо, іншої довжини: речення — переклад, стаття — переказ, питання — відповідь. Складається з енкодера й декодера.

Де вводиться · тема 18 · seq2seq

skip-gram

Другий режим навчання Word2Vec, дзеркальний до CBOW: за словом посередині передбачити його оточення. Повільніший, але краще вчить рідкісні слова.

Де вводиться · тема 12 · Word2Vec

T

T5 і BART text-to-text

Моделі, у яких геть усі задачі зведено до одного вигляду: на вхід текст, на вихід текст. Класифікація, переклад і переказ відрізняються лише тим, що написано на початку запиту.

Де вводиться · тема 31 · T5 і BART

teacher forcing подавання еталона

Прийом навчання декодера: на кожному кроці йому подають не те, що він щойно видав сам, а правильну відповідь із еталона. Навчання йде швидше — але виникає розрив із тим, що буде в бою, коли еталона немає.

Де вводиться · тема 18 · seq2seq

TF-IDF term frequency — inverse document frequency

Ваговий коефіцієнт слова в документі: часте в цьому тексті й рідкісне в усій колекції слово отримує велику вагу, а «і» та «на» — майже нульову. Роками був стандартним поданням тексту.

Де вводиться · тема 05 · TF-IDF

W

Word2Vec

Перша модель ембедингів, що зробила їх масовими: неглибока мережа, яку вчать передбачати слово за оточенням або оточення за словом, а потрібні їй ваги і є векторами слів.

Де вводиться · тема 12 · Word2Vec

Обмеження. Вектор у Word2Vec один на слово назавжди — «коса» на голові й «коса» в полі отримають один і той самий. Контекстні моделі, що з'являться в шостому блоці, саме це й виправляють.

WordPiece

Алгоритм субслівної токенізації, близький до BPE, але пари склеює не за простою частотою, а за тим, наскільки склейка покращує модель. Використаний у BERT.

Де вводиться · тема 02 · Токенізація

Z

Zero-shot і few-shot без прикладів і з кількома прикладами

Два режими роботи великої моделі без донавчання: у першому їй просто описують задачу словами, у другому додають кілька прикладів прямо в запит.

Де вводиться · тема 38 · Що змінює масштаб

Глосарій буде рости. Терміни тут узято з плану курсу — усіх восьми блоків, від «Тексту як даних» до «Дороги до LLM». Коли теми буде написано, до статей додадуться посилання, а самі означення звіримо з тим, як поняття справді пояснене в темі.