Урок 4 із 7
Що означає «it»
9 хв читання
«The cat didn't cross the road because it was too tired.» Що означає it — кіт чи дорога? Ти знаєш миттєво: кіт. Але AI читає по одному слову, за порядком. Як він узагалі може визначити, на яке попереднє слово вказує it?
Жодне слово не стоїть саме
Зміст слова рідко визначений сам по собі. Bank біля річки — це не той bank, що тримає твої гроші. It щоразу вказує на щось інше. Щоб зрозуміти, що слово означає тут, модель мусить подивитися на слова навколо — але це одразу породжує головне питання: які саме з-поміж інших і наскільки кожне має важити?
Жодне слово не можна зрозуміти саме собою: його зміст довершує оточення. Тож робота моделі — з'ясувати для кожного слова, які саме інші слова це оточення утворюють.
Кожне слово озирається й зважує решту
Це і є робота уваги. Усередині кожного шару трансформера з минулого уроку кожне слово озирається на всі попередні й дає кожному вагу — наскільки варто до нього дослухатися. А тоді вбирає зміст із тих, кому дало велику вагу. У сцені нижче слово it робить саме це: перемкни закінчення речення й дивись, куди піде його увага.
Слово it те саме, але зміни одне слово далі — і його увага перестрибує з cat на road. Модель справді з'ясовує з контексту, на що вказує it, а не вгадує найближчий іменник.
Кожне слово, не лише «it»
«It» — це був легкий випадок. Усередині моделі кожне слово робить це озирання водночас, зважуючи слова перед собою. У сцені нижче тапни будь-яке слово, щоб озиралося саме воно, — і дивись, як його стовпчики показують, наскільки воно спирається на кожне попереднє. Зауваж: найпершому слову нема на що озиратися — спертися можна лише на ті слова, що вже були. Перемкни закінчення — і «it» переносить свою увагу з одного слова на інше просто в тебе на очах.
Пласка низка слів стає павутиною: кожне слово тихо зважує кожне попереднє, усі водночас. Ця павутина, відбудовувана в кожному шарі, і є тим, як модель стежить, на що слово насправді вказує.
Чому це і є вся суть
Увага — це серце трансформера, та частина, що робить справжню роботу. Саме вона дає моделі стежити за довгим заплутаним реченням, тримати в голові, хто що кому зробив, і зв'язати слово з іншим, далеким. Кожен шар робить це зважування знову й знову, і саме це повторення поступово розплутує вузол справжнього речення.
Увага — це те, як модель перетворює плаский ряд слів на павутину зв'язків: яке слово з яким пов'язане. Це той єдиний трюк, що уможливив сьогоднішній AI.
Під капотом кожне слово і ставить маленьке питання (query), і пропонує свій key; а те, наскільки добре query збігається з key, і задає вагу. Модель проганяє багато таких патернів уваги пліч-о-пліч (їх звуть heads), і кожен стежить за своїм типом зв'язку: один за граматикою, інший за тим, хто що зробив, і так далі.
Підсумок
- —Зміст слова залежить від інших слів навколо — модель мусить знайти, яких саме
- —Увага дає кожному слову озирнутися й зважити попередні слова за тим, наскільки вони для нього важать
- —Це ядро трансформера: як пласка низка слів стає павутиною зв'язків — і так у кожному шарі
Ти даєш AI: «The cat didn't cross the road because it was too **wide**.» Щоб зрозуміти, на що вказує *it*, на яке з попередніх слів моделі треба звернути найбільше уваги — і чому?
Продовжити в застосунку
Пройди весь курс «Як AI працює насправді» — з відстеженням
Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.