Learn AI

Відстежуй прогрес · навчайся офлайн

Отримати

Урок 2 із 7

Слова стають токенами

8 хв читання

Спитай AI, скільки літер «r» у слові «strawberry», і він цілком може відповісти «дві». За секунди напише тобі сонет, а на літерах слова, яке вміє написати першокласник, збивається. Ця помилка не випадкова — це підказка, як AI читає насправді.

Він не читає літери

Перш ніж AI передбачить бодай одне слово, твій текст ріжеться на шматки, які звуться токенами. Він ніколи не бачить «s-t-r-a-w-b-e-r-r-y» так, як ти. Його абетка — це не 26 літер, а фіксований словник із десятків тисяч шматків, і читає та пише він лише ними.

Найменша одиниця моделі — це не літера й навіть не завжди слово, а токен, шматок тексту. Що б вона не читала — то завжди низка таких шматків.

Слова стають шматками

Як слово ділиться на шматки? Поширені слова трапляються так часто, що кожне дістає окремий токен — cat це один шматок. Рідкісні чи довгі слова — ні; їх складають з менших частин, які модель бачила часто: strawberry розпадається на straw + berry. Потикай слова нижче й подивись, як той самий текст виглядає одним для тебе, а зовсім іншим — для AI.

Для моделі strawberry — це лише два шматки, straw і berry. Вона ніколи не бачить окремих літер усередині, тож трьох «r» їй просто нема де порахувати.

Чому це пояснює дивні речі

Щойно знаєш, що він читає шматками, ціла купа дивацтв стає зрозумілою. Він плутається в задачах на рівні літер — порахувати літери, написати слово навпаки, скласти охайні рими чи анаграми, — бо для них потрібні літери, яких він не бачить. Рідкісні слова й одруки, що розлітаються на багато чудернацьких шматків, збивають його дужче за поширені. Навіть ціна працює так само: що на більше токенів ділиться текст, то більше роботи, щоб його прочитати й написати.

Токен — це атом моделі. Напрочуд багато її «сліпих плям» узагалі не про інтелект: вони ведуть прямо до того, що вона міркує шматками, а не символами.

Під капотом ці шматки визначає метод, який зветься byte-pair encoding: він починає з окремих символів і раз за разом зливає найчастішу сусідню пару в новий токен, тож поширені послідовності лишаються цілими, а рідкісні — по шматках. Кожна родина моделей має власний токенайзер, тож точний поділ може відрізнятися.

Прихована ціна шматків

Є ще одне місце, де шматки тихо даються взнаки: рахунок і годинник. Усе, що AI читає й пише, рахується в токенах, а не в словах, тож текст, який ділиться на більше шматків, дорожче обробляти й довше на нього відповідати. Англійська пакується охайно — шматок-два на слово. Але інші мови, код, незвичні імена чи багато емодзі розлітаються на значно більше частин, тож те саме повідомлення може коштувати в кілька разів дорожче. Ось чому відповідь однією мовою може відчуватися повільнішою чи дорожчою за ту саму відповідь іншою.

Токен — це не лише те, як модель читає, а й одиниця, за якою її тарифікують і відлічують час. Менше й чистіші шматки означають дешевші, швидші відповіді; а текст, що дробиться на багато шматків, тихо коштує більше.

Підсумок

Хтось просить AI написати слово «lemonade» навпаки, літера за літерою, і він помиляється, хоча пише бездоганні абзаци. Чому саме ця задача для нього складна?

Продовжити в застосунку

Пройди весь курс «Як AI працює насправді» — з відстеженням

Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.