Урок 3 із 6
Чому більше даних допомагає
10 хв читання
Якщо навчання — це читання і тренування, напрошується питання: а якщо і того, і того буде більше, AI стане розумнішим? Здебільшого так, але з двома великими застереженнями.
Дві ручки: скільки і як довго
Два чинники визначають, наскільки доброю стане навчена модель. Перший — скільки вона прочитала: більше тексту охоплює більше світу, тож менше тем лишається порожніми. Прочитай мільйон медичних статей — і вона підтримає розмову про медицину; дай майже нічого про рідкісне хобі — і цей закуток так і лишиться напівпорожнім. Другий — як довго вона тренувалася: більше кіл «здогад — поштовх» загострюють кожне передбачення, перетворюючи розмите передчуття на впевнене й влучне. Підкрути обидва — і модель водночас ширшає й гострішає.
Більше даних розширює охоплення моделі; більше тренування загострює її передбачення. Разом вони роблять її сильнішою — саме це й називають законами масштабування.
Сміття зайшло — сміття вийшло
Ось перше застереження: якість важить не менше за кількість. Перемкни дані на брудні (суцільні помилки, спам і суперечності) — і скільки їх не додавай, майже не допоможе. Модель сумлінно вивчає весь цей безлад, бо не вміє відрізнити добрий текст від поганого: просто вбирає все, що їй дали. З тієї ж причини студент, який зубрить зі стосу хибних відповідей, стає гіршим, а не кращим: тренування вкарбовує саме те, що відпрацьовуєш. Менша купка чистого, надійного тексту зазвичай б'є цілу гору мотлоху — ось чому справжні навчальні конвеєри викидають куди більше тексту, ніж лишають.
Ось чому команди витрачають величезні зусилля на очищення й фільтрацію навчальних даних. Модель настільки надійна, наскільки надійне те, чим її годували.
Більший обсяг допомагає лише тоді, коли він якісний. Модель не вміє оцінити свої джерела: вивчає безлад так само сумлінно, як і правду.
Більше — ще не диво
Друге застереження: приріст виходить на плато. Подвоєння даних не подвоює кмітливість: кожна наступна купа допомагає трохи менше за попередню, як десятий підручник з теми навчає менше за перший. І все ж, починаючи з певних розмірів, можуть проявитися нові здатності, яких раніше явно не було: модель раптом дає раду задачі, яку колись провалювала, хоча цю навичку їй ніхто не програмував. Масштабування потужне, але це радше рівне сходження з нечастими сюрпризами, ніж перемикач, що клацає на «геній».
Масштабування допомагає, але зі спадною віддачею — хоча за більших розмірів справді нові здатності можуть проявитися.
Що взяти з собою
- —Більше даних заповнює прогалини; більше тренування загострює передбачення.
- —Якість б'є кількість — брудні дані навчають брудну модель.
- —Приріст виходить на плато, хоча за більших масштабів іноді з'являються нові здатності.
Команда подвоює навчальні дані, додаючи брудний, низькоякісний текст. Що станеться?
Продовжити в застосунку
Пройди весь курс «Як навчається AI» — з відстеженням
Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.