Урок 7 із 7
Поза межами людського
6 хв читання
2016 року AI, що грав у настільну гру ґо, зробив хід — свій 37-й — настільки дивний, що коментатори вирішили, ніби це помилка. Це була не помилка. Він виграв партію, і жодна людина так не зіграла б. Що це каже нам про те, як AI вчиться?
Хід, якого не зробила б жодна людина
Тим AI був AlphaGo, що грав проти чемпіона світу Лі Седоля. Експерти оцінили ймовірність, що людина обрала б його хід 37, приблизно в 1 до 10 000 — він ламав багатовікову усталену мудрість. І хід був блискучий. AlphaGo не навчився його з людських партій; він навчився, граючи сам із собою мільйони разів (це й є навчання з підкріпленням), і практика привела його туди, куди не заходила жодна людська традиція. Порівняй нижче.
Натренований практикою, а не наслідуванням, AlphaGo міг сягнути ходів поза всім, що спробували б люди — і один із них був кращим за будь-що, що зіграла б людина.
Поза наслідуванням
У цьому — глибока обіцянка того тренування, про яке цей курс. Модель, що лише наслідує нас, обмежена нами: може бути незгіршою за найкращу людину, але не кращою. А модель, що практикується, підкріплюючи те, що справді працює, здатна забрести за межі людського репертуару й вряди-годи знайти щось нове. Саме так AI уже перевершує людей у ґо й шахах, і саме в цей бік помалу рухаються моделі-мислителі в математиці та коді.
Наслідування тримає AI усередині простору того, що люди вже роблять. Практика проти справжнього результату — ось що дає йому зрідка вийти за цей простір і зробити щось справді нове.
Будьмо чесні щодо меж: «поза межами людського» очевидно справджується у вузьких, перевірюваних світах на кшталт ґо, шахів і частини математики — там, де спробу можна оцінити точно. Загальне міркування перевірити значно важче, тож сьогоднішні моделі лише починають там нас випереджати. А от механізм — той самий, що уможливив хід 37: практикуйся, винагороджуй те, що працює, і не просто наслідуй.
Підсумок
- —Оскільки AI вчиться практикою, а не копіюванням, він може знайти ходи поза всім, що спробували б люди, — як-от хід 37 AlphaGo
- —Чисте наслідування обмежене людським рівнем; практика проти справжнього результату може вийти за нього
- —Це найясніше у перевірюваних світах (ґо, шахи, частина математики); загальне міркування лише починає туди діставатися
Хід 37 AlphaGo славиться тим, що жодна людина так не зіграла б, а він був чудовим. Яка частина того, як його тренували, найкраще це пояснює?
Продовжити в застосунку
Пройди весь курс «Як AI вчиться думати» — з відстеженням
Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.