Урок 5 із 7
Спостерігаємо, як модель міркує
8 хв читання
Почитай викладки моделі-мислителя — і помітиш дивне: посеред думки вона пише «стоп — це не так», викреслює власний крок і пробує знову. Це вагання ніхто не програмував. Звідки ж воно?
Думати вголос
Коли модель практикується на складних задачах, спроби, що вдаються, мають спільну звичку: спершу думати вголос. Вони переказують задачу, викладають кроки, пробують шлях і перевіряють його. Оскільки ця звичка раз по раз доходить до відповіді, навчання з підкріпленням її зміцнює — тож добре натренована модель-мислитель природно видає довгий ланцюжок міркувань, перш ніж зважитися на відповідь.
Покрокові викладки — не декорація. Це стратегія, яку практика визнала найнадійнішою — тож модель навчилася викладати міркування, перш ніж відповісти.
«Стоп — це не так»
Найдивовижніше — те, що з'являється всередині цих викладок: модель починає сама в собі сумніватися. Вона піде лінією міркування, помітить, що та не тримається купи, напише щось на кшталт «стоп, перегляну ще раз» — і відступить назад. Цього ходу ніхто не прописував — він проявився сам, бо впіймати власну помилку посеред розв'язку — чудовий спосіб урешті дійти правильної відповіді, а навчання з підкріпленням винагороджує саме за правильний результат. Пройди міркування крок за кроком нижче й дивись, як це стається.
Самовиправлення не вчили — його відкрили. Оскільки практика винагороджує за правильну фінальну відповідь, модель навчилася вертатися й виправляти себе, точно як зробила б уважна людина.
Чому повертатися назад окупається
Варто бути точним, чому це з'являється. Під час практики спроба, що жене вперед на хибному кроці, зазвичай закінчується хибно — і її відкидають. Спроба, що спиняється, помічає хибний крок і виправляє його, частіше закінчується правильно — і її лишають. Ніхто ж не винагороджує слово «стоп»; практика винагороджує лише за правильну фінальну відповідь. Самоперевірка виживає, бо це надійний шлях до неї.
Самовиправлення — не вдача, якою модель наділили. Це побічний наслідок винагороди за правильні відповіді: звичка ловити помилки — це та сама звичка, що доходить до правильної відповіді, тож практика її й лишає.
Ця самоперевірка, що з'явилася сама собою, стала головною новиною відкритих моделей-мислителів на кшталт DeepSeek-R1, чиї звіти прозвали її «моментом осяяння»: посеред тренування модель спонтанно почала переглядати власні кроки — звичка, якої ніхто не заклав руками.
Підсумок
- —Практика підштовхує модель перед відповіддю видавати ланцюжок міркувань — свої міркування, викладені крок за кроком
- —Усередині цих міркувань вона вчиться самовиправлятися: помітити хибний крок, відступити й виправити
- —Вагання ніхто не прописував — воно проявилося саме, бо практика винагороджує саме за те, щоб дійти правильної відповіді
Модель-мислитель посеред відповіді пише «стоп, так не виходить» і переробляє крок. Що найкраще пояснює цю поведінку?
Продовжити в застосунку
Пройди весь курс «Як AI вчиться думати» — з відстеженням
Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.