Learn AI

Відстежуй прогрес · навчайся офлайн

Отримати

Урок 5 із 7

Спостерігаємо, як модель міркує

8 хв читання

Почитай викладки моделі-мислителя — і помітиш дивне: посеред думки вона пише «стоп — це не так», викреслює власний крок і пробує знову. Це вагання ніхто не програмував. Звідки ж воно?

Думати вголос

Коли модель практикується на складних задачах, спроби, що вдаються, мають спільну звичку: спершу думати вголос. Вони переказують задачу, викладають кроки, пробують шлях і перевіряють його. Оскільки ця звичка раз по раз доходить до відповіді, навчання з підкріпленням її зміцнює — тож добре натренована модель-мислитель природно видає довгий ланцюжок міркувань, перш ніж зважитися на відповідь.

Покрокові викладки — не декорація. Це стратегія, яку практика визнала найнадійнішою — тож модель навчилася викладати міркування, перш ніж відповісти.

«Стоп — це не так»

Найдивовижніше — те, що з'являється всередині цих викладок: модель починає сама в собі сумніватися. Вона піде лінією міркування, помітить, що та не тримається купи, напише щось на кшталт «стоп, перегляну ще раз» — і відступить назад. Цього ходу ніхто не прописував — він проявився сам, бо впіймати власну помилку посеред розв'язку — чудовий спосіб урешті дійти правильної відповіді, а навчання з підкріпленням винагороджує саме за правильний результат. Пройди міркування крок за кроком нижче й дивись, як це стається.

Самовиправлення не вчили — його відкрили. Оскільки практика винагороджує за правильну фінальну відповідь, модель навчилася вертатися й виправляти себе, точно як зробила б уважна людина.

Чому повертатися назад окупається

Варто бути точним, чому це з'являється. Під час практики спроба, що жене вперед на хибному кроці, зазвичай закінчується хибно — і її відкидають. Спроба, що спиняється, помічає хибний крок і виправляє його, частіше закінчується правильно — і її лишають. Ніхто ж не винагороджує слово «стоп»; практика винагороджує лише за правильну фінальну відповідь. Самоперевірка виживає, бо це надійний шлях до неї.

Самовиправлення — не вдача, якою модель наділили. Це побічний наслідок винагороди за правильні відповіді: звичка ловити помилки — це та сама звичка, що доходить до правильної відповіді, тож практика її й лишає.

Ця самоперевірка, що з'явилася сама собою, стала головною новиною відкритих моделей-мислителів на кшталт DeepSeek-R1, чиї звіти прозвали її «моментом осяяння»: посеред тренування модель спонтанно почала переглядати власні кроки — звичка, якої ніхто не заклав руками.

Підсумок

Модель-мислитель посеред відповіді пише «стоп, так не виходить» і переробляє крок. Що найкраще пояснює цю поведінку?

Продовжити в застосунку

Пройди весь курс «Як AI вчиться думати» — з відстеженням

Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.