Learn AI

Відстежуй прогрес · навчайся офлайн

Отримати

Урок 6 із 7

Донавчання виконувати інструкції

8 хв читання

Твоя базова модель допише будь-яке речення. Але постав їй питання — і у відповідь дістанеш лише нові питання. Як змусити її відповідати?

Від передбачувача до асистента

Базова модель передбачає текст — і не здогадується, що має допомагати. Донавчання на інструкціях (SFT) виправляє це невеликим набором зразкових пар (запит і добра відповідь) та кількома раундами того самого навчального циклу. В архітектурі нічого не змінюється: просто вправляєш модель у тому, який вигляд має корисна відповідь.

Донавчання — це той самий цикл «передбач і виправ», спрямований на крихітний, дібраний набір прикладів «інструкція → відповідь».

Дешево, швидко й нашаровується

Порівняно з передтренуванням це дрібниця — години, а не тижні; тисячі прикладів, а не трильйони токенів. Надбудовується це над базовою моделлю, яку вже навчено, тож уся загальна мовна вправність лишається й лише спрямовується на виконання інструкцій. Пізніший раунд налаштування за вподобаннями може ще підгострити тон і безпеку.

Нічого не перенавчаєш з нуля. Донавчання — це легкий шар вправляння поверх усього, чого вже навчило передтренування.

Донавчання формує поведінку, а не факти. Нових знань, яких модель не бачила в передтренуванні, воно не додасть — лише навчить, як відповідати.

Що збудовано

Чим донавчання на інструкціях відрізняється від передтренування?

Продовжити в застосунку

Пройди весь курс «Побудуй LLM з нуля» — з відстеженням

Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.