Урок 6 із 7
Донавчання виконувати інструкції
8 хв читання
Твоя базова модель допише будь-яке речення. Але постав їй питання — і у відповідь дістанеш лише нові питання. Як змусити її відповідати?
Від передбачувача до асистента
Базова модель передбачає текст — і не здогадується, що має допомагати. Донавчання на інструкціях (SFT) виправляє це невеликим набором зразкових пар (запит і добра відповідь) та кількома раундами того самого навчального циклу. В архітектурі нічого не змінюється: просто вправляєш модель у тому, який вигляд має корисна відповідь.
Донавчання — це той самий цикл «передбач і виправ», спрямований на крихітний, дібраний набір прикладів «інструкція → відповідь».
Дешево, швидко й нашаровується
Порівняно з передтренуванням це дрібниця — години, а не тижні; тисячі прикладів, а не трильйони токенів. Надбудовується це над базовою моделлю, яку вже навчено, тож уся загальна мовна вправність лишається й лише спрямовується на виконання інструкцій. Пізніший раунд налаштування за вподобаннями може ще підгострити тон і безпеку.
Нічого не перенавчаєш з нуля. Донавчання — це легкий шар вправляння поверх усього, чого вже навчило передтренування.
Донавчання формує поведінку, а не факти. Нових знань, яких модель не бачила в передтренуванні, воно не додасть — лише навчить, як відповідати.
Що збудовано
- —Набір інструкцій: пари «запит → добра відповідь».
- —Короткий прогін донавчання тим самим навчальним циклом, що й передтренування.
- —Асистента, що виконує інструкції, побудованого на базовій моделі.
Чим донавчання на інструкціях відрізняється від передтренування?
Продовжити в застосунку
Пройди весь курс «Побудуй LLM з нуля» — з відстеженням
Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.