Урок 2 із 6
Як працює донавчання (SFT, LoRA)
7 хв читання
Ти показуєш моделі кілька сотень своїх найкращих відповідей. Як саме це змінює її наступну відповідь?
Показуй, а не розказуй
Головний робочий інструмент тут — кероване донавчання (SFT): ти даєш базовій моделі багато пар-прикладів (промпт та ідеальна відповідь), і тренування підправляє її ваги так, щоб вона частіше видавала відповіді, схожі на твої. З кожною партією частка відповідей у потрібному стилі зростає.
SFT не додає нових фактів, а переформовує схильності. Кожна нова партія прикладів нахиляє модель трохи ближче до поведінки, яку ти показуєш.
LoRA: донавчай маленьку надбудову, а не всю модель
Перетреновувати кожну вагу дорого й ненажерливо до пам'яті. LoRA (низькорангова адаптація) заморожує вихідну модель і тренує поруч крихітний набір додаткових ваг — часто менш ніж 1% її розміру. Так ти отримуєш майже всю користь повного донавчання за частку обчислень і можеш тримати багато маленьких адаптерів на одну базову модель.
LoRA змінює всю економіку: той самий виграш у поведінці за частку обчислень і сховища. Саме тому донавчання стало практичним навіть на скромному залізі.
Повне донавчання й LoRA цілять в одну мішень, просто LoRA дістається туди дешевше. Для більшості команд LoRA — типовий вибір; повне донавчання лишають на рідкісний випадок, коли без нього не обійтися.
Суть коротко
- —SFT тренується на парах промпт→відповідь, зсуваючи схильності до твоїх прикладів.
- —Змінює поведінку, а не знання: жодних нових фактів.
- —LoRA тренує маленький адаптер, а не всю модель: майже вся користь за значно менші витрати.
Що LoRA змінює порівняно з повним керованим донавчанням?
Продовжити в застосунку
Пройди весь курс «Донавчання та кастомізація» — з відстеженням
Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.