Learn AI

Відстежуй прогрес · навчайся офлайн

Отримати

Урок 2 із 6

Як працює донавчання (SFT, LoRA)

7 хв читання

Ти показуєш моделі кілька сотень своїх найкращих відповідей. Як саме це змінює її наступну відповідь?

Показуй, а не розказуй

Головний робочий інструмент тут — кероване донавчання (SFT): ти даєш базовій моделі багато пар-прикладів (промпт та ідеальна відповідь), і тренування підправляє її ваги так, щоб вона частіше видавала відповіді, схожі на твої. З кожною партією частка відповідей у потрібному стилі зростає.

SFT не додає нових фактів, а переформовує схильності. Кожна нова партія прикладів нахиляє модель трохи ближче до поведінки, яку ти показуєш.

LoRA: донавчай маленьку надбудову, а не всю модель

Перетреновувати кожну вагу дорого й ненажерливо до пам'яті. LoRA (низькорангова адаптація) заморожує вихідну модель і тренує поруч крихітний набір додаткових ваг — часто менш ніж 1% її розміру. Так ти отримуєш майже всю користь повного донавчання за частку обчислень і можеш тримати багато маленьких адаптерів на одну базову модель.

LoRA змінює всю економіку: той самий виграш у поведінці за частку обчислень і сховища. Саме тому донавчання стало практичним навіть на скромному залізі.

Повне донавчання й LoRA цілять в одну мішень, просто LoRA дістається туди дешевше. Для більшості команд LoRA — типовий вибір; повне донавчання лишають на рідкісний випадок, коли без нього не обійтися.

Суть коротко

Що LoRA змінює порівняно з повним керованим донавчанням?

Продовжити в застосунку

Пройди весь курс «Донавчання та кастомізація» — з відстеженням

Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.