Урок 3 із 6
Підготовка даних
6 хв читання
Дві команди донавчають ту саму модель. Одна бере 5 000 прикладів, зібраних автоматично, інша — 300, перевірених вручну. Менший набір перемагає. Чому?
Сміття на вході — донавчене сміття на виході
Донавчена модель точно копіює свої приклади — разом з їхніми помилками. Якщо дані непослідовні, погано розмічені чи не в тому тоні, модель саме цього й навчиться. Ось чому кілька сотень чистих, узгоджених прикладів зазвичай б'ють тисячі шумних: ти вчиш не фактам, а патерну, і кожен поганий приклад його розмиває.
Твій датасет — це специфікація. Модель повторює твої приклади, тож узгодженість у них стає узгодженістю в її поведінці.
Який вигляд мають хороші дані
Хороші дані для донавчання узгоджені за форматом, репрезентативні для реальних входів, які ти зустрінеш у продакшні, і достатньо різноманітні, щоб покрити крайні випадки. Повторюй ту саму структуру промпта, яку використовуватимеш при інференсі. Відклади частину даних, яку ніколи не пускаєш у тренування, щоб потім чесно виміряти результат. І хай люди перевіряють розмітку: її якість — це стеля якості всієї моделі.
Ніколи не донавчай на клієнтських даних, не перевіривши згоду й правила конфіденційності. Тренувальні дані можуть запам'ятатися й згодом спливти, тож стався до датасету так, ніби він може витекти.
Суть коротко
- —Якість і узгодженість б'ють голий обсяг: кілька сотень чистих пар зроблять більше, ніж тисячі сирих.
- —Узгодь формат прикладів з реальними промптами на інференсі.
- —Відклади тестову частину, яку ніколи не пускаєш у тренування, для чесного оцінювання.
- —Перевір розмітку й конфіденційність, перш ніж щось піде в тренування.
У тебе 4 000 прикладів, але їх розмічали різні люди в неузгоджених форматах. Найкращий хід перед донавчанням?
Продовжити в застосунку
Пройди весь курс «Донавчання та кастомізація» — з відстеженням
Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.