Learn AI

Відстежуй прогрес · навчайся офлайн

Отримати

Урок 3 із 6

Підготовка даних

6 хв читання

Дві команди донавчають ту саму модель. Одна бере 5 000 прикладів, зібраних автоматично, інша — 300, перевірених вручну. Менший набір перемагає. Чому?

Сміття на вході — донавчене сміття на виході

Донавчена модель точно копіює свої приклади — разом з їхніми помилками. Якщо дані непослідовні, погано розмічені чи не в тому тоні, модель саме цього й навчиться. Ось чому кілька сотень чистих, узгоджених прикладів зазвичай б'ють тисячі шумних: ти вчиш не фактам, а патерну, і кожен поганий приклад його розмиває.

Твій датасет — це специфікація. Модель повторює твої приклади, тож узгодженість у них стає узгодженістю в її поведінці.

Який вигляд мають хороші дані

Хороші дані для донавчання узгоджені за форматом, репрезентативні для реальних входів, які ти зустрінеш у продакшні, і достатньо різноманітні, щоб покрити крайні випадки. Повторюй ту саму структуру промпта, яку використовуватимеш при інференсі. Відклади частину даних, яку ніколи не пускаєш у тренування, щоб потім чесно виміряти результат. І хай люди перевіряють розмітку: її якість — це стеля якості всієї моделі.

Ніколи не донавчай на клієнтських даних, не перевіривши згоду й правила конфіденційності. Тренувальні дані можуть запам'ятатися й згодом спливти, тож стався до датасету так, ніби він може витекти.

Суть коротко

У тебе 4 000 прикладів, але їх розмічали різні люди в неузгоджених форматах. Найкращий хід перед донавчанням?

Продовжити в застосунку

Пройди весь курс «Донавчання та кастомізація» — з відстеженням

Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.