Learn AI

Відстежуй прогрес · навчайся офлайн

Отримати

Урок 3 із 6

Оцінювання як продуктове питання

7 хв читання

Ти запускаєш блискучу нову версію моделі. Демо-відповіді розкішні. А за тиждень підтримка палає: модель тихо здала на нудних випадках, яких ніхто не показував у демо. Як це можна було передбачити?

Демо бреше; тестовий набір — ні

Демо показує найкращий випадок. А реальні користувачі натрапляють на нудні, незручні, граничні — і саме там зміна може тихо все зламати. Рішення — оцінювання: фіксований набір реальних тестових випадків із відомими правильними відповідями, який проганяєш на продукті, щоб міряти якість, а не вгадувати з привабливого демо.

Оцінювання перетворює «відчувається краще» на цифру. Саме так ти ловиш регресію (зміну, що тихо погіршує окремі випадки) раніше за користувачів.

Проганяй його на кожній зміні

Оцінювання виправдовують себе, коли автоматичні: щоразу, коли ти змінюєш модель, промпт чи налаштування, проганяй тестовий набір і порівнюй із попередньою версією. Якщо три випадки, що раніше проходили, тепер провалюються, ти побачиш це до запуску, а не від розлюченого клієнта. Оцінювання — не інженерна забаганка, а ворота якості продукту.

Пропускай зміни крізь оцінювання, а не повз нього. «Демо виглядало чудово» — це не критерій релізу.

Тримай тестовий набір чесним. Наповни його реальними, складними, нудними випадками, які твої користувачі й справді надсилають, а не зручними, на яких бал має гарний вигляд. Оцінювання, яке неможливо провалити, нічого не навчить.

Суть коротко

Перед запуском нової версії моделі — звідки ти знатимеш, що вона тихо не просіла?

Продовжити в застосунку

Пройди весь курс «Вимірювання та управління AI-продуктами» — з відстеженням

Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.