Урок 3 із 6
LLM як суддя
8 хв читання
Точний збіг працює для «2 + 2 = 4». А як автоматично оцінити підсумок, тон чи корисну відповідь, коли сотня різних варіантів однаково прийнятні?
Оцінюй за рубрикою, а не за збігом рядків
Для відкритого виходу не порівняєш результат з одним еталонним рядком. Натомість другій моделі-судді ти даєш відповідь і рубрику (критерії, які має задовольняти гарна відповідь) та просиш оцінити. Тепер «якість» можна визначити, послідовно застосовувати й проганяти на масштабі.
LLM-суддя оцінює вихід за критеріями, які пишеш ти. Рубрика і є твоїм визначенням хорошого: зміниш її — зміниться й переможець.
Суддя — теж модель
Не давай судді карт-бланш. Це модель, тож на неї може вплинути довжина чи впевнене формулювання, а ще вона може бути погано відкаліброваною, тобто впевненою в хибному вердикті. Тримай рубрику конкретною, звіряй суддю з власними мітками й обирай чіткі так/ні-критерії замість розпливчастого «оцінка якості 1–10».
Суддя масштабує твій смак, а не замінює його. Звір суддю з людськими мітками, перш ніж вірити його оцінкам.
Розпливчаста рубрика дає розпливчасті оцінки. «Це добре?» провокує упередженість судді; «Чи цитує політику? (так/ні)» дає результат, якому можна довіряти й який можна перевірити.
Суть коротко
- —Використовуй модель-суддю для відкритого виходу без єдиної правильної відповіді.
- —Рубрика — це твоє визначення якості: конкретні критерії, найкраще так/ні.
- —Суддя — це модель: він може бути упередженим чи погано відкаліброваним, тож звіряй його.
- —Вибірково звіряй оцінки судді зі своїми мітками, перш ніж на них покладатися.
Твій LLM-суддя ставить кожній відповіді впевнене «9/10», навіть тим, про які ти точно знаєш, що вони хибні. Як це виправити?
Продовжити в застосунку
Пройди весь курс «Оцінювання та надійність» — з відстеженням
Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.