Learn AI

Відстежуй прогрес · навчайся офлайн

Отримати

Урок 3 із 6

LLM як суддя

8 хв читання

Точний збіг працює для «2 + 2 = 4». А як автоматично оцінити підсумок, тон чи корисну відповідь, коли сотня різних варіантів однаково прийнятні?

Оцінюй за рубрикою, а не за збігом рядків

Для відкритого виходу не порівняєш результат з одним еталонним рядком. Натомість другій моделі-судді ти даєш відповідь і рубрику (критерії, які має задовольняти гарна відповідь) та просиш оцінити. Тепер «якість» можна визначити, послідовно застосовувати й проганяти на масштабі.

LLM-суддя оцінює вихід за критеріями, які пишеш ти. Рубрика і є твоїм визначенням хорошого: зміниш її — зміниться й переможець.

Суддя — теж модель

Не давай судді карт-бланш. Це модель, тож на неї може вплинути довжина чи впевнене формулювання, а ще вона може бути погано відкаліброваною, тобто впевненою в хибному вердикті. Тримай рубрику конкретною, звіряй суддю з власними мітками й обирай чіткі так/ні-критерії замість розпливчастого «оцінка якості 1–10».

Суддя масштабує твій смак, а не замінює його. Звір суддю з людськими мітками, перш ніж вірити його оцінкам.

Розпливчаста рубрика дає розпливчасті оцінки. «Це добре?» провокує упередженість судді; «Чи цитує політику? (так/ні)» дає результат, якому можна довіряти й який можна перевірити.

Суть коротко

Твій LLM-суддя ставить кожній відповіді впевнене «9/10», навіть тим, про які ти точно знаєш, що вони хибні. Як це виправити?

Продовжити в застосунку

Пройди весь курс «Оцінювання та надійність» — з відстеженням

Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.