Урок 3 із 6
Як читати рейтинги
6 хв читання
«#1 у рейтингу!» — хвалиться кожен новий реліз. Що насправді вимірюють ці ранжування і чому топова модель усе одно може не підійти саме тобі?
Як моделі ранжують
Бенчмарк — це фіксований тест: великий набір питань із відомими відповідями, а бал моделі — це скільки з них вона розв'язала правильно. Арена працює інакше: люди голосують, яка з двох анонімних відповідей краща, і з цих голосів складається рейтинг. Обидва підходи зводять «яка модель хороша» до одного числа, за яким її можна сортувати.
Рейтинг зводить «хороша модель» до одного числа, за яким їх сортують.
Чого ранг не бачить
Заковика в тому, що ранг підсумовує задачі, які можуть бути зовсім не твоїми. Модель, яка очолює бенчмарк із коду, цілком може писати незграбні листи, а улюбленець арени — провалитися на твоїй вузькій темі. До того ж бенчмарки з часом просочуються в навчальні дані й тихо завищують бали. Тож бери рейтинг, щоб звузити коло, а далі проганяй кілька найкращих на власній реальній роботі — це єдиний бенчмарк, що чогось вартий саме для тебе.
Найкраща модель на папері не завжди найкраща для твоєї задачі — перевір самостійно.
Відбери з рейтингу дві-три найкращі моделі й прожени через кожну свою реальну задачу. Саме твоя робота — той бенчмарк, що має значення.
Коротко
- —Бенчмарки оцінюють моделі на фіксованих тестах; арени ранжують за голосами людей.
- —Ранг охоплює деякі задачі — не обов'язково твої.
- —Використай рейтинги для відбору, тоді перевір на власній роботі.
Модель очолює рейтинг. Який тверезий висновок?
Продовжити в застосунку
Пройди весь курс «Ландшафт AI» — з відстеженням
Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.