Урок 2 із 7
Як читати рейтинги
6 хв читання
Хтось постить «щойно вийшла нова модель №1» з графіком. Варто перемикатися? Спершу спитай: хто вирішив, що вона №1, і чи тестували її саме на твоїх питаннях?
Звідки беруться рейтинги
За цими турнірними таблицями стоять дві речі. Бенчмарки — це фіксовані екзаменаційні білети: модель відповідає на набір заданих питань і отримує бал. Арени — це конкурси популярності: люди голосують, яка з двох анонімних відповідей їм більше до вподоби, і перемоги складаються в ранг. Обидва корисні, обидва — усереднення за чужими задачами.
Рейтинг — це усереднення за фіксованим набором задач. Зміни задачу — і порядок перетасується: №1 для програмування може опинитися в середині таблиці для письма.
Ранг — це не «найкраще для тебе»
Графік не знає, чим ти займаєшся щодня. Ще й пропускає те, чого бали не ловлять: чи приємно з нею спілкуватися, чи не забагато вона відмовляє, ціну, швидкість. Сприймай рейтинг як шортлист, а не вирок: він підказує, хто приблизно в грі, а тестуєш їх на власній роботі вже ти.
За рейтингами склади шортлист із двох-трьох моделей, а потім перевір їх на власних справжніх задачах. Твій робочий процес — єдиний бенчмарк, що має значення.
Бенчмарки легко накрутити. Щойно тест стає відомим, лабораторії починають тренуватися саме під нього, тож бали повзуть угору, хоч на твоїх задачах модель кращою не стає. Число, що здається вирішальним, — часто найменш цікаве на сторінці.
Підсумок
- —Бенчмарки — фіксовані екзамени, арени — голоси віч-на-віч, і те, і те усереднення.
- —Порядок залежить від задачі й пропускає відчуття, відмови, ціну та швидкість.
- —Використовуй рейтинг як шортлист, а тоді тестуй фіналістів на власній роботі.
Модель очолює рейтинг із програмування. Ти ж переважно пишеш маркетингові листи. Який висновок?
Продовжити в застосунку
Пройди весь курс «Який AI мені обрати?» — з відстеженням
Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.