Урок 7 із 7
Обслуговувати швидко й дешево
5 хв читання
Усе почалося з питання, навіщо моделі окремий чип. Тепер ти знаєш і чип, і вартість, і ручки. Яка одна ментальна модель зв'язує все це докупи?
Що в тебе тепер є
За жменьку коротких уроків у тебе склалася робоча картина інференсу: не таблиці характеристик, а ідеї, що лишаються правдивими, хоч би як мінялося залізо.
- —GPU — тисячі простих ядер, що роблять паралельну математику моделі всі водночас.
- —NVIDIA — швидкі чипи плюс CUDA, програмний шар, який і є справжнім ровом.
- —Повільно й дорого — текст генерується токен за токеном; міркувальники додають приховані.
- —Сервінг-рушії — vLLM, Ollama та інші тримають GPU зайнятим і задають компроміс.
- —Квантування й вартість — менше бітів робить модель меншою; кілька важелів зрізають рахунок.
Один цикл, який варто запам'ятати
Якщо запам'ятати щось одне: вартість інференсу — це формула, якою ти керуєш, а не фіксована ціна. Підбери модель під задачу, тримай дороге залізо завантаженим і підріж те, що генерує кожен виклик. Ця єдина звичка зводиться до трьох дій: підібрати розмір, наситити залізо, підрізати токени. Вона й покриває майже все, щоб обслуговувати моделі швидко й дешево.
Добре обслуговувати — не секрет: підібрати модель під задачу, тримати GPU завантаженим і зрізати токени. Свідомо, щоразу.
Назви заліза й цінники змінюватимуться щороку. А форми звідси — паралельність, цикл «токен за токеном», квантування, підбір розміру — ні.
Яка ментальна модель зв'язує інференс докупи?
Продовжити в застосунку
Пройди весь курс «Інференс і залізо» — з відстеженням
Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.