Learn AI

Відстежуй прогрес · навчайся офлайн

Отримати

Урок 4 із 7

Стрімінг і затримка

6 хв читання

Два застосунки роблять ідентичний виклик API й чекають ідентичні кілька секунд. Один здається млявим, інший — живим. Уся різниця в тому, коли вони починають показувати відповідь.

Не чекай на всю відповідь

За замовчуванням твій застосунок просить відповідь і чекає, поки надійде вся, перш ніж щось показати. Тому користувач витріщається на спіннер, поки модель генерує. Стрімінг це перевертає: API надсилає кожен токен, щойно його згенеровано, тож ти малюєш відповідь просто в міру надходження, слово за словом, — як це вже роблять знайомі тобі чати.

Стрімінг не пришвидшує саму модель — лише робить очікування відчутно коротшим, показуючи відповідь просто в процесі написання. Час до першого токена — ось що відчувають користувачі.

Затримка — це продуктове рішення

Загальний час залежить від того, що ти можеш налаштувати: більша модель повільніша, довша відповідь триває довше, а більше вхідних даних для читання додає затримку. Стрімінг б'є по відчутному очікуванні; правильно підібрана модель і обмеження довжини відповіді б'ють по реальному. Для чат-UI — стрім. Для фонової задачі, якій просто потрібен готовий JSON, не варто: дочекайся всього одразу.

Важать два годинники: скільки відповідь триває й скільки вона відчувається. Стрімінг лагодить відчуття; вибір моделі й довжина відповіді лагодять годинник.

Стрімінг — не складність заради складності: тягнися до нього в інтерактивних UI й пропускай для пакетних чи інструментальних відповідей, які твій код парсить цілком. Добирай техніку під поверхню.

Суть коротко

Користувачі кажуть, що твій чат «здається повільним», хоч виклики API повертаються за звичні кілька секунд. Який фікс найбільш дієвий?

Продовжити в застосунку

Пройди весь курс «Створення AI-застосунків через API» — з відстеженням

Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.