Урок 1 із 7
Кіно зі слів
10 хв читання
Ти вводиш речення — паперовий човник пливе канавою, повною дощу — і за кілька секунд перед тобою коротке відео саме цього: рухоме, хоча його ніхто ніколи не знімав. Ні камери, ні знімальної групи, ні монтажу. То звідки береться рухома картинка?
Кліп з нічого
Ще недавно кілька секунд відео означали справжню роботу: постав камеру й зніми, найми групу або малюй кадр за кадром, як аніматор. І якщо цього не знято, сцени просто не існувало. Тепер ти описуєш її словами — і інструмент робить короткий рухомий кліп, маленьку сцену, якої не бачив жоден об'єктив. Схоже на магію. Але це не так: усередині одна напрочуд проста ідея, повторена багато разів, і решта уроку її розбирає.
Описати сцену й отримати короткий рухомий кліп — це text-to-video. Ти не знімаєш і не монтуєш наявний матеріал: інструмент створює цілком нові кадри з твоїх слів.
Усе починається з шуму
Ось несподіванка. Інструмент не малює кліп штрих за штрихом. Він починає з цілого кліпу чистого шуму (кожен кадр — просто випадкове зерно, як на неналаштованому телевізорі) і потроху очищає його, керуючись твоїми словами, доки не проявиться картинка. Причому не завершує один кадр, щоб перейти до наступного, а очищає всю низку кадрів одразу, тож усі наводяться на різкість разом. Потягни повзунок очищення внизу й дивись, як кліп із шуму перетворюється на паперовий човник, а кожен кадр прояснюється в такт з рештою.
Почати з шуму й прибирати його крок за кроком, керуючись твоїми словами, — це diffusion: та сама ідея, що й в інструментах для зображень, лише запущена одразу над цілим стосом кадрів.
Кадри, що узгоджуються
Очищення стосу кадрів породжує справжню проблему відео. Кожен кадр має бути гарною картинкою й узгоджуватися з сусідніми (той самий човник, той самий колір, те саме світло), інакше замість плавного руху кліп мерехтить і спотворюється. Тож, очищаючи, інструмент водночас тримає кадри зчепленими й підштовхує кожен збігтися із сусідами. Прибери це узгодження у сцені внизу — і човник перестає бути одним човником: стрибає, змінює розмір, з'їжджає з води. Додай його — і кадри зчеплюються в одне рухоме ціле.
Наскільки кожен кадр узгоджується із сусідніми — це temporal consistency. Це найскладніша частина відео: саме вона робить так, що низка кадрів читається як один рухомий об'єкт, а не мерехтливе слайдшоу.
Чому кліпи лишаються короткими
Із цього випливають дві речі. Перша — вартість. Одне зображення — це один кадр, а п'ятисекундний кліп — уже понад сотня кадрів, усі очищені разом і втримані в узгодженні: величезний обсяг обчислень заради кількох секунд. Друга — тривалість. Що далі триває кліп, то важче тримати кожен кадр узгодженим, тож дрібні відмінності накопичуються й об'єкт поволі дрейфує. Обидва чинники штовхають в один бік: сьогодні кліпи короткі, зазвичай кілька секунд, а довші відео роблять, генеруючи кілька й склеюючи їх один за одним.
Інструменти, що це роблять, швидко кращають (Google Veo, Runway, Kling, Pika, Luma та інші), а сфера змінюється щомісяця, тож будь-яке конкретне обмеження чи ціну, які десь трапляться, сприймай як миттєвий знімок, а не сталий факт. Далі в курсі ти ще зустрінеш ці ідеї як практичні навички; наразі ж головне — вхопити сам механізм.
Суть
- —Ти описуєш сцену, і інструмент генерує короткий рухомий кліп, а не знімає й не монтує наявний матеріал
- —Інструмент стартує з цілого кліпу шуму й очищає його крок за кроком, усі кадри проявляються разом — це diffusion, запущений у часі
- —Кадри мають узгоджуватися між собою, інакше кліп мерехтить (temporal consistency); тримати це важко, тому кліпи короткі й дорогі
Друг каже, що зробити п'ятисекундне AI-відео — це майже те саме, що зробити одне зображення: просто раз натискаєш «згенерувати». Який опис кращий?
Продовжити в застосунку
Пройди весь курс «AI-відео» — з відстеженням
Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.