Урок 5 із 7
Оживи фото мовою
7 хв читання
Дай інструменту одне фото людини й запис голосу — і він може змусити це обличчя вимовити слова: рот рухається в такт, наче її знімали на камеру. Як нерухоме фото починає говорити?
Обличчя плюс голос
Це інший трюк, ніж кліпи, які ми робили досі. Замість описувати сцену, ти даєш інструменту дві речі: нерухоме зображення обличчя (фото або згенерований портрет) і аудіодоріжку мовлення. Інструмент оживлює обличчя так, що воно ніби вимовляє саме ці слова, ще й з природними легкими рухами голови. Результат — аватар, що говорить, і саме так роблять багато AI-ведучих та пояснювальних відео.
Нерухоме обличчя плюс голосова доріжка, оживлені так, що людина ніби говорить, — це аватар, що говорить. Ти даєш обличчя й аудіо, інструмент — рух.
Підлаштувати рот під звук
Суть — правильно зробити рот. Кожен звук мовлення має свою форму рота: губи стуляються на м, округлюються на о, показують зуби на ф. Інструмент слухає аудіо, визначає, який звук лунає в кожну мить, і малює відповідну форму рота на тому кадрі. Вирівняй ці форми зі звуками — і обличчя виглядає так, ніби справді говорить. Це вирівнювання називають lip-sync.
Lip-sync — це підлаштування кожної форми рота під звук, який лунає в ту саму мить. Влучні форми й точний час — і нерухоме обличчя читається як таке, що справді говорить.
Корисно — і легко зловживати
Аватари, що говорять, справді корисні: ведучий, якому не потрібна студія; пояснювач, який записують раз, а оновлюють, просто відредагувавши сценарій; або та сама людина, яка ніби говорить мовою, якої не знає. Але той самий трюк може змусити справжню людину сказати те, чого вона ніколи не казала. Ось де проходить межа між корисним аватаром і дипфейком.
Створюй аватар, що говорить, лише з людини, яка дала чіткий дозвіл, а де це важливо — зазнач, що відео згенероване AI. Змусити справжню людину ніби казати те, чого вона не казала, без її згоди — так і створюють шкідливі дипфейки.
Суть
- —Аватар, що говорить = нерухоме обличчя + голосова доріжка, оживлені так, що людина ніби говорить
- —Lip-sync — це основа: кожен звук мовлення підлаштований під свою форму рота, кадр за кадром
- —Потужно для ведучих і дубляжу — але лише зі згодою; без неї це дипфейк
Ти подаєш портретне фото й аудіозапис в інструмент для аватарів, що говорять. Що інструмент переважно робить, щоб це виглядало переконливо?
Продовжити в застосунку
Пройди весь курс «AI-відео» — з відстеженням
Отримай персональний план, прогрес і стріки в застосунку — цей урок і кожен наступний, по порядку.