3D-художники обычно доводят картинку до совершенства и оставляют звук на последний вечер. Результат предсказуем: отличный рендер с бесплатной библиотечной музыкой и роботизированной озвучкой, которая портит впечатление сильнее, чем помог бы её полный отказ.
Нейросети закрыли этот разрыв: сегодня можно получить приличную озвучку, автоматический липсинк и атмосферный фон без студии и актёров. Разберём, что из этого звучит достойно, где подделка слышна сразу и как собрать всё вместе.
Синтез речи: что изменилось
Разница между синтезом трёхлетней давности и нынешним принципиальная. Раньше модель произносила текст, сейчас она играет его: расставляет паузы, меняет интонацию по смыслу фразы, добавляет дыхание.
Практический уровень: закадровый голос для презентации, обучающего ролика или демонстрации продукта неотличим от человеческого для большинства слушателей. Эмоциональная игра персонажа в драматичной сцене всё ещё слышна как синтез.
Что влияет на качество больше всего. Не выбор модели, а подготовка текста. Синтез читает то, что написано, буквально.
- Числа и сокращения писать словами: не «3D», а «три дэ», не «2026», а «две тысячи двадцать шестой».
- Английские термины транскрибировать русскими буквами, иначе модель прочтёт их по правилам своего основного языка.
- Расставить паузы разбивкой на короткие предложения, а не длинными периодами с запятыми.
- Ударения в редких словах указывать доступным моделью способом, иначе получите «зАмок» вместо «замОк».
Клонирование голоса и где проходит граница
Технически для клонирования достаточно нескольких минут чистой записи. Результат узнаваем.
Юридическая и этическая часть важнее технической. Голос это персональная характеристика человека. Клонировать можно свой собственный голос или чужой с письменного разрешения. Всё остальное создаёт риски, несопоставимые с экономией на озвучке.
Рабочий сценарий для небольшой студии: записать один раз собственный голос диктора в хороших условиях, склонировать и дальше собирать любые тексты без повторных сессий записи. Это законно, экономит время и даёт единое звучание всех роликов.
Липсинк: автоматическая анимация речи
Задача обратная захвату движения: на входе аудиодорожка, на выходе анимация лицевых контроллеров.
Как устроено. Модель разбирает звук на фонемы и сопоставляет им визимы, то есть положения рта. Затем строит плавные переходы между ними с учётом коартикуляции: соседние звуки влияют на форму рта друг друга.
Что получается. Для среднего плана и второстепенных персонажей результат сразу пригоден. Для крупного плана главного героя нужна доводка: автоматика делает рот технически правильным, но невыразительным.
Чего автоматика не делает. Всего, что не связано с речью напрямую: движения бровей, прищур, лёгкие повороты головы в такт. Именно они делают лицо живым, и их добавляют вручную поверх.
Для работы липсинка модель персонажа должна иметь корректный набор блендшейпов или лицевой риг. Если его нет, автоматике не на что опираться. Как строится такая система, мы разбирали в материале про анимацию персонажа в Blender.
Эмбиент и атмосферный фон
Самая недооценённая часть. Ролик без фонового слоя звучит мёртво, даже если в нём есть музыка и речь.
Генеративные модели создают протяжённые атмосферные слои по текстовому описанию: гул серверной, шум цеха, лес перед дождём, гудение неоновой вывески. Для фонового слоя, который звучит тише речи на десяток децибел, качества достаточно.
Практический приём. Стройте фон слоями, а не одним треком. Базовый гул помещения, средний слой с редкими событиями, верхний слой с мелкими деталями. Три простых слоя звучат богаче одного сложного и лучше поддаются сведению.
Ограничение. Модели плохо держат длинные структуры: сгенерированная минута часто заметно повторяется. Лучше собрать длинный фон из нескольких коротких кусков с перекрёстным затуханием.
Звуковые эффекты
Отдельные короткие звуки: удар, шаг, щелчок механизма, работа привода. Здесь генерация пока проигрывает библиотекам.
Причина в том, что короткий звук оценивается слушателем детально: он либо попадает в картинку, либо нет. Библиотечный звук записан с реального объекта и всегда убедительнее.
Разумная стратегия: библиотеки для конкретных событий, генерация для фона и для случаев, когда нужен звук несуществующего объекта. Фантастический механизм или инопланетное существо проще сгенерировать, чем найти.
Ещё один рабочий приём: генерировать не финальный эффект, а сырьё для него. Сгенерированный гул, замедленный вдвое и пропущенный через фильтр, звучит убедительнее прямого результата генерации. Тот же подход, что и с картинками: нейросеть даёт заготовку, обработка делает её пригодной. Про этот принцип применительно к изображениям мы писали в разборе пайплайна текстурирования в ComfyUI.
Сведение: минимум, который решает
Даже хорошие исходники звучат плохо без элементарного сведения. Порядок для ролика с закадровым голосом.
- Уровни. Речь громче всего, фон на десять до пятнадцати децибел тише, музыка между ними. Это соотношение важнее качества исходников.
- Приглушение фона под речью. Автоматическое снижение уровня музыки и фона в моменты речи. Один этот приём поднимает разборчивость радикально.
- Фильтр низких частот на речи. Срез ниже 80 герц убирает гул, которого не должно быть в голосе.
- Компрессия речи. Умеренная, чтобы выровнять громкость, но не задавить динамику.
- Нормализация по громкости. Ориентир для видео в интернете это около минус 14 LUFS. Площадки всё равно приводят к своему уровню, но сведённый по стандарту ролик звучит предсказуемо.
Как это встроить в пайплайн 3D-проекта
Главная рекомендация, которая противоречит привычке: делайте звук не в конце, а параллельно.
Закадровый текст пишется до анимации, потому что он задаёт хронометраж. Анимировать сцену, а потом подгонять под неё речь, значит переделывать анимацию.
Рабочий порядок: текст, черновая озвучка синтезом, монтаж по этому таймингу, анимация под утверждённый хронометраж, финальная озвучка, липсинк, звуковые слои, сведение.
Черновая озвучка синтезом на раннем этапе это отдельная ценность: раньше приходилось либо ждать актёра, либо начитывать самому, и обе опции тормозили работу.
Звук в демонстрации продукта и портфолио
Отдельный сценарий, который касается почти каждого 3D-художника: ролик о собственной работе.
Здесь звук решает непропорционально много. Одинаковая по картинке демонстрация со сведённым звуком и без него воспринимается как работа разного уровня. Причина простая: зритель не анализирует звук осознанно, но чувствует общую аккуратность.
Минимальный набор для такого ролика: ровный закадровый текст, тихий атмосферный слой, аккуратные акценты на смене планов. Музыка не обязательна, а часто мешает: под неё сложнее слушать объяснение.
Частая ошибка это громкая музыка поверх тихого голоса. Если приходится напрягаться, чтобы разобрать слова, зритель уходит. Что вообще стоит показывать в работах и как их оформлять, разбирали в материале про портфолио 3D-художника.
Технические требования к дорожке
Чтобы не пересводить после первой же загрузки на площадку.
- Частота дискретизации 48 килогерц. Стандарт для видео. 44,1 это музыкальный стандарт, при монтаже он приводит к пересчёту.
- Разрядность 24 бита при работе, 16 при финальной отдаче. Запас разрядности нужен на этапе обработки, в готовом файле он бесполезен.
- Стерео, а не моно. Даже если речь по центру: атмосферный слой в стерео сразу добавляет объём.
- Пиковый уровень не выше минус одного децибела. Запас нужен, потому что при перекодировании площадкой пики поднимаются.
- Никакого клиппинга. Обрезанные пики слышны как треск и не лечатся после экспорта.
Если ролик пойдёт на несколько площадок, экспортируйте одну мастер-дорожку по стандарту и не подгоняйте её под каждую отдельно: площадки нормализуют звук сами.
Что слышно как подделка
Чтобы понимать, где остановиться.
- Эмоциональные пики. Крик, плач, смех синтез не вытягивает.
- Длинные монологи. На третьей минуте однообразие интонаций становится заметным. Разбивайте, меняйте темп.
- Диалог двух синтезированных голосов. Отсутствие реакции друг на друга слышно сразу: люди перебивают, ускоряются, отвечают с разной задержкой.
- Терминология и имена собственные. Первое, на чём спотыкается синтез.
- Идеальная чистота. Полное отсутствие дыхания и комнатного тона звучит неестественно. Немного фона добавляет достоверности.
Частые вопросы
Можно ли использовать сгенерированный звук коммерчески?
Зависит от лицензии сервиса, и это нужно читать до начала работы, а не после. Условия у разных инструментов отличаются радикально, у части бесплатных тарифов коммерческое использование прямо запрещено.
Нужен ли микрофон, если всё синтезируется?
Для клонирования собственного голоса нужен, и качество исходной записи определяет результат. Для остального нет.
Почему липсинк выглядит правильно, но неживо?
Потому что рот двигается сам по себе. Речь это движение всего лица: брови, веки, лёгкие повороты головы. Автоматика делает только рот, остальное добавляется вручную и занимает больше времени, чем сам липсинк.
Что делать, если синтез неверно ставит ударение?
Переписать слово так, как оно должно звучать, либо разбить фразу. Это выглядит грубо в тексте сценария, но текст для синтеза это не текст для чтения глазами, а партитура.
Стоит ли генерировать музыку?
Для фонового подклада под демонстрацию продукта вполне. Для темы, которая должна запоминаться и нести настроение, генерация пока даёт усреднённый результат: технически корректный и совершенно безликий.
