Fish Audio выпустила превью генератора речи Drama 3
Fish Audio выпустила превью генератора речи Drama 3
Fish Audio опубликовала превью генератора речи Drama 3, смещая схему управления в сторону описательных указаний интонации. Основное изменение заменяет короткие жёсткие аудиотеги свободными текстовыми описаниями темпа, тона и характера для более гибкого контроля.
Ключевые возможности
В превью отмечены несколько улучшений в рабочем процессе и синтезе, которые затрагивают редактирование, многоголосые сцены и поддержку языков.
- Целевая регенерация позволяет заменить отдельное слово или фразу в существующем треке, не изменяя оставшийся аудиофрагмент.
- Модель может переключаться между разными голосами в середине предложения, позволяя выразительным и динамичным сменам говорящего внутри одного высказывания.
- Она генерирует многоперсонажные диалоги за один проход, сокращая время производства сцен, требующих нескольких различных голосов.
- Система поддерживает генерацию на русском языке, включая фонетические и просодические шаблоны, характерные для современной русской речи.
Доступность и примечания к тестированию
Drama 3 в настоящее время платная, тогда как версия 2.1 общедоступна и использовалась как основа для тестирования. В ходе тестов версии 2.1 доступный голос сильно напоминал актёра Сергея Бурунова, что свидетельствует о высокой точности воспроизведения для некоторых пресетов.
Однако некоторые директивы тегов, такие как 'crowd laughing' и 'excited', не всегда срабатывали, а ошибки постановки ударения возникали часто в испытаниях. Эти ограничения затронули некоторые выразительные цели в оценённых пресетах.
Доступ
Превью-билд доступен через API для разработчиков и аудиокоманд, заинтересованных в ранней оценке новых рабочих процессов синтеза голоса. Fish Audio позиционирует подход с описательными подсказками как способ упростить создание материалов, одновременно обеспечивая более тонкий контроль исполнения.
Похожие записи

