Fish Audio выпускает превью генератора речи Drama 3
Fish Audio выпускает превью генератора речи Drama 3
Компания Fish Audio опубликовала превью новой модели речи Drama 3, заменяющей короткие аудиотеги описательными подсказками.
Основное изменение в работе с подсказами
Вместо строгих одно‑ или двусловных аудиотегов авторы теперь могут описывать интонацию, темп и характер обычными текстовыми подсказками, чтобы формировать исполнение.
Ключевые возможности
В превью выделены несколько функциональных улучшений по сравнению с предыдущими релизами и показано более гибкое управление сгенерированным аудио.
- Избирательное регенерирование: движок может перегенерировать отдельное слово или фразу внутри существующего трека, не изменяя окружающее аудио.
- Смена голоса в середине высказывания: модель способна менять тембр говорящего в пределах одного предложения или фразы.
- Многоголосный диалог: Drama 3 может генерировать разговоры нескольких персонажей за один проход.
- Поддержка русского языка: система генерирует речь на русском наряду с другими поддерживаемыми языками.
Сравнение с версией 2.1
Тестирование с версией 2.1 показало, что некоторые теги не всегда влияли на выходной результат, а постановка ударения время от времени промахивалась при синтезе.
Напротив, использование той же подсказки с несколькими описательными фразами в Drama 3 давало более чёткое произношение и более естественную интонацию на протяжении предложений.
Некоторые сигналы реакции толпы, такие как аплодисменты или крики, в превью всё ещё игнорировались, но в целом подача продемонстрировала заметное улучшение по сравнению с предыдущей моделью.
Доступность и указание авторства
По сообщениям от Fish Audio, превью-сборка Drama 3 уже доступна бесплатно на сайте разработчика, а широкомасштабный выпуск планируется позже.
В ходе ранних тестов среди доступных голосов был спикер, обозначенный как Сергей Бурунов, чей сэмплированный тембр напоминал исполнение этого актёра в тех испытаниях.
Похожие записи

