Neuro.net представила новое поколение технологии синтеза речи (Neuro TTS) для голосовых AI-решений

Российская компания Neuro.net представила новое поколение технологии синтеза речи Neuro TTS. Разработка предназначена для голосовых ИИ-решений и позволяет встраивать генерацию речи в сервисы бизнеса через API.

Neuro.net представила новое поколение технологии синтеза речи (Neuro TTS) для голосовых AI-решений
Источник: youtube.com

В основе новой технологии — сочетание больших языковых моделей и диффузионного синтеза. Такой подход позволяет учитывать не только сам текст, но и его контекст, а также акустические особенности формируемой речи. Для бизнеса предусмотрена возможность задавать характер звучания ИИ-агента и подключать синтез непосредственно к своим сервисам.

Neuro.net развивает речевые технологии для автоматизации контакт-центров. В таких системах синтез речи работает не отдельно, а как часть полноценного диалога: голосовой ИИ должен распознать речь клиента, определить его намерение, сформировать ответ и затем озвучить его.

Одной из особенностей Neuro TTS стала потоковая генерация. По данным компании, первые аудиоданные начинают поступать примерно через 120 мс после запроса. Благодаря этому воспроизведение можно начать до того, как система завершит генерацию всей реплики.

«В Neuro.net мы годами развиваем собственные технологии разговорного ИИ: распознавание и синтез речи, управление диалогом. Для нас это и технологическая независимость, и возможность самим определять, на что способны наши продукты. Мы хотим, чтобы технологии, которые создает наша команда, выдерживали сравнение с лучшими мировыми решениями. Мы видим, как в мире конкуренция ИИ-компаний заставляет даже гигантов двигаться быстрее, пересматривать стратегии и выпускать то, что еще вчера казалось невозможным. Я хочу, чтобы в России было так же. Чтобы за внимание бизнеса боролись качеством технологий, скоростью и результатом».

Александр Цепелев, глава группы компаний, в которую входит Neuro.net

Новая модель уже доступна для использования. Neuro.net предоставляет синтез через REST и WebSocket, а сама модель работает с русской речью и поддерживает потоковую выдачу аудио. На сайте сервиса можно выбрать голос и протестировать синтез.

Читайте также:

xAI выпустила Grok 4.7 для длительных задач и программирования

Alibaba представила новый ИИ-чип и готовит модель на 10 трлн параметров

Что будем искать? Например,ChatGPT

Мы в социальных сетях