Российская ИИ-модель Grom Zvuk обошла Suno v6 по качеству звучания в слепом тесте

Российский разработчик GPTunneL представил Grom Zvuk — новую модель для генерации музыки. Она создает готовые композиции продолжительностью до четырех минут, включая вокал, мелодию, аранжировку и сведение. Полученный трек можно сразу использовать в видео или другом контенте без обязательной дополнительной обработки.

Российская ИИ-модель Grom Zvuk обошла Suno v6 по качеству звучания в слепом тесте
Источник: gptunnel.ru

В слепом сравнении Grom Zvuk получила 83 балла из 100 за качество звучания. Для сравнения, Suno v6 набрала 80 баллов. При оценке соответствия заданному тексту обе модели получили по 85 баллов.

В тестировании использовали 150 треков на разных языках. Все модели запускали с одинаковыми настройками, а 75% промптов взяли из открытого набора WildSongBench. Участники не знали, какая модель создала конкретную композицию. Помимо Grom Zvuk и Suno, в сравнении участвовали Suno v5, Suno v5.5, Mureka 9 и другие модели. При этом Suno v5 получила 88 баллов за качество звучания и 90 за соответствие текста, а Mureka 9 — 90 и 78 баллов соответственно.

Grom Zvuk построена примерно на 5 млрд параметров. В ее архитектуре два основных компонента. Планировщик последовательно определяет развитие мелодии и смену гармонии, а синтезатор одновременно работает со всей длиной композиции и уточняет ее звучание целиком. В конце декодер формирует готовую стереозапись.

Особенность подхода в том, что модель создает песню как единую структуру. Сначала она определяет расположение интро, куплетов, припевов и других частей, а затем постепенно преобразует исходное шумовое представление в готовый звук. Поэтому промежуточной версии для прослушивания нет — композиция становится доступна после завершения генерации.

Модель поддерживает вокал на русском, английском, китайском, японском, казахском, испанском, немецком, французском и корейском языках. При генерации она учитывает текст, ударения и фразировку. Также Grom Zvuk умеет создавать инструментальную музыку и делать каверы с сохранением мелодии и текста исходной песни, но с изменением аранжировки, инструментов и манеры вокала.

Генерация песни занимает примерно от 30 секунд в зависимости от нагрузки. Доступ к модели будет предоставляться через API GPTunneL.

Читайте также:

Neuro.net представила новое поколение технологии синтеза речи (Neuro TTS) для голосовых AI-решений

ChatGPT, Claude и другие ассистенты появились в CarPlay

xAI выпустила Grok 4.7 для длительных задач и программирования

Что будем искать? Например,ChatGPT

Мы в социальных сетях