Российский разработчик GPTunneL представил Grom Zvuk — новую модель для генерации музыки. Она создает готовые композиции продолжительностью до четырех минут, включая вокал, мелодию, аранжировку и сведение. Полученный трек можно сразу использовать в видео или другом контенте без обязательной дополнительной обработки.

В слепом сравнении Grom Zvuk получила 83 балла из 100 за качество звучания. Для сравнения, Suno v6 набрала 80 баллов. При оценке соответствия заданному тексту обе модели получили по 85 баллов.
В тестировании использовали 150 треков на разных языках. Все модели запускали с одинаковыми настройками, а 75% промптов взяли из открытого набора WildSongBench. Участники не знали, какая модель создала конкретную композицию. Помимо Grom Zvuk и Suno, в сравнении участвовали Suno v5, Suno v5.5, Mureka 9 и другие модели. При этом Suno v5 получила 88 баллов за качество звучания и 90 за соответствие текста, а Mureka 9 — 90 и 78 баллов соответственно.
Grom Zvuk построена примерно на 5 млрд параметров. В ее архитектуре два основных компонента. Планировщик последовательно определяет развитие мелодии и смену гармонии, а синтезатор одновременно работает со всей длиной композиции и уточняет ее звучание целиком. В конце декодер формирует готовую стереозапись.
Особенность подхода в том, что модель создает песню как единую структуру. Сначала она определяет расположение интро, куплетов, припевов и других частей, а затем постепенно преобразует исходное шумовое представление в готовый звук. Поэтому промежуточной версии для прослушивания нет — композиция становится доступна после завершения генерации.
Модель поддерживает вокал на русском, английском, китайском, японском, казахском, испанском, немецком, французском и корейском языках. При генерации она учитывает текст, ударения и фразировку. Также Grom Zvuk умеет создавать инструментальную музыку и делать каверы с сохранением мелодии и текста исходной песни, но с изменением аранжировки, инструментов и манеры вокала.
Генерация песни занимает примерно от 30 секунд в зависимости от нагрузки. Доступ к модели будет предоставляться через API GPTunneL.
Читайте также:
Neuro.net представила новое поколение технологии синтеза речи (Neuro TTS) для голосовых AI-решений
ChatGPT, Claude и другие ассистенты появились в CarPlay
xAI выпустила Grok 4.7 для длительных задач и программирования