Пользователи ГигаЧата теперь могут создавать видео со звуком

Пользователи ГигаЧата могут создавать видео с речью, музыкой и звуками окружения — в Full HD-качестве и полностью бесплатно. Это стало возможно благодаря новой модели Kandinsky 6.0 Video, которая генерирует ролики с синхронным звуком. Чтобы получить готовый ролик с озвучкой, достаточно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда. Максимальная длительность ролика со звуком — пять секунд, со временем разработчики планируют ее увеличить. Кроме того, модель стала лучше передавать физику реального мира: движения людей, животных и техники в роликах выглядят естественнее и правдоподобнее. Kandinsky стал первой российской нейросетью, способной создавать видео с синхронным звуком.

Пользователи ГигаЧата теперь могут создавать видео со звуком

«Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона. Любой человек получает возможность снимать более выразительные личные видео. А для профессионального контента это означает более быстрое и выгодное производство. Модель Kandinsky 6.0 Video мы отдаем разработчикам бесплатно и без ограничений — строить на ней свои сервисы может каждый».

Антон Фролов, старший вице-президент, руководитель блока «Развитие генеративного ИИ» Сбербанка

Возможности модели

Kandinsky 6.0 Video — мультимодальная модель, которая одновременно «видит» и «слышит» то, что генерирует. Поэтому диалоги, эффекты и фоновая музыка синхронизированы с картинкой, а губы героя движутся вместе с речью. Если звук не нужен, можно попросить нейросеть создать видео без него. Когда модель не знает, как выглядит объект из запроса, например, новый персонаж поп-культуры, она ищет референсы и генерирует точный результат. Так можно создавать даже те объекты, которые появились уже после обучения модели.

Kandinsky создает натуральный звук в широком диапазоне: от разговора и цифровых эффектов до шагов, шума ветра или звука проезжающей машины. В одном ролике можно разыграть диалог, добавить музыку — от «испанской гитары» до «саундтрека к погоне», «лоу-фая для сонного вечера» или любой другой. Модель создает чистый и детализированный звук, без «шипения» и потери качества: в 44 кГц, стандартном качестве большинства стриминговых сервисов.

Эти возможности пригодятся для самых разных задач: с их помощью можно оживить семейную фотографию, записать видеооткрытку с речью или музыкой для близкого человека, снять ASMR-ролик с шелестом бумаги, потрескиванием дров или скрипом снега или оживить старый мем или кадр из фильма.

Разработчикам новая модель доступна в опенсорсе под лицензией MIT — ее можно бесплатно интегрировать в собственные продукты. Модель также будет доступна в популярных инструментах для запуска и интеграции нейросетей, например, FAL, Diffusers, FastVideo, ComfyUI, SGLang и vLLM-omni. Разработчикам не нужно писать интеграцию с нуля: Kandinsky 6.0 Video можно подключить прямо в существующий продукт.

Качество видео

Kandinsky 6.0 Video создает ролики в разрешении до Full HD. В ГигаЧате пользователи смогут выбрать нужное качество прямо в окне ввода перед отправкой запроса: SD для более быстрой генерации, HD или Full HD для более четкой и детализированной картинки. Kandinsky 6.0 Video точнее передает физику реального мира. Движения людей, животных и предметов в роликах выглядят естественнее, а сцены целиком — правдоподобнее. Это особенно заметно в динамичных роликах с быстрым движением или сменой ракурса.

Обновление будет полезно всем, кто создает видео в профессиональных и личных проектах:

  • Авторам контента для соцсетей: создать короткий ролик с озвученной репликой персонажа или фоновым звуком без микрофона, актёров и монтажа звука.
  • Малому бизнесу: сделать голосовой рекламный ролик о товаре или услуге без съёмочной группы.
  • Маркетологам и SMM-специалистам: собрать тестовый ролик с диалогом и фирменной атмосферой — звуком окружения и музыкальной подложкой — для соцсетей и мессенджеров.
  • Преподавателям: оживить архивное фото или портрет исторической личности с озвученной репликой — для урока истории или литературы.
  • Дизайнерам: собрать черновой ролик со звуком для питча или демонстрации идеи.

Как обучали модель

Kandinsky 6.0 Video состоит из двух связанных модулей, которые отвечают за создание видео и звука. Звуковой модуль обучен более чем на 20 млн разнообразных видео со звуком. Для обучения команда отбирала ролики только с чистым, качественным звуком, а также видео с говорящими людьми крупным планом для более точной синхронизации речи и мимики.

В Kandinsky 6.0 Video Pro качество генерации значительно выросло в общем визуальном качестве, следовании промпту и движении камеры. Новая модель лучше Kandinsky 5.0 в среднем в 71% случаев по всем критериям, также уверенно обходит открытую LTX 2.5. Кроме того, в задаче оживления изображения превосходит и ведущую закрытую модель Veo 3.1 Fast — по визуальному качеству, соответствию исходному изображению и движению камеры.

Что будем искать? Например,ChatGPT

Мы в социальных сетях