ByteDance может выпустить ИИ для создания живых виртуальных миров уже в октябре

Виртуальное пространство, которое меняется в ответ на движения и голос человека, может стать следующим направлением развития генеративного ИИ ByteDance. По данным Bloomberg, компания готовит модель пространственного видео для работы в реальном времени, а основатель Чжан Имин лично курирует проект. Запуск возможен в октябре 2026 года, хотя окончательная дата пока не определена.

Источник: thenextweb

Как пишет Bloomberg со ссылкой на знакомые с планами компании источники, Чжан Имин координирует разработку между несколькими подразделениями ByteDance и выделяет на нее вычислительные ресурсы. В основу новой системы должна лечь Seedance, уже используемая компанией для генерации видео. Предполагается, что на этой базе пользователи смогут создавать интерактивные трехмерные пространства для игр, прямых трансляций и коротких сериалов.

Одним из основных направлений применения станут гарнитуры Pico, принадлежащие ByteDance. В таком сценарии человек надевает устройство, перемещается внутри виртуального мира, взаимодействует с окружением голосом и движениями, а модель продолжает генерировать сцену с учетом происходящего. Обычный видеогенератор создает последовательность кадров, которую затем можно посмотреть. Здесь же изображение должно формироваться по мере того, как пользователь действует внутри пространства.

Речь идет о направлении world models (моделей мира). Такие системы формируют представление о пространстве и происходящих в нем изменениях, чтобы сохранять последовательность сцены при взаимодействии с пользователем. В играх это открывает возможность создавать окружение по ходу прохождения, а в интерактивных сериалах менять развитие событий в зависимости от выбора зрителя.

Главная техническая особенность проекта связана с тем, где будут выполняться вычисления. По информации The Next Web, ByteDance ориентируется примерно на 20 кадров в секунду и задержку около 50 мс. Генерацию планируется перенести в облако, оставив гарнитуре меньше вычислительной работы. Если такой подход удастся реализовать, для доступа к сложным виртуальным пространствам может потребоваться менее мощное и более дешевое VR-оборудование.

Впрочем, пока это именно заявленные источниками цели. ByteDance публично не показывала модель, работающую с такими характеристиками, и не объясняла, какие этапы входят в показатель задержки. Для комфортного VR имеет значение полный промежуток между движением головы или руки и появлением соответствующего изображения на экране. Помимо генерации кадра, на него влияют сеть, декодирование видеопотока и сама гарнитура, поэтому одних цифр о скорости модели недостаточно для оценки конечного опыта.

Что будем искать? Например,ChatGPT

Мы в социальных сетях