Компания Runway представила Solaris — первую модель из нового семейства систем, которые они называют «интерфейсными моделями мира». Вместо того чтобы запускать готовые приложения, Solaris генерирует интерфейс кадр за кадром прямо во время использования. Никакого промежуточного кода: модель сама решает, как выглядит экран и как он реагирует на каждое действие пользователя.

Сейчас любой интерфейс — это компромисс. Сначала его рисуют в дизайне, потом превращают в код, потом код превращается в экран. На каждом этапе что-то теряется: визуальная точность, гибкость, скорость реакции. Solaris предлагает отказаться от этого промежуточного звена. Модель генерирует каждый кадр интерфейса по мере того, как пользователь взаимодействует с экраном. Никакого кода между задумкой и отображением — сразу картинка, которая реагирует.
Раньше интеллектуальные системы, которые «знают» (поисковики, ассистенты), выдавали статичный ответ. А системы, которые умеют реагировать в реальном времени (игры, JS-приложения), ничего не знают о задаче пользователя. Объединить это технически сложно: нужно, чтобы модель работала без задержек, сохраняла целостность сцены минутами, а не секундами, и при этом не стоила космических денег. В Runway заявляют, что эти барьеры удалось обойти.
Модель основана на предыдущей разработке — генераторе видео. Ее перестроили так, чтобы она воспринимала клики, перетаскивания и другие действия как условия для следующего кадра. Затем ускорили процесс генерации: вместо десятков шагов шумоподавления свели к нескольким, и обучили быструю версию модели на собственных результатах. В итоге кадры идут в реальном времени, а качество держится на уровне 720p. Логику и рендеринг разделили: языковая модель решает, что должно произойти, а генеративная — как это показать.
Разработчики проверили, сколько информации теряют современные мультимодальные модели, когда пытаются восстановить интерфейс по скриншоту. Чем сложнее визуально страница, тем хуже получается. Solaris работает напрямую с визуальным слоем и, по их данным, не теряет детали с самого первого кадра.
В тесте с участием 250 человек сравнивали поведение Solaris и современной языковой модели при одинаковых запросах. По точности выполнения инструкции Solaris выбрали в 61% случаев против 24% у кода. По естественности реакции — 71% против 21%. Разница объясняется просто: код выполняет команду изолированно, а модель учитывает физику и контекст сцены.
Текст на генерируемых экранах все еще нестабилен. Модели могут ошибаться убедительно — это проблема доверия. Долгие сессии пока сложно поддерживать согласованными. Интеграция со специальными средствами доступности тоже требует доработки. В компании признают, что это текущие ограничения, а не финальные недостатки.
Solaris — первая модель в этом направлении. Разработчики работают с партнерами над публичным запуском и собирают заявки на ранний доступ. Они ожидают, что генерация интерфейсов будет развиваться так же, как генерация изображений и видео: быстрее, точнее, дешевле и разнообразнее.
Читайте также:
Длительное общение с ИИ делает человека похожим на робота
ChatGPT, Reddit и Roblox попали под усиленный надзор Евросоюза
Nissan и Honda создадут общую цифровую платформу для беспилотных автомобилей будущего