#world model

Публикаций: 5

Flux 3 умеет генерировать видео со звуком — и это только начало

Black Forest Labs выпустила Flux 3 — мультимодальную модель с нативной генерацией видео и звука. До 20 секунд, без пост-обработки, и уже тестируется на задачах робототехники.

Агент без LLM на каждом шаге: GATS выдаёт 100% при нулевых вызовах

Новый фреймворк GATS полностью убирает вызовы LLM из агентного планирования на этапе инференса — и при этом показывает 100% успех там, где ReAct падает до 24%, а LATS до 89%. Это меняет логику построения агентных систем и их экономику.

Orca от BAAI научилась управлять роботами без лейблов — и сравнялась с π0.5

BAAI опубликовала Orca — мировую модель, обученную на 125 000 часах видео без единой размеченной акции робота. На пяти задачах управления она сравнялась с π0.5 от Physical Intelligence — и поставила под вопрос саму необходимость дорогостоящей разметки в обучении роботов.

Mirage от Microsoft запомнит, что за поворотом камеры

Microsoft Research представила Mirage — видеомодель, которая хранит пространственный контекст сцены в латентном пространстве, а не в пиксельных облаках точек. Результат: меньше памяти GPU, меньше вычислений, и камера больше не «забывает» комнату, из которой только что вышла.

Google превратила Street View в игровые миры для ИИ-агентов

Google DeepMind подключила мировую модель Genie 3 к архиву Street View: ставишь точку на карте — получаешь проходимый AI-мир по образу реального места. Многолетняя съёмка дорог внезапно стала стратегическим активом для обучения роботов и агентов.

← Все статьи