← Все статьи
2026-07-23 06:30 · 🤖 AI World

DWM разделил то, что делает агент, и то, что делает физика

Новый фреймворк DWM (Decomposed World Model) впервые явно разделяет внутри латентного пространства то, что изменилось из-за действий агента, и то, что поменялось бы само — под влиянием гравитации, инерции, контактной динамики. На задачах с постоянными физическими эффектами метод даёт +13.1% к успешности планирования и не требует изменений в архитектуре базовой модели.

DWM разделил то, что делает агент, и то, что делает физика

21 июля 2026 года на arXiv вышла статья DWM: Decomposed World Model за авторством Yi-Ge Zhang, Tianqi Du, Qi Zhang и Yisen Wang. Авторы атакуют фундаментальный изъян латентных моделей мира: обучающий сигнал для предсказателя переходов состояний монолитен — он не разделяет, что изменилось потому что агент что-то сделал, и что изменилось бы и без него. На трёх специально созданных бенчмарках с постоянными физическими эффектами DWM показывает +13.1% к успешности CEM-планирования относительно сильных baseline-моделей.

Контекст

Латентные модели мира — один из центральных инструментов model-based reinforcement learning. Вместо работы напрямую с пикселями агент строит компактное внутреннее представление среды и учится предсказывать, как оно будет меняться при разных действиях. Такие модели лежат в основе DreamerV3, TD-MPC2 и других систем, применяемых в роботике, игровом ИИ и физической симуляции.

Стандартный подход: на вход идут текущее латентное состояние и действие, на выходе — следующее состояние. Целевой сигнал один, и он поглощает все источники изменений разом. Агент, толкнувший мяч на наклонной плоскости, видит, что мяч сдвинулся — но не знает, это он его толкнул или это наклон сделал своё дело. Авторы называют это слепым угломatent world model: entangled transitions.

DWM вводит явное разделение на уровне supervision-сигнала. Основной «предсказатель» отвечает за action-driven компонент, а вспомогательная «голова мира» (world head) регуляризуется нормализованным contrastive objective так, чтобы быть инвариантной к действию — то есть отражать только то, что произошло бы при нулевом действии. Между двумя компонентами задаётся ограничение ортогональности, чтобы они не перекрывались. Архитектура и inference pipeline базовой модели не меняются.

Аналитика

Разделение причин — не просто академическая чистота. Это напрямую влияет на transferability: модель, выучившая action-driven динамику отдельно от физики среды, может перенести политику в новые условия, не перекалибруя то, как мир движется сам по себе. Именно это делает метод интересным для sim-to-real: симулятор и реальный мир различаются прежде всего action-invariant эффектами — трением, деформациями, воздушным сопротивлением.

«Объединение в единый target запутывает оба компонента в латентном переходе, мешает модели атрибутировать наблюдаемые изменения их реальным причинам и подрывает переносимость выученной динамики» — из абстракта DWM.

Практически важная деталь: +13.1% достигнуто на задачах, где в среде есть постоянный физический эффект (PushT-W, Reacher-W, TwoRoom-W). На стандартных «плоских» вариантах тех же задач DWM держится на уровне baseline — то есть метод не ломает то, что работало, и подключается именно там, где физика среды сложнее. Это говорит о хорошем inductive bias: польза растёт вместе со сложностью реальной динамики, а не навязывается насильно.

В более широком контексте DWM вписывается в растущий тренд на causal structure в обучении агентов: вместо того чтобы давать сети больше данных, исследователи всё чаще вкладывают знание о структуре задачи напрямую в supervision-сигнал. Это и дешевле, и интерпретируемее — критически важно для agentic-систем, где нужно понимать, что агент контролирует, а что нет.

Кейсы применения в бизнесе

B2B-стартап в робототехнике или warehouse automation. Если вы обучаете манипуляторы или роботов-сортировщиков в симуляции перед деплоем на реальный склад, DWM как supervision-надстройка поможет модели чётче разделять движения объектов из-за захвата робота и из-за физики конвейера. Ожидаемый эффект: меньше накопленных ошибок при sim-to-real переносе, быстрее сходится политика — без переработки всей архитектуры.

Корпорация с legacy-симулятором. В авиации, энергетике, промышленной автоматизации симуляторы уже существуют. DWM можно интегрировать как дополнительный слой обучения поверх существующей world model. Конкретный сценарий: планировщик технического обслуживания, которому нужно разделять износ оборудования (action-invariant) и действия оператора (action-driven) — чтобы не приписывать естественную деградацию чужим вмешательствам.

SMB / локальный бизнес в Кыргызстане или ЦА. Прямое внедрение DWM требует ML-инфраструктуры. Но идея decomposition применима шире: если вы строите аналитику продаж и хотите разделить «клиент купил потому что вы запустили скидку» и «клиент купил потому что пришёл сезон» — это та же задача с двумя источниками изменений. Contrastive-подход с инвариантностью к одному из факторов работает и в табличных, не-физических доменах.

Кейсы в личной жизни

Разработчик, строящий RL-агентов. Если вы пишете агента для физического симулятора (Gymnasium, MuJoCo, IsaacGym), DWM — конкретная идея для эксперимента: добавьте вспомогательную голову в модель переходов, обучайте её на null-action эпизодах, задайте orthogonality constraint. Авторы утверждают, что базовые задачи не деградируют, а сложные — улучшаются.

ML-инженер или исследователь. Авторы создали три W-варианта стандартных бенчмарков (PushT-W, Reacher-W, TwoRoom-W) специально для оценки устойчивости к постоянным физическим эффектам. Это готовый evaluation suite, который можно взять для тестирования своих моделей независимо от того, используете ли вы DWM.

Студент, изучающий model-based RL. DWM — хорошая точка входа в тему decomposition в latent space. Метод концептуально чистый: два источника изменений, два сигнала, ограничение ортогональности. Читается как учебный пример правильной формулировки inductive bias — знания о структуре задачи, встроенного в процесс обучения, а не в архитектуру.

Как применить сегодня

  • Прочитать препринт arXiv 2607.18715 — авторы детально описывают реализацию world head и нормализованного contrastive objective.
  • Следить за GitHub-репозиторием авторов: код к препринту нередко появляется через несколько дней после публикации.
  • Собрать собственный W-benchmark по аналогии: взять стандартную задачу и добавить постоянный физический эффект (наклон, ветер, инерция) — это хорошая проверка робастности вашей текущей модели ещё до применения DWM.
  • Перенести идею в нефизические домены: любая система, где нужно разделить «что изменилось из-за вашего вмешательства» и «что изменилось само по себе», — кандидат на decomposition-подход.
  • Добавить в фид arXiv cs.AI фильтр по «world model» + «decomposition» — тема активно развивается и DWM вряд ли последняя работа в этом направлении.
← Все статьи