#RL-обучение

Публикаций: 1

TRACE от Stanford: агенты учатся на своих провалах автоматически

Stanford представил TRACE — систему, которая сама диагностирует повторяющиеся сбои агента, синтезирует под каждый тип ошибки отдельную RL-среду и обучает свой LoRA-адаптер. Результат на SWE-bench Verified — 73.2% Pass@1, рост на +15.3 балла по τ²-Bench.

← Все статьи