2026-07-21 16:04 · 🤖 AI World
Xiaomi обучила модель управления движением на более 100 000 часов реальных физических данных — и выяснила, что наращивание объёма данных даёт куда больший прирост производительности, чем увеличение числа параметров. Кривая обучения при этом не выходит на плато.
2026-06-20 12:02 · 🤖 AI World
Девять исследователей опубликовали на arXiv метод ICT, который при RLVR-обучении LLM обновляет только 10% «особых» токенов вместо всех подряд. На моделях Qwen2.5 это дало средний прирост pass@4 на 4,58% и до 14,9% максимум — без роста размера модели.
2026-06-07 14:01 · 🤖 AI World
Исследователи нашли конкретный механизм, объясняющий, почему большие языковые модели умеют то, что маленьким не даётся. Оказалось, дело не в размере как таковом — а в том, как частые задачи вытесняют редкие из памяти модели.
2026-05-24 20:02 · 🤖 AI World
ByteDance Seed установили: если учить мультимодальную модель отвечать на вопросы по документу вместо того, чтобы просто переписывать текст, — 7B-параметровая модель начинает стабильно обходить значительно более крупные системы. Даже на документах в 4 раза длиннее обучающей выборки.