#обучение моделей

Публикаций: 4

Xiaomi-Robotics-1 показала: данные решают больше, чем размер модели

Xiaomi обучила модель управления движением на более 100 000 часов реальных физических данных — и выяснила, что наращивание объёма данных даёт куда больший прирост производительности, чем увеличение числа параметров. Кривая обучения при этом не выходит на плато.

10% токенов дают +14,9% к reasoning: ICT против энтропийного коллапса

Девять исследователей опубликовали на arXiv метод ICT, который при RLVR-обучении LLM обновляет только 10% «особых» токенов вместо всех подряд. На моделях Qwen2.5 это дало средний прирост pass@4 на 4,58% и до 14,9% максимум — без роста размера модели.

Малые LLM не слабее — они просто забывают редкие задачи из-за частых

Исследователи нашли конкретный механизм, объясняющий, почему большие языковые модели умеют то, что маленьким не даётся. Оказалось, дело не в размере как таковом — а в том, как частые задачи вытесняют редкие из памяти модели.

7B-модель читает документы лучше гигантов — метод ByteDance

ByteDance Seed установили: если учить мультимодальную модель отвечать на вопросы по документу вместо того, чтобы просто переписывать текст, — 7B-параметровая модель начинает стабильно обходить значительно более крупные системы. Даже на документах в 4 раза длиннее обучающей выборки.

← Все статьи