Xiaomi опубликовала подробности обучения Xiaomi-Robotics-1 — специализированной модели для управления движением роботов. Датасет превысил 100 000 часов реальных физических движений. Собирали их не роботы, а люди: операторы управляли ручными захватами с камерами, и система записывала траектории. Главный вывод: добавление данных улучшает модель значительно сильнее, чем наращивание размера самой модели. Абсолютные показатели успеха пока остаются низкими, но кривая обучения не выходит на плато.
Контекст
Xiaomi — давно не просто производитель смартфонов. Компания несколько лет развивает направление роботов: в портфеле есть человекоподобный CyberOne и четвероногий CyberDog. Xiaomi-Robotics-1 — модель нового типа: она нацелена именно на управление физическим движением, а не на языковые задачи.
Подход с телеоперацией, когда человек управляет устройством, а система записывает его действия, стал стандартом в современных робототехнических стартапах. Схожие методы используют Physical Intelligence, Figure, 1X Technologies и другие игроки. Смысл прост: реальные физические данные правдоподобнее симуляторов, где sim-to-real gap — разрыв между виртуальным и реальным — часто сводит на нет результаты. Xiaomi реализовала этот подход в промышленном масштабе: 100 тысяч часов — серьёзный объём для отрасли, где тысяча часов уже считается хорошим датасетом.
Оговорка честная: абсолютные показатели успеха остаются низкими. Роботы пока не справляются с задачами надёжно. Но важна динамика — каждая новая порция данных продолжает давать прирост, без видимого замедления.
Аналитика
«Больше данных — лучше модель» — закономерность, хорошо известная по истории NLP. Когда данных мало, архитектура имеет значение. Когда данных достаточно, объём и качество выборки становятся доминирующим фактором. Для робототехники это означает сдвиг ставки: не «насколько крупна модель», а «сколько реального движения в датасете». Xiaomi подтверждает это эмпирически на масштабе, которого раньше в открытой публикации не было.
Если прирост от данных не замедляется, следующий рубеж — не «лучший трансформер», а «больше часов реального движения».
Практический вывод для индустрии: узкое место — не вычислительная мощность и не архитектура, а инфраструктура сбора данных. Кастомный захват с камерой дешевле полноценной роботизированной установки. Тот, кто выстраивает дешёвый конвейер сбора реальных физических данных, получает долгосрочный актив, который сложнее скопировать, чем архитектурное решение.
Для более широкого AI-рынка это сигнал о природе масштабирования в физическом домене. В мире LLM разговоры о замедлении скейлинга идут давно. Здесь иная картина — и это открывает пространство для игроков, которые не могут конкурировать по размеру модели, но могут выиграть за счёт уникального датасета.
Кейсы применения в бизнесе
B2B-стартап в автоматизации склада или производства. Если вы разрабатываете решения для физических задач — сортировки, упаковки, комплектации — архитектура модели вторична. Первично: как быстро и дёшево вы соберёте тысячи часов движений в вашей конкретной среде. Телеоперация с захватами дешевле, чем покупка готового робота для генерации данных. Это основной инфраструктурный приоритет, а не выбор между базовыми моделями.
Корпорация с физическим производством. Крупные предприятия уже имеют операторов, ежедневно выполняющих повторяющиеся действия. Сценарий: оснастить один участок захватами с записью, за 6–12 месяцев накопить специализированный датасет — и получить модель под своё конкретное оборудование. Это надёжнее, чем адаптировать универсальный робототехнический фреймворк к нестандартной среде.
SMB и бизнес в КР/СНГ. Прямое применение физической робототехники требует высокого порога входа, и здесь это пока нишевая история. Но логика «данные важнее модели» прямо переносится на программных агентов: ваши внутренние логи, история решений, примеры выполненных задач — ценнее переключения на более крупную LLM. RAG и fine-tuning на собственных данных часто дают больший прирост производительности, чем апгрейд базовой модели.
Кейсы в личной жизни
ML-инженер или разработчик агентов. Результаты Xiaomi подкрепляют простой принцип для fine-tuning-проектов: потратьте больше времени на сбор и разметку релевантных примеров — это окупится сильнее, чем поиск архитектуры получше. Размер базовой модели не компенсирует скудный или нерелевантный датасет.
Контент-мейкер, фрилансер, студент. Ваши стили, шаблоны, примеры удачных и неудачных результатов — это персональный датасет. Если вы работаете с Claude, GPT или другим LLM, инвестируйте в качественные few-shot примеры и структурированные системные промпты. Это ваш аналог «100 тысяч часов данных» в индивидуальном масштабе — и он работает пропорционально усилиям, вложенным в его наполнение.
Как применить сегодня
- Проведите аудит примеров, которые вы даёте своим AI-агентам в контекст: их качество и количество важнее выбора базовой модели.
- Для команд в автоматизации физических процессов: изучите методологию teleoperation data collection — захваты с записью движений стоят дешевле полноценных роботизированных ячеек.
- Следите за открытыми датасетами физических движений: ряд ведущих лабораторий публикует их в открытом доступе — это ресурс для специализированного дообучения.
- Оцените, где у вас накапливаются неиспользуемые данные: логи операторов, история решений, примеры задач. Это потенциальное топливо для специализированной модели.
- Если строите продукт с AI-ядром, зафиксируйте метрику «часов реальных взаимодействий» в вашем датасете — это конкурентный актив, который сложнее скопировать, чем архитектурное решение.