METR — организация по независимой оценке AI-систем — представила метрику «горизонт расходов» (expenditure horizon). Она переводит вопрос «умеет ли агент делать X?» в практический: «дешевле ли это делать с AI, чем с человеком?» Первые замеры на задаче NanoGPT speedrun показали: пока агенты проигрывают по стоимости на длинных горизонтах. Авторы признают, что метрика имеет слепые пятна, но новое поколение моделей может изменить картину.
Контекст
METR (ранее известная как ARC Evals) — одна из немногих организаций, систематически измеряющих реальные возможности AI вне лабораторий их создателей. Их подход отличается от стандартных бенчмарков: агент помещается в открытую задачу с реальными условиями, без заранее известного ответа. Введение экономической метрики — логичный следующий шаг: индустрия накопила огромное число оценок «что умеет AI», но мало кто системно считает «во сколько это обходится по сравнению с человеком».
NanoGPT speedrun — инженерная задача: оптимизировать обучение небольшой языковой модели, ориентируясь на скорость и качество результата. У неё есть измеримый выход и понятная стоимость работы квалифицированного разработчика — именно поэтому она подходит для калибровки экономической метрики.
Контекст шире: рынок AI-агентов перегрет ожиданиями. Anthropic, OpenAI, десятки стартапов позиционируют агентов как универсальное решение для автоматизации труда. Но экономика этих решений редко оцифрована публично. «Горизонт расходов» — попытка дать индустрии честный язык для такого разговора.
Аналитика
«Горизонт расходов» — по сути порог: длина или сложность задачи, при которой суммарная стоимость работы агента (инференс, инфраструктура, цена ошибок и повторных попыток) сравнивается или превышает стоимость работы человека. Ниже горизонта — AI экономически выгоден, выше — нет. Идея звучит просто, но честная реализация требует учитывать не только цену токенов, но и надзор, постобработку и стоимость ошибок агента.
То, что первые результаты на NanoGPT speedrun неутешительны, указывает на системную проблему агентных архитектур: деградация качества на длинных горизонтах. Агент справляется с короткими подзадачами, но чем длиннее цепочка действий, тем выше накопленная ошибка и совокупная стоимость. Это не проблема конкретной модели — это архитектурное ограничение, которое сохраняется даже при переходе на более мощные основы.
У метрики есть и слепые пятна: она не учитывает скорость (AI не устаёт и не берёт отпуск), параллелизм (тысяча агентов одновременно недостижима для людей) и долгосрочное накопление знаний. Поэтому «горизонт расходов» — полезный, но неполный инструмент. Для стратегического планирования его нужно дополнять оценкой масштабируемости и системного эффекта, а не использовать как единственный аргумент против автоматизации.
Кейсы применения в бизнесе
B2B-SaaS стартап: Если внутри продукта работают AI-агенты — code review, обогащение данных, клиентская поддержка — метрика помогает настроить правила эскалации. Задачи короче «горизонта» уходят агенту автоматически, длиннее — разбиваются на подзадачи или передаются человеку. Это снижает стоимость и повышает качество одновременно без сложной инфраструктуры.
Корпорация с legacy: AI-пилоты в крупных компаниях часто буксуют, потому что никто не считал ROI в деньгах. «Горизонт расходов» — готовая методология: замерьте стоимость задачи вручную, замерьте стоимость агента с учётом надзора и ошибок, получите реальную точку окупаемости. Это язык, который понимает финансовый директор, а не только CTO.
SMB и бизнес в КР/СНГ: При ограниченных бюджетах особенно важно не переплатить. Агент для простой повторяющейся задачи — классификация обращений, генерация однотипных текстов, базовая аналитика — выгоден. Агент для сложного консалтинга или нестандартных переговоров — нет. Логика «горизонта» помогает сделать этот выбор до того, как деньги потрачены.
Кейсы в личной жизни
Разработчик: Перед тем как запустить агента на ночную задачу — рефакторинг, тест-сьют, документация — прикиньте стоимость токенов. Длинные задачи с размытым контекстом могут обойтись дороже ожидаемого. Разбивайте на чёткие подзадачи с промежуточными чекпоинтами — это и дешевле, и контролируемее.
Контент-мейкер: Генерация серии постов, транскрипция и саммари видео, создание brief — короткие задачи, где агент явно выгоден. Полноценный сценарий с несколькими итерациями правок под конкретный голос бренда — длинный горизонт, где человек пока дешевле. Разделяйте задачи по этому принципу осознанно.
Фрилансер, продающий AI-автоматизацию: Концепция «горизонта расходов» становится вашим продажным аргументом. Не «AI умеет делать X», а «AI делает X за такую-то долю от стоимости вашей команды при задачах такого типа». Это конкретика, которую понимает клиент, — и она выгодно отличает вас от тех, кто продаёт абстрактные «возможности».
Как применить сегодня
- Для следующей задачи агенту — замерьте стоимость: количество токенов × цена токена. Сравните с ценой вашего часа или часа сотрудника. Это первый шаг к личному «горизонту».
- Настройте правило эскалации: задачи, требующие больше N шагов агента или занимающие более M минут, автоматически передаются человеку или разбиваются на подзадачи.
- При оценке AI-инструментов для команды — запрашивайте у вендора данные о средней стоимости на задачу, а не только о точности или скорости. Отсутствие таких данных — повод для вопросов.
- Следите за публикациями METR: организация выпускает открытые оценки возможностей моделей, не аффилированные с их разработчиками. Редкий источник с независимой позицией.
- Попробуйте декомпозицию: разбейте одну длинную задачу агента на 3–5 коротких с явными промежуточными результатами. На практике это часто снижает и стоимость, и количество ошибок.