← Все статьи
2026-07-27 20:03 · 🤖 AI World

Когда агент дороже человека: METR считает в долларах

Организация METR ввела метрику «горизонт расходов» — способ посчитать, при каких задачах AI-агент обходится дороже человека. Первые тесты на NanoGPT speedrun оказались неутешительными.

Когда агент дороже человека: METR считает в долларах

METR — организация по независимой оценке AI-систем — представила метрику «горизонт расходов» (expenditure horizon). Она переводит вопрос «умеет ли агент делать X?» в практический: «дешевле ли это делать с AI, чем с человеком?» Первые замеры на задаче NanoGPT speedrun показали: пока агенты проигрывают по стоимости на длинных горизонтах. Авторы признают, что метрика имеет слепые пятна, но новое поколение моделей может изменить картину.

Контекст

METR (ранее известная как ARC Evals) — одна из немногих организаций, систематически измеряющих реальные возможности AI вне лабораторий их создателей. Их подход отличается от стандартных бенчмарков: агент помещается в открытую задачу с реальными условиями, без заранее известного ответа. Введение экономической метрики — логичный следующий шаг: индустрия накопила огромное число оценок «что умеет AI», но мало кто системно считает «во сколько это обходится по сравнению с человеком».

NanoGPT speedrun — инженерная задача: оптимизировать обучение небольшой языковой модели, ориентируясь на скорость и качество результата. У неё есть измеримый выход и понятная стоимость работы квалифицированного разработчика — именно поэтому она подходит для калибровки экономической метрики.

Контекст шире: рынок AI-агентов перегрет ожиданиями. Anthropic, OpenAI, десятки стартапов позиционируют агентов как универсальное решение для автоматизации труда. Но экономика этих решений редко оцифрована публично. «Горизонт расходов» — попытка дать индустрии честный язык для такого разговора.

Аналитика

«Горизонт расходов» — по сути порог: длина или сложность задачи, при которой суммарная стоимость работы агента (инференс, инфраструктура, цена ошибок и повторных попыток) сравнивается или превышает стоимость работы человека. Ниже горизонта — AI экономически выгоден, выше — нет. Идея звучит просто, но честная реализация требует учитывать не только цену токенов, но и надзор, постобработку и стоимость ошибок агента.

То, что первые результаты на NanoGPT speedrun неутешительны, указывает на системную проблему агентных архитектур: деградация качества на длинных горизонтах. Агент справляется с короткими подзадачами, но чем длиннее цепочка действий, тем выше накопленная ошибка и совокупная стоимость. Это не проблема конкретной модели — это архитектурное ограничение, которое сохраняется даже при переходе на более мощные основы.

У метрики есть и слепые пятна: она не учитывает скорость (AI не устаёт и не берёт отпуск), параллелизм (тысяча агентов одновременно недостижима для людей) и долгосрочное накопление знаний. Поэтому «горизонт расходов» — полезный, но неполный инструмент. Для стратегического планирования его нужно дополнять оценкой масштабируемости и системного эффекта, а не использовать как единственный аргумент против автоматизации.

Кейсы применения в бизнесе

B2B-SaaS стартап: Если внутри продукта работают AI-агенты — code review, обогащение данных, клиентская поддержка — метрика помогает настроить правила эскалации. Задачи короче «горизонта» уходят агенту автоматически, длиннее — разбиваются на подзадачи или передаются человеку. Это снижает стоимость и повышает качество одновременно без сложной инфраструктуры.

Корпорация с legacy: AI-пилоты в крупных компаниях часто буксуют, потому что никто не считал ROI в деньгах. «Горизонт расходов» — готовая методология: замерьте стоимость задачи вручную, замерьте стоимость агента с учётом надзора и ошибок, получите реальную точку окупаемости. Это язык, который понимает финансовый директор, а не только CTO.

SMB и бизнес в КР/СНГ: При ограниченных бюджетах особенно важно не переплатить. Агент для простой повторяющейся задачи — классификация обращений, генерация однотипных текстов, базовая аналитика — выгоден. Агент для сложного консалтинга или нестандартных переговоров — нет. Логика «горизонта» помогает сделать этот выбор до того, как деньги потрачены.

Кейсы в личной жизни

Разработчик: Перед тем как запустить агента на ночную задачу — рефакторинг, тест-сьют, документация — прикиньте стоимость токенов. Длинные задачи с размытым контекстом могут обойтись дороже ожидаемого. Разбивайте на чёткие подзадачи с промежуточными чекпоинтами — это и дешевле, и контролируемее.

Контент-мейкер: Генерация серии постов, транскрипция и саммари видео, создание brief — короткие задачи, где агент явно выгоден. Полноценный сценарий с несколькими итерациями правок под конкретный голос бренда — длинный горизонт, где человек пока дешевле. Разделяйте задачи по этому принципу осознанно.

Фрилансер, продающий AI-автоматизацию: Концепция «горизонта расходов» становится вашим продажным аргументом. Не «AI умеет делать X», а «AI делает X за такую-то долю от стоимости вашей команды при задачах такого типа». Это конкретика, которую понимает клиент, — и она выгодно отличает вас от тех, кто продаёт абстрактные «возможности».

Как применить сегодня

  • Для следующей задачи агенту — замерьте стоимость: количество токенов × цена токена. Сравните с ценой вашего часа или часа сотрудника. Это первый шаг к личному «горизонту».
  • Настройте правило эскалации: задачи, требующие больше N шагов агента или занимающие более M минут, автоматически передаются человеку или разбиваются на подзадачи.
  • При оценке AI-инструментов для команды — запрашивайте у вендора данные о средней стоимости на задачу, а не только о точности или скорости. Отсутствие таких данных — повод для вопросов.
  • Следите за публикациями METR: организация выпускает открытые оценки возможностей моделей, не аффилированные с их разработчиками. Редкий источник с независимой позицией.
  • Попробуйте декомпозицию: разбейте одну длинную задачу агента на 3–5 коротких с явными промежуточными результатами. На практике это часто снижает и стоимость, и количество ошибок.
← Все статьи