Когда агент дороже человека: METR считает в долларах
Организация METR ввела метрику «горизонт расходов» — способ посчитать, при каких задачах AI-агент обходится дороже человека. Первые тесты на NanoGPT speedrun оказались неутешительными.
Публикаций: 70
Организация METR ввела метрику «горизонт расходов» — способ посчитать, при каких задачах AI-агент обходится дороже человека. Первые тесты на NanoGPT speedrun оказались неутешительными.
OpenSpace предлагает законченный пайплайн для AI-агентов, которые накапливают навыки, помнят свою историю и переиспользуют готовые решения вместо повторного обращения к LLM. MCP-интеграция и SQLite-lineage делают это доступным без сложной инфраструктуры.
MarkTechPost опубликовал end-to-end туториал по Baidu Unlimited-OCR — модели для распознавания текста в высокоразрешённых изображениях и многостраничных PDF. Пайплайн покрывает настройку GPU-окружения, два режима инференса и обработку плотных таблиц с кросс-страничным контентом.
Anthropic добавил в десктопное приложение Claude Cowork функцию обучения через демонстрацию: записываешь экран, объясняешь голосом — Claude превращает это в многоразовый навык. Никакого кода и длинных инструкций.
Coding agents обнулили ROI-расчёт, который десятилетиями тормозил автоматизацию закрытых систем. То, что раньше было технически возможным, но экономически бессмысленным, теперь стоит нескольких часов.
DevOps-команды тонут в алертах, постмортемах и ночных дежурствах. ИИ-агенты начали забирать именно это — и разрыв между теми, кто внедрил, и теми, кто ждёт, нарастает каждый квартал.
Google DeepMind выпустила Gemini 2.5 Flash как быструю и дешёвую альтернативу flagship-моделям — и это первый реальный кандидат для встройки в SMB-процессы без раздутого бюджета. Разбираем, что из этого работает для бизнеса в Кыргызстане и Центральной Азии прямо сейчас.
Туризм — одна из первых отраслей, где ИИ прошёл путь от пилота до операционной необходимости. Разбираем, какие инструменты уже работают, где совершают ошибки при внедрении и с чего начать без риска.
n8n — open-source движок для автоматизации рабочих процессов, который позволяет запустить собственный Zapier на своём сервере. Для технических команд это не просто экономия — это другая модель контроля над данными, логикой и стоимостью.
Команда из 13 исследователей выпустила Long-Horizon-Terminal-Bench — бенчмарк, где AI-агентам дают задачи на несколько часов непрерывной работы в терминале. Из 15 протестированных фронтирных моделей лучшая справилась лишь с 15,2% при частичном зачёте, а среднее по всем — 1,7% при идеальном выполнении.
Математик Джозеф Миллер формализовал сложное доказательство из математической физики в Lean 4 — не написав ни строчки доказательства самостоятельно. Его роль: директор. Роль ИИ-агента: исполнитель.
Мульти-агентный пайплайн, который монтирует видео по команде на естественном языке — не концепт и не демо, а рабочая система на FFmpeg и Whisper без единого API-ключа. Разбираем архитектуру: парсинг намерений, граф исполнения и авторемонт при сбоях.
Более 200 экономистов и исследователей ИИ — среди них 16 нобелевских лауреатов и представители Google, OpenAI, Anthropic — выпустили скоординированное заявление: время готовиться к экономическому удару ИИ стремительно уходит. Документ без конкретных мер, зато с жёстким сигналом: масштаб трансформации может превзойти Промышленную революцию — и в разы быстрее.
shot-scraper 1.11 вышел 12 июля 2026 — небольшое, но аккуратное обновление CLI-инструмента для автоматизированных скриншотов и веб-скрейпинга. Главное: теперь можно подтягивать JS-скрипты прямо из GitHub, а серверные процессы умеют ждать до 30 секунд вместо того, чтобы падать через одну.
CEO OpenAI Сэм Альтман теперь «почти уверен», что ИИ создал больше рабочих мест, чем уничтожил. Это разворот на 180° от его собственных предупреждений о массовых увольнениях — и CEO Anthropic Дарио Амодеи идёт тем же путём.
Anthropic проанализировал 1,2 млн сессий Claude Cowork из более 600 000 организаций — и обнаружил, что половина всего времени уходит на статус-репорты, чеклисты и слайды. Не на код. Не на аналитику.
OpenAI одновременно открыла публичный доступ к GPT-5.6 и запустила ChatGPT Work — агента, который самостоятельно ведёт проекты в Google Drive, Slack и Salesforce. Не помогает — именно ведёт.
Anthropic перевела агентский режим Claude Cowork на мобильные и веб-платформы — теперь агент продолжает работать в фоне даже с закрытым ноутбуком и сам пишет на телефон, когда нужно решение. Это меняет паттерн взаимодействия с ИИ от синхронного чата к асинхронному делегированию.
Simon Willison попросил Claude Fable 5 через DSPy оценить промпты Datasette Agent — и фреймворк сразу нашёл структурный баг: схема без колонок плюс запрет лишних вызовов гонял агент в петли ошибок. Ручной промпт-инжиниринг такое не ловит.
Shot-scraper 1.10 вышел 30 июня 2026 года с одной флагманской новинкой: команда <code>shot-scraper video</code> позволяет AI-агентам автоматически записывать видеодемо своей работы в браузере. Для тех, кто строит agentic-пайплайны, это закрывает давний вопрос — как убедительно показать, что агент делает именно то, что задумано.
Саймон Уиллисон выпустил shot-scraper 1.10 с командой video — теперь AI-агент сам записывает видеодемо своей работы в браузере через Playwright. Демо-стройборд для статьи целиком написал GPT-5.5 xhigh по одной инструкции в Codex Desktop.
OCRmyPDF — open-source Python-инструмент, который добавляет настоящий текстовый слой к отсканированным PDF через Tesseract. Берёт папку с тысячами документов, прогоняет батчем и отдаёт архивный PDF/A плюс sidecar.txt — готовый к индексации и RAG-пайплайнам.
Исследователи из Tencent и нескольких китайских университетов поставили диагноз нынешним AI-системам: умеют отвечать, но не умеют доделывать. И это принципиально разные вещи.
Международное научное сообщество всерьёз обеспокоено: там, где ИИ-инструменты берут на себя рутинные задачи, у специалистов атрофируются базовые профессиональные компетенции. Это не страшилка — это задокументированный когнитивный эффект с конкретными последствиями для бизнеса.
Исследователи опубликовали бенчмарк, имитирующий настоящую офисную работу — анализ, исследования, многошаговые решения. Лучшая из протестированных моделей полностью решила 3% задач.
Adobe разворачивает «творческих агентов» в ключевых приложениях Creative Cloud — Photoshop, Premiere и других. Пользователь описывает задачу словами, агент сам разбивает её на шаги и выполняет — без пошагового руководства.
Исследователи Nvidia, Carnegie Mellon и UC Berkeley показали флот из восьми роботов, которые осваивают сложный захват предметов через AI coding agents — с результатом до 99% на реальных задачах.
Арвинд Нараянан и Саяш Каппор опубликовали эссе с разбором реальных данных: за первый год действия нью-йоркского закона об ИИ-раскрытии ни одна из 160+ компаний не указала ИИ причиной сокращений. Почему — объясняется не тем, что думают большинство.
Anthropic опросила почти 52 000 американцев — и цифры оказались жёсткими: 64% боятся потерять работу из-за ИИ, а 56% — способность думать самостоятельно. При этом те, кто использует ИИ каждый день, беспокоятся об этом значительно меньше.
Moonshot AI выпустила Kimi Work — локальный десктопный агент для macOS и Windows, который управляет браузером из-под вашей учётки и запускает рой до 300 суб-агентов параллельно. Это уже не ассистент — это диспетчер задач.
Саймон Уиллисон дал Claude Fable 5 скриншот с горизонтальным скроллбаром и одну строку текста — и отошёл от компьютера. Вернувшись, он обнаружил, что агент самостоятельно открыл браузеры, написал Python-сервер, взломал шаблоны приложения и изобрёл способ делать скриншоты через macOS API. Фикс — две строки CSS.
Claude Fable 5 получил один скриншот и однострочный промпт — и без дополнительных инструкций поднял локальный сервер, открыл Safari, написал собственный Python CORS-сервер, отредактировал шаблоны приложения через JavaScript и нашёл CSS-фикс из двух строк. Симон Уиллисон задокументировал весь процесс — и сделал вывод, который должен насторожить каждого, кто запускает агентов вне sandbox.
Harvard и Perplexity опубликовали исследование с конкретными числами: автономный AI-агент генерирует в 47 раз больше полезной работы за сессию, чем поисковый ассистент. Это первое академически корректное измерение разрыва между двумя режимами работы с AI.
Промпт-инжиниринг вручную — это угадайка. GEPA предлагает другой путь: рефлексивный фреймворк, который сам улучшает промпты через структурированную обратную связь, многокомпонентную эволюцию и проверку на отложенной выборке.
Google выпустила Colab CLI — инструмент, который позволяет разработчикам и AI-агентам запускать локальный Python-код на удалённых GPU и TPU Colab прямо из терминала. Без браузера, без Jupyter-интерфейса — чистый subprocess.
Alibaba выпустила Qwen3.7-Plus — мультимодальную агентную модель, которая видит экран, управляет GUI и пишет код в едином цикле. В демо агент за 11 часов написал более 10 000 строк кода для приложения по изучению словарного запаса.
Open-source модель Audio Interaction перекраивает логику голосового ИИ: вместо ожидания паузы она непрерывно слушает поток и каждые 400 миллисекунд принимает решение — пора ответить или нет. Код, веса и инструкции уже на GitHub под Apache 2.0.
OpenAI движется дальше чатботов и агентов. Сэм Альтман описал следующий этап: ИИ, который работает фоном постоянно и действует сам, не дожидаясь вопроса от пользователя.
OpenAI добавляет в Codex плагины под конкретные роли — аналитика данных, продажи, инвестбанкинг. Пять миллионов пользователей в неделю, и каждый пятый — не разработчик.
Стартап Rudus из Y Combinator автоматизирует takeoff — расчёт объёмов бетона по строительным чертежам. Процесс, который сейчас занимает недели ручного Excel, ИИ закрывает за минуты.
OpenAI воссоздаёт робототехническое подразделение спустя пять лет после его закрытия. Ближайшая цель — роботы для инфраструктуры, долгосрочная — личный робот, который делает всё что нужно.
OpenAI выпустила нативное приложение Codex для Windows 11 с режимом Computer Use: агент самостоятельно управляет интерфейсом, запускает программы, ищет баги и тестирует приложения. Мониторить задачи можно удалённо с телефона через ChatGPT.
Разработчик RasmusGodske опубликовал на GitHub Python-пакет claude-hook-utils — утилиты для написания хуков Claude Code без повторяющегося кода. Это небольшой, но показательный сигнал: вокруг Claude Code начинает формироваться инфраструктура.
Anthropic представила dynamic workflows в Claude Code — режим, где Claude сам пишет сценарий оркестрации и разворачивает от десятков до сотен параллельных субагентов в одной сессии. Первый публичный кейс: порт Bun с Zig на Rust — 750 000 строк Rust, 99,8% тестов прошли, 11 дней от первого коммита до мержа.
Robinhood позволил AI-агентам самостоятельно торговать акциями и совершать покупки по кредитной карте — клиент подключает Claude или другого агента через MCP к отдельному счёту, и дальше агент действует без подтверждений. Американский регулятор FINRA уже занёс это в новую категорию рисков.
Разработчик нашёл вредоносные GitHub-репозитории, спросил людей — и получил один и тот же ChatGPT-ответ трижды подряд. Это не анекдот. Это новая норма.
Большинство разработчиков используют Claude Code как умный автодополнитель. Меньшинство — как программируемого агента с памятью, кастомными командами и параллельными сессиями. Разрыв между этими двумя группами огромный.
UC Berkeley School of Law с лета 2026 года запрещает использование ИИ при выполнении практически любых оценочных работ — от набросков и черновиков до проверки орфографии. Исключение одно: исследовательская работа. Это не паника перед технологиями — это сознательная педагогическая позиция одного из самых влиятельных юридических учебных заведений мира.
Губернатор Калифорнии подписал первый в США исполнительный указ, направленный против вытеснения работников искусственным интеллектом. Это прецедент — до сих пор ни один штат не брал на себя такую ответственность официально.
Reasoning-модель OpenAI опровергла гипотезу Пола Эрдёша о геометрии единичных расстояний, открытую с 1946 года. Лауреат Медали Филдса Тим Гауэрс назвал результат «вехой в математике ИИ» и предупредил: людям скоро станет очень трудно конкурировать с ИИ в математике.
Страхование — одна из немногих отраслей, где ИИ не просто ускоряет процессы, а переписывает экономику самого продукта. Тарификация в реальном времени, автоматические выплаты, выявление мошенничества без следователя — всё это уже в продакшене у ведущих игроков.
Калифорнийский стартап Humble Robotics собрал беспилотный электрогрузовик Hauler меньше чем за полгода и уже ведёт переговоры о пилотах с крупными логистическими игроками. Главная ставка — VLA-модели (Vision-Language-Action), которые дают машине принимать решения в нестандартных ситуациях без водителя.
Разработчик из СНГ полгода кормил один AGENTS.md правилами — и всё равно получал агента, который молча срезал углы. Вот что он построил вместо этого: четыре отдельных скилла, машиночитаемый контракт и обязательная Parallel Decomposition Matrix.
CEO российской IT-компании Siberian.pro Влад Кармаков рассказал, как один сотрудник с декабря 2025 года не написал ни строчки кода руками — и при этом сдал полноценную production-систему. Разбираем методологию пошагово.
В американской медкомпании DaVita сотрудники самостоятельно создали больше 10 000 AI-агентов. Отрасль называет это «agent sprawl» — и пока не знает, как с этим жить.
Большинство ИТ-компаний думают, что строят продукты. На самом деле — они часами переносят контекст между людьми. AI-native меняет не инструменты, а саму операционную модель.
Инженер из Kaiten год строил harness вокруг Claude и других LLM — и пришёл к неудобному выводу: смена модели даёт ограниченный прирост, а каждый новый слой обвязки вокруг неё — кратный. Разбираем, почему это не хайп, а реальная механика продуктивности.
Тех-гиганты массово убирают мидл-менеджеров — не джунов и не разработчиков. К концу 2025 года вакансий для менеджеров среднего звена в США стало на 42% меньше, чем в пике 2022-го: ИИ-агенты забирают координационную рутину, и платить за неё человеку больше невыгодно.
28 мая КРОК проведёт офлайн-митап в Москве, где покажет, как LLM-агенты и Cursor меняют разработку и управление 1С-проектами. Один из докладов — про сокращение оценки требований с 2–3 дней до одного.
Один не-разработчик потратил вечер и $1.70, чтобы собрать личного агента на Claude Managed Agents. Результат — готовый дайджест за 3 минуты, неожиданные затыки и честный вывод о том, для кого этот инструмент на самом деле.
С 13 мая недельные лимиты Claude Code выросли на 50% для всех платных подписок — автоматически и без каких-либо настроек. А с 15 июня появится отдельный агентный кредит ($20–$200/мес), изолированный от обычного чата.
Gartner прогнозирует: более 40% agentic AI проектов будут закрыты к концу 2027 года. Причина не в слабых моделях — в том, что компании автоматизируют процессы, которых сами не понимают.
9 мая вышел BetterMediaInfo 0.9 — бесплатный кроссплатформенный графический фронтенд для MediaInfo с поддержкой MKV-экстракции, 20 темами оформления и восемью языками интерфейса. Инструмент для всех, кто работает с видео- и аудиоконтентом профессионально или регулярно.
Команда из машиностроительного производства построила пайплайн, который извлекает параметры детали из PDF-чертежа автоматически — тип, габариты, квалитеты, шероховатости, резьбы, материал, масса — и отдаёт их в калькулятор стоимости в виде JSON. До автоматизации каждый чертёж занимал у технолога от 5 до 15 минут ручной работы.
Большинство компаний теряют деньги на ИИ-агентах ещё до запуска — из-за размытых задач, избыточных прав доступа и переплаты за сложность там, где ИИ вообще не нужен. Разбираем пять этапов, которые защищают бюджет.
Глава AWS Мэтт Гарман объявил: Amazon наймёт в 2026 году 11 000 стажёров-разработчиков — столько же, сколько всегда. Пока AI-лабы и венчуры обсуждают конец профессии джуниора, крупнейший облачный провайдер мира голосует деньгами в обратном направлении.
Telegram выкатил обновление с более чем 200 изменениями: боты теперь отвечают другим ботам, пользователи создают собственные AI-стили и подключают автоответчиков к своим профилям. Для тех, кто строит автоматизацию внутри мессенджера, это важнее, чем кажется на первый взгляд.
Автор написал сатиру про вайбкодинг — и половина читателей восприняла её всерьёз. Это само по себе диагноз. Но за шумом скрывается реальный вопрос: если технических писателей в крупных компаниях уже сократили с команды до одного человека — что мешает случиться тому же с разработчиками?
Борис Черни, создатель Claude Code, с октября 2025 не написал ни строки кода руками — и рекорд за сутки составил 150 pull request-ов с телефона. Но главное, что он привёз на Sequoia AI Ascent 2026, — не про скорость, а про loops.
ITSM 365 выпустил весеннее обновление: интеграция с MAX и Контур.Толк, переработанное меню и мелкие улучшения UX, которые реально экономят время. 23 апреля — вебинар с живым показом.