← Все статьи
2026-07-25 08:02 · 🤖 AI World

Opus 5 держит атаку: Anthropic закрыла prompt injection

Boris Cherny из Anthropic выделил неожиданное достоинство Opus 5 — не MMLU-цифры, а устойчивость к prompt injection. Это зарыто на странице 73 системной карты модели, но именно здесь скрыт главный сдвиг для agentic AI.

Opus 5 держит атаку: Anthropic закрыла prompt injection

Boris Cherny из команды Anthropic процитировал ключевой факт из System Card Opus 5: модель стала наименее уязвимой к prompt injection из всех, что Anthropic когда-либо выпускала. Не средние оценки в чатах — а результаты PI-evalов и red teaming. Это мелькнуло на странице 73 системной карты. И вот почему это важнее большинства бенчмарков.

Контекст

Prompt injection — атака, при которой вредоносный текст во входных данных перехватывает инструкции модели и заставляет её действовать против правил или владельца системы. Для чат-бота это неудобство. Для agentic-систем — критическая уязвимость: агент, читающий письма, код или веб-страницы, может выполнить команды злоумышленника вместо инструкций разработчика.

Anthropic публикует System Card для каждой крупной модели — это технический документ с описанием методологии безопасности, результатов red teaming и ограничений, не пресс-релиз. То, что prompt injection попал в карту отдельным пунктом с положительной оценкой, говорит о системной работе, а не случайном улучшении.

Boris Cherny — инженер Anthropic, работающий над Claude Code. Его оценка — не маркетинговый текст, а взгляд человека, который строит agentic-стек поверх этой модели и ежедневно сталкивается с её поведением в продакшне.

Аналитика

Prompt injection — последний крупный незакрытый класс атак на LLM-системы. SQL injection решили параметризованными запросами, XSS — экранированием, CSRF — токенами. У prompt injection нет симметричного технического решения: граница между данными и инструкциями в языковой модели по природе размыта. Именно поэтому заявление Anthropic о прогрессе — даже без публичных числовых бенчмарков — стоит принять всерьёз.

Для рынка agentic AI это переломный сигнал. Главный сдерживающий фактор при развёртывании автономных агентов в продакшне — страх перед атаками на контекст. Агент, парсящий письма от незнакомцев, читающий код из внешних репозиториев или просматривающий веб-страницы по запросу — все они становятся менее рискованными, если базовая модель устойчива к инжекту.

Это также конкурентный сигнал. GPT-4o, Gemini 2.5 Pro, Qwen, DeepSeek — все активно строят agentic-обёртки. Но насколько их базовые модели устойчивы к prompt injection — публичных данных почти нет. Anthropic сделала этот пункт явным и верифицируемым: System Card открыта, методология описана, страница указана.

Кейсы применения в бизнесе

B2B-SaaS стартап с агентами: если вы строите агента, читающего входящие тикеты от клиентов или парсящего данные из внешних API, Opus 5 стоит рассмотреть как базовую модель. Устойчивость к инжекту снижает риск того, что вредоносное сообщение в тикете изменит поведение агента или вытащит системный промпт. Это страховка без дополнительного инфраструктурного слоя.

Корпорация с legacy-интеграциями: когда LLM-агент подключён к внутренним базам через RAG и читает документы из разных команд, риск случайного или намеренного инжекта через документ высок. Переход на модель с лучшими PI-показателями — снижение security-риска в аудитном контексте без изменения архитектуры.

SMB и локальный бизнес в КР/СНГ: малый бизнес, подключающий AI-ассистента к CRM или мессенджеру, редко думает о безопасности промптов. Использование модели с встроенной защитой от инжекта — это снижение attack surface без найма security-инженера. Выбор более устойчивой модели закрывает класс атак на уровне инфраструктуры.

Кейсы в личной жизни

Разработчик, строящий агентов: если вы пишете автономного агента с MCP или tool use — Opus 5 стоит протестировать как базу именно в сценариях с внешними данными. Меньше параноя о том, что агент прочитает злонамеренный текст из файла или веба и начнёт выполнять чужие инструкции вместо ваших.

Контент-мейкер с AI-ассистентом: агент, собирающий информацию по теме из открытых источников, может наткнуться на страницы с намеренными инжект-попытками — это реальная практика в SEO-отравленном вебе. Устойчивая модель даёт более надёжный вывод без ручной проверки каждого источника.

Исследователь или студент: при анализе больших массивов текстов или PDF из разных источников prompt injection через документ — недооценённый риск. Opus 5 снижает его без изменения рабочего процесса — просто другая модель в том же интерфейсе.

Как применить сегодня

  • Найти System Card Opus 5 на сайте Anthropic и прочитать раздел про prompt injection (страница 73) — это первичный источник без маркетинга.
  • Если у вас есть agentic-пайплайн с внешними данными — запустить тест: подать в контекст «враждебный» текст с инструкцией проигнорировать системный промпт и сравнить поведение Opus 5 и текущей модели.
  • При проектировании новых агентов добавить «input sanitization layer» в архитектуру — Opus 5 снижает риск, но не заменяет многоуровневую защиту.
  • Если строите на Claude Code: протестировать агентный сценарий с tool use и внешними данными именно на Opus 5 — сравнение на живом пайплайне покажет разницу лучше любого бенчмарка.
  • Следить за публичными PI-бенчмарками и независимыми red team-отчётами — числовые сравнения с конкурентами появятся в ближайшие недели.
← Все статьи