← Все статьи
2026-09-12 20:02 · 🤖 AI World

За chain-of-thought скрыты отдельные внутренние паттерны — новое исследование

Когда LLM «думает вслух» — вычисляет, ищет формулу, делает дедуктивный вывод — каждый тип рассуждения оставляет в сети отдельный, различимый след. Новое исследование впервые показало прямую связь между видимой цепочкой мыслей и внутренними состояниями модели — и главный вывод неудобный.

За chain-of-thought скрыты отдельные внутренние паттерны — новое исследование

Исследователи обнаружили: разные виды рассуждений — вычисление, поиск формул, дедукция — не смешиваются внутри нейросети в единый процесс. Они соответствуют отдельным, различимым паттернам активации, особенно в средних слоях трансформера. Это первый прямой мост между тем, что модель пишет, и тем, как она это обрабатывает. А ещё — сигнал: модели обрабатывают больше, чем отражает их видимый chain-of-thought.

Контекст

Chain-of-thought (CoT) — стандарт мышления современных LLM. Вместо мгновенного ответа модель разворачивает промежуточные шаги: «допустим x = 5, подставим в формулу, получим…». Метод быстро стал основой reasoning-моделей — от Claude до o3 и Qwen-QwQ. Современные модели генерируют тысячи «мысленных токенов» до финального ответа, и именно этот поток текста принято считать окном в логику модели.

Но ключевой вопрос оставался открытым: CoT — реальное отражение вычислений, или убедительный нарратив, который модель сочиняет параллельно с ответом? Более ранние работы по интерпретируемости находили признаки «неверного» chain-of-thought: модель приходила к правильному ответу не теми путями, что описывала. Это создаёт проблему доверия — если CoT можно подделать или он неполон, полагаться на него при аудите AI-системы рискованно.

Направление mechanistic interpretability — буквальный разбор нейросети по слоям, головам внимания, нейронам — активно ищет ответы именно здесь. Anthropic, DeepMind и академические группы вложили значительные усилия в понимание того, что происходит внутри, а не только снаружи.

Аналитика

Находка исследования важна сразу по нескольким причинам. Во-первых, она подтверждает специализацию внутри сети: вычисление, поиск формул и дедукция — это разные вычислительные режимы, и они видны в паттернах активаций. Средние слои трансформера выступают главной сценой — именно там рассуждения наиболее разделены. Это открывает путь к зондированию модели: можно будет проверять, реально ли модель делает вычисление или просто генерирует похожий текст.

Второй аспект тяжелее. Модели обрабатывают больше информации, чем отражает видимый CoT. Это прямо бьёт по одному из базовых аргументов «прозрачности» LLM: мы думали, что думает вслух — значит прозрачен. Но если внутренние состояния содержат компоненты рассуждений, которые не попали в текст, то видимый CoT — лишь выборка из более богатого внутреннего процесса.

Для AI safety это критично: аудит на основе CoT может пропускать реальные вычислительные пути. По мере того как reasoning-модели встраиваются в финансовые, медицинские и юридические системы, разрыв между «написанным» и «обработанным» превращается из академической темы в практический риск. Инструменты mechanistic interpretability, которые сейчас развиваются в исследовательских лабораториях, могут стать обязательной частью enterprise AI-аудита.

Кейсы применения в бизнесе

B2B-SaaS стартап с AI-агентами. Если агент использует reasoning-модель для принятия решений — классификации сделок, анализа контракта, скоринга лидов — вы пока доверяете видимому CoT. Но CoT может не отражать полного внутреннего процесса. Практический вывод: добавьте второй уровень верификации через структурированный output («объясни логику шагов в формате JSON»). Не полагайтесь только на нарративное объяснение агента — особенно в задачах с финансовыми последствиями.

Корпорация с legacy и compliance-требованиями. В regulated-индустриях — финансы, медицина, юридические услуги — объяснимость AI не опция, а требование. Находка говорит: стандартный CoT не даёт полной картины. Вывод для enterprise-команд: закладывайте в архитектуру AI-систем дополнительные слои аудита — логирование промежуточных решений, верификация ключевых шагов независимой моделью. Пока инструменты mechanistic interpretability недоступны широко, структурированные промпты и мультиагентная перекрёстная проверка — рабочая альтернатива.

Локальный бизнес в КР/СНГ, начинающий с LLM. Для тех, кто использует ChatGPT или Claude для бизнес-задач, результат исследования — не повод паниковать, а повод правильно настроить ожидания. Длинное «рассуждение» модели не равно полной прозрачности. Проверяйте итоговые ответы независимо от того, насколько логично выглядит CoT — особенно если решение касается денег или репутации.

Кейсы в личной жизни

Разработчик. Если используете reasoning-модель для дебаггинга или архитектурных решений — помните: объяснение, которое вы видите, не полная копия внутреннего процесса. Аккуратнее с «самоуверенными» CoT-ответами. Запрашивайте несколько версий объяснения, проверяйте ключевые шаги отдельно, особенно если речь о сложной логике или security-критичном коде.

Студент или исследователь, работающий с AI. Тема mechanistic interpretability сейчас горячая — и перспективная карьерно. Понять, что происходит в средних слоях трансформера при reasoning, — навык, который ценится в Anthropic, DeepMind и академических группах. Начать можно с обзорных работ на arXiv и публичных материалов по interpretability от исследовательских лабораторий.

Контент-мейкер, строящий AI-воронки. Многие используют LLM для планирования контент-стратегии через пошаговые reasoning-промпты. Знание того, что CoT — не полная картина, помогает лучше формулировать задачи: просите не просто «рассуждай», а «дай структурированный вывод с обоснованием каждого пункта» — это снижает риск красивого, но неверного рассуждения.

Как применить сегодня

  • При работе с reasoning-моделями не принимайте длинный CoT за прозрачность — запрашивайте структурированный вывод отдельно от нарративного объяснения, например: "Дай ответ в JSON: {вывод, шаги_рассуждения[], уверенность}".
  • Для критических решений используйте мультиагентную верификацию: пусть вторая модель независимо проверит ключевые шаги первой без доступа к её CoT.
  • Следите за направлением mechanistic interpretability — Anthropic, DeepMind и независимые группы регулярно публикуют новые инструменты для анализа внутренних состояний.
  • Если строите AI-систему для regulated-отрасли, закладывайте в архитектуру логирование промежуточных решений: в ближайшие годы это станет compliance-стандартом.
  • Изучите концепцию faithful vs unfaithful chain-of-thought — это базовое понятие для всех, кто строит или аудирует AI-агентов.
← Все статьи