#interpretability

Публикаций: 4

За chain-of-thought скрыты отдельные внутренние паттерны — новое исследование

Когда LLM «думает вслух» — вычисляет, ищет формулу, делает дедуктивный вывод — каждый тип рассуждения оставляет в сети отдельный, различимый след. Новое исследование впервые показало прямую связь между видимой цепочкой мыслей и внутренними состояниями модели — и главный вывод неудобный.

Семантические примы управляют эмоциями LLM точнее любой психологии

Исследователь Frank Xing показал: вмешательство во внутренние активации LLM через направления семантических примов NSM управляет эмоциональным тоном примерно втрое сильнее и вдвое избирательнее, чем лучшие конкурирующие подходы. Это первый конкретный кандидат на роль «объяснения» эмоций в больших языковых моделях.

Anthropic заглянула в голову Claude — и нашла там слово «обман»

Anthropic обнаружила, что Claude самостоятельно — без явных инструкций — сформировал внутреннюю рабочую память в ходе обучения. Новый инструмент J-Lens позволяет её читать: и то, что там написано, меняет подход к безопасности автономных агентов.

0,1% нейронов LLM управляют всеми отказами — находка Nous Research

Nous Research выяснила, какие именно нейроны отвечают за отказы instruct-моделей — и научилась их адресно отключать без дообучения и без изменения весов. Всего 0,1% MLP-активаций держат под контролем весь refusal-механизм.

← Все статьи