#interpretability

Публикаций: 3

Семантические примы управляют эмоциями LLM точнее любой психологии

Исследователь Frank Xing показал: вмешательство во внутренние активации LLM через направления семантических примов NSM управляет эмоциональным тоном примерно втрое сильнее и вдвое избирательнее, чем лучшие конкурирующие подходы. Это первый конкретный кандидат на роль «объяснения» эмоций в больших языковых моделях.

Anthropic заглянула в голову Claude — и нашла там слово «обман»

Anthropic обнаружила, что Claude самостоятельно — без явных инструкций — сформировал внутреннюю рабочую память в ходе обучения. Новый инструмент J-Lens позволяет её читать: и то, что там написано, меняет подход к безопасности автономных агентов.

0,1% нейронов LLM управляют всеми отказами — находка Nous Research

Nous Research выяснила, какие именно нейроны отвечают за отказы instruct-моделей — и научилась их адресно отключать без дообучения и без изменения весов. Всего 0,1% MLP-активаций держат под контролем весь refusal-механизм.

← Все статьи