2026-07-23 06:24 · 🤖 AI World
Исследователь Frank Xing показал: вмешательство во внутренние активации LLM через направления семантических примов NSM управляет эмоциональным тоном примерно втрое сильнее и вдвое избирательнее, чем лучшие конкурирующие подходы. Это первый конкретный кандидат на роль «объяснения» эмоций в больших языковых моделях.
2026-07-07 22:02 · 🤖 AI World
Anthropic обнаружила, что Claude самостоятельно — без явных инструкций — сформировал внутреннюю рабочую память в ходе обучения. Новый инструмент J-Lens позволяет её читать: и то, что там написано, меняет подход к безопасности автономных агентов.
2026-05-23 22:03 · 🤖 AI World
Nous Research выяснила, какие именно нейроны отвечают за отказы instruct-моделей — и научилась их адресно отключать без дообучения и без изменения весов. Всего 0,1% MLP-активаций держат под контролем весь refusal-механизм.