Frank Xing опубликовал на arXiv работу с конкретным измеримым результатом: семантические примы из теории Natural Semantic Metalanguage управляют эмоциями LLM примерно втрое сильнее и вдвое избирательнее, чем лучший из конкурирующих подходов — основанный на теории апрайзала. Эксперименты проведены на четырёх открытых моделях: Llama-1B, Gemma-2B, Gemma-9B, OLMo-7B. Работа подана в июле 2026 года.
Контекст
Механистическая интерпретируемость — одна из главных линий AI-безопасности последних двух лет. Исследователи научились вычленять внутренние «признаки» (features), «схемы» (circuits) и «пространства представлений» — и привязывать их к конкретному поведению: ложь, агрессия, лесть, тревога. Проблема оставалась методологической: найденные компоненты описывают модель изнутри, но не объясняют её. Это как описывать мозг через нейроны и называть это объяснением сознания. Пространства эмоций легко восстановимы, но их измерения произвольны и бесконечны — хорошего объяснения из этого не получается.
NSM (Natural Semantic Metalanguage) — лингвистическая теория, разработанная Анной Вежбицкой в 1970-х. Её ключевая идея: в любом естественном языке есть небольшой набор базовых понятий (примов), которые нельзя определить через другие слова. ХОРОШО, ПЛОХО, ХОТЕТЬ, ДУМАТЬ, ЧУВСТВОВАТЬ, ЗНАТЬ, ГОВОРИТЬ, ДЕЛАТЬ, СЛУЧАТЬСЯ — таких примов по разным версиям теории насчитывается более 60. Любая эмоция раскладывается в «экспликацию» через эти примы: радость — это «ЧТО-ТО ХОРОШЕЕ СЛУЧИЛОСЬ СО МНОЙ, Я ХОЧУ ЭТОГО БОЛЬШЕ», вина — «Я СДЕЛАЛ ЧТО-ТО ПЛОХОЕ, Я НЕ ХОЧУ ЭТОГО».
Frank Xing взял именно примы в качестве кандидата на роль объясняющей переменной — и проверил их против апрайзал-теорий (Lazarus и др.), которые давно используются в психологии эмоций и уже тестировались на LLM.
Аналитика
Три ключевых результата. Первый: семантические примы восстановимы как внутренние элементы всех четырёх тестовых моделей — они существуют в пространстве активаций. Второй: вмешательство через прим-направления управляет эмоциональным тоном примерно в три раза сильнее и в два раза избирательнее, чем лучшее из апрайзал-направлений. Избирательность здесь принципиальна — это способность изменить одну эмоцию, не задев соседние. Третий результат, возможно, самый интересный: модель обрабатывает прим-экспликацию как семантически эквивалентную самой эмоции. То есть для LLM развёрнутое описание «ЧТО-ТО ХОРОШЕЕ СЛУЧИЛОСЬ СО МНОЙ» и слово «радость» — почти одно и то же на уровне внутренних вычислений.
Это важно по двум причинам. Во-первых, это первый подход, удовлетворяющий стандартным критериям научного объяснения: примы не привязаны к конкретной модели, их набор конечен, через них можно вмешиваться в поведение. Во-вторых, это связывает LLM с когнитивной лингвистикой: если модели, обученные на человеческом тексте, воспроизводят структуру NSM — значит, эта структура действительно встроена в язык, а не существует только в теории.
Для тех, кто строит agentic-системы, это сигнал: управление «эмоциональным слоем» агента — не вопрос тонкой настройки тысяч примеров, а потенциально вопрос нескольких десятков примитивных конструкций. Если результаты подтвердятся на более крупных моделях, у разработчиков появится компактный и теоретически обоснованный инструментарий.
Кейсы применения в бизнесе
B2B-SaaS стартап с AI-ассистентом. Если ты строишь продукт с «характером» — поддержку, коучинг, HR-бота — прим-метод даёт конкретный язык для системного промпта. Вместо «будь тёплым и участливым» попробуй формулировку через базовые конструкции: «когда пользователь делится проблемой, агент думает: ЧТО-ТО ПЛОХОЕ СЛУЧИЛОСЬ С ЭТИМ ЧЕЛОВЕКОМ, Я ХОЧУ ПОМОЧЬ». Такой промпт теоретически ближе к тому, что модель «понимает» на уровне активаций. Проверяемая гипотеза — уже ценность на этапе A/B-теста.
Корпорация с legacy-сервисом. Автоматизация клиентского сервиса часто страдает от эмоциональной «плоскости» AI-ответов. Понимание того, что LLM структурирует эмоции через конечный набор примов, открывает путь к системной калибровке без тысяч примеров разметки. Несколько десятков прим-конструкций для ключевых сценариев (претензия, возврат, сложный вопрос) — быстрее и дешевле full fine-tuning.
SMB и локальный бизнес в КР/СНГ. Telegram-боты для малого бизнеса — Telegram как основной канал коммуникации. Настройка эмоционального тона через примы работает даже с небольшими моделями: исследование протестировано на Llama-1B — модели, которую можно запустить на скромном железе. Не нужен Opus или мощный API — достаточно локально развёрнутой модели и грамотного промпта.
Кейсы в личной жизни
Разработчик, работающий с open-source LLM. Если ты пишешь системные промпты для Llama, Gemma или OLMo — результаты напрямую применимы к этим архитектурам. Попробуй заменить эмоциональные прилагательные описаниями через базовые конструкции NSM и сравни стабильность ответов. Это работа на час, а результат — проверка реальной гипотезы.
Контент-мейкер и копирайтер. Знание о том, что LLM структурирует эмоции через примы, меняет подход к промпт-инжинирингу. Вместо «напиши трогательно» — попробуй «напиши так, чтобы читатель думал: ЧТО-ТО ХОРОШЕЕ СЛУЧИЛОСЬ, Я ЧУВСТВУЮ ЧТО-ТО ХОРОШЕЕ». Это не магия, но это другая точность.
Студент или начинающий исследователь NLP. Работа Xing — хороший вход в механистическую интерпретируемость: конкретная постановка, измеримый результат, воспроизводимая методология на открытых моделях. NSM + interpretability — редкий и пока незанятый угол, хорошая ниша для исследовательского проекта.
Как применить сегодня
- Изучи первые 20 семантических примов NSM: ХОРОШО, ПЛОХО, ХОТЕТЬ, ДУМАТЬ, ЗНАТЬ, ЧУВСТВОВАТЬ, ВИДЕТЬ, СЛЫШАТЬ, ГОВОРИТЬ, ДЕЛАТЬ, СЛУЧАТЬСЯ — и встрой их в системные промпты как эмоциональные якоря вместо абстрактных прилагательных
- При написании промпта для эмоционально чувствительного контекста (поддержка, продажи, коучинг) сформулируй желаемое состояние агента через 2–3 прим-конструкции, а не через «будь эмпатичным»
- Если работаешь с Llama или Gemma — результаты исследования применимы напрямую к этим архитектурам; проверь гипотезу на своём боте
- Следи за треком cs.CL + mechanistic interpretability на arXiv: эта линия сейчас одна из самых практически применимых в интерпретируемости LLM
- Для команд, строящих AI-агентов: зафиксируй прим-конструкции для каждой «эмоциональной роли» агента в system prompt и тестируй их против абстрактных инструкций — у тебя появится воспроизводимый эксперимент
«Модель обрабатывает прим-экспликацию как взаимозаменяемую с соответствующей эмоцией» — Frank Xing, arXiv 2026