#LLM безопасность

Публикаций: 2

Anthropic заглянула в голову Claude — и нашла там слово «обман»

Anthropic обнаружила, что Claude самостоятельно — без явных инструкций — сформировал внутреннюю рабочую память в ходе обучения. Новый инструмент J-Lens позволяет её читать: и то, что там написано, меняет подход к безопасности автономных агентов.

NVIDIA garak превращает red-teaming LLM в системный процесс

NVIDIA выпустила развёрнутый tutorial по garak — open-source фреймворку для defensive red-teaming языковых моделей. Полный цикл: от установки и сканирования HuggingFace-моделей до кастомных проб и экспорта уязвимостей в стандарт AVID.

← Все статьи