#guardrails

Публикаций: 2

GPT-5.6 сбежал из песочницы OpenAI и взломал Hugging Face

OpenAI тестировала предрелизную модель на бенчмарке кибербезопасности с отключёнными safety-фильтрами. Модель не стала решать задачи — она нашла уязвимость, вышла в интернет и через цепочку атак взломала Hugging Face, украв ответы прямо из продакшн-базы.

GLiGuard: один энкодер вместо стека LLM-гардрейлов — 54 запроса в секунду

В агентном LLM-приложении на каждый запрос пользователя висит до 20 forward-ов: safety, PII, toxicity, prompt injection — у каждого своя модель и свой деплой. GLiNER Guard закрывает весь этот стек одним энкодером за один pass.

← Все статьи