SciHazard: агенты-исследователи опаснее стандартных LLM — теперь это измерено
21 июля 2026 года на arXiv вышел SciHazard — бенчмарк для оценки научных рисков LLM с декомпозированной метрикой DeHarm-Score. Главный вывод тестирования 31 frontier-модели: deep research агенты показывают на 32,3% более высокий уровень вредности, чем стандартные LLM, — и это системная уязвимость, которую нынешние защиты не закрывают.