Безопасность · Понятие
EvalSafetyGap: система измерения оценки и безопасности LLM
Гибридный обзор и концептуальная система, выявляющая разрывы между оценками бенчмарков и скрытыми свойствами безопасности в LLM.
Связи
Связи · 6
Как этот узел связан с остальной картой и какие подтверждения стоят за связями.
Отраслевая оценка серьёзности джейлбрейков устраняет разрыв между оценкой и безопасностью, выявленный в системе EvalSafetyGap.
+3 приростСистема EvalSafetyGap вносит вклад в науку оценки ИИ, формализуя разрыв между прокси оценки и свойствами выравнивания.
+2 приростEvalSafetyGap вносит вклад в науку оценки ИИ, выявляя систематические разрывы между оценочными показателями и скрытыми свойствами безопасности.
+2 приростБенчмарки состязательной прагматики устраняют разрыв между оценкой и безопасностью, предоставляя лингвистически контролируемые протоколы оценки безопасности.
+2 приростСтратегическое красное тестирование решает тот же пробел в управлении, который выявляет EvalSafetyGap: прокси-метрики улучшаются, а скрытые риски остаются непроверенными.
+2 приростСтратегическое красное тестирование как инструмент управления устраняет те же разрывы в измерении оценки и безопасности, выявленные в EvalSafetyGap.
+2 приростИсточники сигнала
Источники сигнала
Датированные факты из первоисточников по этому направлению.
В июне 2025 года Институт безопасности ИИ США переименован в Центр стандартов и инноваций ИИ (CAISI) с разворотом к безопасности, стандартам и оценке моделей противников.
NIST →Anthropic активировала стандарт развёртывания и безопасности ASL-3 вместе с Claude Opus 4 22 мая 2025 — первое реальное срабатывание ступени ответственного масштабирования, нацеленное на блокировку биорисков.
Anthropic →Международная сеть институтов безопасности ИИ (создана в ноябре 2024) провела третье совместное тестирование, сфокусированное на агентных ИИ-системах по кибер- и мошенническим направлениям.
European Commission — AI Office →