Безопасность · Понятие
Институциональный red-teaming: правила деплоя как переменные безопасности
Рассматривает институциональные правила деплоя и состояния authority как первоклассные переменные безопасности мультиагентов.
Shifts safety R&D from model-only fixes toward tunable deployment institutions.
Связи
Связи · 5
Как этот узел связан с остальной картой и какие подтверждения стоят за связями.
IABench-CA показывает, что правила развёртывания причинно меняют коллективную безопасность в мультиагентных системах ИИ.
+4 приростЭксперименты POLIS показывают, что правила развёртывания и guard’ы меняют уровень нарушений мультиагентных систем.
+3 приростMulti-turn мультиагентные stress-test’ы делают правила диалога и стратегии деплоя safety-переменными.
+3 приростВстраивает поиск исторических инцидентов в pre-task planning, делая процесс безопасности операционной переменной.
+3 приростМетодология институционального красного тестирования предоставляет конкретный инструмент оценки для механизмов управления, выявленных в обзоре управления агентным ИИ.
+2 приростИсточники сигнала
Источники сигнала
Датированные факты из первоисточников по этому направлению.
В июне 2025 года Институт безопасности ИИ США переименован в Центр стандартов и инноваций ИИ (CAISI) с разворотом к безопасности, стандартам и оценке моделей противников.
NIST →Anthropic активировала стандарт развёртывания и безопасности ASL-3 вместе с Claude Opus 4 22 мая 2025 — первое реальное срабатывание ступени ответственного масштабирования, нацеленное на блокировку биорисков.
Anthropic →Международная сеть институтов безопасности ИИ (создана в ноябре 2024) провела третье совместное тестирование, сфокусированное на агентных ИИ-системах по кибер- и мошенническим направлениям.
European Commission — AI Office →