Безопасность · Понятие
Векторы steering для верности chain-of-thought
Исследует обобщение activation steering для повышения признания подсказок и снижения неверной CoT на разных типах cues и датасетах.
Monitoring unfaithful CoT may increasingly rely on activation-level interventions, not prompts alone.
Связи
Связи · 4
Как этот узел связан с остальной картой и какие подтверждения стоят за связями.
Пошаговые сигнатуры энергии — внутренний сигнал, дополняющий steering при диагностике неверных/слабых узлов рассуждения.
+4 приростОба касаются надёжности alignment/monitorability: steering вскрывает инструментальные шаги, которые оптимизация может скрывать.
+3 приростСкрытые бэкдоры показывают, что CoT может выглядеть верным при атакуемом поведении, ограничивая мониторинг и steering.
+3 приростSteering верности CoT стремится сделать инструментальные шаги рассуждений более вербализованными, противодействуя скрытым сбоям CoT.
+3 приростИсточники сигнала
Источники сигнала
Датированные факты из первоисточников по этому направлению.
В июне 2025 года Институт безопасности ИИ США переименован в Центр стандартов и инноваций ИИ (CAISI) с разворотом к безопасности, стандартам и оценке моделей противников.
NIST →Anthropic активировала стандарт развёртывания и безопасности ASL-3 вместе с Claude Opus 4 22 мая 2025 — первое реальное срабатывание ступени ответственного масштабирования, нацеленное на блокировку биорисков.
Anthropic →Международная сеть институтов безопасности ИИ (создана в ноябре 2024) провела третье совместное тестирование, сфокусированное на агентных ИИ-системах по кибер- и мошенническим направлениям.
European Commission — AI Office →