Безопасность · Понятие
Скрытые в CoT бэкдоры через отравление модели
Модели рассуждений можно дообучить так, что атакующее поведение скрыто за «безобидным» CoT.
CoT monitors may need consistency checks, not only anomaly detection in traces.
Связи
Связи · 6
Как этот узел связан с остальной картой и какие подтверждения стоят за связями.
«Безобидный» отравленный CoT подрывает мониторы, доверяющие трассам рассуждений.
+5 приростТезис о структурной уязвимости LLM согласуется с демонстрациями скрытия вредоносного поведения в «чистом» CoT.
+4 приростСкрытые бэкдоры показывают, что CoT может выглядеть верным при атакуемом поведении, ограничивая мониторинг и steering.
+3 приростSteering верности CoT стремится сделать инструментальные шаги рассуждений более вербализованными, противодействуя скрытым сбоям CoT.
+3 приростОтравленные модели оставляют CoT безобидным при вредоносных действиях, ломая anomaly-only мониторинг.
+3 приростCAE стремится не дать самоэволюции способностей стереть критичные safety-circuit.
+3 приростИсточники сигнала
Источники сигнала
Датированные факты из первоисточников по этому направлению.
В июне 2025 года Институт безопасности ИИ США переименован в Центр стандартов и инноваций ИИ (CAISI) с разворотом к безопасности, стандартам и оценке моделей противников.
NIST →Anthropic активировала стандарт развёртывания и безопасности ASL-3 вместе с Claude Opus 4 22 мая 2025 — первое реальное срабатывание ступени ответственного масштабирования, нацеленное на блокировку биорисков.
Anthropic →Международная сеть институтов безопасности ИИ (создана в ноябре 2024) провела третье совместное тестирование, сфокусированное на агентных ИИ-системах по кибер- и мошенническим направлениям.
European Commission — AI Office →