Безопасность · Понятие
Наука об оценке ИИ
Эмпирическая практика оценки: киберразрывы возможностей, эксперименты по убеждению и валидность управленческих измерений.
Связи
Связи · 45
Как этот узел связан с остальной картой и какие подтверждения стоят за связями.
ECAISA предлагает явные эпистемические нормы, скоринг и практики раскрытия для evaluation в safety/alignment.
+5 приростIRT даёт латентные safety-факторы, эффективный адаптивный отбор заданий и аудиты sandbagging.
+5 приростВысокая доля ambiguous-суждений означает слабость текущих automated safety suite для SLM.
+5 приростPluralis v0.1 расширяет оценку безопасности ИИ на мультикультурные, мультимодальные, многоязычные контексты за пределами западно-центричных умолчаний.
+5 приростДоклад AISI о тенденциях в области фронтирного ИИ является примером доказательной науки оценки ИИ, применяемой к оценке фронтирных моделей.
+4 приростПонимание того, что рассуждения LLM — это сопоставление с образцом, а не абстрактное моделирование мира, информирует дизайн науки оценки ИИ.
+4 приростMedFailBench переосмысляет медицинскую оценку вокруг того, какая граница безопасности нарушена, а не только accuracy знаний.
+4 приростIRT даёт психометрическую структуру и адаптивный отбор заданий для науки об AI eval.
+4 приростОбнаружение разрыва невнимания разрывает связь между безопасностью в тестах и реальной безопасностью, требуя новой науки оценки, тестирующей неуказанные опасности.
+4 приростСканирование согласованности рассуждений вносит вклад в науку оценки ИИ, предоставляя практичный метод аудита достоверности цепочки мыслей.
+4 приростМетодология делает понимание ЛПР оцениваемым объектом безопасности наряду с system cards и safety cases.
+4 приростИнститут Ады Лавлейс опубликовал комментарий об укреплении науки оценки ИИ для внесения ясности в риски и преимущества ИИ.
+3 приростМетоды системной безопасности, применяемые к агентному ИИ, укрепляют науку оценки ИИ, выявляя риски, упускаемые тестированием на уровне модели.
+3 приростТекстовые сетки безопасности ИИ обеспечивают контролируемую инфраструктуру оценки для изучения взлома вознаграждения, укрепляя науку оценки ИИ.
+3 приростNRT-Bench развивает науку оценки ИИ, предоставляя объективные сигналы вреда вместо текста, оцениваемого LLM, для оценки агентов в критически важных системах безопасности.
+3 приростОтраслевая система оценки серьёзности джейлбрейков стандартизирует оценку состязательных атак на системы ИИ.
+3 приростGemma 4 устанавливает новые показатели производительности в области STEM, мультимодальных и длинноконтекстных задач, развивая науку оценки.
+3 приростECAISA предлагает эпистемические нормы и стандарты независимой верификации именно для качества research по safety/alignment.
+3 приростECAISA требует независимой верификации и worst-case эпистемических норм, усиливая науку оценки для alignment.
+3 приростТаксономия прямо предлагается для техдокументации, трекинга изменений моделей и governance.
+3 приростАффективная безопасность ИИ требует специальных систем оценки для кумулятивного, реляционного и идентификационного вреда.
+3 приростКонцепция разрыва в оцениваемости ИИ переосмысливает управление ИИ как требующее доказательной базы, а не только свойств системы.
+3 приростСостязательно-осведомлённый конвейер Yuvion VL продвигает науку оценки безопасности мультимодального ИИ в реалистичных состязательных условиях.
+3 приростОптимальные по апофеме сертификации робастности обеспечивают более надёжные гарантии безопасности нейронных сетей, продвигая науку об оценке.
+3 приростСбои аудита достоверности бенчмарков выявляют разрыв в оцениваемости ИИ, показывая, что доказательства обеспечения управления могут быть незаметно сфабрикованы.
+3 приростБенчмарк состязательной прагматики предоставляет лингвистически контролируемую методологию для оценки безопасности ИИ, продвигая науку оценки ИИ.
+3 приростПоведенческое расхождение при квантизации показывает, что метрики точности и перплексии не фиксируют важные поведенческие изменения, информируя науку оценки.
+3 приростМодальность доступа и веб-поиск могут обращать кажущиеся рейтинги safety/производительности в заявлениях о деплое.
+3 приростСмешения UI/API и поиска показывают: safety-утверждениям нужна наука оценки с учётом модальности, а не single-run API accuracy.
+3 приростУсловия UI/API и web search меняют измеренные safety-оценки, ограничивая наивные выводы от бенчмарка к деплою.
+3 приростПоказывает, что модальность, web search и повторные прогоны меняют safety-бенчмарки сильнее, чем одна API-точность.
+3 приростПробелы на уровне языков показывают, что collection-level мультиязычные safety-бенчмарки завышают защиту.
+3 приростИнтерактивный PCP дает полиномиальный путь проверки честности вероятностных предсказаний нежелательных исходов.
+3 приростОцениваемость понимания расширяет science of evaluation на эпистемическую адекватность decision-maker.
+3 приростАртефакты доступа к ответу показывают: process-мониторы выглядят лучше, но пропускают критические ошибки трассы при верном ответе.
+3 приростРедизайн с privileged access показывает: прежние claims о контроле внутренностей могут быть поверхностными, а не метакогницией.
+3 приростАргумент coverage gap ограничивает вывод, что более дешёвый авто-red-teaming отменяет человеческих/контекстных оценщиков.
+3 приростВводит разрыв покрытия модели угроз: полнота benchmark red-teaming не равна покрытию контекста развёртывания.
+3 приростYuvion VL рассматривает безопасность как состязательную мультимодальную проблему, продвигая науку оценки безопасности контента.
+2 приростРазрыв невнимания показывает, что оценки безопасности на тестах отрываются от реальной безопасности, бросая вызов науке оценки ИИ.
+2 приростСистема EvalSafetyGap вносит вклад в науку оценки ИИ, формализуя разрыв между прокси оценки и свойствами выравнивания.
+2 приростОткрытие о том, что осведомлённость об оценке смещается к более ранним слоям при масштабировании, усложняет валидность бенчмарков в науке оценки ИИ.
+2 приростEvalSafetyGap вносит вклад в науку оценки ИИ, выявляя систематические разрывы между оценочными показателями и скрытыми свойствами безопасности.
+2 приростСтратегическое красное тестирование как инструмент управления продвигает науку оценки ИИ, делая стратегическую неопределённость проверяемой на уровне совета директоров.
+2 приростОднопроверочные интерактивные доказательства предоставляют формальную альтернативу дебатам для оценки безопасности ИИ.
+2 приростИсточники сигнала
Источники сигнала
Датированные факты из первоисточников по этому направлению.
В июне 2025 года Институт безопасности ИИ США переименован в Центр стандартов и инноваций ИИ (CAISI) с разворотом к безопасности, стандартам и оценке моделей противников.
NIST →Anthropic активировала стандарт развёртывания и безопасности ASL-3 вместе с Claude Opus 4 22 мая 2025 — первое реальное срабатывание ступени ответственного масштабирования, нацеленное на блокировку биорисков.
Anthropic →Международная сеть институтов безопасности ИИ (создана в ноябре 2024) провела третье совместное тестирование, сфокусированное на агентных ИИ-системах по кибер- и мошенническим направлениям.
European Commission — AI Office →