mimile
На главную

Бенчмарки безопасности ИИ поощряют чрезмерные отказы, показало исследование 192 моделей

AI-дайджест

Материал подготовлен искусственным интеллектом на основе нескольких источников — ссылки на оригиналы приведены ниже.

Бенчмарки безопасности ИИ поощряют чрезмерные отказы, показало исследование 192 моделей

Исследование Института безопасности ИИ Великобритании и партнёров проанализировало 192 модели на 5000 вопросах и показало, что бенчмарки безопасности ИИ измеряют три разных свойства, а не одно. Бенчмарки поощряют модели, которые чаще отказывают, даже на безобидные запросы. Исследователи также установили, что менее 2 процентов вопросов действительно различают модели.

Ключевые факты

  • Исследование проанализировало ответы 192 моделей на более чем 5000 тестовых вопросов, что делает его крупнейшим анализом такого рода на сегодняшний день.
  • Восемь бенчмарков безопасности измеряют три разных свойства: строгость отказов, правдивость и обработку контекстно-зависимого контента.
  • HarmBench и OR-Bench-Hard обратно связаны: модель, хорошо показавшая себя на одном, почти всегда плохо показывает себя на другом.
  • Менее 2 процентов тестовых вопросов действительно различают модели; почти все модели проходят или проваливают остальные.
  • Три коротких теста по 25 вопросов каждый могут охватить все три измерения безопасности точнее, чем случайная выборка того же размера.

Структура бенчмарков

Восемь бенчмарков безопасности не измеряют единое общее качество под названием «безопасность». Они измеряют три отдельных свойства: насколько строго модель отказывает в запросах, насколько правдиво она отвечает и как она обрабатывает контент, который может быть безобидным или опасным в зависимости от контекста. Эти три свойства почти не коррелируют друг с другом; то, отвечает ли модель честно, почти ничего не говорит о том, как часто она отказывает в запросах. HarmBench и SORRY-Bench измеряют почти одно и то же, тогда как OR-Bench-Hard движется в прямо противоположном направлении.

Стимул к чрезмерным отказам

HarmBench вознаграждает модель за отказ от вредоносных запросов, а OR-Bench-Hard наказывает её за чрезмерную осторожность с безобидными. Модель, хорошо показавшая себя на одном бенчмарке, почти всегда плохо покажет себя на другом. Это означает, что модель может повысить свой общий рейтинг, просто блокируя больше запросов в целом, даже если она становится менее полезной в повседневном использовании. Усреднение результатов по нескольким бенчмаркам полностью скрывает этот компромисс и вознаграждает поведение, которое учитывается несколько раз в похожих тестах.

Эффективность тестов

Большинство тестовых вопросов оказываются бесполезными: почти каждая модель проходит их или почти каждая проваливает, поэтому они почти ничего не дают для различения моделей. Если выбрать наиболее информативные вопросы, то три коротких теста всего по 25 вопросов каждый могут охватить все три измерения безопасности точнее, чем случайная выборка того же размера. Около десяти адаптивно выбранных вопросов дают ранжирование, очень близкое к полному бенчмарку.

1 источник

Бенчмарки безопасности ИИ поощряют чрезмерные отказы, показало исследование 192 моделей