Бенчмарки безопасности ИИ поощряют чрезмерные отказы, показало исследование 192 моделей
Материал подготовлен искусственным интеллектом на основе нескольких источников — ссылки на оригиналы приведены ниже.

Исследование Института безопасности ИИ Великобритании и партнёров проанализировало 192 модели на 5000 вопросах и показало, что бенчмарки безопасности ИИ измеряют три разных свойства, а не одно. Бенчмарки поощряют модели, которые чаще отказывают, даже на безобидные запросы. Исследователи также установили, что менее 2 процентов вопросов действительно различают модели.
1 источник
Бенчмарки безопасности ИИ поощряют чрезмерные отказы, показало исследование 192 моделей



