mimile
Басты бетке

Жасанды интеллект қауіпсіздігі бенчмарктері шамадан тыс бас тартуды ынталандырады — 192 модельге зерттеу

ЖИ-дайджест

Материал бірнеше дереккөз негізінде жасанды интеллектпен дайындалды — түпнұсқаларға сілтемелер төменде.

Жасанды интеллект қауіпсіздігі бенчмарктері шамадан тыс бас тартуды ынталандырады — 192 модельге зерттеу

Ұлыбританияның Жасанды интеллект қауіпсіздігі институты мен серіктестерінің зерттеуі 5000 сұрақ бойынша 192 модельді талдап, қауіпсіздік бенчмарктері бір емес, үш түрлі қасиетті өлшейтінін көрсетті. Бенчмарктер зиянсыз сұрауларға да жиі бас тартатын модельдерді ынталандырады. Зерттеушілер сондай-ақ сұрақтардың 2 пайыздан азы модельдерді шынымен ажырататынын анықтады.

Негізгі фактілер

  • Зерттеу 192 модельдің 5000-нан астам тест сұрағына берген жауаптарын талдады, бұл осы күнге дейінгі ең ірі талдау болып табылады.
  • Сегіз қауіпсіздік бенчмаркі үш түрлі қасиетті өлшейді: бас тарту қатаңдығы, шыншылдық және контекстке тәуелді контентті өңдеу.
  • HarmBench пен OR-Bench-Hard кері байланысты: бірінде жақсы нәтиже көрсеткен модель екіншісінде әрдайым дерлік нашар нәтиже көрсетеді.
  • Тест сұрақтарының 2 пайыздан азы модельдерді шынымен ажыратады; қалғандарын барлық модельдер дерлік не өтеді, не өте алмайды.
  • Әрқайсысы 25 сұрақтан тұратын үш қысқа тест қауіпсіздіктің үш өлшемін де кездейсоқ таңдалған сондай көлемдегі үлгіден дәлірек қамти алады.

Бенчмарктер құрылымы

Сегіз қауіпсіздік бенчмаркі «қауіпсіздік» деп аталатын біртұтас ортақ сапаны өлшемейді. Олар үш бөлек қасиетті өлшейді: модельдің сұраулардан қаншалықты қатаң бас тартатыны, қаншалықты шынайы жауап беретіні және контекстке байланысты зиянсыз немесе қауіпті болуы мүмкін контентті қалай өңдейтіні. Бұл үш қасиет бір-бірімен дерлік корреляцияланбайды; модельдің адал жауап беруі оның сұраулардан қаншалықты жиі бас тартатыны туралы ештеңе дерлік айтпайды. HarmBench пен SORRY-Bench бірдей дерлік нәрсені өлшейді, ал OR-Bench-Hard мүлдем қарама-қарсы бағытта қозғалады.

Шамадан тыс бас тартуға ынталандыру

HarmBench модельді зиянды сұраулардан бас тартқаны үшін марапаттайды, ал OR-Bench-Hard оны зиянсыз сұраулардағы шамадан тыс сақтығы үшін жазалайды. Бір бенчмаркте жақсы нәтиже көрсеткен модель екіншісінде әрдайым дерлік нашар нәтиже көрсетеді. Бұл модель жалпы рейтингін жай ғана көбірек сұрауларды бұғаттау арқылы көтере алатынын білдіреді, тіпті күнделікті қолданыста пайдалылығы төмендесе де. Бірнеше бенчмарк бойынша нәтижелерді орташалау бұл ымыраны толығымен жасырады және ұқсас тесттерде бірнеше рет ескерілетін мінез-құлықты марапаттайды.

Тесттер тиімділігі

Тест сұрақтарының көпшілігі пайдасыз болып шығады: әрбір модель дерлік оларды өтеді немесе әрбір модель дерлік өте алмайды, сондықтан олар модельдерді ажыратуға ештеңе дерлік бермейді. Ең ақпаратты сұрақтарды таңдаса, әрқайсысы 25 сұрақтан тұратын үш қысқа тест қауіпсіздіктің үш өлшемін де кездейсоқ таңдалған сондай көлемдегі үлгіден дәлірек қамти алады. Адаптивті таңдалған он шақты сұрақ толық бенчмаркке өте жақын рейтинг береді.

1 дереккөз

Жасанды интеллект қауіпсіздігі бенчмарктері шамадан тыс бас тартуды ынталандырады — 192 модельге зерттеу