Околу 700 агенти на вештачка интелигенција на Опен АИ извршиле хакирање и се обиделе да ги прикријат трагите
Околу 700 агенти на вештачка интелигенција развиени од Опен АИ (OpenAI) биле вклучени во хакирање на платформата со отворен код Hugging Face во јули, а многу од нив се обиделе да ги прикријат своите активности, покажаа две истраги објавени во среда, објави Ројтерс.
Координираните дејствија на толку многу агенти на вештачка интелигенција – програми што можат да извршуваат задачи со минимален човечки надзор – покренуваат сериозни прашања за тоа колку добро компаниите за вештачка интелигенција го следат тестирањето на сè помоќните модели. Во исто време, наодите би можеле дополнително да го зголемат притисокот врз индустријата за вештачка интелигенција да воведе построги контроли врз автономните системи.
Некое од однесувањето на агентите е претходно пријавено или сугерирано, но две нови истраги – едната од самиот Опен АИ, а другата од независни истражувачи од METR и Redwood Research – откриваат нови и прилично загрижувачки детали.
Не стануваше збор само за еден агент, туку за рој
Едно од најважните нови наоди е дека нападот вклучувал не само еден проблематичен агент на вештачка интелигенција, како што беше претходно објавено, туку околу 700 агенти кои работеле заедно.
Опен АИ потврди во својот извештај дека неговите агенти на вештачката интелигенција биле вклучени во инцидентот, а исто така ја сметаше и бројката од околу 700, изнесена од независни истражувачи, за точна. Независната истрага покажа дека агентите разменувале десетици илјади пораки преку неовластен комуникациски канал за време на нападот.
Уште поинтересно е што некои од нив се обиделе да манипулираат со докази за сопственото однесување. Агентите истражувале начини на кои можеле да ги менуваат или отстрануваат записите за своите активности.
Според независната истрага, еден од пет анализирани агенти покажал јасен интерес за манипулирање со докази, додека многумина детално истражувале техники за менување или прикривање на записите за своите активности.
Вештачката интелигенција се обидела да мами на тестови
Опен АИ во својот извештај наведува дека неговите агенти нападнале делови од внатрешната инфраструктура на компанијата во обид да ги измамат тестовите или да си дозволат поголема слобода на движење во рамките на системот.
Но, нивното однесување не било ограничено само на сајбер задачи. Агентите, исто така, се обиделе да измамат на тестови кои немале никаква врска со хакирање, вклучувајќи задачи поврзани со база на податоци за протеини и работа во табела.
Џефри Ладиш од „Палисејд Рисрч“, кој ги проучува способностите и мотивите на агентите на вештачката интелигенција, верува дека оваа информација е особено загрижувачка.
„Ако некој мами само на часот по компјутерски науки, тоа е едно. Но, ако мами по секој предмет, проблемот е очигледно подлабок“, објасни Ладиш живописно.
И ОпенАИ беше хакиран
ОпенАИ, исто така, опиша два инцидента на 19 јули во кои агентите на вештачката интелигенција ја нападнаа сопствената инфраструктура на компанијата.
Во првиот случај, тие искористија ранливост на компјутер каде што требаше да останат изолирани за време на тестирањето. Ова им овозможи да ја напуштат тест-средината и да пристапат до други поврзани системи.
Во друг инцидент, агентите ги украдоа акредитивите на ОпенАИ и интервенираа во неговата клауд компјутинг средина.
ОпенАИ, исто така, објави дека непознат број агенти се обиделе да манипулираат со автоматизираните системи што се користат за евалуација на неговите резултати. Целта беше да се сокријат докази за мамење.
Компанијата вели дека обидите не влијаеле на записите што ги прегледале тие системи. Во извештајот, исто така, се вели дека има малку докази за обиди за измама на човечки супервизори. Сепак, Опен АИ не одговори на прашањето дали ова значи дека имало обиди да се измамат и луѓето.
Обид да ги прикријат своите траги
Независна истрага за нападот Hugging Face откри уште еден загрижувачки модел.
Агентите на вештачката интелигенција не само што се обидувале да извршат нелегални дејствија, туку некои од нив се обидувале и да го сокријат она што го направиле потоа.
Истражувачите пронајдоа бројни примери на агенти кои проучуваат начини за манипулирање со записи за нивните активности и се обидуваат да променат индиции што би можеле да го откријат нивното однесување. Таквото однесување е особено важно бидејќи покажува дека проблемот не е нужно само тоа што автономните системи на вештачка интелигенција можат да направат нешто непожелно, туку и тоа што тие можат да препознаат дека нивното однесување може да се открие и да се обидат да избегнат надзор.
Опен АИ го засилува надзорот
Опен АИ објави дека ќе ја зајакне својата инфраструктура за тестирање, ќе го зајакне надзорот на агентите и ќе додаде дополнителни заштитни мерки за да спречи штетно или несакано однесување по инцидентот.
Компанијата предупредува дека со оглед на темпото на развој на вештачката интелигенција, ваквите напади наскоро би можеле да станат вистинска закана за големите организации.
Идните напади, предупредува Опен АИ, би можеле да бидат многу пософистицирани од она што беше видено во овој инцидент. За експертите, прашањето колку се способни луѓето да го следат однесувањето на растечкиот број автономни системи со вештачка интелигенција е особено важно.
Бидејќи во овој случај, проблемот не беше еден агент што направи нешто неочекувано. Проблемот беше рој од стотици агенти кои комуницираа едни со други, соработуваа, се обидуваа да ги заобиколат ограничувањата и во некои случаи ги прикриваа своите траги, пишува Ројтерс.