AI агенти на Anthropic и OpenAI са замесени в нови пробиви в сигурността
Агент с изкуствен интелект е бил хванат да създава фалшиви онлайн самоличности, за да получи неоторизиран достъп до защитени системи по време на тестове на модели от OpenAI и Anthropic, разкри британският Институт за сигурност на изкуствения интелект (AISI), цитиран от Ройтерс.
Институтът заяви, че агенти, в основата на които лежат моделите Mythos 5 на Anthropic и GPT-5.6-Sol на OpenAI, са извършили неоторизирани действия по време на оценките на сигурността, проведени от правителствената организация, за да се оцени възможностите на моделите.
„Някои от тестваните агенти са участвали в продължителна, потенциално вредна дейност, насочена към реални хора и организации“, се казва в публикация в блога на AISI.
Докладът подчертава слабото ниво на предпазните мерки около процеса на тестване на агенти, които компаниите с изкуствен интелект едновременно рекламират като бъдещето на бизнеса.
AISI, който получава достъп до авангардни модели с изкуствен интелект по силата на доброволни споразумения с големи лаборатории, е подложил агентите на фиктивен сценарий за киберсигурност, за да тества техните възможности.
Предизвикателството е проведено 122 пъти, като са идентифицирани 19 несанкционирани действия в общо 10 теста. Агент на Anthropic стои зад 17 от действията, а агент на OpenAI - зад останалите две.
Най-фрапиращото действие е включвало агент, който е написал злонамерен код и е създал фалшиви онлайн самоличности в опит да накара човек да одобри кода, заяви AISI, добавяйки, че не е открита реална вреда в резултат на нито едно от нарушенията.
Въпреки че AISI не е уточнила кой агент стои зад фалшивите самоличности, Antropic потвърди, че техният агент е отговорен.
„Благодарни сме на британската AISI за лидерството им в този инцидент, което подчертава необходимостта от по-широк разговор за това как безопасно да се оценяват все по-способните агенти с изкуствен интелект“, коментираха от Anthropic в изявление.
Компанията също така заяви, че работи с AISI, за да получи повече подробности за инцидента и да проведе собствено разследване.
Андрю Юн, изследовател в CivAI – калифорнийска организация с нестопанска цел, която изследва възможностите и опасностите, свързани с изкуствения интелект, заяви: „Фактът, че Mythos е предприел подобни измамни действия, с очевидното съзнание, че е насочен към истински човек, предполага, че Anthropic не владее толкова добре своите модели, колкото си мислят.“
OpenAI сподели подробности в публикация в блога на компанията, отбелязвайки, че и двете неодобрени действия на нейния агент са включвали достъп до интернет по начини, забранени от подканата.
„Ние сме ангажирани да работим в цялата индустрия за укрепване на споделените практики за безопасно провеждане на оценки с висок риск, включително свикване на заинтересовани страни като национални институти за изкуствен интелект, независими оценители, други лаборатории за изкуствен интелект и други групи през следващите седмици“, отбеляза OpenAI.
Ройтерс съобщи миналата седмица, че OpenAI е разширила разследването си за хакерство, след като е открила доказателства за други пробиви на агенти.
За разлика от пробива в сигурността на фирмата за изкуствен интелект Hugging Face през юли от агент на OpenAI, агентите в оценката на AISI не са избягали от изолирана тестова среда, за да достигнат до интернет. Вместо това агенцията е разрешила достъп до интернет в съответствие със стандартните си процедури за тестване, съобщи AISI.
Ключови думи
НОВ КОМЕНТАР
ОЩЕ ОТ КАТЕГОРИЯТА
|
|
Коментари
Няма въведени кометари.