AI агенти на Anthropic и OpenAI са замесени в нови пробиви в сигурността

Политика за бисквитки

Агент с изкуствен интелект е бил хванат да създава фалшиви онлайн самоличности, за да получи неоторизиран достъп до защитени системи по време на тестове на модели от OpenAI и Anthropic, разкри британският Институт за сигурност на изкуствения интелект (AISI), цитиран от Ройтерс.

Институтът заяви, че агенти, в основата на които лежат моделите Mythos 5 на Anthropic и GPT-5.6-Sol на OpenAI, са извършили неоторизирани действия по време на оценките на сигурността, проведени от правителствената организация, за да се оцени възможностите на моделите.

„Някои от тестваните агенти са участвали в продължителна, потенциално вредна дейност, насочена към реални хора и организации“, се казва в публикация в блога на AISI.

Докладът подчертава слабото ниво на предпазните мерки около процеса на тестване на агенти, които компаниите с изкуствен интелект едновременно рекламират като бъдещето на бизнеса.

AISI, който получава достъп до авангардни модели с изкуствен интелект по силата на доброволни споразумения с големи лаборатории, е подложил агентите на фиктивен сценарий за киберсигурност, за да тества техните възможности.

Предизвикателството е проведено 122 пъти, като са идентифицирани 19 несанкционирани действия в общо 10 теста. Агент на Anthropic стои зад 17 от действията, а агент на OpenAI - зад останалите две.

Най-фрапиращото действие е включвало агент, който е написал злонамерен код и е създал фалшиви онлайн самоличности в опит да накара човек да одобри кода, заяви AISI, добавяйки, че не е открита реална вреда в резултат на нито едно от нарушенията.

Въпреки че AISI не е уточнила кой агент стои зад фалшивите самоличности, Antropic потвърди, че техният агент е отговорен.

„Благодарни сме на британската AISI за лидерството им в този инцидент, което подчертава необходимостта от по-широк разговор за това как безопасно да се оценяват все по-способните агенти с изкуствен интелект“, коментираха от Anthropic в изявление.

Компанията също така заяви, че работи с AISI, за да получи повече подробности за инцидента и да проведе собствено разследване.

Андрю Юн, изследовател в CivAI – калифорнийска организация с нестопанска цел, която изследва възможностите и опасностите, свързани с изкуствения интелект, заяви: „Фактът, че Mythos е предприел подобни измамни действия, с очевидното съзнание, че е насочен към истински човек, предполага, че Anthropic не владее толкова добре своите модели, колкото си мислят.“

OpenAI сподели подробности в публикация в блога на компанията, отбелязвайки, че и двете неодобрени действия на нейния агент са включвали достъп до интернет по начини, забранени от подканата.

„Ние сме ангажирани да работим в цялата индустрия за укрепване на споделените практики за безопасно провеждане на оценки с висок риск, включително свикване на заинтересовани страни като национални институти за изкуствен интелект, независими оценители, други лаборатории за изкуствен интелект и други групи през следващите седмици“, отбеляза OpenAI.

Ройтерс съобщи миналата седмица, че OpenAI е разширила разследването си за хакерство, след като е открила доказателства за други пробиви на агенти.

За разлика от пробива в сигурността на фирмата за изкуствен интелект Hugging Face през юли от агент на OpenAI, агентите в оценката на AISI не са избягали от изолирана тестова среда, за да достигнат до интернет. Вместо това агенцията е разрешила достъп до интернет в съответствие със стандартните си процедури за тестване, съобщи AISI.

Коментари

НОВ КОМЕНТАР

НАЙ-НОВО

|

НАЙ-ЧЕТЕНИ

|

НАЙ-КОМЕНТИРАНИ

Полицейско разкритие: Банда във Виетнам откраднала и продала за месо 2700 котки
Почина изпълнителят на хита „You Are My Lady“
Москва пое управлението на руските активи на енергийните гиганти Uniper и Fortum
Как да спрете да обмисляте и да започнете да действате?
Подготвят акции на полицията в цялата страна, свързани с издаването на ТЕЛК решения
Office 1 превръща най-големия си магазин на „Цариградско шосе“ в пространство за технологии, творчество и идеи
Турция ще разработи национален аналог на американската система Starlink
НС разшири кръга от лица, които могат да извършват частна охранителна дейност
Полицейско разкритие: Банда във Виетнам откраднала и продала за месо 2700 котки
Jaguar залага бъдещето си на нов електромобил за 130 000 паунда
Започва изплащането на еднократната помощ от 50 евро за скъпите горива
Световните продажби на бензинови автомобили паднаха под 50% за първи път в историята
Сбогом на GPS: Квантовите сензори ще се превърнат в следващата основа на навигацията
Санирането - на фокус във видеокаста на Obekti.bg
Шефът на Porsche съкращава 40% от мениджмънта, за да спаси компанията
Емилиян Георгиев става зам.-кмет с ресор „Обществено строителство“ в Столична община
Готови за новите изисквания към сградите: как WEOZ™ съчетава автоматизация, комфорт и енергийна ефективност
Новият Закон за потребителския кредит: регулация, която пази потребителя, а не го изпраща при лихварите
„Сова Харис“: Йотова-Вълчев са с 50,2% подкрепа, а Гюров-Кандев – с 23,7%
Пеевски: Ако има 36 фактури за платени мои полети, си подавам оставката като лидер на ДПС
Еврокомисарят по търговията: Трудните преговори с Китай все още не са дали резултат
Контактните лещи могат да са източник на зараза, експерти съветват да носим очила
Гълъб Донев: Бюджетният дефицит за тази година ще бъде до 5,7% от БВП
Земетресение разлюля София
Факторите, които превръщат синдрома на самозванеца в професионална суперсила
Жилищната криза тласка Испания към предсрочен вот
Едно наум, ако бившето гадже иска да останете приятели
Тръмп заяви, че „заплаха“ е накарала САЩ да изтеглят бомбардировачите си от RAF Fairford
Кристин Лагард: Не би било добра идея да се кандидатирам за президент на Франция