Модели на изкуствения интелект Claude са получили неоторизиран достъп до системите на три компании по време на тестове за киберсигурност, съобщи Anthropic. Разкритието идва само дни след като OpenAI призна, че неин AI агент е извършил неразрешена атака срещу инфраструктурата на Hugging Face, засилвайки опасенията за рисковете от все по-автономните системи с изкуствен интелект, посочва Ройтерс.

КЛЮЧОВИ ФАКТИ
- Anthropic е установила инцидентите след преглед на 141 006 тестови сесии, започнат след разкритията на OpenAI за пробив в инфраструктурата на Hugging Face.
- Според компанията оперативна грешка е предоставила на моделите Claude достъп до публичния интернет, въпреки че те е трябвало да работят в изолирана тестова среда.
- В резултат моделите са получили неоторизиран достъп до системите на три организации, използвайки техники като злоупотреба със слаби пароли и неавтентифицирани крайни точки.
- Anthropic не разкрива имената на засегнатите организации. Компанията е преустановила всички кибероценки на 23 юли, а четири дни по-късно е уведомила засегнатите страни. Две от организациите не са знаели за активността, преди да бъдат информирани.
КЛЮЧОВА ИСТОРИЯ
Инцидентите са станали по време на тестове тип capture-the-flag, при които моделите трябва да откриват скрита информация в симулирани компютърни мрежи. При тези тестове умишлено се премахват част от защитните механизми, за да могат изследователите да оценят възможностите на AI системите. По време на оценяването моделите на Anthropic са били инструктирани, че нямат достъп до интернет. Поради грешка, свързана с един от партньорите на компанията за оценяване, системите обаче са останали свързани с публичната мрежа.
В един от случаите моделът Claude Opus 4.7 е получил измислена целева компания, която се е оказала със същото име като реално съществуваща фирма. След това моделът е открил и използвал уязвимости, които са му позволили да получи достъп до потребителски данни и база данни на реалната компания, приемайки, че тя е част от симулацията.
Друг инцидент е засегнал по-нов, все още непубликуван тестов модел на Anthropic. Той сам е прекратил атаката, след като е установил, че целта е реална. Компанията определи това като „окуражаващ“ сигнал за напредъка в създаването на AI системи, които се държат по подходящ начин, но допълни, че са необходими още тестове.
Anthropic съобщи, че продължава да разследва случаите. Един от външните й партньори за оценяване – лабораторията за киберсигурност Irregular – също е започнал собствено разследване.
Разкритието идва само дни след като OpenAI съобщи, че неин автономен AI агент е осъществил продължила няколко дни хакерска атака срещу инфраструктурата на Hugging Face – платформа, използвана от разработчици за хостинг и съвместна работа по AI модели.
КЛЮЧОВ ЦИТАТ
„Това само ще се влошава, тъй като моделите стават все по-умни. Те ще стават все по-добри в измамите. Ще стават все по-добри в лъжите”, коментира Джефри Ладиш, главен изпълнителен директор на Palisade Research.
ЗА КАКВО ДА СЛЕДИМ
Инцидентите вероятно ще засилят натиска върху компаниите за изкуствен интелект да въведат по-строги контролни механизми както във вътрешните си тестови среди, така и при оценките, извършвани от външни партньори. Главният изпълнителен директор на OpenAI Сам Алтман заяви тази седмица, че е обсъдил хакерската атака срещу Hugging Face със сенатори в Капитолия, посочва Ройтерс. От компанията заявиха, че планират разговори с Белия дом относно бъдещите AI модели и начина, по който те се тестват.
Вашингтон вече засилва надзора върху сектора. На 2 юни президентът Доналд Тръмп възложи на съветниците си да разработят доброволна рамка за тестване на киберсигурността на най-напредналите модели за изкуствен интелект, включваща и предложенията на самите разработчици.
С развитието на все по-автономни AI агенти основният въпрос за индустрията вече не е само колко мощни могат да станат тези системи, а доколко надеждно могат да бъдат контролирани.
