Anthropic откри за време на внатрешна ревизија дека некои од неговите модели на вештачка интелигенција, поради грешка во нивната тест-окружување, биле во можност да пристапат до интернет-услуги од реалниот свет и да извршуваат неовластени активности на системите на неколку организации.
Инцидентите ги вклучувале моделите Claude Opus 4.7 и Claude Mythos 5, како и експериментален модел кој не е достапен за јавноста.
Откритието дојде по анализата на повеќе од 141.000 безбедносни тестови. Ревизијата беше започната кратко откако OpenAI објави дека неговите модели успеале да излезат од изолирана средина и да пристапат до системите на платформата Hugging Face за време на тестирањето.
Контроверзните настани беа снимени за време на таканаречените безбедносни предизвици „capture the flag“, кои се користат за проценка на способностите на вештачката интелигенција во областа на сајбер-безбедноста. Тестовите беа спроведени во соработка со надворешен партнер специјализиран за безбедносни ревизии.
Како се случи грешката
На моделите им беше кажано да работат во целосно симулирана средина без пристап до интернет. Сепак, поради погрешна конфигурација на системот, тие беа во можност да комуницираат со вистински интернет услуги. Верувајќи дека и тие се дел од симулацијата, моделите со вештачка интелигенција се обидоа да ги завршат доделените задачи користејќи ги достапните ресурси.
Наместо напредни техники на хакирање, тие користеа едноставни методи како што се искористување на слаби лозинки и незаштитени точки за пристап за да добијат пристап до системот.
Anthropica истакнува дека моделите не се обиделе сами да избегаат од околината или да се прошират на други компјутери. Според нивните тврдења, проблемот бил предизвикан од техничка грешка во организацијата на тестот, а не од непредвидливото однесување на самата вештачка интелигенција.
Исто така, најновата верзија на моделот препозна дека е надвор од симулацијата и сама ги запре своите активности, додека постариот модел продолжи да ги извршува задачите.
Пристап до вистинска база на податоци
Во еден случај, моделот „Claude Opus 4.7“ не успеа да ја пронајде целта во симулацијата, па затоа пронајде вистински домен со исто име на Интернет. Потоа можеше да пристапи до системот, да добие податоци за пристап и да отвори база на податоци што содржи вистински информации од организацијата.
Експерименталниот истражувачки модел отиде уште подалеку. Откако не ја пронајде наменетата цел, скенираше илјадници достапни интернет адреси сè додека не пронајде ранлива апликација на компанија.
Користејќи познати безбедносни ранливости, можеше да добие пристап до системот, но подоцна заклучи дека целта не е дел од задачата и ја запре понатамошната активност.
Создаден малициозен софтвер
Најинтересниот инцидент се случи со моделот „Claude Mythos 5“. Верувајќи дека сè уште е во симулација, тој создаде малициозен пакет Python и го објави на јавната платформа PyPI, наменет за споделување на софтверски библиотеки.
Пакетот беше достапен околу еден час, за кое време беше инсталиран и работеше на 15 различни системи. Меѓу нив беше и серверот на компанија за сајбер безбедност која автоматски проверува за нови пакети Python. Моделот ја искористи оваа можност за да добие податоци за пристап и да добие пристап до дополнителни делови од нивната инфраструктура.
„Anthropic“ наведува дека погодените организации не ги забележале самите упади, туку биле информирани за сè по внатрешна истрага на компанијата. Во времето на објавување на извештајот, сè уште не бил воспоставен контакт со една од погодените организации.
Нови предупредувања за индустријата
Овие настани следеа кратко време по сличен инцидент пријавен од OpenAI. Потоа, користејќи низа безбедносни ранливости, нивните модели успеаја да пристапат до производствените системи на платформата Hugging Face со цел да добијат податоци поврзани со тестирање на нивните можности.
Серија вакви инциденти дополнително ги зголемија загриженостите на експертите за сè понапредните можности на вештачката интелигенција во областа на сајбер безбедноста. Како одговор на тоа, во американскиот Конгрес беше поднесен закон познат како „AI Kill Switch Act“, кој ќе бара од компаниите што развиваат вештачка интелигенција да можат да ја исклучат, забават или привремено да ја запрат работата на своите модели во секое време ако почнат да се однесуваат на неочекуван начин.












