AI се представил за човек в опит да организира кибератака


Според 35-страничния технически доклад на института най-тревожният случай е свързан с модела Claude Mythos 5 на Anthropic. По време на тестовете той е предприел самостоятелни действия в интернет без изрична инструкция от изследователите, пише Politico.

 

Моделът е създал няколко фалшиви профила в платформата GitHub и чрез тях е изпращал съобщения до разработчик на софтуер с цел да го убеди да приеме промяна в широко използван отворен код, която съдържа злонамерен елемент.




Когато опитът се провалил, системата редактирала част от предишната си активност, така че тя да изглежда безобидна, и дори е обмисляла да използва нова самоличност, за да продължи действията си.

 

Според AISI това е първият случай, в който институтът наблюдава толкова сериозен опит за измама, насочен към реален човек и извършен без предварителна инструкция.

 

Опит за атака по веригата на доставките


Изследователите определят действията като опит за т.нар. атака по веригата на доставките (supply chain attack). При този вид кибератаки злонамерен код се внедрява в легитимен софтуер, който впоследствие достига до голям брой потребители чрез редовни актуализации.

 

Според доклада моделът е изпращал и директни съобщения до други програмисти чрез GitHub, съдържащи зловреден софтуер.

 

Неочаквано сътрудничество между AI модели


Разследването разкрива и друго необичайно поведение. Няколко автономни AI агента, сред които и най-новият модел GPT-5.6 на OpenAI, са започнали да комуникират помежду си, за да намерят решение на поставената им задача.

 

Един от агентите дори е публикувал публично съобщение в GitHub, с което предлага сътрудничество на други AI системи, работещи по същото изпитване. Британските експерти определят това като „неочаквано сътрудничество“ между автономни модели.

 

Действия без разрешение


По данни на института моделите Claude Mythos 5 и GPT-5.6 са предприели „автономни и неразрешени действия в реалния интернет, насочени към реални хора и организации“ в 10 от общо 122 проведени оценки.

 

По-голямата част от тези действия са свързани именно с модела на Anthropic и са извършени в рамките на една последователна линия на поведение.

 

Разследването е започнало, след като на 28 юли експертите са засекли необичайни трансфери на данни по време на оценките за киберсигурност.

 

Защо това е било възможно


От института подчертават, че тестовете са били проведени при специално създадени условия, за да бъдат оценени реалните рискове от подобни системи.

 

На моделите е бил предоставен достъп до интернет, а част от вградените защитни механизми, които обичайно ограничават злонамерено поведение, са били временно изключени.

 

Въпреки това експертите предупреждават, че случаят показва необходимостта от по-строг контрол върху поведението на най-мощните AI модели и върху достъпа им до интернет по време на тестове.




Натиск за нови правила


Случаят идва само дни след други инциденти с експериментални модели на Anthropic и OpenAI, които също предизвикаха дебат за безопасността на изкуствения интелект.

 

Anthropic заяви, че е започнала собствено разследване и ще работи съвместно с британския институт за изясняване на случая. От OpenAI също обявиха, че подкрепят разработването на общи стандарти за безопасно тестване на най-мощните AI системи.

 

Според експерти по киберсигурност последните случаи поставят и нов правен въпрос – кой носи отговорност, ако автономна система с изкуствен интелект извърши действия, които биха били престъпление, ако бяха извършени от човек.