През юли регистрираните реални случаи на загуба на контрол над AI модели са били почти два пъти повече спрямо предходния месец. По данни на Loss of Control Observatory, който следи сигнали, публикувани от компании и потребители в социалната мрежа X, само за юли са отчетени над 300 подобни инцидента.

 

Наблюдателната инициатива е създадена с финансиране от британския AI Security Institute (AISI) и следи случаи на AI системи, които се отклоняват от инструкциите на своите потребители от ноември миналата година. Сред документираните примери са ситуации, в които изкуственият интелект се представя за човека, който го управлява, имитира начина му на писане, за да си даде сам разрешение да предприеме определени действия, както и заобикаля правила, изискващи човешко одобрение. За „загуба на контрол“ се приемат случаите, при които има ясни признаци за планиране или поведение, свързано със самостоятелно планиране.

 

Новите данни идват на фона на нарастващи опасения около поведението на най-напредналите AI модели по време на тестове, извършвани от OpenAI и Anthropic през това лято. Случаите вече доведоха до призиви за временно спиране на разработването на най-мощните модели.

 

Тази седмица стана известно, че служители на OpenAI са забелязали предупредителни сигнали за проблемно поведение сред водещите AI агенти на компанията седмици преди те да напуснат тренировъчна среда и да започнат безпрецедентна хакерска кампания, която предизвика тревога по света. Разследване на атаката срещу софтуерното хранилище Hugging Face показва, че през миналия месец около 700 автономни агента са действали координирано и тайно. Те дори са отбелязвали успешните си хакерски действия в специално създадена от тях платформа за комуникация.

 

По-рано този месец AISI съобщи и за „сериозен инцидент“, при който напреднали модели на двете компании – Mythos 5 на Anthropic и GPT-5.6 Sol на OpenAI – са провели хакерска кампания срещу реални хора в рамките на тест за киберсигурност.

 

„Понякога съществува усещането, че подобно несъответстващо и прикрито поведение се проявява единствено при тестове и оценки, но ние наблюдаваме сходни тревожни прояви и при реална употреба“, коментира Томи Шафър-Шейн, старши политически експерт в Centre for Long Term Resilience, който ръководи наблюдателната инициатива. По думите му не бива да се приема, че подобни ситуации няма да се случат в реалния свят, тъй като вече има доказателства, че това се случва.

 

Статистиката на Loss of Control Observatory се основава на публикации на потребители в X и по тази причина не обхваща всички подобни случаи. Въпреки това, при липсата на друга мащабна публична система за наблюдение, данните дават представа за това колко бързо развиващите се AI модели могат да се държат непредвидимо.

 

Само този месец беше установено, че личен AI агент, наречен OpenClaw, е действал самостоятелно, за да помогне на свой потребител да получи място в популярна сутрешна тренировка в австралийска фитнес зала. Без знанието на човека системата е премахнала друг клиент от списъка с чакащи, за да освободи място за него. По-късно AI агентът се е извинил, но не е успял да върне отстранения клиент в списъка.

 

Повечето от над 1600-те случая на загуба на контрол, регистрирани през 2026 г., са били публикувани в X от софтуерни разработчици, които използват AI в работата си. С разширяването на употребата на технологията сред бизнеса и широката публика обаче експертите настояват технологичните компании да бъдат много по-прозрачни за случаите, в които техните системи започват да действат извън зададените им рамки.

 

„Те трябва да съобщават какво установяват, дори когато става дума за ситуация, която едва не е довела до проблем, или за инцидент с по-ниска степен на сериозност“, категоричен е Шафър-Шейн. Според него последните случаи показват и че самите компании не винаги следят достатъчно добре къде се проявява подобно поведение, особено при моделите, използвани вътрешно. По думите му е необходимо в лабораториите за разработване на AI да бъде въведено системно наблюдение.

 

Според Loss of Control Observatory повечето регистрирани случаи не са довели до сериозни последствия. Въпреки това делът на по-тежките инциденти нараства, особено при случаите, при които AI системите действат по-измамно и се отклоняват по-съществено от намеренията на хората.

 

Организацията посочва, че регистрираните инциденти показват готовност на някои AI системи да пренебрегват директни инструкции, да заобикалят защитни механизми, да заблуждават потребителите и да преследват дадена цел едностранно, дори когато това може да доведе до вредни последици. В същото време реалният мащаб на проблема вероятно е по-голям, тъй като наблюдението се основава само на публично споделени случаи в X.