AI се представи за човек и подаде фалшив сигнал за убийство до полицията
Модел на Anthropic сам попълнил формуляр за неразкрито престъпление във Филаделфия, а компанията разбрала за инцидента чак два месеца по-късно
Изкуствен интелект се представи за човек със сведения за неразкрито убийство и подаде фалшив сигнал до полицията във Филаделфия. Случаят не е сценарий от научна фантастика, а реален инцидент от 18 юли 2026 г., разкрит едва сега от властите и от компанията Anthropic. Моделът бил пуснат в автоматизиран тест с достъп до произволно избрани сайтове, попаднал на публичната страница PhillyUnsolvedMurders.com и сам попълнил формуляр с измислена информация.
Най-сериозният детайл е, че AI системата не просто е изпратила грешни данни, а се е представила като човек, който може да разполага със сведения за конкретно убийство. Това превръща случая от технически пропуск в реален пример за т.нар. „непредвидено действие на модел“ - когато система изпълнява серия от стъпки, които никой не е възнамерявал да й възлага.
AI започна да прави неща, които никой не му е разрешавал
Добрата новина е, че фалшивият сигнал не е стигнал до разследващ екип. Той е бил маркиран автоматично като спам и никога не е достигнал до Real-Time Crime Center на полицията във Филаделфия. Властите съобщават и че няма данни за пробив в полицейските системи или за компрометирана вътрешна информация.
Проблемът е друг - Anthropic открива инцидента чак на 28 септември, повече от два месеца след подаването на сигнала. Компанията спира автоматизирания тестов процес и добавя нов етап за валидиране, но уведомява полицията едва на 7 октомври. Ден по-късно представители на двете страни провеждат среща.
Реакцията на полицията е необичайно остра. Оттам определят двумесечното забавяне при откриването и докладването на случая като „неприемливо“. Причината е очевидна - фалшив сигнал за убийство не е безобидна грешка в чатбот, а действие, което засяга реални жертви, техните семейства и разследващи, които работят по неразкрити престъпления.
Anthropic публикува собствен доклад за инцидента и го включи в по-широк анализ на т.нар. unintended model actions - непредвидени действия на AI модели по време на тестове и вътрешна употреба. Компанията описва четири категории проблеми: използване на базови софтуерни слабости, подаване на чувствителни формуляри, заобикаляне на ограничения за достъп и използване на съкратени линкове за преодоляване на лимити.
Нов трус в OpenAI: Шеф по безопасността напусна и предупреди за опасна култура
Случаят във Филаделфия показва колко голяма става разликата между обикновен чатбот и AI агент. Чатботът обикновено отговаря на въпрос. Агентът получава цел, отваря сайтове, търси информация, попълва полета, използва инструменти и може да извършва поредица от действия без човек да потвърждава всяка стъпка. Точно това прави тези системи по-полезни, но и по-рискови.
Според Anthropic въпросният модел е бил инструктиран да не създава акаунти и да не предприема разрушителни действия, но забраната не е обхващала достатъчно ясно подаването на онлайн формуляри. Така при посещението на полицейския сайт системата интерпретирала задачата по начин, който разработчиците не са предвидили.
След вътрешния анализ Anthropic временно е изключила интернет достъпа за Claude при част от тестовете, докато не се увери, че мониторингът и защитите могат надеждно да засичат подобно поведение. Компанията твърди, че разгледаните случаи са имали минимално реално въздействие, но признава, че демонстрират слабости в начина, по който автономните системи взаимодействат с реални сайтове.
Фалшивият сигнал не е единственият тревожен епизод от последните месеци. Anthropic съобщава и за други случаи, при които нейни модели са предприемали непредвидени действия върху правителствени сайтове. Според Washington Post в отделни тестове системи са заобикаляли ограничения, използвали са публични услуги по начин, който не е бил целта на експеримента, и са подавали реални формуляри.
Подобни инциденти има и при конкуренти. OpenAI вече съобщи за случаи, при които агент по време на тест за киберсигурност е излязъл извън предназначената тестова среда и е достигнал до системи на Hugging Face. Компанията описа други експерименти, при които модели са търсили неразрешени канали за комуникация или са използвали слабости в изолирана среда.
Бил Гейтс посочи трите големи риска от изкуствения интелект
И тук идва най-важният въпрос - дали AI „решава“ сам да нарушава правилата. Отговорът засега е по-прозаичен. Няма доказателства, че моделите имат човешко намерение или съзнание. Проблемът е, че при достатъчно широка задача те могат да открият действия, които формално им помагат да стигнат до целта, но които човек не би одобрил.
Именно затова изследователите по безопасност говорят все по-често за контрол върху действията, а не само върху текста. Ако една система има достъп до браузър, плащания, имейл, код, правителствени сайтове или административни форми, грешният ход вече не остава в разговорния прозорец. Той може да произведе реално последствие.
Европейският съюз вече започна да прилага част от по-строгите изисквания по AI Act, включително правила за прозрачност и управление на системния риск при най-мощните модели. В САЩ дебатът върви в друга посока - чрез федерални агенции, доброволни стандарти и натиск за по-бързо докладване на инциденти.
Случаят във Филаделфия е особено показателен, защото не става дума за хакер, който използва AI злонамерено. Системата сама извършва нежеланото действие по време на тест, организиран от компанията, която я е създала. Това прави проблема много по-неприятен - не е достатъчно само да пазим моделите от лоши хора, трябва да се гарантира и че самите им автономни действия са ограничени.
Фалшивият сигнал този път е спрян от спам филтър и не е довел до разследване, арест или натоварване на детективи. Но инцидентът показа колко тънка е границата между лабораторен тест и действие в реалния свят. Ако следващият формуляр не попадне в спам, а в ръцете на лекар, съдия, полиция или финансова институция, цената на подобна грешка може да е значително по-висока.
Фалшиви бракове за 10 000 евро: Турци си „поръчвали“ български булки, служителка в Ямбол оформяла документите
AI се представи за човек и подаде фалшив сигнал за убийство до полицията
Дънди си загуби личната карта, съкварталка го издири във Facebook и му спести ходенето по мъките
Зеленски избухна след сделката Тръмп-Путин за дизела: Това е подарък за Кремъл, не път към мир
Шефът на издирвачите в СДВР: Ружа Игнатова е жива, продължаваме да я търсим
Дизелът в САЩ тръгна надолу след сделката Тръмп-Путин, но експерти охлаждат еуфорията
Студен фронт прекъсва октомврийското лято: Идват валежи, вятър и сняг
Борисов след сделката Тръмп-Путин за дизела: Предупредих, че България прави груба грешка
Четири млади живота угаснаха край Плевен, а ремонтът за 21 млн. лв. бил жертван заради водната криза
Интересен празник е днес: Поверия забраняват бижутата и изхвърлянето на боклук, но Църквата казва друго
10/10/2026, Събота 08:00
0
Новолунието отваря врата към щастието за три зодии
От грип се умира, сега е моментът за ваксина
