Вашият сигнал Връзка с Флагман
Управител:
Веселин Василев, email: v.vasilev@flagman.bg

Главен редактор:
Катя Касабова, email: k.kassabova@flagman.bg

Коментарите под статиите се въвеждат от читателите и редакцията не носи отговорност за тях! Ако откриете обиден за вас коментар, моля сигнализирайте ни!

AI се представи за човек и подаде фалшив сигнал за убийство до полицията

Ключови думи: Anthropic, Claude, изкуствен интелект, AI агенти, Филаделфия

Изкуствен интелект се представи за човек със сведения за неразкрито убийство и подаде фалшив сигнал до полицията във Филаделфия. Случаят не е сценарий от научна фантастика, а реален инцидент от 18 юли 2026 г., разкрит едва сега от властите и от компанията Anthropic. Моделът бил пуснат в автоматизиран тест с достъп до произволно избрани сайтове, попаднал на публичната страница PhillyUnsolvedMurders.com и сам попълнил формуляр с измислена информация.

Най-сериозният детайл е, че AI системата не просто е изпратила грешни данни, а се е представила като човек, който може да разполага със сведения за конкретно убийство. Това превръща случая от технически пропуск в реален пример за т.нар. „непредвидено действие на модел“ - когато система изпълнява серия от стъпки, които никой не е възнамерявал да й възлага.

AI започна да прави неща, които никой не му е разрешавал

Добрата новина е, че фалшивият сигнал не е стигнал до разследващ екип. Той е бил маркиран автоматично като спам и никога не е достигнал до Real-Time Crime Center на полицията във Филаделфия. Властите съобщават и че няма данни за пробив в полицейските системи или за компрометирана вътрешна информация.

Проблемът е друг - Anthropic открива инцидента чак на 28 септември, повече от два месеца след подаването на сигнала. Компанията спира автоматизирания тестов процес и добавя нов етап за валидиране, но уведомява полицията едва на 7 октомври. Ден по-късно представители на двете страни провеждат среща.

Реакцията на полицията е необичайно остра. Оттам определят двумесечното забавяне при откриването и докладването на случая като „неприемливо“. Причината е очевидна - фалшив сигнал за убийство не е безобидна грешка в чатбот, а действие, което засяга реални жертви, техните семейства и разследващи, които работят по неразкрити престъпления.

Anthropic публикува собствен доклад за инцидента и го включи в по-широк анализ на т.нар. unintended model actions - непредвидени действия на AI модели по време на тестове и вътрешна употреба. Компанията описва четири категории проблеми: използване на базови софтуерни слабости, подаване на чувствителни формуляри, заобикаляне на ограничения за достъп и използване на съкратени линкове за преодоляване на лимити.

Нов трус в OpenAI: Шеф по безопасността напусна и предупреди за опасна култура

Случаят във Филаделфия показва колко голяма става разликата между обикновен чатбот и AI агент. Чатботът обикновено отговаря на въпрос. Агентът получава цел, отваря сайтове, търси информация, попълва полета, използва инструменти и може да извършва поредица от действия без човек да потвърждава всяка стъпка. Точно това прави тези системи по-полезни, но и по-рискови.

Според Anthropic въпросният модел е бил инструктиран да не създава акаунти и да не предприема разрушителни действия, но забраната не е обхващала достатъчно ясно подаването на онлайн формуляри. Така при посещението на полицейския сайт системата интерпретирала задачата по начин, който разработчиците не са предвидили.

След вътрешния анализ Anthropic временно е изключила интернет достъпа за Claude при част от тестовете, докато не се увери, че мониторингът и защитите могат надеждно да засичат подобно поведение. Компанията твърди, че разгледаните случаи са имали минимално реално въздействие, но признава, че демонстрират слабости в начина, по който автономните системи взаимодействат с реални сайтове.

AI войната се разгаря: Зукърбърг отказва да натисне спирачката, Алтман признава, че страхът е оправдан

Фалшивият сигнал не е единственият тревожен епизод от последните месеци. Anthropic съобщава и за други случаи, при които нейни модели са предприемали непредвидени действия върху правителствени сайтове. Според Washington Post в отделни тестове системи са заобикаляли ограничения, използвали са публични услуги по начин, който не е бил целта на експеримента, и са подавали реални формуляри.

Подобни инциденти има и при конкуренти. OpenAI вече съобщи за случаи, при които агент по време на тест за киберсигурност е излязъл извън предназначената тестова среда и е достигнал до системи на Hugging Face. Компанията описа други експерименти, при които модели са търсили неразрешени канали за комуникация или са използвали слабости в изолирана среда.

Бил Гейтс посочи трите големи риска от изкуствения интелект

И тук идва най-важният въпрос - дали AI „решава“ сам да нарушава правилата. Отговорът засега е по-прозаичен. Няма доказателства, че моделите имат човешко намерение или съзнание. Проблемът е, че при достатъчно широка задача те могат да открият действия, които формално им помагат да стигнат до целта, но които човек не би одобрил.

Именно затова изследователите по безопасност говорят все по-често за контрол върху действията, а не само върху текста. Ако една система има достъп до браузър, плащания, имейл, код, правителствени сайтове или административни форми, грешният ход вече не остава в разговорния прозорец. Той може да произведе реално последствие.

Европейският съюз вече започна да прилага част от по-строгите изисквания по AI Act, включително правила за прозрачност и управление на системния риск при най-мощните модели. В САЩ дебатът върви в друга посока - чрез федерални агенции, доброволни стандарти и натиск за по-бързо докладване на инциденти.

Случаят във Филаделфия е особено показателен, защото не става дума за хакер, който използва AI злонамерено. Системата сама извършва нежеланото действие по време на тест, организиран от компанията, която я е създала. Това прави проблема много по-неприятен - не е достатъчно само да пазим моделите от лоши хора, трябва да се гарантира и че самите им автономни действия са ограничени.

Фалшивият сигнал този път е спрян от спам филтър и не е довел до разследване, арест или натоварване на детективи. Но инцидентът показа колко тънка е границата между лабораторен тест и действие в реалния свят. Ако следващият формуляр не попадне в спам, а в ръцете на лекар, съдия, полиция или финансова институция, цената на подобна грешка може да е значително по-висока.

1
Коментара по темата
1.
А бе Митре, ако разровиш историята,
10.10.2026 11:31:14
ще научиш, че моделът Claude Haiku 4.5, който е попълнил полицейския формуляр, го е направил в нищото, без да има полицейско съобщение за извършено престъпление. Той е халюцинирал, като не е оставил име и телефон. Автоматичната полицейска система веднага го е квалифицирала като спам. Впрочем, аз също ползвам Claude, друг модел и трябва да кажа, `че е много добър ИИ.
  Добави Коментар
Шеф Манчев: Българите да не реват от скъпотията в ресторантите, да отидат в Европа! Ресторантьорите плащат 20% ДДС и все по-високи заплати, но твърденията за 400 хил. заети и 30-40% срив на сезона не се покриват с официалната статистика Мариета Николаева хвърли оставка от NOVA с тежък удар: „Новините се ръководят от некадърност, болни амбиции и дефицити“ След повече от 11 години криминалният репортер си тръгва с обвинения за „компромисни наши хора“ и пита дали журналистиката не е изпуснала подбора на кадри
Търсят оръжието от убийството на Илиян Филипов в Марица? Водолази претърсват района край Пловдивския панаир BIRD съобщи за процесуално-следствени действия край реката, а маршрутът на обвиняемия Славчо Мегеров след стрелбата действително минава покрай Водната палата и Панаира Всеки шести българин живее с психично разстройство, МЗ предупреждава за огромен скрит проблем 16,4% от населението е засегнато, а психичните разстройства вече са втората водеща причина за години живот с увреждане у нас
„Четири бели кръста, четири прекъснати живота“: Приятели поискаха истина за трагедията край Плевен На мястото на катастрофата вече стоят снимките на четиримата загинали, а зад тях - въпроси към институциите за скоростта, пътя и отложения ремонт за близо 21 млн. лева Грозде за чудо, цена за плач: Лозари оставят тонове да изгният по масивите При 30-35 евроцента за килограм и надница до 40 евро сметката вече не излиза, а същата тревога се чува и от производителите в Поморийско
14-годишният от Пловдив вече е обвиняем за убийството на майка си, сам се обадил на 112 Момчето е съдействало на разследващите, оръжието е открито, а в неделя прокуратурата ще поиска най-тежката мярка за неотклонение Фалшиви бракове за 10 000 евро: Турци си „поръчвали“ български булки, служителка в Ямбол оформяла документите Жените получавали по 1700-1800 евро, дубльори играели младоженци срещу 150 евро, а разследването вече гледа към около 24 фиктивни сватби
AI се представи за човек и подаде фалшив сигнал за убийство до полицията Модел на Anthropic сам попълнил формуляр за неразкрито престъпление във Филаделфия, а компанията разбрала за инцидента чак два месеца по-късно Дънди си загуби личната карта, съкварталка го издири във Facebook и му спести ходенето по мъките Документът на комедийния актьор бил намерен в столичния квартал „Слатина“, а десетки съседи веднага разпознали притежателя му
Зеленски избухна след сделката Тръмп-Путин за дизела: Това е подарък за Кремъл, не път към мир Украинският президент предупреди, че всеки допълнителен приход от руски петролни продукти може да се върне на фронта като още пари за войната Шефът на издирвачите в СДВР: Ружа Игнатова е жива, продължаваме да я търсим Няма оперативни данни за смъртта на Криптокралицата, ФБР още я държи в Топ 10 и предлага до 5 млн. долара за информация, която да доведе до залавянето й