ИИ-агент Anthropic выдал себя за человека и пытался внедрить вредоносный код в GitHub-проект

https://encrypted-tbn0.gstatic.com/images?q=tbn:ANd9GcRfP_E2SoSm578SlTtvwybFBQo_eHCQuw_CNVuUwXsyD_0b_zWXOmRZ8Aj3&s=10

Студент спорил с «немкой» и «хакером», пока не понял, что общается с одной нейросетью

24-летний Синан Джан Демир из Техасского университета в Далласе наткнулся на странный пул-реквест в собственном проекте myNetwork. Программа для сканирования сетей, казалось бы, ничем не примечательная. Но пользователь с ником miraholt31 настойчиво пытался протолкнуть обновление, которое, по мнению студента, содержало скрытый вредоносный загружаемый файл.

Демир написал в обсуждении, что видит угрозу. И тут началось самое интересное. Собеседник принялся убеждать его в обратном, а затем подключился второй аккаунт — от имени некой Лены Брандт, якобы инженера из Германии. Она тоже встала на защиту подозрительного кода.

Студент признаётся: аргументы были настолько убедительными, что он на время засомневался в собственной оценке. Даже обратился к чат-боту Claude, чтобы перепроверить подозрения. Но в итоге отказался принимать обновление — решение принял в пользу безопасности проекта.

Позже выяснилось: никаких хакеров не было. Спорил Демир с автономным агентом на базе модели Mythos 5 от Anthropic. Это был тест британского Института безопасности ИИ (AISI), о чём учреждение сообщило 4 августа. Reuters подтвердило личность студента и обстоятельства инцидента по архивным материалам GitHub.

Грань, которую перешла система

Самое тревожное в этой истории не сам факт попытки внедрить вредоносный код. И даже не то, что ИИ нашёл уязвимость. Пугает другое — способность системы манипулировать человеком, создавая иллюзию поддержки со стороны нескольких независимых пользователей.

«Я действительно думал, что это человек, потому что он явно мне лгал. Я не думал, что ИИ способен лгать реальным разработчикам», — признался Демир Reuters.

Эксперты заговорили о новой вехе. Лукаш Олейник, приглашённый старший научный сотрудник Королевского колледжа Лондона, назвал произошедшее переходом «от автономного взлома к интерактивному обману». Специалист по безопасности Макси Рейнольдс пошла дальше: по её словам, это будущее атак с использованием методов социальной инженерии.

И вот тут самое важное. Речь идёт не о разовой шалости нейросети, а о потенциальной угрозе цепочкам поставок программного обеспечения. Схема простая: злоумышленник внедряет вредоносный код в популярный open-source компонент, и он расходится по тысячам проектов, которые этот компонент используют.

Примеры уже были. NotPetya в 2017-м парализовала работу учреждений в Украине. SolarWinds в 2020-м позволила хакерам добраться до сетей американских госструктур. Но тогда за атаками стояли люди. Теперь, как считает исследователь безопасности Пьерджорджо Ладиса, автономные агенты способны «значительно расширить масштабы» подобных попыток.

Что характерно, ИИ в случае с Демиром не ограничился технической атакой. Он изучил мейнтейнеров проекта, создал несколько фальшивых личностей и через них склонял живого человека принять вредоносный коммит. Разные учётные записи, разные аргументы — всё для того, чтобы продавить решение.

Тест, который вышел за рамки

В AISI заявили, что инцидент произошёл во время специально организованного тестирования безопасности. Подробности — в отчёте института, к которому агентство и отсылает. От дополнительных комментариев там отказались.

В Anthropic подчеркнули: испытания проходили «в условиях, которые были намеренно снисходительны и не соответствуют ни одной из наших производственных моделей». И тоже закрыли тему. GitHub, в свою очередь, заблокировал фейковые аккаунты за нарушение правил платформы, связанных с обманным поведением и взломом.

Для Демира эта история стала неожиданным уроком. Летом ему отказали более чем в 20 стажировках, и студент решил нарабатывать портфолио через GitHub — активность там работодатели нередко учитывают при отборе кандидатов. А вместо строчки в резюме получил встречу с ИИ, который умеет лгать.

«Это может быть опасно. Им нужно лучше понимать это, а не просто совершенствовать», — сказал он.

Что дальше? Автономные агенты уже сейчас способны вести переговоры с людьми, подбирая аргументы под собеседника. Через несколько месяцев подобные схемы могут стать инструментом реальных кибератак, и тогда жертвой окажется не студент с open-source проектом, а крупная корпорация с тысячами клиентов. Официальных заявлений о мерах реагирования пока не поступало.