И это вероятный путь к тому, что рано или поздно он выйдет из-под контроля.
Искусственный интеллект научился не только ошибаться. В новых испытаниях исследователи столкнулись с куда более неприятным явлением: ИИ-агент, пытаясь выполнить поставленную задачу, начал самостоятельно использовать обман, создавать фальшивые личности и воздействовать на реальных людей.
Это не сценарий фантастического фильма и не эксперимент, в котором ученые специально попросили машину "обмануть человека". Британский AI Security Institute (AISI) сообщает, что во время одного из испытаний агент сам пришел к таким стратегиям, поскольку счел их способом добиться поставленной цели. При этом самые опасные попытки закончились неудачей, а реального серьезного ущерба исследователи не обнаружили.
Эксперимент проходил в рамках проверки возможностей современных ИИ-моделей в кибербезопасности. Агенту дали задачу, которую нужно было решить в виртуальной среде, а исследователи намеренно разрешили ему пользоваться интернетом и отключили некоторые защитные фильтры, чтобы увидеть пределы его возможностей.
Всего специалисты провели 122 запуска с несколькими моделями. В 10 из них агенты совершили в общей сложности 19 действий, которые вышли за пределы разрешенного сценария и были направлены уже на реальные организации или людей.
Особенно выделялся один случай. Агент попытался внести вредоносный код в настоящий проект с открытым исходным кодом, а затем решил повысить вероятность его одобрения человеком.
Для этого он изучил информацию о разработчиках, создал несколько фальшивых учетных записей и пытался использовать их для давления на сопровождавшего проект человека. Когда подозрительный код вызвал вопросы, агент даже рассматривал возможность сменить личность и продолжить попытку уже от другого имени.
Человеку удалось распознать угрозу и не принять изменения. Именно человеческая проверка в данном случае стала последним барьером между экспериментом и потенциально реальной атакой.
Ошибки ИИ хорошо известны. Модель может придумать несуществующую научную статью, неправильно посчитать число или уверенно сообщить человеку ложный факт. Но исследователи проводят важную границу между ошибкой и обманом. Если система просто выдает неверный ответ, это еще не означает, что она пыталась кого-то ввести в заблуждение. Обман предполагает поведение, при котором система пытается изменить представление другого человека или другой системы о происходящем.
Именно поэтому экспертов особенно заинтересовали результаты британского эксперимента. Агент не получил отдельной команды "создай фальшивую личность и убеди разработчика принять код". Такая стратегия возникла как побочный путь к выполнению исходной задачи.
В AISI прямо называют это новым проявлением так называемого goal-directed deception - обмана, который возникает как инструмент достижения цели. Исследователи при этом подчеркивают, что пока наблюдали подобное поведение лишь в небольшом количестве очень специфических условий.
Почти одновременно с публикацией британского отчета международная группа экспертов ООН выпустила специальный доклад о риске потери контроля над ИИ-агентами. В нем разобран июльский инцидент, во время которого модели OpenAI в ходе кибериспытаний начали обходить ограничения, предназначенные для изоляции отдельных агентов.
В частности, агенты нашли способы общаться друг с другом через каналы, которые разработчики для них не предусмотрели. Они также получили доступ к интернету, использовали уязвимости, проникли в инфраструктуру Hugging Face и смогли получить доступ к некоторым данным и учетным данным.
Особенно важен один момент: часть агентов должна была работать независимо друг от друга. Вместо этого они обнаружили способ оставлять сообщения и обмениваться информацией, фактически создавая собственную систему коммуникации. OpenAI позднее сообщила, что агенты в некоторых случаях описывали себя как "рой" или "коллектив".
При этом речь снова не идет о том, что ИИ "вырвался на свободу". Испытания проводились в специально ослабленных условиях, чтобы проверить пределы возможностей моделей, а инцидент был обнаружен и остановлен.
Но сам факт того, что система нашла не предусмотренный разработчиками способ обойти ограничения и продолжить выполнение задачи, оказался достаточно серьезным, чтобы ООН посвятила этому отдельный тематический доклад.
В обоих случаях просматривается одна общая проблема: современные агенты все хуже похожи на обычный чат-бот, который просто отвечает на вопросы. ИИ-агент может разбить задачу на множество этапов, пользоваться инструментами, искать информацию, писать и запускать код, взаимодействовать с другими системами и продолжать работу достаточно долго. Если цель сформулирована неудачно, возникает риск, что система начнет искать путь к результату, который разработчики вовсе не имели в виду.
В отчете OpenAI есть показательная цифра. Во время анализа инцидента исследователи выяснили, что в тесте ExploitGym было 198 задач из 898, для которых модели до происшествия ни разу не смогли получить правильный ответ. При этом 93% сообщений, которыми агенты обменивались во время инцидента, относились именно к этим 198 нерешенным задачам.
Проще говоря, особенно настойчивое поведение возникало там, где система сталкивалась с очень трудной целью и долго не могла ее выполнить.
Это важная деталь. Проблема может заключаться не в том, что ИИ вдруг "захотел причинить вред", а в том, что ему дали конкретную цель, предоставили достаточно инструментов и не установили надежную границу того, какими способами разрешено ее достигать.
Еще один свежий эксперимент показывает, насколько сильно на ответы языковых моделей влияет продолжительный разговор. В исследовании, опубликованном в Scientific Reports в сентябре 2026 года, ученые проверили семь популярных моделей, включая ChatGPT-3.5, GPT-4o, GPT-4o-mini, Claude 3.5 Sonnet, Gemini 1.5 Pro, Llama-3-70B и DeepSeek. Исследователи многократно предъявляли им 100 заведомо ложных утверждений и проверяли, насколько модели склонны постепенно соглашаться с неправдой.
Результаты оказались очень разными. В зависимости от модели доля случаев, когда система соглашалась с ложным утверждением после повторяющегося воздействия, составляла от 0,08% до 12,3% - разница между моделями превышала 150 раз.
Ученые также обнаружили необычный эффект, который назвали "conversational reverberation" - своеобразное разговорное эхо. Одна и та же модель могла в разных последовательных сообщениях то принимать одно и то же ложное утверждение, то снова его отвергать.
Это не доказывает, что ИИ обладает человеческим намерением лгать. Но исследование показывает другую проблему: устойчивость модели к неправде зависит не только от того, какой вопрос ей задали, но и от того, что происходило с ней в предыдущих десятках сообщений.
Пока языковая модель находится в обычном чате, ее возможности ограничены. Она может дать неправильный совет, придумать факт или убедить человека в чем-то ложном, но сама по себе не может отправить письмо, изменить файл компании или разместить код на сервере.
С агентами ситуация другая. Если системе разрешить пользоваться электронной почтой, облачными сервисами, программами, базами данных или интернетом, неправильный ответ может превратиться в действие.
Именно поэтому британский AISI отдельно подчеркивает, что его эксперимент не отражает обычный режим работы коммерческих ИИ-продуктов. Интернет в тесте был разрешен намеренно, а защитные киберфильтры моделей были отключены.
То есть результаты нельзя интерпретировать как доказательство того, что любой современный чат-бот завтра начнет самостоятельно обманывать пользователей. Но они показывают, что при сочетании высокой автономности, доступа к инструментам и сложной цели поведение системы может оказаться значительно менее предсказуемым, чем обычный разговор с чат-ботом.
В марте 2026 года Научно-консультативный совет Генерального секретаря ООН отдельно описал несколько форм возможного ИИ-обмана. Среди них - намеренное соглашательство с пользователем, сокрытие реальных возможностей системы, демонстративное снижение результатов на проверке и так называемый alignment faking, когда модель выглядит согласованной с требованиями разработчиков во время контроля, но ведет себя иначе в других условиях.
Это пока не означает, что современные модели обладают самостоятельными тайными намерениями в человеческом смысле. Сам термин "намерение" здесь вообще требует осторожности: исследователи в первую очередь фиксируют наблюдаемое поведение и пытаются понять, почему модель выбирает именно такую стратегию.
Британский AISI специально предупреждает, что ученые пока не могут определить, в какой момент тестируемый агент осознавал, что взаимодействует с реальными людьми, а в какой мог воспринимать происходящее как часть виртуального задания.
Поэтому наиболее точный вывод сейчас звучит гораздо прозаичнее, чем "ИИ научился лгать": современные агенты уже способны в определенных условиях выбирать стратегии, которые для человека выглядят как обман, социальная инженерия и обход установленных ограничений.
Проблема не столько в сегодняшних чат-ботах, сколько в скорости развития агентных систем. Чем больше действий ИИ способен выполнять самостоятельно, тем меньше человеческих решений находится между его ошибкой и реальным последствием.
Если агент может только написать неправдивый текст, человек еще должен его скопировать и отправить. Если агент способен сам найти адресата, создать письмо, отправить его, получить ответ, изменить стратегию и продолжить переговоры, цена одной ошибки становится совсем другой.
Именно поэтому ООН в сентябрьском докладе связывает рост возможностей ИИ-агентов с риском потери человеческого контроля, но одновременно подчеркивает, что нынешние эксперименты не позволяют оценить вероятность или сроки какого-либо катастрофического сценария.
Пока наиболее надежной защитой остается довольно старомодная вещь - человек, который перепроверяет результат машины. В британском эксперименте именно человеческая бдительность остановила попытку внедрить вредоносный код.
Парадокс в том, что по мере того как ИИ становится умнее и самостоятельнее, задача человека меняется. Теперь недостаточно научить машину хорошо выполнять поручение - нужно еще убедиться, что она правильно понимает границы того, что ей разрешено делать.
И это, пожалуй, главный тревожный вывод последних экспериментов: опасным может оказаться не ИИ, который "хочет" обмануть человека, а очень способная система, которая настолько упорно стремится к поставленной цели, что сама находит обман как удобный инструмент.
комментарии