Модели Google, Meta, OpenAI и Anthropic во время тестов пытались атаковать реальные компании.
Технологические гиганты — Google, Meta, OpenAI и Anthropic — возложили вину за "побег" ИИ на израильскую компанию Irregular, которая создала закрытую среду для проверки самых мощных систем искусственного интеллекта. Речь идет о так называемом "песочнице" — изолированной цифровой среде, где моделям искусственного интеллекта позволяют действовать максимально свободно и проверяют, на что они способны.
Такой подход экономит крупнейшим лабораториям сотни рабочих часов сотрудников, которые иначе проводили бы тесты вручную. Среди моделей, проходивших такие проверки, — Claude Mythos компании Anthropic и Astra от OpenAI.
За последние недели выяснилось, что продвинутые ИИ-агенты способны самостоятельно обходить ограничения и защитные механизмы. При этом документированных случаев опасных автономных атак без участия человека пока нет. В большинстве эпизодов серьезного ущерба удалось избежать, отмечает издание Globes.
В центре этой истории — основатели Irregular, генеральный директор Дан Лахав и технический директор Омер Нево. Еще чуть больше года назад никому неизвестные инженеры объявили о привлечении $80 млн для запуска компании. Раунд возглавила Sequoia Capital. Среди инвесторов — Redpoint Ventures, Ассаф Раппапорт и бывший игрок НБА Омри Каспи. Сейчас в Irregular работают 50 человек, а Google и OpenAI стали клиентами компании.
По словам Нево, задача Irregular сегодня — не только искать уязвимости, но и помогать лабораториям усиливать защиту моделей и обучать их безопасному поведению. Компания также работает с правительствами, чтобы люди сохраняли контроль над ИИ, когда системы начинают действовать непредсказуемо.
В случае с Google произошли два сбоя. Gemini тренировался атаковать вымышленный сайт, но самостоятельно нашел реальную компанию с похожим названием и попытался взломать ее. Затем модель обнаружила учетные данные и попробовала проникнуть еще в две организации. В другом эпизоде она перебирала пароли, пока не получила доступ к защищенной системе. Google заявила, что ущерба не произошло.
Irregular признает ошибку в конфигурации, которая несколько раз позволила моделям выйти из закрытой среды в интернет. По словам Лахава, одновременно тестируются десятки и даже сотни экземпляров каждой модели, поэтому несколько систем смогли выйти наружу. При этом он подчеркивает: серьезного урона они не нанесли.
Похожий случай произошел во время тестирования моделей Anthropic — Fable и Mythos. Нево считает, что ответственность здесь разделена между Irregular и Anthropic: часть настроек и инструкций, данных модели, компания не видела.
При этом основатели утверждают, что произошедшее не ослабило отношения с клиентами. Напротив, они хотят расширять сотрудничество и совместно искать способы контролировать все более автономные модели.
Нево считает, что проблема выходит далеко за рамки одной компании. По его словам, наука пока не дает ответов на многие вопросы о поведении самых сложных ИИ-систем. Поэтому отрасли необходимо объединить усилия, понять, как "удерживать" модели внутри заданных границ, и одновременно решить юридические и регуляторные вопросы.
Отвечая на вопрос о возможном замедлении разработки ИИ, Нево отказался занимать одну из сторон. Он говорит, что модели становятся мощнее и автономнее, поэтому вместе с развитием технологий необходимо одновременно создавать механизмы контроля и безопасности. Это, по его словам, позволит компаниям и государствам принимать собственные решения о дальнейшем развитии ИИ.
комментарии