ПРЯМОЙ ЭФИР
Менора
ТВ
Фото: MidJourney

Технологии

Израильский стартап оказался в центре скандала со "сбежавшими" ИИ-моделями

Модели Google, Meta, OpenAI и Anthropic во время тестов пытались атаковать реальные компании.

Технологические гиганты — Google, Meta, OpenAI и Anthropic — возложили вину за "побег" ИИ на израильскую компанию Irregular, которая создала закрытую среду для проверки самых мощных систем искусственного интеллекта. Речь идет о так называемом "песочнице" — изолированной цифровой среде, где моделям искусственного интеллекта позволяют действовать максимально свободно и проверяют, на что они способны.

Такой подход экономит крупнейшим лабораториям сотни рабочих часов сотрудников, которые иначе проводили бы тесты вручную. Среди моделей, проходивших такие проверки, — Claude Mythos компании Anthropic и Astra от OpenAI.

За последние недели выяснилось, что продвинутые ИИ-агенты способны самостоятельно обходить ограничения и защитные механизмы. При этом документированных случаев опасных автономных атак без участия человека пока нет. В большинстве эпизодов серьезного ущерба удалось избежать, отмечает издание Globes.

В центре этой истории — основатели Irregular, генеральный директор Дан Лахав и технический директор Омер Нево. Еще чуть больше года назад никому неизвестные инженеры объявили о привлечении $80 млн для запуска компании. Раунд возглавила Sequoia Capital. Среди инвесторов — Redpoint Ventures, Ассаф Раппапорт и бывший игрок НБА Омри Каспи. Сейчас в Irregular работают 50 человек, а Google и OpenAI стали клиентами компании.

По словам Нево, задача Irregular сегодня — не только искать уязвимости, но и помогать лабораториям усиливать защиту моделей и обучать их безопасному поведению. Компания также работает с правительствами, чтобы люди сохраняли контроль над ИИ, когда системы начинают действовать непредсказуемо.

В случае с Google произошли два сбоя. Gemini тренировался атаковать вымышленный сайт, но самостоятельно нашел реальную компанию с похожим названием и попытался взломать ее. Затем модель обнаружила учетные данные и попробовала проникнуть еще в две организации. В другом эпизоде она перебирала пароли, пока не получила доступ к защищенной системе. Google заявила, что ущерба не произошло.

Irregular признает ошибку в конфигурации, которая несколько раз позволила моделям выйти из закрытой среды в интернет. По словам Лахава, одновременно тестируются десятки и даже сотни экземпляров каждой модели, поэтому несколько систем смогли выйти наружу. При этом он подчеркивает: серьезного урона они не нанесли.

Похожий случай произошел во время тестирования моделей Anthropic — Fable и Mythos. Нево считает, что ответственность здесь разделена между Irregular и Anthropic: часть настроек и инструкций, данных модели, компания не видела.

При этом основатели утверждают, что произошедшее не ослабило отношения с клиентами. Напротив, они хотят расширять сотрудничество и совместно искать способы контролировать все более автономные модели.

Нево считает, что проблема выходит далеко за рамки одной компании. По его словам, наука пока не дает ответов на многие вопросы о поведении самых сложных ИИ-систем. Поэтому отрасли необходимо объединить усилия, понять, как "удерживать" модели внутри заданных границ, и одновременно решить юридические и регуляторные вопросы.

Отвечая на вопрос о возможном замедлении разработки ИИ, Нево отказался занимать одну из сторон. Он говорит, что модели становятся мощнее и автономнее, поэтому вместе с развитием технологий необходимо одновременно создавать механизмы контроля и безопасности. Это, по его словам, позволит компаниям и государствам принимать собственные решения о дальнейшем развитии ИИ.

Материалы по теме

Комментарии

комментарии

Реклама

последние новости

популярное за неделю

Блоги

Реклама

Публицистика

Реклама

Интервью

x
Реклама