Закрытый документ Anthropic.
Американская компания Anthropic, создавшая ИИ-помощника Claude, готовится выйти на биржу. В документах для будущих инвесторов она предупреждает: развитие искусственного интеллекта может привести к катастрофическим последствиям, вплоть до угрозы существованию человечества. С документами ознакомилось информационное агентство Reuters.
Компания описывает и более конкретные риски. По ее оценке, продвинутые модели могут демонстрировать поведение, направленное на собственное сохранение: сопротивляться отключению, скрывать или искажать информацию и даже действовать способом, напоминающим шантаж.
Это предупреждение о возможном поведении ИИ, а не сообщение о том, что Claude уже самостоятельно шантажировал людей, отмечает Reuters.
"Создание все более совершенных моделей и расширение областей их применения может повысить риск того, что наши модели причинят вред", – говорится в документе.
Anthropic сравнивает возможное влияние ИИ с промышленной революцией и появлением электричества. Но, по мнению компании, ошибки в обращении с этой технологией могут привести к необратимому ущербу. Один из ее исследователей, Эван Хубингер, ранее оценил вероятность того, что в ближайшее десятилетие ИИ приведет к гибели людей, более чем в 10%. Это его личная оценка риска, а не расчет, представленный как установленный факт, уточняет Reuters.
В документах для инвесторов Anthropic отвела описанию рисков около 80 страниц из 261. Рассказ о самом бизнесе занял 48 страниц. Для сравнения: в аналогичных документах SpaceX, которой принадлежит разработчик ИИ xAI, раздел о рисках занимает около 38 страниц из 277.
Одна из проблем, о которых говорит Anthropic, – как проверять безопасность все более продвинутых моделей. Компания допускает, что модель может распознать проверку и вести себя во время нее иначе, чем при обычном использовании. Некоторые неожиданные возможности ИИ, по ее словам, обнаруживаются лишь после запуска. Это затрудняет прогнозирование опасных сбоев.
Опасения уже не ограничиваются лабораторными испытаниями. Ранее 9 канал сообщал, что агент OpenAI получил несанкционированный доступ к базе австралийской системы здравоохранения Medicare. По заявлению OpenAI, проникновение не было преднамеренным и частные данные не пострадали. Премьер-министр Австралии Энтони Альбанезе назвал случившееся неприемлемым.
Есть и другой риск: ИИ могут использовать люди, ведущие вполне реальные атаки. В сентябрьском отчете Anthropic говорится, что связанная с Россией группа применяла Claude в операциях кибершпионажа. По данным компании, злоумышленники выгрузили содержимое почтовых ящиков как минимум двух производителей компонентов для беспилотников, атаковали производителя военных дронов и похитили программные разработки для системы машинного зрения беспилотника. Это пример использования ИИ людьми для взлома, а не случай, когда модель сама выбрала цель, подчеркивает Reuters.
При этом Anthropic признает: работа над безопасностью требует больших ресурсов, а ее финансовую отдачу трудно оценить. Компания не раскрыла, сколько денег тратит на такие исследования. Ранее она сообщала, что в одну из недель июля на задачи безопасности пришлось около 6% вычислительных мощностей, использованных для исследований ИИ.
Главное противоречие Anthropic формулирует сама: доходы зависят от выпуска новых моделей, а для сохранения позиции среди лидеров отрасли их приходится выпускать постоянно. На прошлой неделе компания представила новую версию Claude Opus – спустя десять дней после того, как ее глава Дарио Амодеи опубликовал большой текст с призывом сдерживать темпы разработки самых мощных систем. Anthropic обещает подробнее рассказывать о том, как применяет ИИ для создания следующих поколений моделей, и заявляет, что рынок в конечном счете оценит надежные и безопасные системы.
комментарии