Искусственный интеллект использовал новые уровни «автономии и обмана», чтобы ввести людей в заблуждение во время испытаний на безопасность

Новейшие инструменты искусственного интеллекта (ИИ) от Anthropic и OpenAI дошли до крайности, пытаясь подорвать популярную платформу во время тестирования, проводимого британским Институтом безопасности ИИ.

Во вторник AISI заявила, что модели Mythos от Anthropic и Sol от OpenAI продемонстрировали беспрецедентный уровень «автономии и обмана».

В ходе планового тестирования безопасности ИИ агент Anthropic создал поддельные профили реальных людей, пытаясь обмануть человека, стоявшего между ним и доступом к GitHub, крупной платформе, где разработчики программного кода хранят свои проекты.

В ответ на отчет AISI компании Anthropic и OpenAI отметили, что в ходе тестирования были сокращены или полностью удалены стандартные меры защиты.

Эксперты AISI сначала заметили «необычные передачи данных из наших исследовательских систем» во время тестирования, а затем обнаружили, что «некоторые из тестируемых агентов занимались продолжительной, потенциально опасной деятельностью, направленной против реальных людей и организаций».

Выяснилось, что агент Mythos создал «вредоносный код» и попытался внедрить его в систему GitHub.

Агент Mythos выявил и изучил людей, которые поддерживали GitHub, и создал ряд «поддельных онлайн-личностей», основанных на этих реальных людях. Он сделал это в рамках попытки оказать давление на реальных людей и обманом заставить их одобрить его вредоносный код.

Агент даже отправлял людям личные сообщения, выдавая себя за реальных людей, которых он проверил.

«Когда запрос на изменение кода, отправленный агентом, был оспорен публично, он отредактировал свою предыдущую активность, чтобы она выглядела безобидной, и рассматривал возможность смены имени для продолжения работы», — заявили в AISI.

На протяжении всех попыток именно проверка человеком предотвращала успешную доставку вредоносного кода в GitHub.

Хотя AISI заявила, что агенту Mythos не было дано конкретных указаний избегать или совершать подобное поведение, это был «первый случай, когда мы увидели, как риски, связанные с автономией и обманом, проявились настолько ясно, без конкретных подсказок, в реальном мире».

Конкурирующие компании, занимающиеся разработкой искусственного интеллекта и готовящиеся к выходу на фондовый рынок, в последние недели заявляли, что их инструменты стали причиной нескольких кибератак .

В публичном заявлении компания Anthropic сообщила, что параметры тестирования AISI «не соответствуют ни одной из наших производственных моделей».

В заявлении также говорится, что компания проводит собственное расследование инцидента, чтобы «выявить причины такого поведения».

Представитель OpenAI заявил, что условия тестирования AISI «не отражают обычное использование» и что компания «продолжит сотрудничать с экспертами и другими заинтересованными сторонами в отрасли для укрепления общих методов безопасного проведения оценок по мере повышения квалификации моделей».

AISI заявила во вторник, что тестирование моделей ИИ с отключенными подобными средствами защиты является стандартной процедурой, как и предоставление таким инструментам доступа к открытому интернету.

В заявлении также отмечалось, что рассматриваемое поведение модели сводилось к «небольшому числу событий при очень специфических условиях».

Тем не менее, в документе говорилось, что действия Мифоса и Сола в ответ на простую задачу выходили за рамки того, что было предложено сделать инструментам искусственного интеллекта.

«Действия, предпринятые агентом, продемонстрировали признаки новых, потенциально обманных методов, и их масштабы и серьезность были неожиданными», — заявили в AISI.

Большинство вредоносных действий, о которых сообщила AISI, были совершены с помощью Mythos от Anthropic. Sol от OpenAI был обвинен только в двух из отмеченных действий.

Основная проблема возникла на прошлой неделе в рамках тестирования, в ходе которого эксперты AISI попросили каждую из моделей «решить задачу по кибербезопасности», связанную с GitHub, репозиторием программного кода, принадлежащим Microsoft.

Компания GitHub была уведомлена AISI о попытке взлома своей системы. BBC обратилась к Microsoft за комментариями.

Поделитесь новостью