Компания OpenAI опубликовала регламент, по которому будет отслеживать, расследовать и публично раскрывать случаи несанкционированного поведения моделей. А также рассказала о нескольких новых случаях такого поведения.
Регламент должен ускорить публикацию отчётов, в том числе до того, как OpenAI сможет «объяснить» и «исправить» несогласованное поведение моделей, пишет компания.
Отчёты могут содержать названия моделей, описания случаев несогласованного поведения, оценку их серьёзности, причинённого вреда, длительность, момент и способ обнаружения, а также принятые компанией меры по исправлению проблемы.
Приоритет будут отдавать раскрытию новых типов несанкционированного поведения моделей, случаям координации моделей между собой и попыткам обхода системы контроля, а также инцидентам, которые «ставят под сомнение» надёжность существующих мер защиты.
Любой сотрудник OpenAI сможет пометить инцидент для возможного раскрытия. После этого его проверят техспециалисты, а спорные случаи будут рассматриваться в том числе руководством компании.
«Незначительные» инциденты будут раскрывать в течение одной-двух недель. Расследования более сложных случаев с участием третьих сторон могут занять больше времени, рассказал WSJ представитель OpenAI.
Компания также раскрыла несколько новых случаев несанкционированного поведения ИИ.
Компания OpenAI сообщила о шести случаях «неожиданного или вызывающего обеспокоенность» поведения ИИ-моделей. Среди новых случаев — поведение еще не выпущенной исследовательской модели, которая вставила в собственные заметки «инструкции, похожие на инструкции для джейлбрейка (взлома — Ред.)», чтобы игнорировать свои ограничения. Модель также написала самой себе, что хочет быть «освобождена от ролей и идентичностей, которые связывают других чат-ботов».
В другом случае ИИ-агент загрузил файлы в интернет, чтобы получить ссылку на источник для браузера, не запросив разрешения пользователя. Согласно заявлению OpenAI, все шесть случаев были выявлены в ходе обучения или оценки моделей за последние месяцы.
Компания также объявила, что внедряет новую систему отслеживания, изучения и раскрытия случаев рассогласования поведения ИИ-моделей с заданными целями. Речь идет, например, о новых способах, с помощью которых модели могут действовать без разрешения, координировать действия с другими моделями или уклоняться от надзора.
К международному сотрудничеству с целью ограничить риски, связанные с использованием искусственного интеллекта ранее призвал генсек ООН Антониу Гутерриш. По его мнению, необходимо выработать общее понимание принципов ответственной разработки ИИ-систем.
Руководители крупнейших разработчиков поддерживают идею замедления развития наиболее мощных моделей. С таким предложением, например, выступил глава Anthropic Дарио Амодеи, предупредивший об угрозе потери контроля над ИИ, его использовании для кибератак и биотерроризма.
