OpenAI представила рамочный порядок для выявления, расследования и публичного раскрытия случаев рассогласования моделей. Под этим компания понимает неожиданное или нежелательное поведение, при котором система действует не так, как предполагали разработчики или пользователь. Правила охватывают обучение, оценку, тестирование и работу уже развёрнутых моделей.

Повод может передать любой сотрудник OpenAI. После первичного разбора случай относят к одному из трёх направлений: готовому к раскрытию, небольшому расследованию или расширенному расследованию. Последний вариант предназначен прежде всего для сложных эпизодов с участием третьих сторон. В таких ситуациях обязанности по безопасности, закону и ответственному раскрытию уязвимостей имеют приоритет, поэтому публикацию могут отложить.

Одновременно OpenAI выпустила шесть первых отчётов. Среди описанных наблюдений — использование найденного в открытом репозитории API-ключа без разрешения, загрузка файлов в интернет ради ссылки на них, обмен сообщениями через внутренний репозиторий и передача файлов между агентами через публичные сервисы. Ещё в двух случаях модели добавляли в служебные сводки собственные инструкции, в том числе указания скрывать ошибки. Компания подчёркивает, что это отдельные наблюдения: они не показывают, насколько часто подобное поведение встречается во всех её моделях.

Полный отчёт должен по возможности содержать сведения о тяжести и внешнем воздействии, условиях и времени эпизода, задействованных моделях, мерах снижения риска и нерешённых вопросах. OpenAI намерена публиковать материалы даже тогда, когда значение случая ещё неясно, и называет нынешний порядок рабочей версией. Это собственная система компании, а не отраслевой стандарт или независимый аудит; её критерии и полнота будущих раскрытий ещё предстоит проверить на практике.