OpenAI опубликовала начальную схему safety cases для обучения передовых моделей с подкреплением. Под safety case компания понимает структурированный набор аргументов и доказательств того, что риски конкретного запуска находятся под контролем. Такой документ предлагается готовить до продолжения обучения передовых моделей, хотя сама OpenAI называет подход ориентиром в разработке, а не завершённым стандартом.
Техническая часть охватывает выравнивание поведения, изоляцию среды и мониторинг. Среди мер — проверка учебных сред, настройка автоматических оценщиков против эксплуатации уязвимостей заданий, тесты на распознавание оценки моделью и стресс-тесты худшего поведения. Отдельное правило запрещает автоматическим оценщикам видеть цепочки рассуждений (chain-of-thought) при обучении с подкреплением: иначе модель может получить стимул научиться обходить наблюдение за собственными рассуждениями. Предлагаются также многоуровневая защита инфраструктуры, неизменяемые журналы и автоматическая остановка запуска при непринятом вовремя тревожном сигнале.
Организационная проверка должна включать независимое возражение: после подготовки safety case участник другой команды ищет в нём пробелы и даёт оценку риска, а команда обучения обязана ответить на замечания. Несколько руководителей, включая ответственных за исследования и безопасность, должны иметь право вето. Аудиторам нужен достаточный доступ для проверки заявленных доказательств.
Даже после этих мер документ должен перечислять остаточные риски, которые действующие защиты не покрывают, чтобы решение об их принятии было осознанным. При инциденте предлагаются анализ первопричин, разбор организационных причин, регрессионные оценки и публичное раскрытие результатов; затронутых третьих лиц следует уведомлять как можно скорее.
Рекомендации относятся именно к обучению передовых моделей с подкреплением: для внутреннего и внешнего развёртывания нужен более широкий набор свойств безопасности. OpenAI пишет, что внедрение ещё продолжается и практики будут меняться в ближайшие недели; публикация не подтверждает внешнюю сертификацию и не гарантирует безопасность будущих запусков.