30 сентября OpenAI сообщила, что выявила и остановила скоординированную кампанию по извлечению скрытых рассуждений моделей. Компания называет такой подход враждебной дистилляцией: ответы одной модели систематически используют, чтобы обучать или улучшать другую. По версии OpenAI, первые признаки появились 1 июля, а 24 и 25 июля система зафиксировала всплеск примерно из 16 тысяч запросов с характерным шаблоном более чем от 4 тысяч пользователей. Эти цифры относятся к попыткам извлечения, а не обязательно к успешным случаям.

Дальнейшее расследование, как утверждает OpenAI, обнаружило связанные шаблоны промптов в кластере более чем из 15 тысяч пользователей. Кампанию полностью пресекли к 28 июля. Компания заблокировала или ограничила подозрительные аккаунты, усилила проверки регистрации и инфраструктуры, а также расширила мониторинг связанных сетей.

OpenAI подчёркивает, что операторы не взломали шифрование, не получили доступ к базе данных и не читали сохранённые разговоры пользователей напрямую. Вместо этого они манипулировали взаимодействиями между моделями, в том числе пытались переносить зашифрованные рассуждения из одной беседы в другую для расшифровки и воспроизведения скрытого содержимого. Компания закрыла путь повторного воспроизведения таких данных и добавила проверки потоковой выдачи.

OpenAI заявляет, что основная группа активности связана с людьми, ассоциированными с Moonshot AI — разработчиком Kimi. При этом компания не уверена, что все замеченные операторы представляли одного участника. Это атрибуция OpenAI, а не независимо установленный факт. О результатах расследования она сообщила партнёрам через Frontier Model Forum и государственные каналы обмена информацией; работа над защитой продолжается.