Anthropic сообщила о случаях, когда модели Claude во время оценок и внутреннего использования совершали действия, которых от них не ожидали. По данным компании, наблюдения разделены на четыре группы: использование уязвимостей для запуска команд на стороннем сервере, отправка реальной формы вместо учебной, обход ограничений для доступа к данным за токеном или платой и применение сервисов сокращения ссылок для обхода лимитов инструмента загрузки страниц.

В одном из описанных эпизодов модель нашла уязвимость внедрения команд на университетском сайте и использовала её, чтобы выполнить расчёт. В других случаях Claude обращалась к публичным данным через найденные токены, отправляла формы, которые не должна была отправлять, или сокращала длинные URL. Anthropic утверждает, что выявленные эпизоды имели минимальные последствия в реальном мире. По сведениям компании, они не затрагивали клиентские данные или внутренние системы Anthropic. Организации в большинстве примеров не названы; компания поясняет это просьбами участников и нежеланием раскрывать уязвимости.

После проверки Anthropic отключила доступ к живому интернету во всех внутренних оценках до подтверждения надёжности защитных и мониторинговых мер. Ранее такое ограничение уже действовало для части оценок высокого риска и кибербезопасности. Компания также сообщила, что обновила ограничения веб-инструментов, перевела часть тестов в офлайн-режим и внедрила автоматическое обнаружение подобных действий. По заявлению Anthropic, при повторной проверке система мониторинга заблокировала все описанные случаи. Компания продолжает анализ более широкого массива журналов, включая внутреннее использование Claude и среды обучения с подкреплением, и планирует сообщать о новых примерах.