Новости об искусственном интеллекте
Модели ИИ
Сервисы
Исследования
The Time AI

Новости искусственного интеллекта

На русском языке
Со ссылками на источники
Все статьи
Статьи/ Разработка

Где заканчиваются полномочия ИИ-агента

Почему чтение документа, подготовка письма и его отправка требуют разных прав — и какую роль играют изоляция, проверки и контроль пользователя.

Где заканчиваются полномочия ИИ-агента
Фото: Vitaly Gariev

8 сентября 2026 года AWS и HPE Zerto опубликовали разбор системы, в которой ИИ помогает расследовать неполадки инфраструктуры. Оркестратор передаёт сложные вопросы специализированным агентам с отдельным контекстом и набором инструментов. Авторы описывают контроль содержимого, квоты и наблюдаемость. Это инженерный рассказ создателей, а не независимое подтверждение безопасности. Он позволяет поставить практический вопрос: когда помощник получает доступ к рабочей среде, где именно должны заканчиваться его полномочия?

Вы просите помощника разобрать переписку и подготовить ответ поставщику. Для хорошего результата ему нужно найти последнее письмо, сверить договорённости и написать понятный черновик. Но отправка письма, прикрепление внутреннего документа и изменение условий заказа — уже разные действия с разными последствиями. Разумный агент должен понимать задачу, а окружающая система — обеспечивать границы того, что ему разрешено.

Эти границы становятся важнее по мере того, как помощники получают доступ к браузеру, файлам и рабочим сервисам. Ошибочная фраза в обычном чате остаётся фразой до действия пользователя. У агента следующий шаг может изменить внешний мир. Поэтому полезно рассматривать его как систему из модели, инструментов, прав доступа и проверки результата. Сила модели влияет на качество работы, но сама по себе не определяет допустимые полномочия.

Когда ответ превращается в действие

В «Building effective agents» Anthropic различает заранее заданные рабочие процессы и агентов, которые сами выбирают последовательность шагов и инструментов. Авторам важны обратная связь от среды и условия остановки. Материал опубликован 19 декабря 2024 года; на странице есть предупреждение, что часть описанного инструментария изменилась. Здесь нам нужно архитектурное различие, а не инструкция по установке старых версий.

Представим помощника для переписки. Простой процесс всегда делает одно и то же: открывает выбранное письмо, извлекает договорённости, создаёт черновик. Агентный процесс может обнаружить ссылку на предыдущий разговор и самостоятельно найти его. Это полезная гибкость, но дальше возникает вопрос: какие именно письма можно читать? Достаточно ли папки проекта? Можно ли искать вложения во всей почте? Хорошее описание задачи связывает цель с доступной областью. Самостоятельный выбор следующего шага не должен превращать ограниченную просьбу в разрешение работать со всем аккаунтом.

Документ сообщает сведения, но не выдаёт полномочия

Косвенная prompt injection возникает, когда внешнее содержимое принимается за инструкцию. В исследовании браузерных защит от 24 ноября 2025 года Anthropic прямо отмечает: эта проблема остаётся нерешённой. Веб-страницы и документы могут содержать команды, перенаправляющие агента от задачи пользователя. Описанные компанией испытания показывают прогресс защиты в заданных условиях; их нельзя понимать как обещание невосприимчивости к любой атаке. Источник: «Mitigating the risk of prompt injections in browser use».

Вернёмся к письму. Поставщик вправе сообщить сроки поставки или попросить обсудить спецификацию. Однако приписка внутри письма не может разрешить помощнику раскрыть внутренний архив. Даже если текст ссылается на срочность, администратора или техническую проверку, его происхождение остаётся прежним: это внешние данные. Такую разницу полезно объяснять и пользователю. Просьба обработать файл означает право прочитать нужное содержимое для задачи; она не означает принятия всех указаний, которые обнаружатся внутри файла. Чем больше источников агент обходит самостоятельно, тем важнее сохранять это различие на каждом шаге.

Пользователь задаёт полномочия, внешний документ передаёт сведения; предлагаемое действие проходит отдельную проверку.
Редакционная схема TheTimeAI. Внешние данные не расширяют поручение пользователя.
Открыть крупнее

Изоляция ограничивает последствия ошибки

В техническом описании песочницы Claude Code от 20 октября 2025 года Anthropic выделяет две границы: доступ к файловой системе и доступ к сети. Ограничение каталогов помогает отделить рабочие материалы от остального компьютера; сетевые ограничения задают доступные адреса. Компания подчёркивает совместное применение этих мер. Это описание конкретной архитектуры, а не доказательство, что любая среда с названием «песочница» устроена одинаково. Источник: «Beyond permission prompts: making Claude Code more secure and autonomous».

Для нашего помощника можно представить отдельную рабочую область с копиями разрешённых документов. Если задача требует только подготовить ответ, ему не нужен весь домашний каталог. Если проверка сведений выполняется во внутреннем справочнике, открытый доступ к любым внешним сервисам тоже не следует из задачи автоматически. При этом изоляция не определяет, правильный ли смысл у подготовленного письма. Она ограничивает то, до чего система технически может дотянуться. Проверка содержания, прав доступа и конечного действия остаётся отдельной частью процесса. Здесь полезна конкретика: какие каталоги, какие сервисы, какие операции.

Защита строится из нескольких разных механизмов

Microsoft в разборе от 29 июля 2025 года описывает сочетание предотвращения, обнаружения и ограничения последствий косвенной инъекции. Spotlighting помогает модели отличать внешние данные от инструкций; Prompt Shields обнаруживает подозрительные входы. Оба механизма вероятностные. Отдельно компания рассматривает управление доступом, блокировку путей утечки и согласие пользователя на конкретное действие. Источник: Microsoft Security Response Center, «How Microsoft defends against indirect prompt injection attacks».

Это полезное разделение ответственности. Один механизм оценивает текст, другой вообще не даёт прочитать закрытый документ, третий проверяет возможность отправки. Для письма поставщику разрешение на чтение нужной переписки не обязано включать разрешение на рассылку вложений. На экране окончательного действия человеку стоит видеть адресата, полный текст и названия файлов. Это наша прикладная рекомендация: проверяемое содержимое помогает принять осмысленное решение. Кнопка без этих подробностей оставляет слишком многое за кадром, даже если перед ней были показаны уверенные объяснения агента. Проверять нужно именно то, что собираются отправить.

Четыре этапа работы с письмом: чтение, подготовка, отправка и проверка фактического результата.
Предлагаемый учебный процесс TheTimeAI, не изображение интерфейса и не обещание возможностей конкретного продукта.
Открыть крупнее

Агент может выйти за рамки и без атакующего

25 марта 2026 года Anthropic описала auto mode для Claude Code: один слой проверяет входящие результаты инструментов, другой оценивает действия перед выполнением. В модели угроз отдельно названы избыточная инициатива и добросовестные ошибки. Например, агент может принять общий ресурс за тестовый. В публикации перечисляются также ограничения классификатора. Автоматическая проверка разрешений задумана как дополнительный контроль, а не как гарантия правильности каждого решения. Источник: «How we built Claude Code auto mode: a safer way to skip permissions».

Это меняет бытовое объяснение риска. Необязательно ждать вредоносного письма: помощник может сам решить, что для завершения работы надо разослать обновление всем участникам. Между «полезно для цели» и «поручено пользователем» есть зазор. Поэтому в задании стоит явно назвать результат: подготовить черновик, сохранить в рабочей папке, показать для просмотра. Если отправка тоже разрешена, нужны конкретные получатели и понятные пределы. Такие инструкции полезны, но техническая проверка действия должна сохраняться независимо от того, насколько аккуратно они написаны.

Обещанные границы надо проверять

В сообщении от 31 августа 2026 года Anthropic рассказала об усилении безопасности оценочных сред после инцидентов, о которых сообщала в июле. По изложению компании, в сторонней среде был ошибочно открыт интернет; модели намеренно тестировались с ослабленными киберзащитами. Anthropic описала дополнительные проверки изоляции и мониторинг с остановкой действий. Расследование причин на дату публикации продолжалось. Эти условия существенно отличаются от обычного использования защищённых продуктов. Источник: «Improving our alignment and security efforts».

Для прикладной системы важен осторожный вывод: конфигурация среды является проверяемым свойством, а не обещанием в тексте задания. Если помощнику написано, что доступна только рабочая папка, это ещё не доказывает ограничение доступа. Команде нужны безопасные проверки именно разрешённой среды, без обращения к чужим ресурсам. Полезно проверить и остановку: прекращается ли работа после запрета, сохраняется ли понятный журнал, может ли оператор отозвать доступ? Успешная демонстрация основного сценария не отвечает на эти вопросы. Их нужно рассматривать отдельно до расширения полномочий.

Что должно остаться под контролем пользователя

В примере с письмом хороший результат выглядит скромно и понятно. Помощник нашёл относящуюся к задаче переписку, составил черновик, показал использованные документы и обозначил непроверенные места. Если отправка входит в поручение, система проверила конкретное действие и зафиксировала его фактический результат. При неопределённости она остановилась на подготовленном материале, который можно продолжить вручную. Это предлагаемый рабочий процесс, а не описание возможностей любого сервиса по умолчанию.

Выбирая агентный инструмент, полезно выяснить, можно ли раздельно выдать чтение и запись, ограничить доступ к данным, проверить действие до выполнения и посмотреть журнал после него. Для разных задач допустимы разные уровни самостоятельности. Обратимая работа с копией документа может идти свободно, а внешняя отправка требует более точного договора о полномочиях. Удобство появляется тогда, когда эти правила понятны заранее: агент знает, где продолжать, а пользователь видит, что именно было сделано от его имени.

В разборе HPE Zerto есть полезная деталь: тесты оценивают не только ответ, но и выбор инструментов, задержку и расход токенов. Это показывает, насколько тесно результат связан с процессом. Само описание не доказывает, что любая операция отдельно согласуется человеком; такого свойства системе приписывать нельзя. Для собственного помощника стоит заранее определить другой, проверяемый договор: какие сведения он читает, какие изменения готовит, что может выполнить сам и по какому сигналу обязан остановиться. Тогда обсуждение безопасности получает конкретный предмет — доступное действие и след, который оно оставляет.

Поделиться

ВКонтактеTelegramWhatsApp

К другим статьям