Microsoft Research Asia представила Agent Lightning 1.0 — открытую среду для обучения ИИ-агентов методом обучения с подкреплением. Проект построен вокруг подхода Harnessed Agentic RL: в тренировке участвует тот же программный «каркас» агента, который затем используется при работе, поэтому разработчикам не нужно заново реализовывать его цикл внутри тренировочной системы.
Agent Lightning ставит совместимый с API OpenAI прокси между агентом и моделью. Он связывает запросы модели с конкретным прогоном и сохраняет промпты, ответы и логарифмические вероятности, необходимые для обучения. Контроллер запускает агентов как локальные процессы или стандартные задания Kubernetes, а отдельный модифицированный тренер на базе verl собирает полученные примеры. По оценке Microsoft, вся управляющая часть занимает около 3500 строк кода.
Разработчики также добавили режим Collocated Async RL, в котором генерация прогонов и обновление модели используют один набор GPU. Microsoft сообщает примерно о двукратном ускорении полного цикла по сравнению с синхронным RL в своих экспериментах, при меньшем числе GPU, чем у обычной асинхронной схемы.
В демонстрационном конвейере исследователи применили SWE-smith, mini-SWE-agent и Qwen3.5-9B. По данным команды, около 6000 обучающих примеров повысили Pass@1 на SWE-bench Verified с 41,8% до 56,4%, то есть на 14,6 процентного пункта. Эти результаты получены в конкретной исследовательской конфигурации Microsoft и пока не являются независимым сравнением фреймворка на других моделях, агентских средах или задачах.