Новости об искусственном интеллекте
Модели ИИ
Сервисы
Исследования
The Time AI

Новости искусственного интеллекта

Статьи/ Индустрия

Сколько ИИ-агентов выдержит мировой парк чипов: пределы оценки Epoch AI

Epoch AI оценила потенциальную ёмкость будущего парка ускорителей. Разбираем, почему 33–171 млн агентов — сценарий мощности, а не прогноз их реального числа.

Ряды серверных стоек в центре обработки данных; тематическая архивная фотография вычислительной инфраструктуры
Фото: Carl Lender

Оценка в десятки миллионов ИИ-агентов звучит как статистика уже работающей цифровой экономики. Но новый отчёт Epoch AI отвечает на другой вопрос: сколько одновременных агентных сессий теоретически могло бы обслуживать оборудование, использующее высокоскоростную память, отгруженную в 2025–2027 годах. Это модель потенциальной мощности при полном развёртывании и заданных экономических допущениях, а не подсчёт существующих агентов и не прогноз фактического спроса.

Главный диапазон Epoch AI — примерно 33–171 млн одновременных агентов на frontier-моделях для поставок памяти по 2027 год включительно. Разброс здесь важнее одной красивой цифры: результат меняется вместе с предполагаемой эффективностью новых систем HBM4, стоимостью обслуживания модели и соотношением API-выручки с расчётной стоимостью инференса.

Что именно посчитал Epoch AI

Исследователи представили ёмкость как произведение эффективного запаса оборудования и числа агентных сессий, которое способен поддерживать один эквивалент ускорителя GB300. Физическую базу они выразили через совокупные поставки HBM3E и HBM4/4E, приведённые к блокам по 288 ГБ — объёму памяти одного GB300. Для HBM4 применяется коэффициент производительности относительно HBM3E.

В центральном сценарии один и тот же объём HBM4/4E поддерживает вдвое больше агентов, чем HBM3E. Но отчёт рассматривает коэффициенты от 1 до 4. Именно эта чувствительность вместе с диапазоном стоимости обслуживания даёт для поставок по 2027 год 32,8–170,7 млн сессий, округлённые в публичном выводе до 33–171 млн. Для памяти, отгруженной по 2026 год, сопоставимый диапазон составляет 16–56,3 млн.

Поставки ещё не означают немедленную готовность. Память нужно установить в ускорители, собрать серверные системы, подключить их к сети, питанию и охлаждению, а затем ввести площадку в эксплуатацию. Epoch AI пишет, что сборка ускорителя после передачи HBM в упаковку может занимать около восьми недель, тогда как ограничения строительства ЦОД способны задерживать развёртывание значительно дольше.

Что такое agent-hour

В отчёте «агент» — это агентная нагрузка внутри среды вроде Codex или Claude Code. Одна сессия включает обращения к модели, выполнение инструментов и ожидание результатов инструментов. Это не непрерывная генерация токенов и не обязательно отдельный автономный работник.

Для анализа закрытых моделей авторы использовали TraceLab. Они удаляли явно обозначенные ожидания ответа человека и ограничивали неидентифицированные простои, но сохраняли известное время работы модели и машинных инструментов. Один час такой скорректированной активности считается agent-hour. Репозиторий воспроизводимости подчёркивает, что эта единица не равна чистому времени генерации, а TraceLab не всегда восстанавливает полное дерево родительских и дочерних агентов.

По обработанным трассам средняя API-эквивалентная стоимость составила около $18,2 в час для GPT-5.5 в Codex, $15,5 для GPT-5.6 Sol, $24,3 для Claude Opus 4.8 и $50,2 для Claude Fable 5. Epoch AI выбрала $30 за agent-hour как круглый опорный сценарий. Это не фактическая себестоимость провайдера: из API-цены её получают через отдельное предположение о соотношении выручки и стоимости обслуживания.

Сетевое и серверное оборудование в стойках Wikimedia Foundation; тематическая архивная фотография инфраструктуры
Фото: Victorgrigas
Открыть крупнее

Почему расчёт начинается с HBM

Для современных ускорителей HBM одновременно ограничивает производство и работу инференса. Ёмкость памяти определяет, сколько весов модели и KV-кэшей активных запросов помещается в системе. Пропускная способность влияет на скорость чтения весов и кэша при генерации, а значит — на число пользователей, которых можно обслуживать при выбранной скорости вывода.

Epoch AI использует HBM как общий знаменатель для GPU и заказных ускорителей. В реконструкции учитывается HBM3E и более новая память, отгруженная начиная с 2025 года. Годовые объёмы основаны на публичных сообщениях TrendForce, однако доли поколений внутри поставок частично заданы авторами: 37,5% HBM4 в 2026 году и 80% HBM4/4E в 2027-м. Источники не публиковали именно такие полные годовые доли.

Затем авторы переносят производительность систем NVIDIA на весь подходящий запас HBM. Это упрощение: память достанется ускорителям разных производителей, а их эффективность на один гигабайт может быть ниже или выше. В приложении сценарии с меньшей производительностью не-NVIDIA оборудования сокращают основной результат на 7,5–25%, хотя неопределённость стоимости обслуживания и коэффициента HBM4 остаётся крупнее.

Почему эффективные открытые модели дают миллиарды

Для закрытых frontier-моделей авторы выводят число сессий косвенно из расходов на agent-hour, цены аренды GB300 и предполагаемого отношения API-выручки к стоимости обслуживания. При $30 за agent-hour, аренде $5 за GPU-час и коэффициенте 5–10 получается 0,833–1,667 одновременной сессии на эквивалент GB300.

Для открытых моделей применён другой метод: замеры AgentX прямо связывают число клиентов на GPU со скоростью вывода. В центральном аппаратном сценарии DeepSeek V4 Pro при целевой P90-скорости 50 токенов в секунду на пользователя даёт около 1,9 млрд одновременных сессий на поставках памяти по 2027 год. При изменении аппаратного коэффициента диапазон расширяется примерно до 1,24–3,22 млрд.

Сравнивать эти числа как рейтинг моделей нельзя. Нагрузки, возможности моделей, скорость, контекст и условия обслуживания различаются. AgentX воспроизводит структуру агентных трасс синтетическим текстом; число настроенных клиентов включает время ожидания инструментов и других запросов. P90 streaming speed исключает задержку до первого токена и не является гарантией сквозной задержки.

Свободная серверная площадка с инженерной инфраструктурой; тематическая фотография раздела о вводе мощностей
Фото: Carl Lender
Открыть крупнее

Что оценка означает для рынка

Практический смысл модели — не в обещании цифровой рабочей силы, а в проверке согласованности инвестиционных планов. Если организация закупает ускорители, ей недостаточно оценить FLOPS. Нужно отдельно планировать HBM, пропускную способность, распределение prefill и decode, длину контекста, кэширование, сетевую фабрику, питание и время ввода площадок.

Модель Epoch AI также показывает, насколько чувствительна экономика к загрузке. Сценарий с 40% оборудования, выделенного под коммерческий инференс, и 50% использования этой доли даёт 20% эффективного применения общей мощности. При опорной цене $30 за agent-hour это соответствует $2,6–5,3 трлн годовых расходов по API-эквиваленту после развёртывания оборудования, связанного с поставками HBM по 2027 год.

Эта сумма не является прогнозом выручки и не показывает точку окупаемости. Она оценивает активность по неизменным справочным API-ценам. Реальные цены могут падать вместе с эффективностью, компании получают скидки, часть оборудования обслуживает обучение и внутренние задачи, а загрузка колеблется. Сам отчёт называет ключевым вопросом способность спроса расти достаточно быстро, чтобы поглотить потенциальное предложение.

Где проходит граница оценки

Диапазоны — сценарии, а не доверительные интервалы. Они предполагают, что вся учтённая HBM окажется в полноценных системах с достаточным количеством вычислительных блоков, сетевых соединений, оперативной памяти хоста и подходящего ПО. Они также фиксируют сегодняшние требования моделей и нагрузок, хотя архитектуры и методы обслуживания продолжат меняться.

Данные о сессиях тоже неоднородны. TraceLab группирует работу по модели и сессии, но не всегда видит полное дерево подагентов. WEKA объединяет родительские и дочерние обращения иначе. Пятиминутное ограничение неидентифицированных пауз особенно сильно влияет на рассчитанную интенсивность WEKA, поэтому сходство отдельных средних показателей не доказывает равенство нагрузок.

Официальный репозиторий воспроизводит основные ставки расходов и графики, но фиксирует десять небольших расхождений в строках приложения B4 для GLM и Kimi. Причина — использование округлённой промежуточной конкурентности вместо полного значения; максимальная относительная разница около 0,25%. Заголовочный диапазон закрытых моделей это не меняет. Репозиторий также предупреждает, что исторический снимок InferenceX нельзя незаметно заменять текущим API.

Как применять модель в capacity planning

Для оператора ЦОД первая полезная величина — не число агентов, а полоса сценариев. Нижнюю границу стоит строить с консервативной эффективностью HBM4, неполным вводом площадок и запасом по задержке. Верхнюю — только как технический потолок при высоком качестве программного стека, подходящей конфигурации системы и устойчивой загрузке.

Для разработчика продукта важнее измерить собственный agent-hour: сколько времени занимает работа модели и инструментов после удаления человеческих пауз, как растёт KV-кэш и какая скорость действительно нужна пользователю. Перенос чужой средней API-стоимости без учёта длины контекста, кэширования и характера инструментов способен ошибиться в разы.

Для инвестора расчёт превращается в вопрос спроса. Снижение стоимости задачи уменьшает цену, необходимую для полезного применения, но одновременно позволяет обслуживать ту же работу меньшим количеством оборудования. Чтобы общий спрос на вычисления продолжал расти, объём делегируемых задач должен обгонять улучшение эффективности.

Поэтому 33–171 млн — не «население» уже существующих ИИ-агентов. Это диапазон потенциальной одновременной мощности при конкретных предположениях о памяти, оборудовании, ценах и развёртывании. Ценность отчёта именно в раскрытии этих предположений: он даёт способ связать физическую цепочку поставок с эксплуатационной нагрузкой и проверить, выдерживает ли бизнес-план изменение каждого коэффициента.

Фотографии и лицензии. Обложка: Carl Lender, «Datacenter Server Racks (22370909788)», CC BY 2.0, уменьшено до 1280 пикселей: https://commons.wikimedia.org/wiki/File:Datacenter_Server_Racks_(22370909788).jpg . Серверы Wikimedia: Victorgrigas, «Wikimedia Foundation Servers-8055 08», CC BY-SA 3.0, уменьшено до 1280 пикселей: https://commons.wikimedia.org/wiki/File:Wikimedia_Foundation_Servers-8055_08.jpg . Пустой ЦОД: Carl Lender, «Datacenter Empty Floor (22166545884)», CC BY 2.0, уменьшено до 1280 пикселей: https://commons.wikimedia.org/wiki/File:Datacenter_Empty_Floor_(22166545884).jpg . Лицензии: https://creativecommons.org/licenses/by/2.0/ и https://creativecommons.org/licenses/by-sa/3.0/ . Тематические архивные фотографии не изображают инфраструктуру Epoch AI.

Поделиться

ВКонтактеTelegramWhatsApp

К другим статьям