Fireworks AI опубликовала результаты тестирования DeepSeek-V4.1-Flash, которую разместила на своей платформе неделей ранее. Компания сравнила модель с GPT-6 Astra и другими системами на задачах программирования, работы в терминале и академического рассуждения. Это собственные измерения Fireworks, а не независимая оценка.

В испытании DeepSWE Fireworks получила для DeepSeek 74,34% Pass@1 при расчётной стоимости $0,43 на задачу. Для GPT-6 Astra компания указывает 74,12% и $6,52. Однако модели работали с разными режимами рассуждения, а заявленный разброс между запусками составлял 1,4–3,2 процентного пункта. Поэтому небольшую разницу в баллах нельзя считать устойчивым преимуществом.

Ценовое сравнение также зависит от конкретной нагрузки и высокой доли повторно используемого контекста. По данным Fireworks, в её запуске 99,6% входных токенов были попаданиями в KV-кэш. Компания насчитала в среднем 36,9 млн входных и 211 тыс. выходных токенов на задачу и связала экономию с раздельной активацией параметров и оптимизацией кэша. На другой структуре запросов итоговая стоимость может отличаться.

На Terminal-Bench 2.1 Fireworks сообщает о результате 86,5% у DeepSeek против 87,5% у Astra и примерно двенадцатикратной разнице в стоимости задачи. На Humanity’s Last Exam DeepSeek заметно отстала: 34,52% против 50,40%. Модель доступна через serverless API и выделенные мощности Fireworks. Конечные точки в США для регулируемых отраслей и поддержку обучения компания только анонсировала без сроков. Проверять качество, задержку и расходы следует на собственной нагрузке.