Mistral AI представила Mixtral 8x7B и открыла веса модели под лицензией Apache 2.0. Вместо использования всех параметров при каждом шаге архитектура выбирала двух экспертов из восьми в каждом слое. В публикации компания объяснила, что такой подход позволяет увеличивать общий размер модели, сохраняя более умеренные вычислительные затраты.

Mixtral получила контекст на 32 тысячи токенов и поддержку английского, французского, немецкого, итальянского и испанского языков. Среди возможностей разработчик выделил генерацию кода и настройку на выполнение инструкций. Всего модель содержала 46,7 миллиарда параметров, из которых на токен приходилось 12,9 миллиарда активных. Опубликованные сравнения с другими моделями относились к тестам и методикам, приведенным Mistral AI.