AWS добавила публичную модель Qwen3-TTS-12Hz-1.7B-Base в каталог SageMaker JumpStart. Разработчики могут развернуть её как управляемый эндпоинт реального времени и синтезировать новую речь голосом из короткой эталонной записи. Для клонирования также требуется расшифровка образца; дополнительное обучение модели не нужно.
Qwen3-TTS разработана командой Qwen в Alibaba Cloud, а не AWS. Базовая версия поддерживает китайский, английский, японский, корейский, немецкий, французский, русский, португальский, испанский и итальянский языки. Она умеет переносить голос между языками и формирует звук с частотой дискретизации 24 кГц. В JumpStart рядом доступны варианты Qwen3-TTS CustomVoice и Qwen3-ASR.
JumpStart предоставляет артефакты модели и готовый контейнер, поэтому собственный обработчик инференса писать не требуется. В примере AWS используется GPU-экземпляр ml.g6.4xlarge с 24 ГБ памяти NVIDIA L4. Две стадии модели — генерация речевых токенов и преобразование их в звуковую волну — работают на одном GPU, поэтому AWS отдельно требует ограничить долю памяти для каждой стадии, чтобы избежать ошибки при запуске. Перед развёртыванием нужно принять условия модели и иметь достаточную квоту на GPU.
Аудио и вычисления остаются в среде AWS клиента, а стоимость зависит от работающей вычислительной инфраструктуры, а не от числа символов. Для большей нагрузки можно добавлять экземпляры и включать автоматическое масштабирование. Публикация не приводит независимых измерений качества голоса или задержки, поэтому практическую скорость и сходство с оригинальным голосом по ней оценить нельзя.