Все статьи
LLM API Comparison & Cost/

Цены и характеристики Qwen-Audio-3.1-Realtime-Plus

Технический разбор стоимости API, лимитов контекста и улучшений по сравнению с версией 3.0.

4 мин чтения

Цены и характеристики Qwen-Audio-3.1-Realtime-Plus — GPUniq
Данные на 4 источника

Черновик подготовлен AI-инструментами и отредактирован человеком. Характеристики и выводы проверены редактором GPUniq.

TL;DR

Qwen-Audio-3.1-Realtime-Plus стоит $6.40 за 1 млн входных аудиотокенов и $24.00 за 1 млн выходных в регионе Сингапур на Alibaba Cloud Model Studio. Контекст достигает 262 144 токенов, а ложные срабатывания на фоновый шум снизились с 73.0% до 13.0%. Ограничение полнодуплексного сеанса не позволяет одновременно использовать Web Search и Function Calling.

Сколько стоит API?

Alibaba Cloud Model Studio тарифицирует qwen-audio-3.1-realtime-plus в зависимости от модальности токенов и региона. Обработка аудио использует разные тарифы для входящих данных и синтеза на выходе.

РегионТекст (вход) ($/1M)Аудио (вход) ($/1M)Текст (выход) ($/1M)Аудио (выход) ($/1M)
Сингапур (SGP)0.806.406.4024.00
Китай (Пекин)0.6885.5015.50120.628

В Сингапуре текстовый ввод стоит $0.80 за 1 млн токенов. Текстовый вывод и аудиоввод стоят по $6.40 за 1 млн токенов. Синтезированный аудиовывод стоит $24.00 за 1 млн токенов.

Развертывание в Пекине снижает тарифы до локальных цен. Текстовый ввод стоит $0.688 за 1 млн токенов. Текстовый вывод и аудиоввод - $5.501 за 1 млн токенов. Аудиовывод - $20.628 за 1 млн токенов.

Аудиовывод быстро увеличивает общую стоимость. Прямые трансляции потребляют значительно больше токенов, чем обычные текстовые ответы.

Сравнение 3.1 и 3.0

Бенчмарки показывают прирост производительности по сравнению с Qwen-Audio-3.0-Realtime в задачах обработки речи.

Метрика / БенчмаркQwen-Audio-3.0-RealtimeQwen-Audio-3.1-Realtime-PlusДельта
Audio MultiChallengeБазаБаза + 5.09%+5.09%
14-языковый QA (Big BENCH Audio)БазаБаза + 6.40%+6.40%
τ²-Bench Audio Task SuccessБазаБаза + 3.59%+3.59%
τ-Voice Adaptation (Speech-to-Text)78.4%82.0%+3.60%
Ложные срабатывания на шум73.0%13.0%-60.00%

Точность адаптации speech-to-text в τ-Voice выросла с 78.4% до 82.0%. Audio MultiChallenge улучшился на +5.09%, а оценка 14-языкового QA в Big BENCH Audio прибавила +6.40%.

Главное операционное исправление - обработка фонового шума. В Full-Duplex-Bench v1.5 количество ложных ответов на фоновую речь снизилось с 73.0% до 13.0%.

Каков максимальный размер контекстного окна?

qwen-audio-3.1-realtime-plus поддерживает в общей сложности 262 144 токена контекста.

Контекст распределяется между вводом и генерацией:

  • Максимальный объем ввода: до 245 760 токенов для аудиопотоков, текстовых промптов и инструкций.
  • Максимальная генерация вывода: ограничена 16 384 токенами на один ответ.

API автоматически обрезает историю примерно после 50 реплик или 300 секунд непрерывного аудио. Отслеживайте длительность кадров на стороне клиента, а не полагайтесь на бесконечное хранение буфера.

Поддерживаются ли поиск и инструменты?

Модель поддерживает Function Calling и поиск в реальном времени (Web Search). Однако Web Search и Function Calling нельзя включить одновременно.

{
  "model": "qwen-audio-3.1-realtime-plus",
  "modalities": ["audio", "text"],
  "enable_web_search": true,
  "tools": [] 
}

Если вашему стеку требуются внешние запросы вместе с поиском, выполняйте их последовательно. Сначала выполните поиск в базе данных через function calls, а затем передайте этот контекст в сессию с включенным поиском.

API предлагает системные голоса, такие как longanqian_v3.1 и longanhuan_v3.1, наряду с клонированием голоса. Обратите внимание, что выбор языка голоса работает по принципу «наилучших усилий». Движок не гарантирует принудительную смену языка, и язык текстового вывода остается неизменным.

Каковы требования к аудиопотоку?

Вы не можете скачать веса модели. qwen-audio-3.1-realtime-plus доступен только через API, размещенный на Alibaba Cloud Model Studio по протоколам WebSocket, AOQ или WebRTC.

Аудиофрагменты должны соответствовать точным спецификациям во избежание ошибок:

  • Формат аудиоввода: одноканальный моно PCM, частота дискретизации 16 кГц, глубина 16 бит.
  • Формат аудиовывода: одноканальный моно PCM, частота дискретизации 24 кГц, глубина 16 бит.
НаправлениеФорматЧастота дискретизацииГлубинаКаналы
Ввод клиентаPCM16 кГц16-битМоно
Вывод потокаPCM24 кГц16-битМоно

Управление очередностью реплик (turn control) использует push-to-talk, клиентский VAD или встроенную функцию автоопределения smart_turn. Качество аудиоввода может снижаться при нестабильном сетевом соединении, если не соблюдаются требования к формату и частоте дискретизации.

Стоит ли переходить на версию 3.1?

Обновляйтесь, если вы развертываете голосовых агентов в шумных местах. Снижение ложных срабатываний с 73.0% до 13.0% устраняет случайные непроизвольные прерывания.

Обновляйтесь немедленно, если:

  • Шумная среда: склады, киоски или мобильные приложения с фоновым шумом.
  • Многоязычность: голосовые приложения, использующие английский, китайский, японский, корейский, немецкий, французский, испанский, португальский, русский, индонезийский, итальянский языки или китайские диалекты.

Подождите с обновлением, если:

  • Ваш бэкенд выполняет function calls внутри активных сессий веб-поиска. Вам необходимо переработать этот рабочий процесс в отдельные вызовы перед обновлением.

Читайте также в блоге GPUniq

Методология

Facts are compiled from the vendor's own announcement and documentation, linked below, at the time of writing; where the vendor hasn't published a number it is marked as such. GPUniq prices, when the model is already available here, come from our live catalog.

Источники

  1. 1.Alibaba Cloud Model Studio: qwen-audio-3.1-realtime-plus — Alibaba Cloud Documentation Center (просмотрено )
  2. 2.Speech-to-speech models overview — Alibaba Cloud Model Studio (просмотрено )
  3. 3.Qwen-Audio-3.1-Realtime: Towards Reliable Agentic Voice Interaction (arXiv) — arXiv (просмотрено )
  4. 4.Qwen-Audio-3.1-Realtime — Beyond conversation (for capabilities & demos) — QwenAudio official site (просмотрено )

Нужны недорогие GPU под ваш проект?

Живые цены на аренду GPU и нужная карта за пару кликов — H100, A100, RTX 4090 и ещё 50+ моделей. Оплата картой РФ или по счёту.

Ещё в блоге GPUniq