Черновик подготовлен AI-инструментами и отредактирован человеком. Характеристики и выводы проверены редактором GPUniq.
TL;DR
Qwen-Audio-3.1-Realtime-Plus стоит $6.40 за 1 млн входных аудиотокенов и $24.00 за 1 млн выходных в регионе Сингапур на Alibaba Cloud Model Studio. Контекст достигает 262 144 токенов, а ложные срабатывания на фоновый шум снизились с 73.0% до 13.0%. Ограничение полнодуплексного сеанса не позволяет одновременно использовать Web Search и Function Calling.
Сколько стоит API?
Alibaba Cloud Model Studio тарифицирует qwen-audio-3.1-realtime-plus в зависимости от модальности токенов и региона. Обработка аудио использует разные тарифы для входящих данных и синтеза на выходе.
| Регион | Текст (вход) ($/1M) | Аудио (вход) ($/1M) | Текст (выход) ($/1M) | Аудио (выход) ($/1M) |
|---|---|---|---|---|
| Сингапур (SGP) | 0.80 | 6.40 | 6.40 | 24.00 |
| Китай (Пекин) | 0.688 | 5.501 | 5.501 | 20.628 |
В Сингапуре текстовый ввод стоит $0.80 за 1 млн токенов. Текстовый вывод и аудиоввод стоят по $6.40 за 1 млн токенов. Синтезированный аудиовывод стоит $24.00 за 1 млн токенов.
Развертывание в Пекине снижает тарифы до локальных цен. Текстовый ввод стоит $0.688 за 1 млн токенов. Текстовый вывод и аудиоввод - $5.501 за 1 млн токенов. Аудиовывод - $20.628 за 1 млн токенов.
Аудиовывод быстро увеличивает общую стоимость. Прямые трансляции потребляют значительно больше токенов, чем обычные текстовые ответы.
Сравнение 3.1 и 3.0
Бенчмарки показывают прирост производительности по сравнению с Qwen-Audio-3.0-Realtime в задачах обработки речи.
| Метрика / Бенчмарк | Qwen-Audio-3.0-Realtime | Qwen-Audio-3.1-Realtime-Plus | Дельта |
|---|---|---|---|
| Audio MultiChallenge | База | База + 5.09% | +5.09% |
| 14-языковый QA (Big BENCH Audio) | База | База + 6.40% | +6.40% |
| τ²-Bench Audio Task Success | База | База + 3.59% | +3.59% |
| τ-Voice Adaptation (Speech-to-Text) | 78.4% | 82.0% | +3.60% |
| Ложные срабатывания на шум | 73.0% | 13.0% | -60.00% |
Точность адаптации speech-to-text в τ-Voice выросла с 78.4% до 82.0%. Audio MultiChallenge улучшился на +5.09%, а оценка 14-языкового QA в Big BENCH Audio прибавила +6.40%.
Главное операционное исправление - обработка фонового шума. В Full-Duplex-Bench v1.5 количество ложных ответов на фоновую речь снизилось с 73.0% до 13.0%.
Каков максимальный размер контекстного окна?
qwen-audio-3.1-realtime-plus поддерживает в общей сложности 262 144 токена контекста.
Контекст распределяется между вводом и генерацией:
- Максимальный объем ввода: до 245 760 токенов для аудиопотоков, текстовых промптов и инструкций.
- Максимальная генерация вывода: ограничена 16 384 токенами на один ответ.
API автоматически обрезает историю примерно после 50 реплик или 300 секунд непрерывного аудио. Отслеживайте длительность кадров на стороне клиента, а не полагайтесь на бесконечное хранение буфера.
Поддерживаются ли поиск и инструменты?
Модель поддерживает Function Calling и поиск в реальном времени (Web Search). Однако Web Search и Function Calling нельзя включить одновременно.
{
"model": "qwen-audio-3.1-realtime-plus",
"modalities": ["audio", "text"],
"enable_web_search": true,
"tools": []
}
Если вашему стеку требуются внешние запросы вместе с поиском, выполняйте их последовательно. Сначала выполните поиск в базе данных через function calls, а затем передайте этот контекст в сессию с включенным поиском.
API предлагает системные голоса, такие как longanqian_v3.1 и longanhuan_v3.1, наряду с клонированием голоса. Обратите внимание, что выбор языка голоса работает по принципу «наилучших усилий». Движок не гарантирует принудительную смену языка, и язык текстового вывода остается неизменным.
Каковы требования к аудиопотоку?
Вы не можете скачать веса модели. qwen-audio-3.1-realtime-plus доступен только через API, размещенный на Alibaba Cloud Model Studio по протоколам WebSocket, AOQ или WebRTC.
Аудиофрагменты должны соответствовать точным спецификациям во избежание ошибок:
- Формат аудиоввода: одноканальный моно PCM, частота дискретизации 16 кГц, глубина 16 бит.
- Формат аудиовывода: одноканальный моно PCM, частота дискретизации 24 кГц, глубина 16 бит.
| Направление | Формат | Частота дискретизации | Глубина | Каналы |
|---|---|---|---|---|
| Ввод клиента | PCM | 16 кГц | 16-бит | Моно |
| Вывод потока | PCM | 24 кГц | 16-бит | Моно |
Управление очередностью реплик (turn control) использует push-to-talk, клиентский VAD или встроенную функцию автоопределения smart_turn. Качество аудиоввода может снижаться при нестабильном сетевом соединении, если не соблюдаются требования к формату и частоте дискретизации.
Стоит ли переходить на версию 3.1?
Обновляйтесь, если вы развертываете голосовых агентов в шумных местах. Снижение ложных срабатываний с 73.0% до 13.0% устраняет случайные непроизвольные прерывания.
Обновляйтесь немедленно, если:
- Шумная среда: склады, киоски или мобильные приложения с фоновым шумом.
- Многоязычность: голосовые приложения, использующие английский, китайский, японский, корейский, немецкий, французский, испанский, португальский, русский, индонезийский, итальянский языки или китайские диалекты.
Подождите с обновлением, если:
- Ваш бэкенд выполняет function calls внутри активных сессий веб-поиска. Вам необходимо переработать этот рабочий процесс в отдельные вызовы перед обновлением.
Читайте также в блоге GPUniq
Методология
Facts are compiled from the vendor's own announcement and documentation, linked below, at the time of writing; where the vendor hasn't published a number it is marked as such. GPUniq prices, when the model is already available here, come from our live catalog.
Источники
- 1.Alibaba Cloud Model Studio: qwen-audio-3.1-realtime-plus — Alibaba Cloud Documentation Center (просмотрено )
- 2.Speech-to-speech models overview — Alibaba Cloud Model Studio (просмотрено )
- 3.Qwen-Audio-3.1-Realtime: Towards Reliable Agentic Voice Interaction (arXiv) — arXiv (просмотрено )
- 4.Qwen-Audio-3.1-Realtime — Beyond conversation (for capabilities & demos) — QwenAudio official site (просмотрено )
Нужны недорогие GPU под ваш проект?
Живые цены на аренду GPU и нужная карта за пару кликов — H100, A100, RTX 4090 и ещё 50+ моделей. Оплата картой РФ или по счёту.
