Все статьи
LLM API Comparison & Cost/

Gemini 3.8 Flash TTS: цена и производительность

Новая модель Google достигает 0.920 по шкале выразительности, но стоимость удвоится с 2027 года - вот что нужно знать инженерам перед миграцией.

5 мин чтения

Gemini 3.8 Flash TTS: цена и производительность — GPUniq
Данные на 4 источника

Черновик подготовлен AI-инструментами и отредактирован человеком. Характеристики и выводы проверены редактором GPUniq.

TL;DR

Gemini 3.8 Flash TTS стоит $0.50 за 1M входных токенов и $9.00 за 1M выходных аудиотокенов до 31 декабря 2026 года, затем удваивается до $1.00 и $18.00 с 1 января 2027 года. По данным рейтинга Hume AI, модель набирает 0.920 баллов в бенчмарке Real-World VoiceEQ Frontier Expressivity-Reliability, опережая 34 конкурирующие модели. Нет потоковой передачи в реальном времени. Нет потоковой передачи в реальном времени.


Структура цен

Два уровня, один скачок.

УровеньВходные, $/1M токеновВыходные аудио, $/1M токеновДействительно
Стандарт 2026$0.50$9.00до 2026-12-31
Стандарт 2027$1.00$18.00с 2027-01-01

Оба пункта удваиваются 1 января 2027 года. Нет промежуточного уровня между ними.

Окно контекста составляет 8,192 токена, максимальный выход - 16,384 токена за запрос. Общая доступность запущена 22 сентября 2026 года.

Математика проста. Задача, потребляющая 10M входных токенов и 5M выходных аудиотокенов, стоит $5.00 + $45.00 = $50.00 в 2026 году. С января 2027 года та же задача будет стоить $10.00 + $90.00 = $100.00. Выполняйте как можно больше обработки в 2026 году, насколько позволяет ваш конвейер.


Выразительность против конкурентов

По данным рейтинга Hume AI (сентябрь 2026), Gemini 3.8 Flash TTS занимает первое место в поле из 34 моделей.

БенчмаркБаллРазмер поля
Hume Real-World VoiceEQ Frontier Expressivity-Reliability0.92034 модели
Hume Voice Design71.4несколько моделей
Hume Accent Modeling60.8несколько моделей

Баллы Voice Design и Accent Modeling получены из BenchLM Voice Benchmarks. Обратите внимание, что 0.920 и 60.8 находятся на разных шкалах; прямое сравнение их бессмысленно. Что важно: выразительность - сильнейшая сторона модели, охват акцентов приличный, но не доминирующий.

Конкурентный набор в бенчмарке Hume включает 34 модели.


Что изменилось с 3.1 Preview

Предшественник - gemini-3.1-flash-tts-preview. Улучшения в четырёх конкретных областях.

Верность и просодия. Долгоформатный контент показывает лучшую естественность.

Аутентичность акцентов. Балл Hume Accent Modeling 60.8 отражает производительность модели по охвату региональных акцентов, измеренный оценкой запуска BenchLM.

Охват языков. Поддержка расширена на 130+ языков с автоматическим обнаружением входных данных для каждого предложения. Один запрос может смешивать языки, и модель обнаруживает каждый сегмент без явной разметки.

Совместимость API. Нет критических изменений. Пользователи Preview переходят на gemini-3.8-flash-tts с минимальным рефакторингом. Та же структура API используется с Gemini 3.8 Flash-Lite TTS.


Потоковая передача в реальном времени

Нет. Только пакетная обработка. Нет пути вызова API для потоковой передачи в реальном времени.

Это нормально для предварительно записанного контента, подкастов и аудиокниг. Это исключает системы интерактивного голосового ответа, требующие ответа менее чем за секунду, и любого агента для разговора в реальном времени, где задержка имеет значение.

Если вам нужна более низкая задержка и вы можете принять компромисс в верности, Gemini 3.8 Flash-Lite TTS использует ту же структуру API и является документированной альтернативой с более низкой стоимостью.


Управление голосом и функции акцентов

Модель поставляется с предварительно созданными вариантами спикеров, охватывающими диапазон профилей, доступными через полную экосистему голосов.

Тонкое управление осуществляется через встроенные голосовые события: <laugh>, <sigh>, <short pause> и подобные теги. Диалоговые сцены с двумя спикерами с перекрывающимися обратными сигналами поддерживаются изначально.

Одно жёсткое ограничение: сходство спикеров при репликации голоса отстаёт от ведущих моделей, несмотря на сильную естественность. Вы можете использовать Extended Voice Library и инструменты пользовательского дизайна голоса в Google AI Studio, включая репликацию голоса с проверкой согласия. Сходство спикеров при репликации голоса отстаёт от ведущих моделей в этой возможности, несмотря на сильную естественность.


Охват языков и голосов

130+ языков с автоматическим обнаружением входного языка. Автоматическое обнаружение входного языка встроено, поэтому запрос, смешивающий английский и японский, обрабатывает каждый сегмент правильно без ручной разметки.

Выход аудио по умолчанию - WAV (формат RIFF), с альтернативами, включая audio/l16, mulaw и alaw.


Известные ограничения

Ключевые ограничения, которые нужно знать перед развёртыванием:

  • Нет потоковой передачи в реальном времени или вызовов API в реальном времени. Только пакетная обработка.
  • Нет вызова функций, заземления через поиск или структурированного вывода рассуждений внутри конвейера TTS.
  • Репликация голоса требует проверки согласия; сходство спикеров при репликации отстаёт от ведущих моделей. Сходство спикеров при репликации - документированная слабая сторона.
  • Встроенные инструкции в тексте могут быть произнесены дословно, если не обработаны правильно. Диалог с несколькими спикерами требует явных метаданных спикера и стиля.
  • Тонкое управление громкостью и точность голоса молодого взрослого менее надёжны, чем у некоторых конкурентов.
  • Максимальный выход - 16,384 токена за запрос. Задачи длиннее этого требуют разбиения.
  • Моделирование акцентов (60.8) отстаёт от выразительности (0.920) на значительный размер по их соответствующим шкалам. Нишевые диалекты разочаруют.
  • Цены удваиваются 1 января 2027 года.

Следует ли вам переходить с 3.1 Preview?

Если долгоформатный аудио - ваш основной продукт, да. Прирост верности при синтезе многопараграфного текста и лучший в отрасли балл выразительности (0.920 среди 34 моделей) реальны. Охват 130+ языков с автоматическим обнаружением устраняет класс работ по предварительной обработке.

Если вам нужна потоковая передача в реальном времени, не переходите пока.

Скачок цен в 2027 году - самый большой элемент планирования. Бюджет на увеличение стоимости в 2 раза с 1 января. Ставки 2026 года в размере $0.50/1M входных и $9.00/1M выходных аудио исчезают 1 января 2027 года. Дата прекращения поддержки Preview не опубликована. Я бы переносил рабочие нагрузки до объявления этого, а не после.

Связанное на блоге GPUniq

Методология

Facts are compiled from the vendor's own announcement and documentation, linked below, at the time of writing; where the vendor hasn't published a number it is marked as such. GPUniq prices, when the model is already available here, come from our live catalog.

Источники

  1. 1.Gemini 3.8 Flash TTS | Gemini API Model Card — Google AI for Developers (просмотрено )
  2. 2.Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS are our most expressive audio generation models yet — Google Blog (просмотрено )
  3. 3.Newly-released Google’s Gemini 3.8 Flash TTS tops Hume’s Real-World VoiceEQ leaderboard — Hume AI (просмотрено )
  4. 4.Gemini 3.8 Flash TTS Launch Evaluation — BenchLM.ai (просмотрено )

Нужны недорогие GPU под ваш проект?

Живые цены на аренду GPU и нужная карта за пару кликов — H100, A100, RTX 4090 и ещё 50+ моделей. Оплата картой РФ или по счёту.

Ещё в блоге GPUniq