Черновик подготовлен AI-инструментами и отредактирован человеком. Характеристики и выводы проверены редактором GPUniq.
TL;DR
Gemini 3.8 Flash TTS стоит $0.50 за 1M входных токенов и $9.00 за 1M выходных аудиотокенов до 31 декабря 2026 года, затем удваивается до $1.00 и $18.00 с 1 января 2027 года. По данным рейтинга Hume AI, модель набирает 0.920 баллов в бенчмарке Real-World VoiceEQ Frontier Expressivity-Reliability, опережая 34 конкурирующие модели. Нет потоковой передачи в реальном времени. Нет потоковой передачи в реальном времени.
Структура цен
Два уровня, один скачок.
| Уровень | Входные, $/1M токенов | Выходные аудио, $/1M токенов | Действительно |
|---|---|---|---|
| Стандарт 2026 | $0.50 | $9.00 | до 2026-12-31 |
| Стандарт 2027 | $1.00 | $18.00 | с 2027-01-01 |
Оба пункта удваиваются 1 января 2027 года. Нет промежуточного уровня между ними.
Окно контекста составляет 8,192 токена, максимальный выход - 16,384 токена за запрос. Общая доступность запущена 22 сентября 2026 года.
Математика проста. Задача, потребляющая 10M входных токенов и 5M выходных аудиотокенов, стоит $5.00 + $45.00 = $50.00 в 2026 году. С января 2027 года та же задача будет стоить $10.00 + $90.00 = $100.00. Выполняйте как можно больше обработки в 2026 году, насколько позволяет ваш конвейер.
Выразительность против конкурентов
По данным рейтинга Hume AI (сентябрь 2026), Gemini 3.8 Flash TTS занимает первое место в поле из 34 моделей.
| Бенчмарк | Балл | Размер поля |
|---|---|---|
| Hume Real-World VoiceEQ Frontier Expressivity-Reliability | 0.920 | 34 модели |
| Hume Voice Design | 71.4 | несколько моделей |
| Hume Accent Modeling | 60.8 | несколько моделей |
Баллы Voice Design и Accent Modeling получены из BenchLM Voice Benchmarks. Обратите внимание, что 0.920 и 60.8 находятся на разных шкалах; прямое сравнение их бессмысленно. Что важно: выразительность - сильнейшая сторона модели, охват акцентов приличный, но не доминирующий.
Конкурентный набор в бенчмарке Hume включает 34 модели.
Что изменилось с 3.1 Preview
Предшественник - gemini-3.1-flash-tts-preview. Улучшения в четырёх конкретных областях.
Верность и просодия. Долгоформатный контент показывает лучшую естественность.
Аутентичность акцентов. Балл Hume Accent Modeling 60.8 отражает производительность модели по охвату региональных акцентов, измеренный оценкой запуска BenchLM.
Охват языков. Поддержка расширена на 130+ языков с автоматическим обнаружением входных данных для каждого предложения. Один запрос может смешивать языки, и модель обнаруживает каждый сегмент без явной разметки.
Совместимость API. Нет критических изменений. Пользователи Preview переходят на gemini-3.8-flash-tts с минимальным рефакторингом. Та же структура API используется с Gemini 3.8 Flash-Lite TTS.
Потоковая передача в реальном времени
Нет. Только пакетная обработка. Нет пути вызова API для потоковой передачи в реальном времени.
Это нормально для предварительно записанного контента, подкастов и аудиокниг. Это исключает системы интерактивного голосового ответа, требующие ответа менее чем за секунду, и любого агента для разговора в реальном времени, где задержка имеет значение.
Если вам нужна более низкая задержка и вы можете принять компромисс в верности, Gemini 3.8 Flash-Lite TTS использует ту же структуру API и является документированной альтернативой с более низкой стоимостью.
Управление голосом и функции акцентов
Модель поставляется с предварительно созданными вариантами спикеров, охватывающими диапазон профилей, доступными через полную экосистему голосов.
Тонкое управление осуществляется через встроенные голосовые события: <laugh>, <sigh>, <short pause> и подобные теги. Диалоговые сцены с двумя спикерами с перекрывающимися обратными сигналами поддерживаются изначально.
Одно жёсткое ограничение: сходство спикеров при репликации голоса отстаёт от ведущих моделей, несмотря на сильную естественность. Вы можете использовать Extended Voice Library и инструменты пользовательского дизайна голоса в Google AI Studio, включая репликацию голоса с проверкой согласия. Сходство спикеров при репликации голоса отстаёт от ведущих моделей в этой возможности, несмотря на сильную естественность.
Охват языков и голосов
130+ языков с автоматическим обнаружением входного языка. Автоматическое обнаружение входного языка встроено, поэтому запрос, смешивающий английский и японский, обрабатывает каждый сегмент правильно без ручной разметки.
Выход аудио по умолчанию - WAV (формат RIFF), с альтернативами, включая audio/l16, mulaw и alaw.
Известные ограничения
Ключевые ограничения, которые нужно знать перед развёртыванием:
- Нет потоковой передачи в реальном времени или вызовов API в реальном времени. Только пакетная обработка.
- Нет вызова функций, заземления через поиск или структурированного вывода рассуждений внутри конвейера TTS.
- Репликация голоса требует проверки согласия; сходство спикеров при репликации отстаёт от ведущих моделей. Сходство спикеров при репликации - документированная слабая сторона.
- Встроенные инструкции в тексте могут быть произнесены дословно, если не обработаны правильно. Диалог с несколькими спикерами требует явных метаданных спикера и стиля.
- Тонкое управление громкостью и точность голоса молодого взрослого менее надёжны, чем у некоторых конкурентов.
- Максимальный выход - 16,384 токена за запрос. Задачи длиннее этого требуют разбиения.
- Моделирование акцентов (60.8) отстаёт от выразительности (0.920) на значительный размер по их соответствующим шкалам. Нишевые диалекты разочаруют.
- Цены удваиваются 1 января 2027 года.
Следует ли вам переходить с 3.1 Preview?
Если долгоформатный аудио - ваш основной продукт, да. Прирост верности при синтезе многопараграфного текста и лучший в отрасли балл выразительности (0.920 среди 34 моделей) реальны. Охват 130+ языков с автоматическим обнаружением устраняет класс работ по предварительной обработке.
Если вам нужна потоковая передача в реальном времени, не переходите пока.
Скачок цен в 2027 году - самый большой элемент планирования. Бюджет на увеличение стоимости в 2 раза с 1 января. Ставки 2026 года в размере $0.50/1M входных и $9.00/1M выходных аудио исчезают 1 января 2027 года. Дата прекращения поддержки Preview не опубликована. Я бы переносил рабочие нагрузки до объявления этого, а не после.
Связанное на блоге GPUniq
Методология
Facts are compiled from the vendor's own announcement and documentation, linked below, at the time of writing; where the vendor hasn't published a number it is marked as such. GPUniq prices, when the model is already available here, come from our live catalog.
Источники
- 1.Gemini 3.8 Flash TTS | Gemini API Model Card — Google AI for Developers (просмотрено )
- 2.Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS are our most expressive audio generation models yet — Google Blog (просмотрено )
- 3.Newly-released Google’s Gemini 3.8 Flash TTS tops Hume’s Real-World VoiceEQ leaderboard — Hume AI (просмотрено )
- 4.Gemini 3.8 Flash TTS Launch Evaluation — BenchLM.ai (просмотрено )
Нужны недорогие GPU под ваш проект?
Живые цены на аренду GPU и нужная карта за пару кликов — H100, A100, RTX 4090 и ещё 50+ моделей. Оплата картой РФ или по счёту.
