LIVE

Цены на TTS API: сколько стоит миллион символов озвучки

Цена миллиона символов в TTS API находится в диапазоне от $4 до $300 и выше. Разброс определяется не только качеством голоса.

Обновлено14 августа 2026 г.
Чтение15 мин
Цены на TTS API: сколько стоит миллион символов озвучки

В расчет входят класс модели, способ биллинга, служебные символы, SSML-разметка, лимиты тарифа и тип доступа к платформе.

Для стандартного облачного голоса миллион символов стоит около $4. Нейросетевые модели массового сегмента — $15–$16. HD- и генеративные голоса — $22–$30. Специализированные платформы с акцентом на естественность речи тарифицируют API по $50–$100 за миллион символов. У студийных моделей цена может доходить до $160, а эффективная стоимость подписочного пакета — до $300 и выше.

Сравнивать эти значения напрямую нельзя. Один и тот же объем текста может конвертироваться в разное количество аудио, а новые TTS-модели постепенно уходят от посимвольной модели к оплате текстовых и аудиотокенов.

Экономика синтеза: от базовых голосов до генеративных моделей

TTS API обычно продается по объему входного текста. Базовая единица — один миллион символов. Но слово «символ» в документации провайдера не всегда означает букву, которую произносит вокодер.

В биллинг могут попадать:

  • буквы и цифры;
  • пробелы;
  • знаки пунктуации;
  • переносы строк;
  • XML- и SSML-теги;
  • атрибуты разметки;
  • служебные элементы запроса.

Поэтому расчет по количеству видимых знаков в редакторе дает только предварительную оценку. Фактический счет формируется по строке, переданной в API.

Нижняя граница рынка — стандартные голоса. Amazon Polly Standard и Google Cloud TTS Standard стоят от $4 за 1 миллион символов. Это класс классического параметрического или ограниченно нейросетевого синтеза. Голос обычно стабилен по тембру, но уступает новым моделям по интонации, паузам и обработке сложного текста.

Следующий уровень — нейросетевые голоса общего назначения:

  • Amazon Polly Neural — около $16 за 1 миллион символов;
  • Google Neural2 — около $16 за 1 миллион символов;
  • Azure Prebuilt Neural — около $16 за 1 миллион символов;
  • OpenAI TTS-1 — около $15 за 1 миллион символов.

Разница с базовыми моделями составляет примерно четыре раза. Это не означает четырехкратный рост качества во всех сценариях. Для коротких уведомлений, IVR и системных сообщений стандартный голос может быть достаточен. Для длинной озвучки, диалогов и контента с разметкой просодии нейросетевой класс дает более предсказуемый результат.

Премиальный сегмент начинается с моделей, где в пайплайн добавляются более тяжелые акустические компоненты, улучшенная генерация просодии, расширенная языковая поддержка и дополнительные режимы управления голосом.

К нему относятся:

  • Azure Neural HD — около $22 за 1 миллион символов;
  • OpenAI tts-1-hd — около $30 за 1 миллион символов;
  • Google Cloud TTS с премиальными и генеративными моделями — примерно $22–$30 за 1 миллион символов;
  • Google Cloud TTS Studio — до $160 за 1 миллион символов.

У специализированных платформ диапазон выше. ElevenLabs указывает для прямого API-доступа около $0,05 за 1000 символов для моделей Flash и Turbo. Это $50 за миллион. Для Multilingual v2 и v3 ставка достигает $0,10 за 1000 символов, то есть $100 за миллион. В подписочной модели эффективная цена может быть еще выше — примерно $90–$300 и более за миллион символов в зависимости от пакета и фактического использования.

Yandex SpeechKit API v1 находится около отметки $11 за миллион символов без НДС. Это отдельный ориентир для русскоязычных проектов, где важны локальная инфраструктура, доступность API и работа с русской фонетикой.

Класс TTSПримерЦена за 1 млн символовТипичная задача
StandardAmazon Polly Standard, Google Standardот $4IVR, системные уведомления, массовые короткие сообщения
NeuralAmazon Polly Neural, Google Neural2, Azure Prebuilt Neuralоколо $16ассистенты, справочные сервисы, длинная озвучка
Базовый генеративныйOpenAI tts-1около $15потоковая генерация, диалоги, голосовые интерфейсы
HDOpenAI tts-1-hd, Azure Neural HD$22–$30контент, где заметны просодия и артефакты
Премиальный APIElevenLabs Flash/Turboоколо $50быстрый voice-AI, коммерческая озвучка
Многоязычный премиальный APIElevenLabs Multilingual v2/v3около $100дубляж, мультиязычный контент, брендовые голоса
Студийный классGoogle Cloud TTS Studioдо $160производство с высокими требованиями к естественности

Эта таблица показывает стоимость генерации, а не полную себестоимость аудио. В production-пайплайне отдельно оплачиваются хранение файлов, исходящий трафик, постобработка, повторные генерации и контроль качества.

Дешевый TTS и дорогой TTS отличаются не только тембром. Основная разница проявляется в количестве ручных исправлений после инференса.

Что именно оплачивается в TTS API

Посимвольная модель выглядит простой: объем текста умножается на тариф. На практике между строкой в редакторе и счетом провайдера есть несколько промежуточных этапов.

Видимые символы

Буква, пробел, запятая и перенос строки могут учитываться одинаково как элементы входной строки. Провайдеру неважно, произносится ли конкретный знак. Он обрабатывает текстовый payload.

Проблема появляется в длинных документах. В редакторе пользователь видит только содержание. В API уходит JSON с полями, разметкой и служебными конструкциями. Если приложение отправляет SSML вместе с текстом, длина запроса увеличивается.

Для проекта с небольшим объемом это несущественно. Для конвейера, который генерирует сотни миллионов символов, разница становится частью бюджета.

SSML и управление просодией

SSML позволяет задавать:

  • паузы;
  • ударения;
  • скорость;
  • высоту тона;
  • громкость;
  • произношение отдельных слов;
  • фонетические замены;
  • границы фраз.

Это не бесплатный слой. У ключевых облачных провайдеров SSML-теги могут входить в тарифицируемый объем. Поэтому строка с одной и той же фразой в обычном тексте и в SSML-формате имеет разную стоимость.

Второй фактор — повторная генерация. Если синтезатор неверно произносит название, разработчик добавляет фонетическую подсказку и запускает запрос заново. Счетчик учитывает новый вызов. При массовой озвучке это создает скрытый коэффициент перерасхода.

Язык и схема подсчета

Для английского, русского и большинства европейских языков один введенный символ обычно считается одной биллинговой единицей. В Azure Speech для японского, китайского и корейского языков один вводимый символ списывается как два биллинговых символа.

Это меняет экономику локализации. Перевод на иероглифический язык нельзя оценивать простым умножением объема исходного текста на тариф. Сначала нужно определить правила конкретного API.

Еще одна проблема — смешанные тексты. В документации может быть указана ставка для языка или группы языков, но фактическая обработка зависит от выбранного voice ID, модели и endpoint. Если в одном документе есть латиница, кириллица, цифры, SSML и специальные обозначения, расчет вручную становится ненадежным.

Сравнение облачных провайдеров и специализированных TTS-платформ

Облачные платформы оптимизированы под интеграцию. У них есть регионы, IAM, квоты, мониторинг, SDK, очереди и контракты на объем. Специализированные TTS-сервисы продают прежде всего качество голоса, клонирование, выразительность и скорость вывода.

Эти категории нельзя сравнивать только по цене миллиона символов.

Amazon Polly

Amazon Polly остается вариантом с низкой входной стоимостью. Standard-голоса стоят от $4 за миллион символов. Neural-уровень — около $16.

Преимущества архитектурного уровня:

  • интеграция с AWS IAM;
  • региональное развертывание;
  • понятные квоты;
  • синхронный и асинхронный синтез;
  • поддержка SSML;
  • удобная связка с S3, Lambda и очередями AWS.

Ограничение — характер звучания. Standard-голоса подходят для функционального аудио. Neural-режим закрывает больше сценариев, но не превращает Polly в студийную систему озвучки.

Google Cloud Text-to-Speech

Google предоставляет несколько ценовых классов. Standard и базовые голоса начинаются примерно от $4 за миллион символов. Neural2 — около $16. Премиальные линейки и генеративные модели находятся в диапазоне $22–$30. Для Studio-класса цена может достигать $160.

С технической точки зрения ключевой вопрос — не только voice ID, но и выбранная модель. Смена голоса внутри одного API не всегда означает смену тарифа. В некоторых случаях стоимость определяется конкретным семейством синтеза.

Google также развивает модели, где расчет переходит на токены. Это усложняет сравнение с классическим TTS. Миллион символов перестает быть универсальной расчетной единицей.

Microsoft Azure Speech

Azure Prebuilt Neural тарифицируется около $16 за миллион символов. Neural HD — около $22. По данным актуальной тарифной сетки, в марте 2026 года цена Neural HD была снижена с $30 до $22 за миллион символов. Для контрактов с обязательным объемом действуют Commitment Tiers. В отдельных условиях эффективная ставка может снижаться до $7,50 за миллион.

Это пример того, почему публичный прайс не равен корпоративной цене. На малом объеме применяется стандартная ставка. При зафиксированном потреблении появляется другая экономика. Но commitment-модель переносит риск недоиспользования на клиента.

Azure удобен для корпоративного пайплайна Microsoft. Entra ID, Azure Functions, Event Grid, Blob Storage и мониторинг подключаются без внешнего слоя инфраструктуры. Для проекта, уже работающего в Azure, стоимость миграции может быть важнее разницы в несколько долларов на миллион символов.

OpenAI TTS

Модель tts-1 стоит около $15 за миллион символов. tts-1-hd — около $30. Это промежуточный сегмент между классическим облачным TTS и специализированными системами генеративного голоса.

Главный архитектурный параметр — режим использования. TTS может быть частью диалогового контура, где текст формируется языковой моделью непосредственно перед синтезом. В этом случае стоимость голоса нельзя считать отдельно от LLM-инференса.

Для потокового ассистента важны:

  • задержка до первого аудиофрагмента;
  • поддержка chunked streaming;
  • стабильность генерации;
  • размер буфера;
  • возможность прерывания ответа;
  • повторяемость звучания;
  • стоимость связки текстовая модель плюс TTS.

Сравнение «$15 против $50 за миллион символов» здесь неполное. Если один сервис генерирует меньше служебного текста, быстрее отдает аудио и требует меньше повторных запросов, низкая ставка конкурента не гарантирует меньший итоговый бюджет.

ElevenLabs

ElevenLabs работает в более дорогом классе. Flash и Turbo стоят примерно $50 за миллион символов при прямом API-доступе. Multilingual v2 и v3 — около $100.

Причина более высокой цены — не только синтез как таковой. Платформа ориентирована на выразительные голоса, мультиязычность, voice design, клонирование и коммерческую озвучку. В production-сценариях пользователь платит за качество исходного результата и снижение объема ручной правки.

Но эта модель требует дисциплины по квотам. Подписочный пакет может давать эффективную стоимость $90–$300 и выше за миллион символов. Расчет нужно вести по фактически доступному объему, а не по рекламной цене уровня тарифа.

Для голосового продукта метрика «доллар за миллион символов» недостаточна. Нужна стоимость готовой минуты без артефактов и ручной пересборки.

Как проверить, сколько стоит миллион символов озвучки

Расчет начинается не с тарифной страницы. Сначала фиксируется нагрузочный профиль.

Нужно определить:

1. Объем текста.

Считаются реальные строки, которые приложение отправляет в API. Не страницы, не слова и не количество файлов.

2. Язык и набор голосов.

Русский, английский и азиатские языки могут иметь разные правила списания. Голосовые модели внутри одного сервиса также могут относиться к разным ценовым категориям.

3. Формат запроса.

Чистый текст и SSML дают разный объем payload. Если просодия управляется тегами, они попадают в расчет у ряда провайдеров.

4. Режим инференса.

Синхронный, асинхронный и потоковый вызов могут иметь разные ограничения и условия. Сама ставка за символ не всегда меняется, но меняется архитектура очереди и число повторных запросов.

5. Доля повторной генерации.

Исправление произношения, пауз или ударения требует нового инференса. Для студийной озвучки этот коэффициент может быть выше, чем для системных сообщений.

6. Тип биллинга.

Посимвольная, кредитная и токенная модели считают нагрузку по-разному. Нельзя переносить формулу одного провайдера на другого.

7. Контрактный уровень.

Commitment Tiers и корпоративные скидки меняют ставку, но обычно требуют обязательного объема. Скидка не является бесплатным снижением цены.

Базовая формула для посимвольной модели выглядит так:

Стоимость = оплачиваемый объем символов / 1 000 000 × тариф модели.

Оплачиваемый объем — это не обязательно число символов исходного документа. Практически нужно использовать объем сериализованного текста, переданного в API, с учетом правил конкретного провайдера.

Для предварительного бюджета можно взять миллион символов как диапазон готового аудио. При стандартном темпе речи это примерно 1000–1400 минут, или 16–23 часа. Диапазон широкий. На длительность влияют язык, длина слов, темп, паузы, знаки препинания и SSML-разметка.

Фиксированное соответствие «миллион символов = N минут» применять нельзя. Это только оценка для capacity planning.

Пример расчета

Допустим, сервис генерирует 10 миллионов символов в месяц. Текст не содержит SSML, повторные запросы минимальны.

  • Amazon Polly Standard: от $40;
  • нейросетевой класс по ставке $16: около $160;
  • OpenAI tts-1: около $150;
  • OpenAI tts-1-hd: около $300;
  • ElevenLabs Flash/Turbo: около $500;
  • ElevenLabs Multilingual: около $1000.

Это только стоимость синтеза. Если сервис хранит WAV вместо сжатого формата, возрастает объем storage и egress. Если генерация запускается через очередь, появляются расходы на вычислительные функции и логирование. Если аудио проходит через нормализацию, шумоподавление и сборку сегментов, добавляется постобработка.

Токенная тарификация: новый объект расчета

Часть современных систем уходит от оплаты за символы. В эту категорию входят новые модели, включая Google Gemini-TTS и OpenAI gpt-4o-mini-tts. Биллинг может учитывать входные текстовые токены и выходные аудиотокены.

Для разработчика это означает изменение формулы.

В посимвольной модели бюджет зависит от длины текста. В токенной модели он зависит от токенизации, выбранной модели, режима аудиовывода и объема результата. Один и тот же текст может иметь разную стоимость при разных языках и форматах.

Токенизация не совпадает с количеством букв. Входная строка разбивается на элементы, зависящие от языка, пробелов, пунктуации и структуры текста. Аудиовыход также оценивается отдельной единицей. Поэтому оценка по числу символов становится приблизительной.

Для интеграции нужно собирать телеметрию:

  • количество входных текстовых токенов;
  • количество выходных аудиотокенов;
  • длительность результата;
  • размер аудиофайла;
  • время до первого чанка;
  • количество повторных запросов;
  • процент ошибок;
  • доля отмененных генераций.

Без этих метрик сравнивать токенный TTS с посимвольным нельзя. Публичная цена за миллион символов дает понятный ориентир только для старых классов API.

Токенная схема полезна в диалоговых системах, где TTS встроен в общий LLM-пайплайн. Текст ответа формируется динамически. Приложение не хранит заранее подготовленный корпус. Счет идет по реальному взаимодействию пользователя и модели.

Для пакетной озвучки книг, курсов и больших архивов посимвольная тарификация остается удобнее. Объем известен заранее. Можно построить очередь, определить пиковую нагрузку и получить достаточно стабильный прогноз.

Стоимость миллиона символов не равна себестоимости минуты

Цена API — только один компонент. В production-системе у синтеза есть несколько уровней затрат.

Инференс

Это плата провайдеру за обработку текста. В нее входит выбранная модель и объем входных данных. Разница между $4 и $160 за миллион возникает именно здесь.

Подготовка текста

Текст требуется очистить до отправки в TTS. В пайплайне могут быть:

  • нормализация чисел и дат;
  • раскрытие сокращений;
  • исправление ударений;
  • замена брендов и имен;
  • разбиение на фразы;
  • добавление пауз;
  • генерация SSML;
  • проверка длины сегмента.

Чем сложнее контент, тем больше операций до инференса. Эти процессы могут выполняться на собственных серверах или в облачных функциях.

Постобработка

После API аудио часто нужно привести к единому формату. Используются ресемплинг, нормализация громкости, тримминг тишины, склейка сегментов, контроль пиков и конвертация в MP3, AAC или Opus.

Для голосового ассистента достаточно PCM или Opus с низкой задержкой. Для подкаста или видеодубляжа нужны другие параметры. Формат влияет на storage, сетевой трафик и время обработки.

Повторная генерация

Повторный вызов возникает из-за ошибки произношения, неудачной паузы, неверной интонации или изменения сценария. В API нет понятия «дешевой правки фразы». Исправленная строка оплачивается как новый запрос.

Поэтому для контентного производства требуется версия текста и аудио. Иначе команда не понимает, сколько символов было сгенерировано, сколько из них вошло в финальный релиз и какой объем ушел на итерации.

Доставка аудио

Фактическая стоимость включает хранение и выдачу файлов. Точные корпоративные ставки egress зависят от провайдера и конфигурации. Универсально фиксировать их нельзя. Для большого каталога аудио этот компонент нужно считать отдельно по региону, формату и частоте скачивания.

Как выбрать тариф под архитектуру продукта

Выбор модели определяется не максимальной естественностью голоса. Сначала задается допустимая ошибка и режим использования.

IVR и системные сообщения

Для меню, статусов заказа, кодов подтверждения и коротких уведомлений стандартный голос часто закрывает задачу. Основные параметры — стабильность API, цена, задержка и поддержка нужного языка.

Переход на премиальную модель имеет смысл, если пользователь регулярно слышит длинные фразы или система должна корректно читать нестандартные сущности.

Голосовой ассистент

В ассистенте TTS работает в цикле:

1. пользователь отправляет запрос;

2. ASR преобразует речь в текст;

3. LLM формирует ответ;

4. TTS генерирует аудио;

5. клиент получает поток.

Здесь важна не только цена символа. Критичны time to first byte, потоковая передача, прерывание ответа, стабильность чанков и совместимость с аудиокодеком.

Дорогая модель может быть экономически рациональной, если она сокращает число исправлений и не требует отдельного слоя постобработки. Но это нужно измерять в тестовом контуре. Само описание «естественный голос» ничего не говорит о стоимости эксплуатации.

Дубляж и длинная озвучка

Для курсов, книг и видеодубляжа объем текста известен заранее. Можно считать бюджет по миллиону символов и закладывать процент повторной генерации.

Здесь появляются дополнительные требования:

  • сохранение тембра между сегментами;
  • единый темп;
  • согласование пауз с видеорядом;
  • корректное произношение имен;
  • контроль ударений;
  • стабильность на длинных фрагментах;
  • повторяемость при пересборке.

Премиальный API оправдан не для каждой фразы. Часто эффективнее разделить пайплайн: массовый текст генерировать нейросетевой моделью среднего класса, а проблемные сегменты отправлять в более дорогой режим.

Клонирование голоса

Клонирование увеличивает требования к контролю доступа и политике использования. В расчет входит не только синтез. Нужны хранение эталонных записей, управление правами, журналирование вызовов и защита от несанкционированного voice ID.

Финансовая модель здесь вторична относительно управления риском. Если голос используется в коммерческом продукте, необходимо фиксировать согласие владельца голоса и ограничивать сценарии генерации. API-ключ сам по себе не является системой контроля происхождения аудио.

Практическая схема бюджетирования

Для оценки проекта достаточно разделить нагрузку на несколько корзин:

  • заранее подготовленная пакетная озвучка;
  • динамические ответы ассистента;
  • повторная генерация;
  • тестовые запросы;
  • резерв под рост трафика.

Каждая корзина имеет разный профиль. Пакетную озвучку можно заранее посчитать по символам. Динамический ассистент требует статистики диалогов и токенов. Тестовые вызовы часто недооцениваются: разработчики меняют voice settings и генерируют множество вариантов.

Минимальный набор метрик в production:

  • входные символы;
  • оплачиваемые символы;
  • входные и выходные токены, если используется новая модель;
  • число запросов;
  • доля ошибок;
  • число повторных генераций;
  • средняя и p95-задержка;
  • длительность готового аудио;
  • стоимость одного успешного аудиофрагмента.

Последний показатель полезнее тарифа. Он показывает, сколько стоит результат, который действительно попал пользователю или в финальный медиарелиз.

Если TTS генерирует ответ с ошибкой, API может списать запрос, но продукт не получит пригодное аудио. Если модель не поддерживает нужное произношение, бюджет растет через ручные обходы. Если сегментация текста выполнена плохо, увеличивается число вызовов и ломается просодия.

Проверять, сколько стоит миллион символов озвучки, нужно на уровне конкретного payload. Не на уровне рекламного примера. Тестовый пакет должен включать обычный текст, числа, даты, аббревиатуры, имена собственные, SSML и типовые ошибки разметки.

Итог

Нижняя рыночная граница TTS API — около $4 за миллион символов. Рабочий нейросетевой диапазон — $15–$16. HD-модели стоят примерно $22–$30. Специализированные платформы — $50–$100. Студийный класс может доходить до $160, а эффективная цена подписочных пакетов — до $300 и выше.

Для пакетной озвучки основной параметр — оплачиваемый объем текста. Для голосового ассистента — суммарная стоимость цикла LLM, ASR и TTS. Для дубляжа — цена финальной минуты без артефактов и повторных сборок. Для новых генеративных моделей — число текстовых и аудиотокенов.

Тарифная таблица дает стартовую оценку. Решение принимается после замера реального пайплайна: payload, задержек, повторов, длительности аудио и качества на целевом языке. Иначе сравнение провайдеров остается сравнением разных единиц измерения.

Частые вопросы

Что именно входит в стоимость миллиона символов при оплате TTS API?
В биллинг попадают все элементы переданного запроса: буквы, цифры, пробелы, знаки пунктуации, переносы строк, а также служебные конструкции и SSML-теги.
Почему цена за миллион символов у разных провайдеров так сильно отличается?
Разброс цен обусловлен классом модели — от базовых параметрических голосов до премиальных генеративных систем, а также дополнительными возможностями, такими как клонирование голоса, мультиязычность и качество просодии.
Как SSML-разметка влияет на итоговый счет за озвучку?
У большинства облачных провайдеров SSML-теги входят в тарифицируемый объем, поэтому строка с разметкой стоит дороже, чем аналогичный текст без нее.
Всегда ли один символ равен одной биллинговой единице?
Нет, правила зависят от языка и провайдера. Например, в Azure Speech для японского, китайского и корейского языков один введенный символ может списываться как две биллинговые единицы.
Как рассчитать бюджет на озвучку, если модель тарифицируется по токенам?
В токенной модели стоимость зависит от количества входных текстовых токенов и выходных аудиотокенов, поэтому для оценки необходимо собирать телеметрию по реальным взаимодействиям, а не использовать посимвольный расчет.