Reddit тестирует автоматическую озвучку постов и комментариев с помощью ИИ
По данным GIGAZINE, Reddit тестирует режим, преобразующий посты и комментарии в видео с AI-озвучкой.
Савелий Попов·обновлено 19 августа 2026 г.

Тест начался 17 августа 2026 года в веб-версии, 18 августа функция стала доступна на iOS и Android. Для Voice-AI это пример не отдельного TTS-модуля, а собранного конвейера: multi-voice TTS, субтитры, визуальные шаблоны и переключатель между чтением и воспроизведением.
Поверхность теста
Reddit представила новый видеоформат на телефонной конференции по итогам второго квартала 2026 года. Посты предлагается конвертировать в видео и подкасты с помощью AI. Текущий эксперимент сосредоточен на воспроизведении существующих обсуждений.
Доступ ограничен:
- англоязычными публикациями;
- отдельными тематическими сообществами Reddit;
- веб-интерфейсом, iOS и Android;
- ранней стадией без заявленного полного развёртывания.
При наличии функции пользователь может выбрать режим Read или Play. В опубликованном примере переключатель расположен над восьмилетним постом из сообщества о настольных играх. После запуска Play видео начинает зачитывать пост и комментарии. Под роликом Reddit указывает, что AI озвучивает реальную дискуссию.
Фоновое прослушивание — заявленный сценарий, а не подтверждённый результат. CEO Huffman назвал разговорный и слуховой формат потенциально привлекательным для пользователей. Данных о времени прослушивания, удержании аудитории, частоте переключения режимов или доле завершённых роликов GIGAZINE не приводит. Поэтому тест нельзя считать состоявшимся запуском продукта.
Состав AI-пайплайна
Reddit описала эксперимент как создание новых аудио- и видеоформатов, воспроизводящих разговорную структуру обсуждения. В описание входят:
- multi-voice TTS;
- автоматические субтитры;
- визуальные шаблоны;
- преобразование постов и комментарией в видеопоток.
По опубликованной схеме входом служит текстовая ветка обсуждения. Выход разделён между аудиодорожкой, субтитрами и визуальным оформлением. Такой подход отличается от базового TTS: система должна не только синтезировать речь, но и собрать из нескольких реплик единый медиаобъект.
Детали реализации не раскрыты. GIGAZINE не сообщает, какая модель генерирует голос, сколько голосовых дорожек создаётся, как распределяются реплики между ними и выполняется ли синхронизация субтитров с фонемой. Нет данных о задержке запуска, стабильности потока, вычислительной стоимости и качестве синтеза на длинных ветках комментариев.
Формулировка Reddit о воспроизведении разговоров сама по себе не доказывает использование клонирования голоса. Multi-voice TTS может означать несколько синтетических голосов, но источник не раскрывает их происхождение и настройки. Выводы о голосовой идентичности конкретных людей делать нельзя.
Практическая оценка
Проверять функцию нужно по фиксированному набору параметров. Иначе оценка сведётся к наличию кнопки Play.
1. Доступ. Подтвердить, что публикация входит в число англоязычных материалов в тестовых сообществах. Наличие Reddit на конкретном устройстве само по себе не гарантирует доступность функции.
2. Покрыние текста. Сопоставить исходный пост и комментарии с тем, что попало в аудиодорожку. Ключевые вопросы: сохраняется ли порядок веток, не теряются ли вложенные комментарии и различается ли авторство реплик.
3. Воспроизведение. Замерить задержку после нажатия Play, переключение между Read и Play, обработку длинных комментариев и поведение при прерывании потока.
4. Речь и субтитры. Оценить разборчивость, темп, паузы, соответствие текста, расхождение таймингов и переходы между голосами. Для multi-voice сценария нужна отдельная проверка различимости реплик.
5. Архитектура. Зафиксировать число голосовых потоков, способ генерации, наличие визуальных шаблонов и требования к вычислительным ресурсам. Без этих данных сравнение с другими TTS-системами будет спекулятивным.
Схожая дисциплина измерения используется в материале о том, как летнюю стажировку превратить в измеримый карьерный результат. В обоих случаях интерфейс не заменяет заранее заданные критерии.
Итоговая оценка теста сухая: архитектурный охват шире опубликованной доказательной базы. Reddit проверяет формат, а не качество отдельных компонентов. До публикации метрик TTS, субтитров, задержки и стоимости генерации это ограниченный эксперимент, а не зрелый Voice-AI-инструмент.