LIVE
Новость

Reddit тестирует автоматическую озвучку постов и комментариев с помощью ИИ

По данным GIGAZINE, Reddit тестирует режим, преобразующий посты и комментарии в видео с AI-озвучкой.

Савелий Попов·обновлено 19 августа 2026 г.

Reddit тестирует автоматическую озвучку постов и комментариев с помощью ИИ

Тест начался 17 августа 2026 года в веб-версии, 18 августа функция стала доступна на iOS и Android. Для Voice-AI это пример не отдельного TTS-модуля, а собранного конвейера: multi-voice TTS, субтитры, визуальные шаблоны и переключатель между чтением и воспроизведением.

Поверхность теста

Reddit представила новый видеоформат на телефонной конференции по итогам второго квартала 2026 года. Посты предлагается конвертировать в видео и подкасты с помощью AI. Текущий эксперимент сосредоточен на воспроизведении существующих обсуждений.

Доступ ограничен:

  • англоязычными публикациями;
  • отдельными тематическими сообществами Reddit;
  • веб-интерфейсом, iOS и Android;
  • ранней стадией без заявленного полного развёртывания.

При наличии функции пользователь может выбрать режим Read или Play. В опубликованном примере переключатель расположен над восьмилетним постом из сообщества о настольных играх. После запуска Play видео начинает зачитывать пост и комментарии. Под роликом Reddit указывает, что AI озвучивает реальную дискуссию.

Фоновое прослушивание — заявленный сценарий, а не подтверждённый результат. CEO Huffman назвал разговорный и слуховой формат потенциально привлекательным для пользователей. Данных о времени прослушивания, удержании аудитории, частоте переключения режимов или доле завершённых роликов GIGAZINE не приводит. Поэтому тест нельзя считать состоявшимся запуском продукта.

Состав AI-пайплайна

Reddit описала эксперимент как создание новых аудио- и видеоформатов, воспроизводящих разговорную структуру обсуждения. В описание входят:

  • multi-voice TTS;
  • автоматические субтитры;
  • визуальные шаблоны;
  • преобразование постов и комментарией в видеопоток.

По опубликованной схеме входом служит текстовая ветка обсуждения. Выход разделён между аудиодорожкой, субтитрами и визуальным оформлением. Такой подход отличается от базового TTS: система должна не только синтезировать речь, но и собрать из нескольких реплик единый медиаобъект.

Детали реализации не раскрыты. GIGAZINE не сообщает, какая модель генерирует голос, сколько голосовых дорожек создаётся, как распределяются реплики между ними и выполняется ли синхронизация субтитров с фонемой. Нет данных о задержке запуска, стабильности потока, вычислительной стоимости и качестве синтеза на длинных ветках комментариев.

Формулировка Reddit о воспроизведении разговоров сама по себе не доказывает использование клонирования голоса. Multi-voice TTS может означать несколько синтетических голосов, но источник не раскрывает их происхождение и настройки. Выводы о голосовой идентичности конкретных людей делать нельзя.

Практическая оценка

Проверять функцию нужно по фиксированному набору параметров. Иначе оценка сведётся к наличию кнопки Play.

1. Доступ. Подтвердить, что публикация входит в число англоязычных материалов в тестовых сообществах. Наличие Reddit на конкретном устройстве само по себе не гарантирует доступность функции.

2. Покрыние текста. Сопоставить исходный пост и комментарии с тем, что попало в аудиодорожку. Ключевые вопросы: сохраняется ли порядок веток, не теряются ли вложенные комментарии и различается ли авторство реплик.

3. Воспроизведение. Замерить задержку после нажатия Play, переключение между Read и Play, обработку длинных комментариев и поведение при прерывании потока.

4. Речь и субтитры. Оценить разборчивость, темп, паузы, соответствие текста, расхождение таймингов и переходы между голосами. Для multi-voice сценария нужна отдельная проверка различимости реплик.

5. Архитектура. Зафиксировать число голосовых потоков, способ генерации, наличие визуальных шаблонов и требования к вычислительным ресурсам. Без этих данных сравнение с другими TTS-системами будет спекулятивным.

Схожая дисциплина измерения используется в материале о том, как летнюю стажировку превратить в измеримый карьерный результат. В обоих случаях интерфейс не заменяет заранее заданные критерии.

Итоговая оценка теста сухая: архитектурный охват шире опубликованной доказательной базы. Reddit проверяет формат, а не качество отдельных компонентов. До публикации метрик TTS, субтитров, задержки и стоимости генерации это ограниченный эксперимент, а не зрелый Voice-AI-инструмент.