Создание видео в нейросети LTX Studio AI на русском языке бесплатно
По данным обзора на Хабре, платформа LTX Studio обновила ветку LTX-2.3. Ключевое отличие от большинства видеогенераторов — совместная генерация изображения и аудиодорожки в едином пайплайне.
Савелий Попов·обновлено 31 июля 2026 г.

Для голосовых технологий это меняет подход к синхронизации речи, шумов и действий в кадре.
Спецификации и архитектура
LTX-2.3. Разрешение до 4K. Частота до 50 fps. Длина одной генерации — до 20 секунд в быстром режиме. Профессиональный режим — стабильнее движение, выше детализация, отдельный финальный рендер. Доступ через браузер. Интерфейс — проект, а не изолированный клип: сценарий, сцены, персонажи, локации, раскадровка, движения камеры, звук, сквозной монтаж.
Источник разделяет продукт на слои. LTX Studio — браузерная среда для проектов. LTX 2 — генеративная модель. Студия в браузере — для пользователей без технической подготовки. API — для интеграций. Доступна локальная установка на подходящем оборудовании.
Аудио в пайплайне
LTX-2.3 — единая аудиовизуальная модель. Модель выделяет из запроса героя, действие, локацию, освещение, ракурс, движение камеры, звуковое окружение. Скрытое представление ролика формируется в сжатом пространстве признаков. Временная структура рассчитывается далее: положение персонажей, траектория взгляда, движение камеры, изменение света, поведение среды.
Звук встроен в эту же итерацию. Речь, движение губ, атмосферные шумы и действия в кадре — согласованный выход модели. Стандартный пайплайн разделяет задачи: изображение отдельно, речь отдельно, музыка отдельно, шумы отдельно. Синхронизация — ручная. LTX-2.3 убирает этот этап. Источник приводит пример: запрос с падающей стеклянной чашкой. Модель связывает движение руки, падение, момент удара, звук разбитого стекла в одной итерации.
Применимость и границы
Совместная генерация полезна для рекламных роликов, разговорных сцен, атмосферных видео. Вокодер, lip-sync и шумы не выделены в отдельные модули — это часть скрытого представления. Для TTS и дубляжа это потенциально сокращает постпродакшн: артикуляция и фонемы согласуются с изображением на этапе инференса, а не вручную на таймлайне.
Ограничение по длительности — до 20 секунд в быстром режиме. Параметры профессионального режима по длительности в источнике не указаны. Тестовых данных по естественности русской речи, точности lip-sync или замерам качества вокализации нет. Заявленная совместная генерация — архитектурное свойство, а не подтверждённый результат на бенчмарках.
Смежный контекст: Sostav.ru опубликовал обзор семи генераторов музыки и вокала — SONATA на SUNO 5.5, Сонграйтер, Suno AI, Udio, Soundraw, AIVA. LTX-2.3 в этот сегмент не входит — это видеоплатформа со встроенным аудио, а не специализированный аудиогенератор.