LIVE
Новость

Создать видео "Что же я хочу сказать — Токсис" нейросеть: как сделать ИИ танец под тренд Возьми телефон детка

По данным Хабра, в обновлении 2.7 семейства видеомоделей Wan от команды Alibaba AI появилась встроенная синхронизация изображения со звуком: аудиозапись теперь выступает отдельным входом и служит источником речи, ритма и временных акцентов для генерации.

Савелий Попов·обновлено 02 августа 2026 г.

Создать видео "Что же я хочу сказать — Токсис" нейросеть: как сделать ИИ танец под тренд Возьми телефон детка

Контекстом служит всплеск image-to-video пайплайнов в TikTok, Reels, YouTube Shorts и VK Клипах, где статичные фото ритмично оживают под популярные вокальные треки.

Архитектура входов и параметры Wan 2.7

Модель объединяет четыре сценария, ранее требовавших отдельных инструментов. Текст задаёт сюжет и визуальную задачу — режим text-to-video. Изображение фиксирует внешность персонажа, одежду и композицию первого кадра — режим image-to-video. Видео служит референсом движения: жесты, шаги, повороты камеры переносятся на целевое изображение. Аудио работает как источник тайминга: ритм, акценты, речевая артикуляция привязываются к звуковой дорожке. Длина сцены — до 15 секунд. Разрешение — 720p или 1080p. Поддерживается несколько монтажных планов внутри одного ролика. В режиме с несколькими исходниками модель учитывает отдельные изображения персонажа, одежды, предмета и локации.

Ключевая задача видеогенерации — временная согласованность. Wan 2.7 пытается удержать лицо, одежду, направление света и структуру фона на всём отрезке сцены. Это снижает необходимость в покадровом монтаже. Типичные артефакты остаются: меняющиеся лица, лишние или исчезающие пальцы, исчезающие предметы, нелогичная физика. Один персонаж, одно действие, статичная камера воспроизводятся стабильнее, чем массовая сцена с транспортом и резкими сменами плана. Качество привязано к точности промпта: размытые формулировки вроде «сделай красивое видео» дают неконтролируемый результат.

Контекст тренда

По данным Sostav.ru, практическим триггером стал трек «Nobody» (Aarne, Toxi$, Big Baby Tape, альбом SLAANG). Припев «Что же я хочу сказать» отделился от песни и стал самостоятельным звуком для коротких роликов. В феврале 2026 года фрагмент стрима Toxi$ превратился в мем: исполнитель в образе лысого парня в очках жестикулировал и пел отрывок, запись разошлась как референс для генерации.

Формат устоялся как image-to-video с жёстко заданным аудио-референсом. Пользователь загружает статичное фото и видео с танцем под припев, нейросеть переносит движение на персонажа с фото. Хештеги #токсис, #возьмителефондетка, #лысыйтоксис, #танецтоксис собирают миллионы просмотров ежедневно в TikTok, Reels, YouTube Shorts и VK Клипах. Для индустрии генеративного звука это сигнал: массовый пользовательский спрос на аудио-управляемую генерацию видео уже сформирован.

Что отслеживать

Практический интерес — качество артикуляционной синхронизации. В Wan 2.7 аудио задаёт ритм и акценты, но детальная липсинк-привязка к фонемам остаётся слабым местом. Стоит отслеживать появление отдельного режима text-to-video с управляемой речевой дорожкой на выходе. С точки зрения пайплайна связка TTS → Wan 2.7 пока требует ручной склейки, проверки тайминга и пересчёта кадров под речевую артикуляцию. Полезный параметр для самостоятельного замера: длина контекстного окна аудио, при которой модель стабильно удерживает ритмическую структуру и не «плывёт» на длинных сценах.