Клонирование голоса и дипфейки: как технологии синтеза речи стали инструментом мошенников
Гонконгское издание в выпуске рубрики Connecting Dots зафиксировало уличный опрос о реальных столкновениях с мошенничеством — отдельно выделена категория AI-клонирования голоса и дипфейков.
Савелий Попов·обновлено 18 августа 2026 г.

Soniox TTS v2 и поле голосовых дипфейков: два релиза, один вывод
Параллельно Soniox выпустил TTS v2 — мультиязычную модель синтеза с клонированием по нескольким секундам аудио. Два независимых события, сходящиеся в одном техническом следствии: порог входа в производство убедительной синтетической речи опустился до бытового уровня.
Параметры релиза Soniox TTS v2
- Клонирование: от нескольких секунд аудио. Сохраняются идентичность диктора, акцент, ритм, темп, экспрессивный диапазон.
- Аудиотеги: whisper, laugh, hesitate, смена эмоциональной подачи внутри одной фразы при сохранении связности речи.
- Языки: более 60. Переключение внутри одного utterance без смены модели или голоса, идентичность сохраняется между языками.
- Домены терминологии: медицинская, финансовая, научная, юридическая; адреса, телефонные номера, коды верификации, даты, цены.
- Стриминг: низколатентный, с character-level timestamps для синхронизации текста и аудио, обработки прерываний и продолжения воспроизведения.
- Шум: пайплайн рассчитан на бытовые записи — удаляется эхо, фоновые шумы и артефакты записи.
- Цена: $0.70 за сгенерированный час.
- Доступность: США, Европа, Япония. Имя модели в продакшене — tts-rt-v2.
Поле и регуляторный сигнал
По данным, жители Гонконга среди реальных случаев называли исчезновение члена семьи с крупной суммой наличных, классическую «принц»-схему, банковские звонки, фальшивые курьерские сборы. AI-клонирование голоса и дипфейки выделены как отдельная категория, в которой, по словам респондентов, отличить подделку от оригинала становится критически сложно. Издание параллельно сообщает о задержании 17 человек и изъятии HK$3.67 млн наличными в рамках дела с жертвами из Юго-Восточной Азии. Китайские медиа (по анонсу news.sbs.co.kr) указывают на угрозу AI-клонирования для социального доверия и призывают к регулированию — открытого текста материала в источнике нет, только заголовок и анонс.
Контрмеры на практике
- Аудиодетекция теряет опору. Признаки, на которые опирались раньше — роботизированный голос, неестественные паузы, акцент — больше не надёжны. TTS последнего поколения управляют просодией целенаправленно через аудиотеги и обучение на естественных паттернах.
- Канальная верификация. Кодовая фраза, переключение на другой канал связи, обратный звонок по номеру из собственной записной книжки — минимальный набор контрмер вне зависимости от качества синтеза.
- Интеграторам голосовых агентов. Character-level timestamps и обработка прерываний — не только UX-плюс, но и способ снизить артефактику, что одновременно усложняет детекцию синтеза на слух. Это стоит учитывать при выборе модели для публичных сервисов.