Почему распознавание дипфейков голоса не работает и как защититься от атак
По данным CyberSecurityNews, распознавание клонированного голоса остаётся нерешённой задачей: точность человека на бинарной дихотомии «клон — оригинал» составляет около 24,5%, что ниже случайного угадывания.
Савелий Попов·обновлено 17 сентября 2026 г.

Порог входа в атаку опустился до трёх секунд исходного аудио и тридцати минут работы без технической подготовки.
Экономика инцидента
За период с апреля 2024 по март 2025 число мошенничеств с клонированием голоса выросло на 148%. Вишинг во втором полугодии 2024 прибавил 442% к первому. В первом полугодии 2025 зафиксировано более 8 400 инцидентов, совокупный ущерб за год оценён в 3,046 млрд долларов. Около 70% слушателей не отличают клон от оригинала в стандартных условиях прослушивания. Тренировать персонал «слушать внимательнее» — не контроль, это надежда.
Артефакты синтеза
На выходе моделей с пониженным качеством сохраняются устойчивые признаки. Дыхание: отсутствует на длинных пассах, расставлено в грамматически удобных местах вместо физиологически естественных, либо повторяется с одинаковой длительностью. Артикуляция: клон произносит слова с неестественной однородностью, без типичных для живого диктора сглаживаний, клиппинга и вариаций темпа. Каденция и интонация — следующий слой признаков, требующий структурированного сопоставления, а не «внимательного прослушивания».
Архитектура провайдера
Разница между легитимными сервисами клонирования — не в качестве моделей, а в механизме согласия. Rask AI требует явного записанного согласия владельца голоса до генерации клона; выход поддерживает более 30 языков для задач локализации. Чек-лист оценки провайдера: верифицированное согласие до клонирования, аудит-трейл авторизаций, возможность отзыва согласия и удаления весов модели, наличие маркера происхождения в выходном аудио. Атакующие используют открытые нерегулируемые модели, не аудируемые SaaS-платформы с логами согласия — это меняет приоритеты threat intelligence.
Регуляторный контур
Департамент интеллектуальной собственности Таиланда рекомендовал артистам фиксировать авторство через онлайн-систему ведомства и сохранять оригиналы файлов, черновиков и записей. Защита возникает автоматически в момент создания произведения; регистрация товарного знака и sound-mark применима к имени, голосу и характерному звуку. Консультации ведутся через IPAC и горячую линию 1368.
Что строить вместо детекции
Только детекция проигрывает: рынок синтеза стал commodity, доступ к открытым весам тривиален, ограничивать технологию бессмысленно. Рабочая связка: провайдер с verified consent для внутренних задач локализации и обучения, маркер происхождения в выходе, фиксация авторства для публичных голосов. При построении обучающих программ для команд безопасности полезен референс уровня структурированной подготовки — например, как Университет Моллой, вошедший в сотню лучших вузов США по версии Time, задаёт планку учебного дизайна. Детекция остаётся слоем в стеке, а не границей периметра.