Голос: защита от подделки и методы верификации аудио
На конкурсе ASVspoof 2024 минимальный уровень ошибок в категории обнаружения аудиодипфейков составил 3,41%.

Это сильный результат для лабораторного тестирования, но не гарантия безопасности в реальном звонке, где сигнал проходит через кодеки, шумоподавление, ресемплирование и нестабильный канал связи.
Именно здесь находится главный разрыв между технологической демонстрацией и корпоративным комплаенсом. Система может уверенно распознавать синтетический голос в тестовом датасете и заметно хуже работать в телефонной сети, мессенджере или голосовом интерфейсе банка. Поэтому «голос — защита от подделки» — не одна функция и не отдельный продукт. Это совокупность процедур, моделей и юридических ограничений, которые должны работать одновременно.
Эволюция угрозы: от записи разговора к синтетической личности
Раньше злоумышленнику требовалась готовая запись голоса человека. Ее можно было использовать для монтажа, вырезания отдельных фраз или имитации контекста. Такая атака зависела от содержания исходного материала: если нужной фразы в записи не было, ее приходилось собирать из фрагментов или озвучивать другим человеком.
Нейросетевое клонирование изменило экономику атаки. Для построения голосовой модели уже не требуется длительный архив студийных записей. Достаточный объем открытого аудио может находиться в интервью, подкастах, рекламных роликах, видеоблогах или публичных выступлениях. После обучения или адаптации модели злоумышленник получает возможность синтезировать новые фразы, менять интонацию и подстраивать темп речи под сценарий разговора.
Для бизнеса это создает несколько независимых классов риска:
- мошенническая аутентификация — подмена голоса клиента при обращении в контактный центр или прохождении голосовой биометрии;
- компрометация руководителя — имитация распоряжения о платеже, передаче данных или срочном изменении реквизитов;
- репутационный ущерб — распространение синтетической записи, которую аудитория принимает за публичное заявление конкретного человека;
- нарушение лицензионных условий — использование голоса актера, диктора или ведущего вне согласованного сценария, территории и срока;
- подрыв доказательной ценности аудио — ситуация, в которой подлинная запись автоматически объявляется подделкой из-за общего недоверия к цифровым материалам.
Последний риск часто недооценивают. Если организация внедряет только детектор дипфейков, она решает задачу классификации файла, но не решает вопрос происхождения аудио. Детектор отвечает на вопрос, есть ли в сигнале признаки синтеза. Система происхождения должна дополнительно показать, кем, когда, каким устройством и в рамках какого разрешения был создан материал.
В голосовых системах, работающих с персональными данными и критичными операциями, это различие имеет прямое финансовое значение. Если голос используется как единственный фактор подтверждения личности, стоимость ошибки включает не только сумму конкретной транзакции, но и расходы на расследование, возврат средств, уведомление клиентов, судебные претензии и восстановление доверия к каналу.
Защита голоса начинается не с детектора, а с отказа считать голос единственным доказательством личности.
ASVspoof и переход от демонстрации к измеримой защите
Первый международный конкурс ASVspoof прошел в 2015 году. Его задача заключалась в оценке методов противодействия подмене голоса в системах автоматической верификации диктора. Это принципиально важная постановка: проверяется не только качество распознавания голоса, но и способность системы отличать реального пользователя от атаки.
В последующих сценариях ASVspoof закрепились три основных направления:
- LA, Logical Access — синтетическая или преобразованная речь подается непосредственно в систему, минуя физический канал записи;
- PA, Physical Access — атака воспроизводится через динамик и затем записывается микрофоном, то есть проходит через акустическую среду;
- DF, Deepfake — обнаруживаются сгенерированные или преобразованные аудиоматериалы, включая современные варианты клонирования голоса.
Такое разделение необходимо, потому что один и тот же антиспуфинговый алгоритм может показывать разные результаты в цифровом файле и в реальном разговоре. В сценарии LA модель анализирует относительно чистый сигнал. В PA к нему добавляются отражения помещения, характеристики динамика, фоновые шумы и особенности микрофона. В DF задача шире: необходимо определить, имеет ли аудио признаки генерации или конвертации, даже если оно не используется для непосредственной биометрической аутентификации.
Что измеряет t-DCF
Для комплексной оценки применяется метрика t-DCF — tandem Detection Cost Function. Она учитывает совместную работу двух компонентов:
1. системы автоматической верификации диктора, или ASV;
2. модуля противодействия атакам, или CM.
Обычная точность детектора не показывает полную стоимость ошибки. Система может хорошо находить дипфейки, но блокировать большое число настоящих пользователей. Либо она может пропускать атаки, сохраняя высокий уровень удобства для клиентов. t-DCF позволяет оценивать взаимодействие этих ошибок в связке.
В корпоративной среде это означает, что нельзя закупать антиспуфинговый модуль по одному показателю EER, не рассматривая всю цепочку принятия решения. EER, или равная ошибка принятия и отклонения, удобен для сравнения моделей, но не отвечает на вопрос, сколько будет стоить внедрение в конкретном бизнес-процессе.
При проектировании голосовой биометрии должны быть определены как минимум следующие параметры:
- цена ложного допуска злоумышленника;
- цена ложного отказа настоящему пользователю;
- допустимая задержка проверки;
- доля звонков с низким качеством сигнала;
- сценарии повторной идентификации;
- процедура перевода операции на другой фактор подтверждения;
- порядок хранения исходной записи и признаков, извлеченных моделью.
Система, которая блокирует подозрительный звонок без безопасного маршрута продолжения, будет создавать операционные потери. Система, которая почти никогда не блокирует звонки, превращает антиспуфинг в декоративный компонент.
Пассивная детекция: как система ищет следы синтеза
Пассивная детекция анализирует уже существующий аудиосигнал. На этапе записи в него ничего специально не добавляется. Алгоритм изучает спектрограмму, временные характеристики, согласованность фонем, переходы между звуками и артефакты, которые возникают при генерации или преобразовании голоса.
Классические признаки постепенно уступают место нейросетевым архитектурам, но сама логика задачи остается прежней: синтетическая речь должна быть отделена от естественного сигнала по статистическим и акустическим несоответствиям. Проблема заключается в том, что эти несоответствия не постоянны. Новая модель TTS может устранить артефакт, на котором обучался детектор, а изменение кодека может создать ложный признак подделки.
Почему важны невокализованные участки
Один из практических выводов исследований ASVspoof 2024 состоит в том, что анализ невокализованных, или unvoiced, участков речи может быть эффективнее анализа вокализованных сегментов для обнаружения синтетического голоса.
Вокализованные звуки несут выраженную периодическую структуру. Современные генеративные модели научились достаточно убедительно воспроизводить многие характеристики тона и тембра. Невокализованные участки — согласные, шумовые компоненты, переходы и паузы — устроены менее регулярно. Именно там могут сохраняться следы неестественного формирования сигнала, несогласованности спектра или чрезмерно гладкой генерации.
Для прикладной системы это не означает, что достаточно анализировать только паузы и шумовые звуки. Такой подход создавал бы собственную уязвимость: атакующий мог бы обрабатывать нужные участки или подбирать канал, в котором признаки теряются. Практический вывод другой — модель должна учитывать разные типы речевых фрагментов и не строить решение только на качестве звучания гласных.
AASIST3 и гибридные модели
В соревновании ASVspoof 2024 заметные результаты показали гибридные архитектуры, объединяющие сверточные нейросети и трансформеры. Первые хорошо извлекают локальные акустические признаки, вторые позволяют учитывать более длинные зависимости во времени и структуру речевого фрагмента.
Исследователи МТУСИ и Института AIRI разработали модель AASIST3 на основе архитектуры AASIST с использованием сетей Колмогорова — Арнольда. Модель вошла в топ-10 ASVspoof 2024. Само по себе место в рейтинге не превращает алгоритм в универсальный промышленный стандарт, но демонстрирует направление развития: антиспуфинг становится специализированной областью, где архитектура и набор признаков оптимизируются именно под атаки на голосовую биометрию.
Для бизнеса здесь есть неприятный, но неизбежный вывод. Один раз обученный детектор быстро теряет актуальность. Его необходимо проверять на новых генераторах, новых языках, новых каналах передачи и новых схемах постобработки. В противном случае организация будет измерять не реальную защищенность, а сходство текущего трафика с обучающей выборкой.
Почему пассивная защита не дает окончательного ответа
Пассивный детектор не видит историю создания аудио. Он может оценить вероятность того, что запись синтетическая, но не всегда способен доказать, кто именно ее сгенерировал и была ли она изменена после записи.
На практике ухудшение качества возникает не только из-за атаки. Его вызывают:
- сжатие в мессенджере;
- конвертация формата;
- телефонный кодек;
- шумоподавление;
- автоматическая регулировка усиления;
- запись через динамик;
- фоновые звуки;
- обрезка начала и конца фразы.
Поэтому результат детектора должен быть не бинарным вердиктом, а частью политики риска. Подозрительный сигнал может требовать повторной фразы, дополнительного фактора, ручной проверки или полной остановки операции — в зависимости от ее стоимости.
Проактивная защита: цифровая водяная марка для аудио
Проактивная защита работает до появления спорного файла. В аудиосигнал встраивается цифровая водяная марка, которая позволяет подтвердить происхождение материала или факт его формирования конкретным генератором.
Водяной знак может быть связан с идентификатором сессии, временем генерации, версией модели или внутренним ключом платформы. При проверке система извлекает метку и сопоставляет ее с журналом событий. Это уже не анализ вероятностных акустических следов, а проверка заранее созданного признака происхождения.
Для TTS-сервисов такой подход особенно удобен: платформа контролирует момент генерации и может встроить марку непосредственно в результат. Для живой речи задача сложнее. Метку нужно добавлять во время записи или передачи, не ухудшая разборчивость, не разрушая естественность голоса и сохраняя устойчивость к обычной обработке сигнала.
Исследования показывают, что цифровые водяные знаки могут обеспечивать 100% точность извлечения метки против базовых атак предобработки, включая ресемплирование и сжатие. Но этот показатель нельзя переносить на все возможные сценарии. Устойчивость к базовым преобразованиям не означает устойчивость к намеренному удалению, перезаписи, смешиванию с другим аудио или генерации нового сигнала без исходной метки.
Водяной знак не заменяет детектор
Проактивный и пассивный подходы решают разные задачи.
| Параметр | Пассивная детекция | Цифровая водяная марка |
|---|---|---|
| Момент применения | После появления аудио | При генерации или записи |
| Что проверяется | Акустические признаки синтеза | Наличие и корректность заранее встроенной метки |
| Работа с неизвестным источником | Возможна, если есть обученная модель | Ограничена материалами, созданными с поддержкой маркировки |
| Устойчивость к новым моделям | Требует регулярного дообучения | Зависит от секретности и устойчивости схемы маркировки |
| Основной риск | Ложные срабатывания и пропуск новых атак | Удаление, повреждение или отсутствие метки |
| Влияние на сигнал | Не изменяет исходную запись | Может вызывать сдвиг данных |
| Роль в комплаенсе | Дополнительный анализ подлинности | Подтверждение происхождения и трассируемости |
Ключевой технический конфликт состоит в том, что водяная марка способна изменять распределение данных, на котором работают пассивные детекторы. В результате маркированный сигнал иногда ухудшает их точность и увеличивает EER. То есть добавление одного защитного слоя может снизить эффективность другого, если архитектуры проектировались независимо.
По этой причине внедрение водяного знака должно проходить как изменение всей системы обработки аудио, а не как подключение отдельного API. Необходимо проверять совместимость с детекторами, кодеками, архивными форматами, системами транскрибации и каналами доставки.
Защита от клонирования голоса: где начинается право
Техническая защита не решает вопрос отчуждения прав на голос. Голос человека не сводится к аудиофайлу, который можно свободно передать подрядчику вместе с лицензией на использование записи. В договоре необходимо разделять как минимум исходные материалы, созданную голосовую модель, синтетические результаты и права на конкретные способы эксплуатации.
Для актера или диктора критичны следующие условия:
- разрешено ли обучение модели на исходных записях;
- может ли заказчик создавать новые фразы, которых человек никогда не произносил;
- ограничены ли срок, территория и языки использования;
- допускается ли передача модели субподрядчику;
- кто отвечает за удаление модели после завершения договора;
- можно ли использовать голос в политической рекламе, финансовых сервисах или медицинской коммуникации;
- каким образом фиксируется согласие на каждый новый тип применения.
Формулировка о согласии на «обработку аудиоматериалов» не обязательно покрывает последующее клонирование. С точки зрения управления риском важно не только наличие подписи, но и определенность предмета лицензирования. Чем шире и менее конкретно описано разрешение, тем выше вероятность спора о выходе использования за согласованные пределы.
Отдельный уровень — биометрическая защита голоса. Если голосовой шаблон применяется для идентификации или подтверждения личности, организация должна рассматривать его как чувствительный объект комплаенса, а не как обычный медиафайл. Шаблон, исходная запись, логи решений модели и результаты антиспуфинга требуют разных режимов доступа и хранения.
Для медицинских голосовых интерфейсов цена ошибки может быть выше из-за риска неверного распознавания пациента, назначения или инструкции. На этом фоне обсуждение сокращения бюджета на исследования безопасности пациентов показывает более широкий контекст: цифровая инфраструктура контроля безопасности требует финансирования не только на этапе разработки, но и в процессе постоянного аудита. Голосовой AI в клинике не должен восприниматься как обычный канал автоматизации, если его решения влияют на доступ к медицинской информации или действия персонала.
Что фиксировать в журнале происхождения
Организации, которые используют синтетическую речь, должны вести внутренний журнал происхождения контента. Минимальный набор зависит от сценария, но обычно включает:
- идентификатор модели и ее версию;
- дату и время генерации;
- идентификатор операции или сессии;
- сведения о согласии на использование голоса;
- параметры лицензии;
- факт наличия водяной марки;
- результаты проверки антиспуфингом;
- изменения файла после генерации;
- лиц, имевших доступ к исходным данным и готовому аудио.
Это не бюрократическое дополнение к технологическому стеку. При споре о подлинности записи именно журнал позволяет отличить контролируемый синтетический контент от файла неизвестного происхождения. Без него даже корректно работающая модель будет оставаться черным ящиком, а компания — зависеть от экспертной оценки постфактум.
Как предотвратить кражу голоса ИИ в корпоративном процессе
Универсальной процедуры нет, но архитектуру защиты можно выстроить по уровням. Каждый уровень закрывает отдельный класс уязвимости.
1. Ограничить сбор и повторное использование голоса
Публичный голосовой контент невозможно полностью изъять из интернета после публикации. Однако организация может снизить риск, исключив из открытого доступа длинные чистые записи, необработанные интервью и материалы с большим количеством связной речи.
Для внутренних систем следует разделять:
- исходные студийные записи;
- очищенные датасеты;
- модели и эмбеддинги голоса;
- готовые синтетические файлы;
- резервные копии;
- публичные версии контента.
Доступ к ним не должен предоставляться по одной общей роли. Команда, которая создает озвучку, не обязана иметь доступ к исходному датасету или ключам водяной марки.
2. Не использовать голос как единственный фактор
Голосовая биометрия уместна как один из факторов, но ее нельзя считать непробиваемым доказательством личности. Антиспуфинг снижает вероятность атаки, но не исключает социальную инженерию, компрометацию учетной записи или передачу управления настоящим пользователем.
Для финансовых операций, смены реквизитов, восстановления доступа и раскрытия чувствительных данных следует предусматривать независимое подтверждение. Это может быть приложение, аппаратный ключ, обратный звонок по доверенному номеру или ручная проверка. Выбор зависит от процесса, но принцип остается неизменным: успешное прохождение голосового теста не должно автоматически разрешать действие с высокой стоимостью ошибки.
3. Проверять каналы, а не только модели
Модель, проверенная на WAV-файлах студийного качества, не готова к эксплуатации в телефонном центре. Тестовый контур должен включать реальные и пограничные условия:
- разные кодеки;
- запись через микрофон и динамик;
- фоновый шум;
- короткие фразы;
- паузы и перебивания;
- смешение речи с музыкой;
- изменение громкости;
- ресемплирование;
- повторное сжатие;
- преобразование текста в речь с последующей записью через акустический канал.
Особенно опасна оценка на данных, которые слишком похожи на обучающую выборку. Она создает иллюзию высокой точности и плохо показывает поведение системы против новых генераторов.
4. Обновлять модели и сценарии реагирования
Детектор должен иметь регламент переоценки. Основанием для внеплановой проверки могут быть новая модель клонирования, заметное изменение каналов, рост числа подозрительных звонков или появление нового типа мошенничества.
Не менее важен сценарий после срабатывания. Если система просто присваивает аудио метку «подделка», бизнес-процесс остается без решения. Нужно заранее установить:
- при каком уровне риска операция приостанавливается;
- когда требуется повторная фраза;
- в какой момент подключается оператор;
- какие данные можно сообщать клиенту;
- как сохраняется спорная запись;
- кто имеет право отменить блокировку;
- как проводится постинцидентный анализ.
Пределы технологий и регуляторный прогноз
Сегодня не существует стопроцентного универсального метода, который защищал бы от всех будущих архитектур TTS и voice conversion без обновления моделей. Это ограничение носит не временный, а системный характер. Защита строится против наблюдаемых классов атак, тогда как генеративные модели меняют распределение сигналов быстрее, чем корпоративные процедуры успевают пройти закупку, интеграцию и сертификацию.
Пассивная детекция будет развиваться в сторону мультимодального и контекстного анализа. Одного аудиофайла недостаточно, поэтому в решение могут включаться временные метки, сведения о канале, поведение пользователя, история сессии и криптографические подтверждения происхождения. Однако расширение набора сигналов повышает требования к защите персональных данных и усложняет объяснимость решения.
Проактивная маркировка, вероятно, станет обязательным элементом крупных генеративных платформ, но ее юридическая сила будет зависеть от процедуры хранения ключей, доступности проверяемых журналов и признания таких механизмов регуляторами и судами. Сам факт наличия водяной марки не доказывает, что весь материал после генерации не подвергался изменениям.
Для правообладателей голоса наиболее значимым направлением останется лицензирование цифрового двойника. Рынок будет переходить от разовой оплаты записи к управлению правами на модель: с ограничением сценариев, сроков, языков, каналов и способов коммерческого использования. Компании, которые не смогут доказать происхождение голосового датасета и наличие согласия, будут нести не только договорные, но и репутационные риски.
В корпоративной безопасности это приведет к смене критерия эффективности. Компании будут оценивать не только EER или t-DCF, но и время обнаружения инцидента, стоимость ручной проверки, долю операций с дополнительной аутентификацией, полноту журнала происхождения и способность удалить голосовую модель по завершении лицензии.
Вывод
Защита от клонирования голоса не сводится к поиску лучшего детектора дипфейков. Пассивный анализ выявляет акустические признаки атаки, цифровая водяная марка подтверждает происхождение, голосовая биометрия сопоставляет пользователя с шаблоном, а комплаенс определяет, имела ли организация право использовать этот голос.
Надежная система должна объединять эти уровни и признавать их ограничения. ASVspoof и метрика t-DCF дают индустрии измеримую методологию, модели вроде AASIST3 показывают направление развития антиспуфинга, а водяные знаки создают механизм трассируемости. Но ни один из этих инструментов не отменяет резервного фактора аутентификации, контроля доступа к датасетам и корректного лицензирования.
В ближайшие годы выиграют не те платформы, которые будут обещать невозможность подделки голоса, а те, которые смогут документально показать происхождение аудио, стоимость ошибки и порядок действий после срабатывания защиты. Это уже не вопрос качества синтеза. Это вопрос управляемого риска.