Голосовая биометрия госуслуги: защита от дипфейков и ИИ-атак
Голосовая биометрия в государственных сервисах больше не может оцениваться по принципу «система узнаёт тембр».

Для современной атаки достаточно сгенерировать правдоподобную речь, воспроизвести фрагмент разговора или преобразовать голос одного человека в голос другого. Поэтому вопрос безопасности ЕБС сводится не к качеству звучания синтезатора, а к тому, способен ли контур идентификации отличить живого человека от цифровой имитации.
В Единой биометрической системе используются две основные модальности — изображение лица и запись голоса. Оператором системы выступает АО «Центр Биометрических Технологий». В архитектуре предусмотрены механизмы проверки живости, или liveness detection, а также многоуровневый анализ речевых и физиологических признаков. Это принципиально отличает голосовую биометрию госуслуг от простой проверки совпадения аудиофайла с эталонной записью.
Клонирование голоса угрожает не самой системе идентификации, а слабому сценарию вокруг неё: записи разговора, отсутствию проверки живости и недостаточному контролю согласий.
Архитектура ЕБС: почему одного голоса недостаточно
Голосовая идентификация обычно строится на сравнении биометрического образца с ранее зарегистрированным профилем. Модель анализирует не только слова, но и совокупность параметров речи: характеристики голоса, особенности произношения, темп, артикуляцию и другие признаки, которые могут использоваться для сопоставления личности.
Однако в защищённой системе задача состоит из двух разных процедур:
1. Проверить соответствие голоса зарегистрированному профилю.
2. Установить, что перед системой находится живой человек, а не воспроизведение или синтетическая генерация.
Именно вторая процедура определяет устойчивость к аудиодипфейкам. Если сервис ограничивается анализом заранее записанной фразы, атакующему достаточно получить или сгенерировать подходящий фрагмент. Если же система анализирует поведение пользователя в реальном времени, проверяет совокупность параметров речи и использует дополнительные признаки, воспроизведение становится только одним из факторов риска, а не готовым способом обхода защиты.
В публичных описаниях ЕБС отдельно указывается, что внешнего сходства или подделки голоса недостаточно для прохождения идентификации. Система применяет liveness detection и анализирует параметры речи и физиологические признаки в реальном времени. Конкретная архитектура алгоритмов и исходный код не раскрываются. Это ожидаемо для системы, которая должна противостоять целенаправленным атакам: публикация детального описания порогов и логики принятия решения упростила бы подготовку обходных сценариев.
При этом закрытость архитектуры нельзя трактовать как доказательство абсолютной защищённости. Вероятностная модель не даёт стопроцентной гарантии против всех будущих атак. Безопасность ЕБС определяется не только алгоритмом, но и качеством каналов связи, процедурой регистрации, защитой устройств, управлением доступами и действиями оператора, который использует результат биометрической проверки.
Liveness detection против синтезированного голоса
Liveness detection — это не отдельный фильтр, который просто ищет «роботизированное» звучание. Современный синтез речи может быть достаточно естественным, чтобы человеческое ухо не обнаружило подделку. Поэтому детекция должна оценивать признаки происхождения сигнала и контекст взаимодействия.
Условно угрозы для голосовой биометрии можно разделить на несколько классов.
| Тип атаки | Что получает злоумышленник | Почему простой анализ голоса недостаточен | Какой контур защиты требуется |
|---|---|---|---|
| Воспроизведение записи | Фрагмент реальной речи владельца биометрии | Голос может совпадать с эталоном, хотя человек отсутствует | Проверка живости, анализ канала и сценария взаимодействия |
| Синтез речи по образцам | Сгенерированную фразу с нужным содержанием | Нейросеть воспроизводит тембр и интонацию без участия владельца | Детекция синтетических признаков и проверка поведения в реальном времени |
| Voice conversion | Преобразованный голос атакующего | Система может получить правдоподобный тембр при иной артикуляции | Комплексное сравнение речевых и физиологических признаков |
| Монтаж аудиофайла | Фрагменты речи, собранные из разных источников | Отдельный сегмент может выглядеть убедительно вне исходного контекста | Контроль целостности сессии и анализ последовательности сигнала |
| Атака на устройство или канал | Перехваченный либо подменённый поток данных | Даже сильная модель не компенсирует компрометацию инфраструктуры | Защита передачи, журналирование, управление сессией и доступами |
Эта таблица описывает классы угроз, а не подтверждает, что каждый из них способен обойти ЕБС. Публичные данные не позволяют оценить точный процент успешности атак на liveness detection в реальных условиях. Более того, раскрытие таких показателей без методики тестирования было бы малоинформативным: результат зависит от качества микрофона, сетевого соединения, шума, сценария фразы, типа синтезатора и способа атаки.
Для пользователя принципиальна другая граница. Поддельный голос, который убедительно звучит в телефонном разговоре, не равен поддельному голосу, который пройдёт защищённую биометрическую идентификацию. В первом случае человек оценивает речь субъективно. Во втором система анализирует цифровой сигнал и дополнительные признаки по формализованным процедурам.
Это не отменяет рисков социальной инженерии. Аудиодипфейк может использоваться не для прямого обхода ЕБС, а для давления на сотрудника, получения кода подтверждения, убеждения родственника или инициирования платежа через менее защищённый канал. Поэтому защита голосовой биометрии и защита от мошенничества с использованием голоса — связанные, но не одинаковые задачи.
Голосовая биометрия госуслуги и уровни доступа
В ЕБС предусмотрены три уровня биометрических учётных записей:
- Упрощённая — базовый уровень, который не следует смешивать с полноценной идентификацией по всем возможным сценариям.
- Стандартная — оформляется через приложение «Госуслуги Биометрия».
- Подтверждённая — создаётся очно по паспорту и СНИЛС в МФЦ или банках.
Разделение по уровням имеет значение для оценки риска. Чем выше доверие к биометрическому профилю и чем больше операций он потенциально позволяет выполнять, тем строже должны быть процедура регистрации, контроль согласий и требования к организации, которая получает доступ к результату проверки.
Федеральный закон № 572-ФЗ был принят 29 декабря 2022 года, а основные положения вступили в силу 1 июня 2023 года. Обработка биометрических данных также регулируется законом № 152-ФЗ «О персональных данных». Для коммерческих организаций биометрическая идентификация должна осуществляться через ЕБС. Это означает, что компания не должна формировать параллельную систему идентификации, подменяя государственный контур собственным хранилищем биометрических шаблонов.
Юридически существенен и принцип добровольности. Сдача биометрии не является обязательной для всех граждан, а отсутствие биометрических данных не должно становиться основанием для отказа в услуге, если иной порядок не установлен применимыми правилами. Организация, которая создаёт давление на клиента или маскирует обязательность согласия под техническую необходимость, формирует не только репутационный, но и комплаенс-риск.
С 1 января 2024 года в личном кабинете появилась функция управления согласиями на использование биометрии. Для пользователя это важнее, чем декларативное обещание защищённости алгоритмов: доступ к данным должен быть связан с понятным основанием, определённой целью и контролируемым сроком действия согласия.
При внедрении биометрии компаниям приходится разделять несколько правовых ролей:
1. Оператор системы, который обеспечивает функционирование ЕБС и отвечает за её инфраструктуру.
2. Организация, инициирующая идентификацию, которая использует результат в рамках конкретной услуги.
3. Гражданин, чьи биометрические данные обрабатываются на основании установленной процедуры и согласия, когда оно требуется.
4. Подрядчики и поставщики технологий, которые могут участвовать в интеграции, но не получают автоматически право распоряжаться исходными данными.
Такое разделение влияет на распределение ответственности. Нельзя считать, что передача операции во внешний сервис автоматически снимает риски с компании-заказчика. В договоре и техническом контуре должны быть определены доступы, цели обработки, порядок реагирования на инцидент, хранение журналов и процедура прекращения интеграции.
Детекция дипфейков: полезный инструмент, но не сертификат подлинности
На портале ЕБС запущен сервисный дипфейк-детектор, созданный в партнёрстве с OVISION и ПБС «Мигом». По заявленным данным, в тестируемых сценариях алгоритм выявляет признаки синтеткой генерации изображений и лиц с точностью до 95%.
Эту цифру нельзя переносить на голосовую биометрию и нельзя трактовать как универсальную вероятность правильного решения. Точность алгоритма всегда относится к конкретному набору данных, типам подделок и условиям тестирования. Синтетическое изображение лица, сгенерированная речь, voice conversion и монтаж аудиозаписи имеют разные признаки, поэтому единый показатель для всех типов дипфейков методологически некорректен.
Детектор полезен как дополнительный слой контроля. Он может:
- отсекать часть очевидно синтетических материалов;
- помогать оператору предварительно оценивать загруженный контент;
- повышать стоимость массовых атак;
- использоваться в связке с другими процедурами проверки;
- формировать сигнал для дополнительной верификации.
Но он не должен превращаться в самостоятельное доказательство личности. Для финансовой или юридически значимой операции результат автоматической классификации необходимо связывать с контекстом: способом регистрации, уровнем учётной записи, параметрами сессии и полномочиями пользователя.
Показатель точности детектора относится к сценарию тестирования, а не к универсальной гарантии подлинности любого голоса или изображения.
Вопрос о том, насколько уязвима голосовая идентификация для дипфейков, поэтому нельзя решать одной цифрой. Необходимо смотреть на всю цепочку:
- где был получен исходный голос;
- как сформирован биометрический профиль;
- каким способом пользователь проходит проверку;
- присутствует ли активная проверка живости;
- может ли атакующий управлять устройством или каналом передачи;
- какие действия разрешены после успешной идентификации;
- существует ли дополнительное подтверждение для операции с высоким ущербом.
Последний пункт особенно важен для финансового сектора. Даже если голосовая проверка выполнена корректно, не каждая операция должна запускаться только по её результату. Уровень аутентификации должен соответствовать цене ошибки. Для просмотра справочной информации и для перевода значительной суммы это разные классы риска, а значит, и разные требования к подтверждению.
Ответственность за утечки и компрометацию биометрии
Голос нельзя заменить так же просто, как пароль. Пароль можно отозвать и выпустить заново. Биометрический признак связан с человеком постоянно. Если исходная запись, биометрический шаблон или метаданные идентификации утекли, ущерб может сохраняться длительное время, даже если сама система обнаружит инцидент и ограничит доступ.
По данным, приведённым в исследовательской фактуре, штрафы за утечку биометрических данных по статье 13.11 КоАП РФ могут составлять от 15 до 20 млн рублей. Для бизнеса это только непосредственная финансовая часть риска. К ней добавляются расходы на расследование, уведомление пользователей, восстановление инфраструктуры, юридическое сопровождение, приостановку операций и компенсационные претензии.
Финансовая модель риска для компании выглядит следующим образом:
ожидаемый ущерб = вероятность инцидента × стоимость последствий.
Биометрия увеличивает вторую часть формулы. Даже при умеренной вероятности атаки последствия компрометации могут быть выше, чем при утечке обычной регистрационной информации. Поэтому расчёт ROI от внедрения голосовой идентификации должен включать не только экономию на операторах и ускорение обслуживания, но и стоимость резервных процедур, аудита, защиты каналов и реагирования.
Для организации критичны пять зон контроля.
1. Регистрация биометрии
Слабая регистрация делает бесполезной последующую защиту. Если злоумышленник получил возможность создать профиль от имени другого человека или провести процедуру без достаточной проверки документов и присутствия владельца, liveness detection на этапе дальнейшего входа будет защищать уже скомпрометированный профиль.
2. Управление согласиями
Согласие должно быть не формальной галочкой, а управляемым объектом: с указанием цели, организации, срока и возможности отзыва. Пользователь должен понимать, где применяется биометрия и какие последствия имеет прекращение доступа.
3. Минимизация хранения
Компании не следует собирать больше данных, чем требуется для конкретной операции. Особенно опасна практика создания локальных архивов голосовых записей, если интеграция с ЕБС уже позволяет получить необходимый результат идентификации без накопления исходного материала.
4. Разграничение полномочий
Доступ к биометрическим данным и результатам проверки должен быть разделён по ролям. Сотрудник контактного центра, системный администратор и специалист по расследованию инцидентов не должны иметь одинаковый объём полномочий.
5. Сценарий отказа
Ошибочное срабатывание liveness detection не должно автоматически превращаться в безусловный отказ клиенту. Нужна процедура альтернативной проверки, особенно с учётом принципа добровольности биометрии и запрета дискриминационного отказа в услуге при отсутствии биометрических данных.
Сравнение голосовой биометрии с альтернативами
У голосовой идентификации есть сильная сторона: она не требует отдельного считывателя отпечатка или сложного пользовательского интерфейса и может работать в дистанционном сценарии. Но удобство повышает требования к защите. Голос легко записать, а публичные аудиоматериалы увеличивают объём данных, доступных для обучения моделей клонирования.
| Метод верификации | Преимущество | Основной риск | Роль в защищённом сценарии |
|---|---|---|---|
| Голосовая биометрия | Дистанционное использование и естественный пользовательский интерфейс | Клонирование, воспроизведение и социальная инженерия | Идентификация при наличии liveness detection и контроля сессии |
| Изображение лица | Возможность сопоставления с документом и видеопотоком | Маски, изображения, генерация лица, атаки на камеру | Дополнительная модальность и проверка присутствия |
| Одноразовый код | Простая реализация и понятная процедура | Перехват, фишинг, передача кода третьему лицу | Дополнительный фактор, но не самостоятельная гарантия личности |
| Пароль | Низкая стоимость внедрения и возможность замены | Утечки, повторное использование, фишинг | Базовый фактор доступа |
| Очная проверка документов | Высокая процессуальная определённость | Стоимость и ограниченная масштабируемость | Регистрация подтверждённого уровня биометрии |
Из таблицы следует, что голос не является заменой всем остальным факторам. Его рациональнее использовать как часть многоуровневого контура, где риск операции определяет набор подтверждений. Для подтверждённой регистрации предусмотрена очная процедура по паспорту и СНИЛС в МФЦ или банках. Это повышает доверие к исходному профилю, но не устраняет необходимость защищать последующие сессии.
Ключевая ошибка корпоративного внедрения — считать, что биометрическая проверка автоматически делает операцию безопасной. На практике нужно защищать не только момент распознавания, но и то, что происходит после него. Если после положительного результата пользователь получает широкие полномочия без повторной проверки, атака на учётную запись, сессию или внутреннюю систему может обойти даже качественную голосовую модель.
Что означает защита от подделки голоса на практике
Для гражданина безопасность ЕБС определяется не возможностью распознать любой дипфейк на рынке, а тем, насколько система снижает вероятность конкретного сценария компрометации. Простая проигрываемая запись не должна рассматриваться как гарантированный способ обхода голосовой идентификации: система использует проверку живости и совокупный анализ параметров. Но и обратное утверждение — о невозможности любых ИИ-атак — не имеет достаточных оснований.
Для бизнеса требования более формальны. Перед подключением к биометрическому контуру необходимо оценить:
- какие операции будут доступны после идентификации;
- является ли голос единственным фактором;
- используется ли видео или другая модальность;
- как обрабатываются ошибки и подозрительные сессии;
- где хранятся журналы и технические события;
- какие подрядчики получают доступ к инфраструктуре;
- как отзывается согласие пользователя;
- сколько времени компания хранит сведения о проведённой проверке;
- кто отвечает за уведомление и расследование инцидента;
- предусмотрена ли ручная или очная альтернатива.
Для пользователя практическая защита начинается с контроля собственного цифрового следа. Публичная голосовая запись не является паролем, который нужно немедленно менять, но она может стать материалом для социальной инженерии и генерации синтетической речи. Нельзя передавать коды подтверждения собеседнику, который представляется банком или государственным сервисом, даже если голос кажется знакомым. Надёжность голосовой биометрии не распространяется на обычный телефонный разговор, где отсутствует защищённая процедура идентификации.
Регуляторный прогноз
Регулирование Voice-AI будет смещаться от оценки качества синтеза к контролю происхождения и использования данных. Для компаний это означает рост требований к лицензированию голосов, отчуждению прав, согласию актёров и дикторов, маркировке синтеткого контента и доказуемости происхождения аудиоматериалов.
В государственном контуре основными направлениями останутся многофакторная идентификация, liveness detection, управление согласиями и разделение полномочий между оператором системы и организацией, которая использует результат проверки. Вероятно, усилится и требование к журналированию: при спорной операции нужно будет установить, какой профиль применялся, каким был уровень учётной записи, кто инициировал проверку и какие дополнительные факторы были задействованы.
Для коммерческих систем голосовой ИИ это создаёт отдельный рынок комплаенса. Поставщику будет недостаточно заявить, что модель умеет распознавать дипфейки. Понадобятся методики тестирования, описание границ применимости, контроль обновлений модели и процедура реагирования на новые типы атак. Показатель точности вроде заявленных до 95% должен сопровождаться сценарием, выборкой и перечнем ограничений, иначе он остаётся маркетинговой характеристикой, а не основанием для принятия риска.
Голосовая биометрия госуслуг уже строится как многоуровневая система, а не как аудиопароль. Её устойчивость к дипфейкам определяется сочетанием регистрации, проверки живости, анализа речи и физиологических признаков, правового режима и контроля операций после идентификации. Для пользователя это означает снижение риска, но не отмену базовой цифровой гигиены. Для бизнеса — необходимость считать не только ROI автоматизации, но и стоимость ошибки, утечки и нарушения процедуры обработки биометрии.
Регуляторный тренд очевиден: чем дешевле становится клонирование голоса, тем дороже будет обходиться доказательство его легитимного происхождения. Идентификация останется частью защиты, но перестанет быть единственным доказательством того, что голос действительно принадлежит человеку.