В феврале 2025 года iProov провела тестирование 2000 человек на предмет распознавания смеси реальных медиафайлов и контента, созданного ИИ. Лишь 0,1% участников правильно идентифицировали каждый элемент, а точность распознавания только высококачественных видеодипфейков составила 24,5%.
Между тем 60% тех же участников заявили, что уверены в своей способности распознать подделку. Этот разрыв между уверенностью и точностью представляет собой реальную проблему безопасности. Обнаружение должно происходить на уровне системы, а не зависеть от суждений человека во время живого звонка.
В этой статье рассматривается то, как работает обнаружение на системном уровне, аудиофорензика, биологические сигналы и методы в частотной области, которые выявляют синтетические медиаданные, а также то, где каждый из этих методов дает сбой сам по себе. В ней также рассматриваются недавние инциденты мошенничества с точки зрения демонстрируемых ими паттернов атак и то, как встроить верификацию в рабочий процесс, а не полагаться на мнение сотрудника посреди звонка.
Основные выводы
- Центр финансовых услуг Deloitte' прогнозирует, что убытки от мошенничества с использованием генеративного ИИ в США достигнут 40 миллиардов долларов к 2027 году по сравнению с 12,3 миллиардами долларов в 2023 году, при этом совокупный годовой темп роста составит 32%.
- Точность человеческого обнаружения видеодипфейков составляет около , а уверенность в этой способности значительно превышает реальные результаты.
- Наука реального обнаружения работает на уровне сигналов: анализ формант аудио и вокодеров, обнаружение биологических сигналов, таких как rPPG, генерация частотных отпечатков GAN и несовпадение тайминга фонем и визем.
- Ни один отдельный метод не эффективен сам по себе. Каждый метод обнаружения, описанный здесь, имеет задокументированный режим сбоя, и исследования по обходу ведутся активно для каждого из них.
- Многоуровневая защита, сочетающая обнаружение, проверку на жизнь (liveness) и внеполосную (out-of-band) верификацию, превосходит любой отдельный элемент контроля, включая обучение сотрудников.
Что считается мошенничеством с использованием ИИ-дипфейков
Мошенничество с ИИ-дипфейками использует синтезированные голос, видео, текст или изображения для выдачи себя за реального человека с целью манипулирования кем-либо для совершения мошеннических действий, чаще всего перевода средств, передачи учетных данных или изменения прав доступа.
Это кардинально отличается от мошенничества с украденными учетными данными: злоумышленник не взламывает аккаунт; он генерирует убедительную версию доверенного лица и использует ее напрямую против другого человека в режиме реального времени.
Специалисты по безопасности делят это на две категории атак, которые стоит знать по названиям, поскольку они требуют разных защитных мер: атаки на предъявление и инъекционные атаки.
Атаки на предъявление физически представляют подделку перед камерой или микрофоном (маску, макияж или экран, воспроизводящий дипфейк в реальном времени), и это категория, охватываемая стандартом обнаружения атак на предъявление ISO/IEC 30107.
Инъекционные атаки полностью обходят камеру, перехватывая или заменяя поток данных между записывающим устройством и системой верификации для прямой подачи манипулированных или синтетических биометрических данных. Обновленные рекомендации NIST по цифровой идентификации рассматривают это отдельно, требуя от систем верификации подтверждения того, что биометрический сигнал действительно исходит из живого захвата, а не из воспроизведенного или внедренного ввода.
Почему ручное распознавание дипфейков больше не работает
Большинство советов, основанных на визуальных подсказках — следите за морганием, обращайте внимание на освещение, проверяйте синхронизацию губ — предполагают наличие человека, который выполняет проверку.
Многочисленные исследования восприятия синтетического голоса показали, что точность людей при идентификации клонированного аудио близка к случайной угадываемости, и ситуация ухудшается под давлением времени, которое злоумышленники намеренно создают с помощью срочных запросов.
Gartner пошла еще дальше, оценив, что к 2026 году 30% предприятий будут рассматривать автономную верификацию личности как ненадежную именно из-за риска дипфейков. Практический вывод: любой контроль, зависящий от того, «выглядит ли этот человек и звучит ли он правильно», требует машинного сигнала под ним, а не просто хорошо обученного сотрудника.
Как на самом деле создаются атаки с использованием дипфейков
Цепочка атак одинакова в большинстве инцидентов, независимо от канала.
Сбор исходного материала. Злоумышленники извлекают аудио и видео из отчетов о доходах, вебинаров, выступлений на конференциях, интервью и социальных сетей. Инструменты клонирования голоса теперь требуют всего несколько секунд чистого аудио для создания пригодного клона; горстки видеоклипов достаточно для обучения модели замены лица в реальном времени.
Развертывание в реальном времени. Изменение, которое имеет операционное значение, заключается в том, что дипфейки больше не являются предварительно записанными. Преобразование голоса работает в реальном времени, позволяя злоумышленнику говорить естественно, в то время как программное обеспечение преобразует его голос в соответствии с целью прямо во время разговора. Инструменты замены лиц делают то же самое для видео, накладывая синтетическое лицо на трансляцию с живой камеры кадр за кадром.
Запрос на манипуляцию. Синтетические медиаданные являются механизмом доставки, а не целью. Они используются для создания срочности и авторитета вокруг конкретной просьбы, обычно денежного перевода, сброса учетных данных или исключения из стандартного процесса утверждения.
Топ-6 методов: как системы обнаружения действительно выявляют дипфейки
Именно здесь большинство руководств останавливается на общих советах. Реальная наука обнаружения работает с сигналами, которые человек не может воспринять, но которые модель может точно измерить.
- Аудиофорензика: форманты, просодия и артефакты вокодера
Человеческая речь следует модели источник-фильтр: голосовые связки производят гармонический исходный сигнал, а голосовой тракт формирует его в форманты — резонансные частоты, которые различают гласные звуки. Клонированные голоса убедительно воспроизводят перцептивное звучание речи, но часто не могут воспроизвести точную динамику формант, особенно в среднечастотном диапазоне, где естественную артикуляцию сложнее всего смоделировать точно.
Помимо формант, судебно-медицинский анализ аудио рассматривает просодические и физиологические маркеры, которые модели синтеза все еще с трудом подделывают: контур высоты тона и джиттер (вариация высоты тона от кадра к кадру), шиммер (вариация амплитуды), отношение гармоник к шуму, а также естественные паттерны дыхания и микропаузы. Это непроизвольные физиологические артефакты человеческого голосового тракта, а не стилистические выборы, что затрудняет их убедительное изучение моделью генерации по сравнению с самими словами.
Инструменты преобразования и синтеза голоса также оставляют обнаруживаемые следы от вокодера — компонента, который преобразует внутреннее представление модели обратно в аудиоволну. Вокодеры на основе GAN и диффузионных моделей обычно производят фазовые разрывы, несогласованные гармонические фазы между соседними кадрами и резкие спектральные переходы на границах кадров синтеза, которые иногда видны как слабые высокочастотные артефакты на спектрограмме, которые обученная модель обнаружения может напрямую пометить.
- Обнаружение биологических сигналов: считывание пульса, который дипфейк не может подделать
Это один из наиболее по-настоящему изощренных подходов к обнаружению и тот, который большинство материалов по предотвращению мошенничества полностью пропускает. Дистанционная фотоплетизмография (rPPG) измеряет тонкие периодические изменения цвета кожи человека, вызванные кровотоком при каждом сердечном сокращении — изменения, невидимые глазу, но обнаруживаемые вычислительным путем кадр за кадром в обычном видео.
Поскольку модели для замены лиц и генерации изображений манипулируют изображением лица без моделирования лежащего в его основе сердечного ритма, извлеченный из дипфейка паттерн rPPG (удаленной фотоплетизмографии) либо отсутствует, либо является непоследовательным или статистически отличным от того, что создает настоящий пульс. Системы обнаружения применяют методы обработки сигналов, такие как отношение сигнал/шум, спектральная плотность мощности, корреляция Пирсона между областями лица, которые должны демонстрировать коррелирующие пульсовые сигналы, и дискретное вейвлет-преобразование, чтобы отделить подлинные периодические сердечные ритмы от шума или подделки.
Важное предостережение: качество сигнала rPPG ухудшается при сжатии видео и низком разрешении, что часто встречается в реальных звонках, поэтому он лучше всего работает как один из сигналов в более широком стеке, а не как самостоятельная проверка. Недавние исследования также показали, что детекторы на основе rPPG сами могут быть обмануты достаточно продвинутыми генераторами, которые специально нацелены на этот сигнал, что означает, что это не постоянное «слепое пятно» для злоумышленников, а лишь актуальное на данный момент.
- Цифровые отпечатки GAN и диффузионных моделей
Генеративные модели оставляют структурные отпечатки, связанные с тем, как они создают изображение. Сверточные генераторы, полагающиеся на операции апсемплинга (расширения), что является распространенным архитектурным выбором для масштабирования низкоразрешенного внутреннего представления до полного размера изображения, склонны привносить периодические, похожие на шахматную доску паттерны в высокочастотный спектр выходного сигнала. Эти паттерны не встречаются на изображениях, снятых камерой, которые имеют принципиально иные характеристики высокочастотного шума, обусловленные сенсором и оптикой объектива.
Анализ в частотной области позволяет обнаруживать эти паттерны напрямую, а в некоторых исследованиях — даже приписывать изображение конкретной архитектуре генератора, которая, вероятно, его создала, поскольку разные семейства моделей оставляют различимые сигнатуры отпечатков. Это важно для корпоративного обнаружения, поскольку означает, что хорошо обученная система не просто отвечает «реально или подделка»; она может пометить, какое семейство генераторов создало контент, что является полезным контекстом для расследования мошенничества.
- Несоответствие фонем и визем и тайминг синхронизации губ
Дипфейки с синхронизацией губ подстраивают движение рта под аудио, но выравнивание между фонемами (единицами звука речи) и виземами (соответствующими формами рта) может смещаться на небольшие величины, которые не заметны зрителю при обычном просмотре, но измеримы кадр за кадром. Исследования этого метода показали, что несоответствия длительностью от 50 до 100 миллисекунд обнаружимы, даже если синхронизация губ выглядит убедительно при нормальной скорости воспроизведения.
Более современные подходы извлекают десятки лицевых ориентиров в области губ (обычно с использованием таких инструментов, как MediaPipe FaceMesh) для точного отслеживания динамики артикуляции по всему видео, а затем сравнивают это движение с тем, что предсказала бы последовательность фонем аудио. Устойчивое отклонение является сильным сигналом синтетического медиа, особенно полезным против атак типа «замена лица плюс отдельный клон голоса», где два компонента изначально не были созданы для идеальной синхронизации.
- Мультимодальная перекрестная проверка
Причина, по которой одноканальное обнаружение все чаще пропускает атаки: многие текущие попытки мошенничества объединяют клон голоса из одного инструмента с заменой лица из другого, сшитые вместе для звонка. Каждый компонент может по отдельности пройти узкую одномодальную проверку. Перекрестная проверка аудио- и визуальных сигналов друг с другом, выявление случаев, когда они не имеют общего отпечатка генерации или профиля тайминга, позволяет обнаружить атаки, которые проходят изолированную проверку каждого канала.
- Живость и поведенческий контекст
Детекция «живости» (liveness) отвечает на более узкий вопрос, чем описанные выше методы: физически ли присутствует живой человек прямо сейчас, основываясь на текстуре, глубине и реакции на запросы. Это эффективно против масок, распечатанных фотографий и воспроизведения с экрана, но хорошо сгенерированный дипфейк, который двигается естественно и реагирует на запросы, может пройти проверку. Поведенческие сигналы, такие как нерешительность при ответах на незапланированные дополнительные вопросы, сопротивление этапам проверки, просьбы обойти стандартный процесс и просьбы добавить контекст, — это то, что одна лишь проверка на «живость» обеспечить не может.
Где методы обнаружения терпят неудачу
Говорить об этом прямо важнее, чем делать вид, что проблема обнаружения решена. Каждый из вышеперечисленных методов имеет известное ограничение, и отношение к любому из них как к достаточному само по себе является риском.
Сжатие ухудшает методы, основанные на сигналах. rPPG и тонкие спектральные артефакты ослабевают при сжатии и перекодировании, через которые проходят реальные звонки и загрузки. Метод, который хорошо работает на чистом лабораторном файле, может показать низкую эффективность во время сжатого конференц-звонка.
Детекторы сталкиваются с активной гонкой вооружений в области уклонения. Генеративные модели все чаще обучаются с учетом обнаружения, и исследования показали, что состязательные возмущения могут быть специально нацелены на известные сигналы обнаружения, включая методы на основе rPPG. Детектор, проверенный на генераторах прошлого года, не гарантирует обнаружение моделей этого года.
Генеративные модели «нулевого дня» создают пробелы в покрытии. Модель обнаружения, обученная на известных отпечатках генераторов, может пропустить результат работы совершенно новой архитектуры, которую она еще не видела. Покрытие новых генеративных моделей должно закрываться за часы или дни.
Одномодальные проверки пропускают «сшитые» атаки. Как упоминалось выше, объединение клонированного голоса из одного инструмента с заменой лица из другого побеждает обнаружение, которое проверяет только один канал.
Это и есть настоящий аргумент в пользу многоуровневости, а не предостережение, которое можно пропустить. Ни один отдельный метод, включая технически сложные, описанные здесь, не является полным ответом сам по себе.
Создание многоуровневой программы обнаружения и верификации
Запускайте обнаружение на «живых» каналах. Звонки и видеовстречи — это то место, где мошенничество с выдачей себя за другое лицо происходит в режиме реального времени, поэтому обнаружение должно работать во время взаимодействия.
Комбинируйте типы сигналов. Сочетайте аудиокриминалистику, визуальный/частотный анализ и поведенческие сигналы, вместо того чтобы полагаться на что-то одно. Атаки, которые обходят один уровень, обычно не обходят все их одновременно.
Требуйте внеполосную (out-of-band) верификацию для действий с высоким уровнем риска. Одобрение платежей, сброс учетных данных и изменение прав доступа должны проходить через второй, независимый канал перед выполнением, независимо от того, насколько убедительным казался запрос.
Заранее определите пути эскалации. Сотрудникам нужен задокументированный процесс для пометки подозрительного звонка, а не решение, принятое под давлением времени.
Регулярно проводите повторное тестирование систем обнаружения. Учитывая исследования по уклонению, модель обнаружения, проверенная год назад, нуждается в повторной проверке на соответствие современным методам, а не в предположении, что она все еще работает так же.
Как на самом деле выглядели недавние инциденты с дипфейк-мошенничеством
Сингапур, 2025 год. Финансовый директор санкционировал перевод 499 000 долларов США после видеозвонка в Zoom с созданными с помощью ИИ копиями финансового директора компании и других топ-менеджеров, созданными на основе общедоступных видеоматериалов и инструментов клонирования голоса. Мошенничество раскрылось, когда те же злоумышленники запросили еще 1,4 миллиона долларов, что побудило директора предупредить банк. Власти Сингапура и Гонконга заморозили и вернули переведенные средства — редкий случай, когда обнаружение произошло достаточно быстро, чтобы предотвратить убытки.
Швейцария, январь 2026 года. Предприниматель из кантона Швиц потерял несколько миллионов швейцарских франков в ходе серии телефонных звонков, в которых клонированный с помощью ИИ голос выдавал себя за доверенного бизнес-партнера. В отличие от случая с Arup в 2024 году, здесь использовалось только аудио без видеокомпонента, что демонстрирует ту же схему мошенничества, работающую через менее затратный канал.
Оба случая имеют схожую структуру: мошенничество было распознано не человеком на звонке, заметившим неладное. Оно всплыло позже, в ходе несвязанного этапа верификации. Именно в этом заключается аргумент в пользу того, что обнаружение должно происходить прямо во время взаимодействия.
Как Resemble AI усиливает обнаружение мошенничества с дипфейками
Resemble Detect выполняет мультимодальный анализ (аудио, видео и изображения) с помощью единой модели DETECT-World, а не отдельных инструментов для каждого канала, что напрямую решает проблему комбинированных атак, описанную выше. Система выдает вердикт менее чем за 300 миллисекунд, прошла тестирование на более чем 250 генеративных моделях ИИ и заняла место в топ-2 независимого аудиобенчмарка дипфейков Podonos с точностью 99,5%.
Поддержка новых генеративных моделей добавляется в течение нескольких часов после их публичного выпуска, что имеет решающее значение для устранения проблемы уязвимостей нулевого дня, описанной ранее. Каждый результат поставляется с объяснением того, какие именно сигналы вызвали срабатывание, а не просто с оценкой.
В частности, для живых звонков и встреч Resemble Meetings выполняет обнаружение прямо во время сеансов Zoom, Microsoft Teams, Google Meet и Webex, выявляя синтетический голос или видео во время активного звонка.
Resemble Identity добавляет верификацию на уровне говорящего, сверяя зарегистрированный голос с живым звонящим в реальном времени, а не просто фиксируя общие аномалии. Развертывание осуществляется в облачных, локальных или изолированных (air-gapped) средах для организаций, которые не могут передавать данные звонков на стороннюю инфраструктуру.
Заключение
Разрыв между тем, насколько уверенными люди себя чувствуют в распознавании дипфейков, и их реальной точностью, является истинной уязвимостью, а не отсутствием осведомленности. Устранение этого разрыва означает перенос обнаружения в системы, обрабатывающие звонки, загрузки и верификацию, с использованием реальных научных методов на уровне сигналов (биологических, спектральных и в частотной области), а не визуальной интуиции.
Ни один отдельный метод не покрывает все возможные векторы атак, именно поэтому многоуровневое обнаружение и внеполосная (out-of-band) верификация важнее любого отдельного инструмента. Если вы оцениваете, как это вписывается в ваши существующие рабочие процессы мошенничества и безопасности, запишитесь на демонстрацию, чтобы увидеть, как Resemble Detect и Resemble Meetings применяются для ваших конкретных каналов.
Часто задаваемые вопросы
1. В чем разница между обнаружением дипфейков и обнаружением жизни (liveness)? Обнаружение жизни подтверждает присутствие живого человека во время проверки. Обнаружение дипфейков определяет, является ли сам медиафайл синтетическим. Убедительный дипфейк может пройти проверку на жизнь, поэтому эти два метода должны работать как отдельные, дополняющие друг друга уровни.
2. Можно ли обмануть обнаружение rPPG (биологических сигналов)? Это не перманентная защита. Качество сигнала rPPG ухудшается при сжатии, и исследования показали, что методы состязательной генерации могут целенаправленно воздействовать на детекторы на основе rPPG. Это работает лучше всего в сочетании с другими типами сигналов, а не само по себе.
3. Почему детектирующие системы пропускают дипфейки, объединяющие клонированный голос с отдельно сгенерированной заменой лица? Одномодальное обнаружение проверяет каждый канал изолированно, и комбинированная атака может пройти каждую отдельную проверку. Межмодальная верификация, сравнивающая совпадение отпечатков аудио- и визуальной генерации, а также тайминга, создана специально для выявления этого паттерна.
4. Насколько быстро системы обнаружения должны покрывать новые инструменты генерации дипфейков? Максимально близко к реальному времени. Новые генеративные модели появляются часто, и система обнаружения, у которой уходят месяцы на добавление поддержки, оставляет значительный пробел. Системы, добавляющие поддержку новых генеративных моделей в течение нескольких часов, существенно сокращают это окно.
5. Полезны ли по-прежнему такие визуальные признаки, как моргание и освещение, для выявления дипфейков? В лучшем случае это слабые сигналы по сравнению с текущим качеством генерации, а точность их использования человеком невысока — около 24,5% для высококачественных видеодипфейков в контролируемых исследованиях. Они не заменяют обнаружение на уровне сигналов.
6. Какова наиболее распространенная схема мошенничества с дипфейками в настоящее время? Живая имитация голоса или видео доверенного контакта, руководителя или бизнес-партнера, используемая для создания ощущения срочности вокруг запроса платежа или учетных данных. И случаи Arup, и швейцарский случай 2026 года следовали именно этой структуре, просто через разные каналы.











