В апреле 2026 года злоумышленник позвонил сотруднику компании Charter Communications, представился сотрудником ИТ-поддержки и получил его учетные данные Microsoft Entra ID. Используя этот звонок, группировка вымогателей ShinyHunters взломала систему Salesforce компании Charter и заявила о получении доступа к 40 миллионам записей клиентов.
Данные киберразведки от EclecticIQ свидетельствуют о том, что сообщники ShinyHunters использовали ИИ-голосовых агентов для масштабного проведения таких фишинговых звонков (вишинга), с помощью которых они проникли в другие крупные транснациональные компании, включая ADT, 7-Eleven, Instructure, Vimeo, Medtronic и Carnival. Голосовые агенты корректировали свои сценарии в режиме реального времени в зависимости от ответов жертвы, но в остальном действовали по одной и той же схеме: вишинговый звонок для компрометации единого входа (SSO), переход в Salesforce, кража данных и вымогательство.
Эти атаки демонстрируют растущую потребность в обнаружении сгенерированных ИИ голосов во время живых звонков и в режиме реального времени. Для этого требуется многоуровневый подход к обнаружению, в который мы и погрузимся.
Что вам нужно знать
- У «сгенерированного ИИ голоса» есть три основных направления: синтез речи (TTS) с фиксированным голосом, TTS с клонированием голоса и преобразование речи в реальном времени. Каждое из них попадает в звонок по-своему, однако одна модель, которая изучает структуру, не зависящую от генератора, способна охватить все три варианта, избавляя от необходимости создавать отдельный детектор для каждого из них.
- Обнаружение работает как стек доверия: модель обнаружения анализирует аудио, модуль объяснимости добавляет контекст, сопоставление профилей подтверждает известную личность, а маркировка (водяные знаки) подтверждает происхождение.
- Три из пяти протестированных кодеков телефонной сети общего пользования (TПСО) показали 100% точность как на реальном, так и на синтезированном аудио. Два сжатых кодека, G.728 и iLBC, удерживают показатель выше 91%.
- В продакшене эффективны два шаблона развертывания: потоковое обнаружение прямо во время звонка (четырехсекундные окна, вердикт менее чем за 300 мс, реагирование посреди разговора) и посмертный аудит звонка (полная запись, агрегированные окна, меньше ложных срабатываний).
- Процедура обнаружения требует соблюдения тех же норм согласия на запись, что и сама запись звонка, и она дополняет, а не заменяет протоколы STIR/SHAKEN, которые проверяют личность звонящего, но не подлинность самого голоса.
Что на самом деле означает «голос, созданный ИИ» во время звонка
Все синтетические голоса работают по-разному, поэтому обнаружение делится на три категории, и каждая из них попадает в телефонный звонок своим путем.
TTS с фиксированным голосом. На вход подается текстовый запрос, а на выходе получается сгенерированная речь с использованием стандартного или шаблонного голоса, без участия живого человека. Это категория, о которой большинство людей думает в первую очередь, и именно в ней модели синтеза речи развиваются быстрее всего. ElevenLabs, OpenAI, Azure, AWS Polly и десятки открытых движков могут создавать речь, которую на телефонном звонке трудно отличить от человеческой, особенно когда аудио сжато до качества ТПСО 8 кГц, где исчезают характерные высокочастотные артефакты. Поскольку голос не принадлежит реальному человеку, его спектральная сигнатура может быть оцифрована в виде цифрового отпечатка, что делает его самым простым для выявления среди всех трех вариантов.
TTS с клонированием голоса. На входе по-прежнему текст, но на выходе имитируется целевой голос на основе всего лишь короткого эталонного образца без тонкой настройки или обучения модели. Злоумышленник предоставляет несколько секунд чьго-то голоса, и система генерирует новую речь, звучащую как этот человек. Она работает на той же базовой технологии, что и TTS с фиксированным голосом, но обнаруживать ее сложнее, поскольку вывод несет в себе спектральный и просодический отпечаток реального человека. Именно этот метод использовался на практике при атаках на Charter и ADT.
Преобразование речи в реальном времени. В отличие от первых двух категорий, здесь на вход подается не текст, а живой человеческий голос. Модель принимает этот голос и преобразует его так, чтобы он звучал как кто-то другой прямо по ходу речи человека. Поскольку аудио генерирует реальный человек, все, что находится ниже спектрального преобразования по цепочке, является подлинно человеческим, включая просодию, темп, дыхание и манеру реагирования в беседе. Синтетическим является только спектральный конверт, именно поэтому модели обнаружения имеют здесь наименьшее покрытие публичными бенчмарками по вполне понятным причинам.
Эти три категории располагаются в спектре на уровне сигналов. Детектор, который лишь запоминает отпечатки известных генераторов, как правило, привязан к первому варианту. Если настроить классификатор на TTS с фиксированным голосом, он может пропустить клон, обладающий характеристиками спектра реального человека. Любой из них может пропустить преобразование голоса, где просодия является подлинно человеческой.
Преодоление этого ограничения означает отказ от использования только заученных отпечатков генераторов. Решение DETECT-World от Resemble изучает структурные паттерны, которые генеративные архитектуры оставляют в частотной и временной структуре аудио, а не только фонетическое содержимое. Именно это делает его независимым от языка и позволяет одной модели обобщать данные по всем трем категориям, включая те генераторы, с которыми она никогда раньше не сталкивалась, избавляя от необходимости иметь отдельный детектор для каждой категории.
Как работает обнаружение
Обнаружение сообщает вам, был ли голос в звонке сгенерирован или изменен с помощью ИИ, и выдает ответ в виде оценки степени уверенности (скора). Оно не считывает намерения и не подтверждает согласие. «Является ли этот голос искусственным?» — это первый вопрос, и ответ на него подсказывает, какой вопрос задать следующим: заблокировать вызов, перенаправить его на человека или занести в журнал для рассмотрения.
Поэтому для получения надежного ответа во время живого вызова требуется нечто большее, чем просто один метод. Resemble выполняет обнаружение как часть более крупного стека доверия, где каждый уровень вносит свой тип доказательств.
Обнаружение. Resemble Detect считывает форму волны напрямую и возвращает независимую оценку того, было ли аудио создано или изменено с помощью ИИ, не полагаясь на заявления звонящего или метаданные.
Объяснимость. Resemble Intelligence превращает оценку обнаружения в криминалистический отчет. Он выявляет артефакты, лежащие в основе вердикта, тип мошенничества, статус живости (liveness) и контекст говорящего, такой как язык и диалект. Этот контекст дает агентам и отделам по борьбе с мошенничеством основу для действий и создает контрольный журнал для проверки.
Идентификация. Если голос был зарегистрирован в Resemble Identity, входящий голос можно сопоставить с известным эталоном. Это ускоряет вынесение вердикта и подтверждает, давал ли реальный человек согласие на использование его голоса.
Маркировка. Многомодульный инструмент маркировки PerTh от Resemble внедряет незаметный нейроводяной знак на этапе генерации, оптимизированный для выживания при сжатии ТПСО до 8 кГц, использовании кодека G.723.1 и множественных переходах между операторами связи. Присутствие водяного знака является самым сильным сигналом происхождения из всех доступных. Обратное неверно: отсутствие знака никогда не доказывает, что голос принадлежит человеку, поскольку большинство генераторов не ставят водяные знаки. Обнаружение берет на себя основную нагрузку, а маркировка подтверждает его результаты.
Оценка паттернов. Resemble Signal помечает содержимое звонка, которое соответствует известному шаблону мошенничества, и объясняет совпадение простым языком. Проверка работает без транскрипции, поэтому на любом этапе в виде текста не материализуется ни произнесенный контент, ни персональные данные (PII). Команды могут настраивать библиотеку паттернов под те сценарии, с которыми они сталкиваются на практике.
Слой детектирования работает на базе DETECT-World — модели Resemble третьего поколения, прошедшей тестирование на более чем 250 генераторах и поддерживающей 54 языка. Она изучает статистические отпечатки, которые генеративные архитектуры оставляют в частотной и временной структуре звука, а не только фонетическое содержимое. Именно это делает ее независимой от языка и позволяет быстрее достигать покрытия нулевого дня (zero-day). Podonos, сторонний бенчмарк, который оценивает каждую систему по фиксированному набору клипов с закрытыми метками, поставил DETECT-World на первое место среди 18 протестированных систем, и это единственная система с показателями как ложноположительных, так и ложноотрицательных результатов менее 1%. То, как телефонный вызов влияет на эти показатели, рассматривается в следующем разделе, и именно поэтому детектирование на живой линии настраивается иначе.
Реальность передачи данных при реальном телефонном вызове
Модель детектирования, которая достигает почти идеальной точности на чистых аудиозаписях из лаборатории, часто теряет в качестве на реальном телефонном звуке. Причины носят физический и архитектурный характер, а не связаны с качеством самой модели. Любая честная статья о детектировании искусственного интеллекта в голосе на живых звонках должна начинаться с того, что телефонный вызов на самом деле делает со звуком.
Лестница кодеков. Большинство вызовов ТфОП (PSTN) используют кодек G.711 (mu-law в Северной Америке, a-law в Европе), который кодирует звук с частотой 8 кГц и 8-битными сэмплами. Весь спектральный контент выше 3.4 кГц исчезает. G.722, продвигаемый как HD Voice, расширяет диапазон до 16 кГц, но редко встречается в соединениях между операторами. WebRTC и мобильные вызовы используют Opus, который адаптирует битрейт к доступной пропускной способности, иногда падая до 6 кбит/с. Сотовые сети используют AMR и AMR-WB, применяющие собственное сжатие с потерями. Каждый кодек представляет собой преобразование с потерями. Сигнал детектирования, находящийся в области высоких частот, не переживает стандартный вызов ТфОП. Подробнее о том, как кодеки влияют на качество голоса, принципы остаются теми же и для детектирования.
Цепочка перекодирования. Один вызов между абонентами может быть закодирован, декодирован и перекодирован от двух до четырех раз. Каждое звено между SIP-прокси, медиашлюзами и SBC добавляет шум квантования и стирает миродетали. Аудиосигнал, который детектор видит в конце цепочки, не совпадает со звуком, который записал микрофон звонящего.
Сжатие в мобильных сетях. Сотовые операторы используют адаптацию скорости, прерывистую передачу (DTX) и генерацию комфортного шума. DTX полностью заглушает «тихие» кадры и заменяет их синтетическим фоновым шумом. Сетевая обработка изменяет микропаузы и паттерны дыхания, которые пытается измерить криминалистический детектор.
Буфер джиттера и потеря пакетов. Транспорт реального времени буферизует от 20 до 60 мс аудио, меняет порядок пакетов и вставляет фальшивое аудио для маскировки потерянных пакетов. Кадрово-точный анализ времени в реальном вызове выполнить сложнее, чем в чистом файле.
Эхоподавление и АРУ (AGC). Автоматическая регулировка усиления и эхоподавление изменяют спектральный состав и амплитуду до того, как звук попадет в любую точку анализа. Признаки детектирования, зависящие от исходной амплитуды или спектральной огибающей, смещаются.
Resemble протестировала свою модель детектирования на всем семействе кодеков ТфОП. Их внутренняя оценка, проведенная на Resemble AI Codec Testbench v3, показывает следующую точность:
G.711 a-law, G.722 и EVS сохраняют 100% точность как на реальном, так и на синтетическом аудио. G.728 является наиболее сложным случаем: 91.9% на реальном аудио и 97.9% на синтетическом. iLBC показывает 95.8% для реального и 98.7% для синтетического. Два кодека, на которых точность падает, также являются кодеками с наиболее агрессивным сжатием, которое уничтожает миродетали, необходимые для детектирования. В таких случаях при развертывании в реальном времени применяется более высокий порог обнаружения, настроенный на точность, а послеразговорный паттерн агрегирует несколько окон для снижения риска ошибки при одиночном решении.
Где располагается детектирование в конвейере реального вызова
Детектирование во время живого вызова должно встраиваться в медиапуть вызова. Существует два паттерна развертывания, которые служат различным операционным потребностям.
Паттерн A: потоковое детектирование во время вызова
Вызов поступает на номер Telnyx. Telnyx Call Control разветвляет медиапоток через WebSocket на конечную точку Resemble Detect с помощью команды streaming_start. Telnyx Media Streaming дублирует аудиовызов и передает его на предоставленный клиентом URL WebSocket без ущерба для качества звука живого вызова. Поток содержит RTP-полезную нагрузку в кодеке вызова, закодированную в base64: PCMU, PCMA, G.722, Opus, AMR-WB или L16.
Resemble Detect анализирует аудиопоток и возвращает оценку детектирования. Resemble Intelligence преобразует эту оценку в отчет с аналитикой, определяющий артефакты, стоящие за вынесенным вердиктом, тип мошенничества, статус живости и контекст говорящего. Четырех секунд аудио достаточно для вынесения вердикта, при этом результат возвращается менее чем за 300 миллисекунд.
Telnyx Call Control реагирует на сигнал. Любая команда Call Control может быть отправлена прямо во время звонка с использованием call_control_id: завершить вызов, перевести на оператора, воспроизвести подсказку или залогировать результат. Решение за вами. Конечная точка детектирования возвращает оценку. Ваше приложение решает, что с ней делать.
Для развертывания в реальном времени Resemble Detect применяет более высокий порог обнаружения, чем в конфигурации автономного бенчмарка. Это настраивает систему на точность: когда что-то помечается как синтетическое, уверенность высока, а количество ложных срабатываний на реальных звонках клиентов снижается. Обратная сторона заключается в том, что некоторые синтетические звонки на границе порога будут пропущены. Resemble продолжает совершенствовать этот порог для каждой клиентской среды, учитывая такие факторы, как качество связи и фоновый шум.
Паттерн B: аудит после вызова
Telnyx записывает вызов с помощью записи Call Control. Сеансы SIPREC поступают на siprec.telnyx.com, сервер записи SIPREC от Telnyx, который генерирует вебхуки call.initiated с метаданными записи. Записи попадают в объектное хранилище. Resemble Detect запускается как пакетное задание (batch job) для файла записи. Результат отправляется в конвейер комплаенса, журнал аудита или очередь проверки на мошенничество.
Этот паттерн жертвует задержкой ради точности. После вызова у вас есть вся запись целиком, а не четырехсекундное окно. Вы можете запустить детектирование на нескольких сегментах и агрегировать результаты, что снижает риск ложноположительных срабатываний, возникающих при принятии решений по одному окну в реальном времени.
Resemble Detect поддерживает как потоковый режим, так и режим пакетного API. Потоковая конечная точка предназначена для телефонии в реальном времени и ботов для встреч, где каждое четырехсекундное окно требует мгновенного ответа. Пакетная конечная точка разработана для анализа после вызова и после загрузки, когда можно обрабатывать и агрегировать несколько сегментов. Для развертывания живых звонков рекомендуется устанавливать высокий порог уверенности для любых решений о «действии» (положить трубку, перевести) и более низкий порог для решений о «логировании» (пометить для проверки, добавить в журнал аудита). Это разделение предотвращает дорогие ложные срабатывания на реальных звонках клиентов, позволяя при этом фиксировать пограничные случаи для ручной проверки.
Обе модели имеют разные показатели задержки, стоимости и нормативного регулирования. Правильный выбор зависит от того, требуется ли в данном сценарии реагировать на звонок во время его активного проведения (предотвращение мошенничества) или достаточно доказательств после завершения звонка (аудит соответствия требованиям, расследование мошенничества).
Где обнаружение работает лучше всего
Далеко не каждый звонок требует обнаружения голосового ИИ в реальном времени. Сценарии использования, в которых затраты на это оправданы, делятся на несколько категорий.
- Звонки по высокостоимостным транзакциям: банковские переводы, авторизация платежей, изменение данных счетов, сброс учетных данных. Если действие, запрашиваемое звонящим, связано с переводом денег или изменением уровня доступа, цена ошибки достаточно высока, чтобы оправдать процедуру обнаружения. Банк, который прерывает звонок с попыткой мошеннического банковского перевода до того, как он поступит к оператору, экономит больше, чем стоит API обнаружения. Банк, который прерывает звонок реального клиента по поводу перевода, теряет клиента.
- Входящие вызовы в регулируемых отраслях: банкинг, здравоохранение, страхование, коммунальные услуги. В этих отраслях звонки уже записываются в целях комплаенса. Добавление обнаружения в конвейер записи влечет за собой лишь незначительные дополнительные расходы. Сигнал обнаружения попадает в тот же журнал аудита, что и запись, расшифровка и метаданные звонка. Для таких развертываний модель анализа после звонка часто оказывается достаточной.
- Исходящие вызовы ИИ-агентов в больших масштабах: если вы проводите кампании с использованием голосового ИИ для исходящих вызовов, вы уже столкнулись с обратной стороной этой проблемы. Обнаружение может подтвердить, что ваш синтезированный голос не клонируют и не воспроизводят в вашу сторону. Водяные знаки способны доказать, что аудио, покинувшее вашу систему, — это именно то аудио, которое поступило на телефон вызываемого абонента. Это сценарий использования водяных знаков Resemble: внедрение водяного знака при генерации и проверка на стороне получателя.
- Мониторинг мошенничества в контакт-центрах: контакт-центры, обрабатывающие аутентификацию клиентов, являются главной целью для клонирования голоса. Злоумышленник, который клонирует голос клиента и звонит в контакт-центр для сброса пароля или авторизации перевода, использует телефонный канал для обхода всей системы аутентификации. Защитой служит обнаружение на входящем плече вызова до того, как оператор снимет трубку. Четырехсекундное окно обнаружения означает, что система может пометить синтезированного звонящего до того, как оператор закончит приветствие.
Инструменты комплаенса и операционные средства интеграции
Результаты обнаружения поступают в регуляторные и операционные системы, которые уже контролируют звонок.
STIR/SHAKEN. STIR/SHAKEN устанавливает, кто инициировал вызов на сетевом уровне. Подписанный вызов с полной аттестацией все равно может содержать синтезированный голос. Обнаружение оценивает, является ли аудио сгенерированным с помощью ИИ или измененным. Командам требуются оба сигнала, когда важны и личность звонящего, и звучащий в звонке голос.
Со 2 августа 2026 года Закон ЕС об искусственном интеллекте требует машиночитаемой маркировки контента, созданного с помощью ИИ, включая аудио. Водяные знаки на аудио являются механизмом обеспечения соответствия требованиям. Мультимодальный инструмент нанесения водяных знаков PerTh от Resemble внедряет нейросетевой водяной знак, оптимизированный под ограничение полосы пропускания телефонных сетей (PSTN) в 8 кГц, который выдерживает сжатие G.723.1 и множественные переходы между операторами. Для развертываний, обслуживающих клиентов из ЕС, комплаенс-путем является маркировка при генерации и обнаружение на приемной стороне. Один из наших предыдущих вебинаров о голосовом ИИ в Европе с Зохаибом Ахмедом (генеральный директор Resemble AI) и Дэвидом Кэйсемом (генеральный директор Telnyx) подробно освещает эту тему.
Обнаружение во время звонка требует такого же соблюдения правил получения согласия на запись, как и сама запись звонка. Применяются правила о согласии одной или обеих сторон. Если вы уже осуществляете запись, обнаружение не создает дополнительной нагрузки в отношении согласия. Если вы добавляете обнаружение к звонку, который ранее не записывали, проконсультируйтесь с юридическим отделом.
Результаты обнаружения наиболее полезны, когда они попадают в журнал доказательного уровня: временные метки, ID звонка, показатели уверенности и предпринятые действия. Отделы по борьбе с мошенничеством и регуляторы могут оценивать эти записи наряду с записями звонков, речевой аналитикой (CallMiner, Observe.AI, Verint) и инструментами оценки рисков мошенничества. Обнаружение добавляет в дело доказательства подлинности аудио.
Куда мы инвестируем дальше
Со стороны Resemble мы расширяем возможности рассуждений на базе мировой модели DETECT-World для каждой модальности, которую может содержать живой звонок. Цель состоит в создании детектора, который оценивает физическую правдоподобность голоса, чтобы защита оставалась эффективной даже тогда, когда инструменты синтеза развиваются быстрее, чем любая база данных цифровых отпечатков успевает их отслеживать. Мы также повышаем надежность обнаружения при ухудшении качества телефонного аудио, где современные кодеки наносят наибольший ущерб.
Со стороны Telnyx это часть более масштабной ставки на примитивы агентов. Мы внедряем строительные блоки, необходимые ИИ-агенту для действий в реальном мире: Voice API для совершения и приема звонков, Email API для отправки и получения писем, Browser Agent для навигации в интернете, Search API для поиска информации. Потоковая передача медиаданных Call Control — это примитив, который позволяет такому уровню обнаружения, как Resemble, встраиваться в живой звонок, не управляя им напрямую. Следующим шагом станет нативный хук обнаружения в Call Control: предварительно настроенный вебхук, который получает сигналы обнаружения от такого партнера, как Resemble, и инициирует действия со звонком без необходимости для клиента создавать промежуточный сервер приложений. Цель состоит в том, чтобы сократить объем интеграции от «создать WebSocket-сервер, обрабатывать фреймы, вызывать Call Control» до «включить обнаружение на этом номере, установить порог, выбрать действие».
Более глобальная цель заключается в том, чтобы сделать Telnyx единой платформой для всего, что необходимо агенту для коммуникации и выполнения задач по всему интернету. Голос, сообщения, электронная почта, браузер, поиск, а теперь и обнаружение. Вместе они образуют инфраструктурный слой для агентов, которым необходимо взаимодействовать с людьми и системами за пределами собственного приложения.
Где узнать больше
- Resemble Detect
- Resemble Multimodal Watermarker
- Resemble Intelligence
- Resemble Signal
- Telnyx Call Control
- Telnyx Media Streaming
- Telnyx SIPREC
- Вебинар за май 2026 года: «Голосовой ИИ в Европе: дипфэйки, суверенитет данных и критическая точка комплаенса в августе 2026 года» с Зохаибом Ахмедом (Resemble AI) и Дэвидом Кэйсемом (Telnyx)
- Узнайте больше о голосовом ИИ-мошенничестве и слое доверия в телекоммуникациях
- Прочитайте о рисках и методах защиты от обнаружения дипфэйков










