В апреле 2026 года кто-то позвонил сотруднику Charter Communications, представившись сотрудником службы ИТ-поддержки, и получил его учетные данные Microsoft Entra ID. Используя этот звонок, хакерская группировка ShinyHunters взломала Salesforce компании Charter и заявила о доступе к 40 миллионам записей клиентов.
Аналитические данные об угрозах от EclecticIQ подтверждают, что аффилированные лица ShinyHunters использовали голосовых агентов на базе ИИ для проведения таких фишинговых звонков (вишинга) в масштабе, проникая в другие крупные транснациональные компании, включая ADT, 7-Eleven, Instructure, Vimeo, Medtronic и Carnival. Голосовые агенты корректировали свои сценарии в режиме реального времени в зависимости от ответов жертвы, но в остальном использовали один и тот же алгоритм: вишинговый звонок для компрометации SSO, переход к Salesforce, эксфильтрация данных и вымогательство.
Эти атаки демонстрируют растущую потребность в обнаружении голосов, сгенерированных ИИ, во время живых звонков в режиме реального времени. Для этого требуется многогранный подход к обнаружению, который мы подробно рассмотрим.
Что вам нужно знать
- «Голос, сгенерированный ИИ» имеет три различных пути: TTS с фиксированным голосом, TTS с клонированием голоса и преобразование голоса в реальном времени. Каждый из них попадает в звонок по-разному, но одна модель, которая изучает структуру, не зависящую от генератора, может охватить все три, вместо того чтобы требовать отдельный детектор для каждого.
- Обнаружение работает как стек доверия: модель обнаружения считывает аудио, интерпретируемость добавляет контекст, сопоставление личности подтверждает известный голос, а водяные знаки подтверждают происхождение.
- Три из пяти протестированных кодеков PSTN достигли 100% точности как на реальном, так и на синтетическом аудио. Два сжатых кодека, G.728 и iLBC, остаются выше 91%.
- В производстве работают две модели развертывания: обнаружение потока во время звонка (четырехсекундные окна, вердикт менее чем за 300 мс, действие в середине звонка) и аудит после звонка (полная запись, агрегированные окна, меньше ложных срабатываний).
- Обнаружение требует такого же подхода к согласию на запись, как и сама запись звонка, и оно дополняет, а не заменяет STIR/SHAKEN, который проверяет личность звонящего, но не то, является ли голос реальным.
Что на самом деле означает «голос, сгенерированный ИИ» во время звонка
Не все синтетические голоса работают одинаково, поэтому обнаружение делится на три категории, и каждая из них попадает в телефонный звонок по-своему.
TTS с фиксированным голосом. Вводится текстовая подсказка, и на выходе получается сгенерированная речь с использованием стандартного или предустановленного голоса, без участия человека. Это категория, о которой большинство людей думает в первую очередь, и именно в ней TTS-модели улучшились быстрее всего. ElevenLabs, OpenAI, Azure, AWS Polly и десятки движков с открытым исходным кодом могут создавать речь, которая звучит как человеческая по телефону, особенно когда аудио сжато до качества PSTN 8 кГц, где исчезают характерные высокочастотные артефакты. Поскольку голос не принадлежит реальному человеку, его спектральная сигнатура может быть отсканирована, что делает его самым простым для обнаружения из трех.
TTS с клонированием голоса. Входные данные по-прежнему являются текстом, но выходные данные имитируют целевой голос на основе короткого эталонного образца без дообучения или тренировки модели. Злоумышленник предоставляет несколько секунд чьего-то голоса, и система создает новую речь, которая звучит как этот человек. Она работает на той же базовой технологии, что и TTS с фиксированным голосом, но обнаружить ее сложнее, поскольку выходные данные несут спектральный и просодический отпечаток реального человека. Именно это использовалось на практике в атаках на Charter и ADT.
Преобразование голоса в реальном времени. В отличие от первых двух категорий, здесь входными данными является не текст, а живой человеческий голос. Модель берет этот голос и преобразует его так, чтобы он звучал как кто-то другой, пока человек говорит. Поскольку аудио генерирует реальный человек, все, что следует за спектральной трансформацией, является подлинно человеческим, включая просодию, темп, дыхание и то, как они реагируют в разговоре. Только спектральная огибающая является синтетической, именно поэтому модели обнаружения имеют здесь наименьшее покрытие публичными бенчмарками.
Эти три категории находятся в спектре на уровне сигнала. Детектор, который только запоминает отпечатки известных генераторов, как правило, ограничен первой категорией. Настройте классификатор для TTS с фиксированным голосом, и он может пропустить клон, который несет спектральные характеристики реального человека. Любой из них может пропустить преобразование голоса, где просодия является подлинно человеческой.
Преодоление этого ограничения означает, что нельзя полагаться только на запомненные отпечатки генераторов. DETECT-World от Resemble изучает структурные паттерны, которые генеративные архитектуры оставляют в частотной и временной структуре аудио, а не просто фонетическое содержание. Именно это делает его независимым от языка и позволяет одной модели обобщать все три категории, включая генераторы, которые она никогда не видела, вместо того чтобы требовать отдельный детектор для каждой категории.
Как работает обнаружение
Обнаружение сообщает вам, был ли голос во время звонка сгенерирован или изменен ИИ, и отвечает с оценкой уверенности. Оно не считывает намерения и не подтверждает согласие. «Является ли этот голос ИИ?» — это первый вопрос, и ответ на него подсказывает, какой вопрос задать следующим: заблокировать звонок, перенаправить его человеку или записать для проверки.
Поэтому надежный ответ во время живого звонка требует использования более чем одного метода. Resemble запускает обнаружение как часть более крупного стека доверия, где каждый уровень вносит свой вклад в виде различных доказательств.
Обнаружение. Resemble Detect считывает форму волны напрямую и возвращает независимую оценку того, было ли аудио сгенерировано или изменено ИИ, не полагаясь на заявления звонящего или метаданные.
Интерпретируемость. Resemble Intelligence превращает оценку обнаружения в судебно-медицинский отчет. Он определяет артефакты, стоящие за вердиктом, тип мошенничества, статус «живого» присутствия и контекст говорящего, такой как язык и диалект. Этот контекст дает агентам и командам по борьбе с мошенничеством основу для действий и создает контрольный журнал для проверки.
Личность. Если голос был зарегистрирован в Resemble Identity, входящий голос можно сопоставить с известным сходством. Это ускоряет вынесение вердикта и подтверждает, дал ли реальный человек согласие на использование этого голоса.
Водяные знаки. Мультимодальный водяной знак PerTh от Resemble внедряет незаметный нейронный водяной знак при генерации, оптимизированный для выживания при сжатии PSTN до 8 кГц, G.723.1 и нескольких переходов между операторами. Наличие водяного знака — самый сильный доступный сигнал о происхождении. Обратное неверно: отсутствие знака никогда не доказывает, что голос принадлежит человеку, потому что большинство генераторов не ставят водяные знаки. Обнаружение берет на себя основную нагрузку, а водяные знаки подтверждают ее.
Оценка паттернов. Resemble Signal помечает содержание звонка, которое соответствует известному паттерну мошенничества, и объясняет совпадение простым языком. Он работает без транскрипции, поэтому никакой разговорный контент или PII не материализуются в виде текста на каком-либо этапе. Команды могут настраивать библиотеку паттернов с помощью сценариев, которые они видят на самом деле.
Слой обнаружения работает на базе DETECT-World, модели третьего поколения от Resemble, протестированной на более чем 250 генераторах и охватывающей 54 языка. Она изучает статистические «отпечатки», которые генеративные архитектуры оставляют в частотной и временной структуре аудио, а не только фонетическое содержание. Именно это делает модель независимой от языка и позволяет быстрее достигать покрытия для атак нулевого дня. Podonos, сторонний бенчмарк, который самостоятельно оценивает каждую систему на фиксированном наборе клипов с закрытыми метками, поставил DETECT-World на первое место среди 18 протестированных систем, и признал её единственной системой с уровнем как ложноположительных, так и ложноотрицательных результатов ниже 1%. То, как телефонный звонок влияет на эти показатели, является темой следующего раздела, и именно поэтому обнаружение на «живой» линии настраивается иначе.
Реалии передачи звука во время телефонного звонка
Модель обнаружения, демонстрирующая почти идеальную точность на чистом лабораторном аудио, часто теряет эффективность при работе с реальным телефонным звуком. Причины здесь физические и архитектурные, а не связаны с качеством самой модели. Любая честная статья об обнаружении ИИ-голоса во время живых звонков должна начинаться с того, что именно телефонный звонок делает с аудиосигналом.
Лестница кодеков. Большинство звонков в ТфОП используют G.711 (mu-law в Северной Америке, a-law в Европе), который кодирует аудио с частотой 8 кГц и 8-битными сэмплами. Весь спектральный контент выше 3,4 кГц пропадает. G.722, известный как HD Voice, расширяет диапазон до 16 кГц, но редко встречается в соединениях между операторами. WebRTC и мобильные звонки используют Opus, который адаптирует битрейт к доступной полосе пропускания, иногда снижая его до 6 кбит/с. Сотовые сети используют AMR и AMR-WB, которые применяют собственное сжатие с потерями. Каждый кодек — это преобразование с потерями. Сигнал обнаружения, который находится в области высоких частот, не выживает при стандартном звонке в ТфОП. Подробнее о том, как кодеки влияют на качество голоса, принципы здесь те же, что и для обнаружения.
Цепочка транскодирования. Один звонок между вызывающим и вызываемым абонентом может быть закодирован, декодирован и перекодирован от двух до четырех раз. Каждый сегмент между SIP-прокси, медиашлюзами и SBC добавляет шум квантования и удаляет микродетали. Аудио, которое детектор получает в конце цепочки, — это не то аудио, которое записал микрофон звонящего.
Сжатие в мобильных сетях. Сотовые операторы используют адаптацию скорости, прерывистую передачу (DTX) и генерацию комфортного шума. DTX полностью заглушает «тихие» кадры и заменяет их синтетическим фоновым шумом. Сетевая обработка изменяет микропаузы и паттерны дыхания, которые пытается измерить криминалистический детектор.
Джиттер-буфер и потеря пакетов. Транспорт в реальном времени буферизирует от 20 до 60 мс аудио, переупорядочивает пакеты и вставляет поддельное аудио, чтобы скрыть потерю пакетов. Анализ таймингов с точностью до кадра во время реального звонка сложнее, чем при работе с чистым файлом.
Эхоподавление и АРУ. Автоматическая регулировка усиления (АРУ) и эхоподавление изменяют спектральный состав и амплитуду до того, как аудио достигнет точки анализа. Признаки обнаружения, зависящие от исходной амплитуды или спектральной огибающей, смещаются.
Resemble протестировала свою модель обнаружения на семействе кодеков ТфОП. Их внутренняя оценка, проведенная на стенде Resemble AI Codec Testbench v3, показывает следующую точность:
G.711 a-law, G.722 и EVS сохраняют 100% точность как на реальном, так и на синтетическом аудио. G.728 — самый сложный случай: 91,9% на реальном аудио и 97,9% на синтетическом. iLBC показывает 95,8% на реальном и 98,7% на синтетическом. Два кодека, на которых точность падает, — это также два кодека с наиболее агрессивным сжатием, которое удаляет микродетали, необходимые для обнаружения. В таких случаях при развертывании в реальном времени применяется более высокий порог обнаружения, настроенный на точность, а после завершения звонка паттерн агрегирует несколько окон, чтобы снизить риск ошибки при принятии единичного решения.
Где происходит обнаружение в реальном контуре звонка
Обнаружение во время живого звонка должно вписываться в медиапуть звонка. Существует два паттерна развертывания, которые служат разным операционным потребностям.
Паттерн А: Потоковое обнаружение во время звонка
Звонок поступает на номер Telnyx. Telnyx Call Control перенаправляет медиапоток через WebSocket на конечную точку Resemble Detect с помощью команды streaming_start. Telnyx Media Streaming дублирует аудио звонка и доставляет его на предоставленный клиентом URL WebSocket, не затрагивая качество звука живого звонка. Поток передает base64-кодированные RTP-пакеты в кодеке звонка: PCMU, PCMA, G.722, Opus, AMR-WB или L16.
Resemble Detect анализирует аудиопоток и возвращает оценку обнаружения. Resemble Intelligence превращает эту оценку в отчет, идентифицирующий артефакты, лежащие в основе вердикта, тип мошенничества, статус «живого» человека и контекст говорящего. Четырех секунд аудио достаточно для вынесения вердикта, результат возвращается менее чем за 300 миллисекунд.
Telnyx Call Control выполняет действия на основе сигнала. Любая команда Call Control может быть выдана во время звонка с использованием call_control_id: завершить звонок, перевести на оператора, воспроизвести подсказку или записать результат. Решение за вами. Конечная точка обнаружения возвращает оценку. Ваше приложение решает, что с ней делать.
Для развертывания в реальном времени Resemble Detect применяет более высокий порог обнаружения, чем в их офлайн-конфигурации для бенчмарков. Это настраивается для обеспечения точности: когда что-то помечается как синтетическое, уверенность высока, а ложные срабатывания на звонках реальных клиентов сокращаются. Компромисс заключается в том, что некоторые синтетические звонки, находящиеся на границе порога, будут пропущены. Resemble продолжает уточнять этот порог для каждой клиентской среды, учитывая такие факторы, как качество связи и фоновый шум.
Паттерн Б: Аудит после звонка
Telnyx записывает звонок через Call Control recording. Сессии SIPREC поступают на siprec.telnyx.com, сервер записи SIPREC от Telnyx, который запускает вебхуки call.initiated с метаданными записи. Записи попадают в объектное хранилище. Resemble Detect запускается как пакетное задание для файла записи. Вывод направляется в конвейер соответствия требованиям, журнал аудита или очередь проверки на мошенничество.
Этот паттерн меняет задержку на точность. После звонка у вас есть полная запись, а не четырехсекундное окно. Вы можете запустить обнаружение на нескольких сегментах и агрегировать результаты, что снижает риск ложноположительных срабатываний, возникающий при принятии решений в реальном времени по одному окну.
Resemble Detect поддерживает как потоковый, так и пакетный режимы API. Потоковая конечная точка предназначена для телефонии в реальном времени и развертывания ботов для встреч, где каждое четырехсекундное окно требует мгновенного ответа. Пакетная конечная точка предназначена для анализа после звонка и после загрузки, где можно обрабатывать и агрегировать несколько сегментов. Для развертывания на живых звонках рекомендуется установить высокий порог уверенности для любых «активных» решений (завершить звонок, перевести) и более низкий порог для решений «записать» (пометить для проверки, добавить в журнал аудита). Это разделение предотвращает дорогостоящие ложные срабатывания на звонках реальных клиентов, при этом позволяя фиксировать пограничные случаи для проверки человеком.
Обе модели имеют разные профили задержки, стоимости и нормативного регулирования. Правильный выбор зависит от того, требует ли сценарий использования действий во время активного вызова (предотвращение мошенничества) или достаточно доказательств после завершения вызова (аудит соответствия требованиям, расследование мошенничества).
Где обнаружение работает лучше всего
Не каждый вызов требует голосового обнаружения ИИ в режиме реального времени. Сценарии использования, в которых это оправдывает затраты, делятся на несколько категорий.
- Вызовы с высокоценными транзакциями: банковские переводы, авторизация платежей, изменение данных учетной записи, сброс учетных данных. Если действие, о котором просит звонящий, связано с перемещением денег или изменением доступа, стоимость ошибочного вызова достаточно высока, чтобы оправдать обнаружение. Банк, который прерывает мошеннический вызов по переводу средств до того, как он дойдет до оператора, экономит больше, чем стоит API обнаружения. Банк, который прерывает вызов реального клиента по переводу средств, теряет клиента.
- Входящие вызовы в регулируемые отрасли: банковское дело, здравоохранение, страхование, коммунальные услуги. Эти отрасли уже записывают вызовы для соблюдения нормативных требований. Добавление обнаружения в конвейер записи — это незначительные дополнительные расходы. Сигнал обнаружения попадает в тот же аудиторский след, что и запись, транскрипт и метаданные вызова. Для таких внедрений часто достаточно модели после завершения вызова.
- Масштабируемые исходящие вызовы ИИ-агентов: если вы проводите исходящие голосовые ИИ кампании, вы уже столкнулись с этой проблемой. Обнаружение может подтвердить, что ваш голос ИИ не клонируется и не воспроизводится обратно вам. Водяные знаки могут доказать, что аудио, которое покинуло вашу систему, — это то самое аудио, которое поступило на телефон вызываемого абонента. Это сценарий использования Resemble Watermarker: кодирование водяного знака при генерации, проверка на стороне получателя.
- Мониторинг мошенничества в контакт-центрах: контакт-центры, которые занимаются аутентификацией клиентов, являются наиболее ценной целью для клонирования голоса. Злоумышленник, который клонирует голос клиента и звонит в контакт-центр для сброса пароля или авторизации перевода, использует телефонный канал, чтобы обойти весь стек аутентификации. Обнаружение на входящем плече, до того как оператор ответит, является защитой. Четырехсекундное окно обнаружения означает, что система может пометить синтетического звонящего до того, как оператор закончит приветствие.
Соответствие требованиям и операционные механизмы
Результат обнаружения интегрируется в регуляторные и операционные системы, которые уже управляют вызовом.
STIR/SHAKEN. STIR/SHAKEN устанавливает, кто инициировал вызов на сетевом уровне. Подписанный вызов с полной аттестацией все равно может содержать синтетический голос. Обнаружение оценивает, является ли аудио сгенерированным ИИ или измененным. Командам нужны оба сигнала, когда важна личность звонящего и голос в вызове.
Начиная со 2 августа 2026 года, Закон ЕС об ИИ требует машиночитаемой маркировки контента, созданного ИИ, включая аудио. Аудио-водяные знаки являются механизмом обеспечения соответствия. Мультимодальный водяной знак PerTh от Resemble внедряет нейронный водяной знак, оптимизированный для ограничения полосы пропускания 8 кГц в вызовах PSTN, который сохраняется при сжатии G.723.1 и прохождении через несколько операторов. Для внедрений, обслуживающих клиентов в ЕС, нанесение водяных знаков при генерации и обнаружение на стороне получателя — это путь к соблюдению требований. Один из наших предыдущих вебинаров по голосовому ИИ в Европе с Зохаибом Ахмедом (генеральный директор Resemble AI) и Дэвидом Кейсемом (генеральный директор Telnyx) подробно освещает эту тему.
Обнаружение во время вызова требует такого же порядка согласия на запись, как и сама запись вызова. Применяются правила согласия одной или двух сторон. Если вы уже ведете запись, обнаружение не создает дополнительного бремени по получению согласия. Если вы добавляете обнаружение к вызову, который ранее не записывали, проконсультируйтесь со своей юридической командой.
Результат обнаружения наиболее полезен, когда он попадает в журнал доказательного уровня: метки времени, идентификатор вызова, показатели достоверности и предпринятые действия. Команды по борьбе с мошенничеством и регуляторы могут оценивать эти записи наряду с записями вызовов, аналитикой речи (CallMiner, Observe.AI, Verint) и инструментами оценки мошенничества. Обнаружение добавляет доказательства подлинности аудио в запись дела.
Во что мы оба инвестируем дальше
Со стороны Resemble мы расширяем рассуждения мировой модели, лежащие в основе DETECT-World, на каждую модальность, которую может нести живой вызов. Цель — детектор, который рассуждает о том, является ли голос физически правдоподобным, чтобы покрытие сохранялось по мере того, как инструменты синтеза развиваются быстрее, чем может отследить любая библиотека отпечатков. Мы также усиливаем обнаружение на деградированном телефонном аудио, где лестница кодеков сегодня наносит наибольший ущерб.
Со стороны Telnyx это часть более широкой ставки на примитивы агентов. Мы внедряем строительные блоки, необходимые ИИ-агенту для действий в реальном мире: Voice API для совершения и приема вызовов, Email API для отправки и получения почты, Browser Agent для навигации по сети, Search API для получения информации. Потоковая передача медиа Call Control — это примитив, который позволяет уровню обнаружения, такому как Resemble, находиться внутри живого вызова, не владея самим вызовом. Следующим шагом является собственный хук обнаружения в Call Control: предварительно настроенный вебхук, который получает сигналы обнаружения от партнера, такого как Resemble, и инициирует действия вызова без необходимости создания клиентом промежуточного сервера приложений. Цель — сократить поверхность интеграции с «создать WebSocket-сервер, обрабатывать кадры, вызывать Call Control» до «включить обнаружение на этом номере, установить порог, выбрать действие».
Более широкое направление — сделать Telnyx единой точкой для всего, что нужно агенту для общения и выполнения действий в интернете. Голос, обмен сообщениями, электронная почта, просмотр веб-страниц, поиск и теперь обнаружение. Вместе они составляют инфраструктурный уровень для агентов, которым необходимо взаимодействовать с людьми и системами за пределами своего собственного приложения.
Где узнать больше
- Resemble Detect
- Resemble Multimodal Watermarker
- Resemble Intelligence
- Resemble Signal
- Telnyx Call Control
- Telnyx Media Streaming
- Telnyx SIPREC
- Вебинар в мае 2026 года: «Голосовой ИИ в Европе: дипфейки, суверенитет данных и обрыв соответствия в августе 2026 года» с Зохаибом Ахмедом (Resemble AI) и Дэвидом Кейсемом (Telnyx)
- Узнайте больше о голосовом мошенничестве с использованием ИИ и уровне доверия в телекоммуникациях
- Прочитайте о рисках обнаружения дипфейков и методах защиты










