Veritiliz

Мировой контекст: каков настоящий масштаб происходящего

Когда ФБР сообщает о 4,8 млрд долларов потерь от мошенничества в отношении пожилых людей за 2024 год, эта цифра настоящая. Но отражает она прежде всего разорение от фальшивой техподдержки и инвестиционных схем. Строго отнесённые к своей категории схемы с мнимой бедой и «звонком от внука» дали в США за 2024 год 357 обращений и 2,7 млн долларов задокументированных потерь.

Мошенничество с мнимой семейной бедой и клонированным голосом — не самая массовая по числам схема против пожилых. Возможно, оно самое катастрофичное психологически в расчёте на одного пострадавшего. Смешивание его с многомиллиардной общей суммой ведёт к неверной расстановке приоритетов.

В 2025 году число мошенничеств с использованием ИИ выросло в мире на 1210% по сравнению с предыдущим годом. Только за первый квартал 2025 года голосовые атаки с применением дипфейков выросли более чем на 1600%.

Откуда это идёт

Технологическая гонка

Задача обнаружения клонированного голоса решается в постоянной гонке, где каждая сторона отвечает на ход другой. Как только защищающиеся находят новый признак для распознавания, он попадает в обучающие данные следующего поколения моделей синтеза. Лабораторные показатели и работа в поле — принципиально разные вещи: сжатый звук сотовых сетей может лишать ИИ-классификаторы до 50% их точности.

Самый существенный технический сдвиг — переход от статического синтеза речи из текста к преобразованию речи в речь в реальном времени (RVC). Устойчивая защита — не более совершенная технология обнаружения. Это смена подхода в сторону криптографической проверки личности.

Выход на корпоративный уровень

Та же возможность клонировать голос, что создана для обмана бабушек и дедушек, применяется против финансовых служб компаний. В задокументированном случае 2024 года сотрудник санкционировал банковский перевод на 25,6 млн долларов после видеосовещания, на котором финансовый директор и несколько коллег были полностью смоделированы дипфейк-технологией в реальном времени. Крупные компании сейчас сообщают о средних потерях в 680 000 долларов на одну голосовую атаку.

Что должно измениться

Финансовым организациям нужны обученные операционисты, распознающие характерные поведенческие признаки мошенничества с мнимой семейной бедой прямо в момент снятия наличных, и защита от ответственности за то, что они усомнились в объяснениях клиента.

Операторам связи нужны чёткие обязанности по закону — разворачивать обнаружение синтезированного звука на уровне сети. Протоколы проверки номера STIR/SHAKEN содержимого разговора не касаются.

Разработчикам ИИ-платформ нужны обязательные стандарты подтверждения происхождения голоса. А осведомлённость должна доходить до тех, на кого нацелены звонки, раньше самого звонка — через живое, вызывающее доверие просвещение в сообществах.

Технологии: что именно вы слышали

Не всякое голосовое мошенничество с ИИ использует одну и ту же технологию. Разницу стоит понимать, потому что она объясняет, почему обнаружение сложнее, чем кажется, и почему качество клонированного звука так резко выросло за последние два года.

Синтез речи из текста (TTS) — более старый способ — превращает написанный текст в сгенерированную речь. Ранние системы TTS давали узнаваемые роботизированные призвуки. Нынешние нейросетевые модели TTS выдают звук, который в большинстве тестов на слух принимают за человеческий. Ограничение в том, что TTS плохо справляется с эмоциональной подачей. Сгенерированный голос, читающий нейтральный текст, звучит правдоподобно. Сгенерированный голос, воспроизводящий именно тот срыв дыхания, ту сдерживаемую панику, ту самую интонацию испуганного молодого человека, звонящего бабушке, — для этого нужен другой подход.

Преобразование голоса в реальном времени (RVC) и перенос речи в речь (STS) — вот что даёт ту эмоциональную достоверность, из-за которой мошенничество с мнимой семейной бедой особенно действенно. Эти системы не порождают речь из текста — они превращают живую речь одного человека в акустические характеристики нужного голоса в реальном времени. Говорит оператор. Человек слышит голос своего внука. Эмоциональная составляющая — дрожь, спешка, то самое, как звучит этот человек, когда напуган, — сохраняется и переносится. На выходе появляются биометрические признаки того, кого пострадавший любит. Именно на них отзывается система узнавания голоса в мозге. Не на слова. На акустический отпечаток конкретного человека, которому пострадавший доверяет безоговорочно.

Объём звука, нужный для обучения убедительного клона, сократился с минут до секунд. Трёхсекундного отрывка из видео в соцсети достаточно для нынешних систем коммерческого уровня. Некоторые платформы клонирования голоса с такими возможностями доступны в обычных магазинах приложений и не требуют никаких технических знаний.

Инфраструктура североамериканской сети

У классической схемы с мнимой семейной бедой и «звонком от внука» — работающей без клонирования голоса, на живых операторах, изображающих отчаяние, — есть хорошо задокументированная инфраструктура, сосредоточенная в Монреале и Квебеке. Именно эти операции отработали конкретную модель: телефонное изображение внука, попавшего в неприятности с законом, последующие звонки от поддельных адвокатов и поручителей под залог, курьерские сети, доставляющие наличные в тот же день и добирающиеся до домов в пригородах за считаные часы после первого контакта.

Правоохранительные органы пресекали отдельные ячейки внутри этой сети. Структура оказалась устойчивой. Модель не требует централизованной инфраструктуры. Отдельные колл-центры набирают людей на месте, обучают по готовым сценариям и работают полусамостоятельно. Когда одну ячейку пресекают, отработанная годами методика переходит к следующей.

Появление клонирования голоса в этой готовой модели дало скачок действенности. Живые операторы, изображавшие конкретного внука, всегда были ограничены тем, что не могли воспроизвести голос, которого никогда не слышали. С трёхсекундным отрывком из соцсети и доступной программой преобразования голоса это ограничение исчезло.

Разрыв в законе и в уголовном преследовании

Доля дел, доходящих до суда, при мошенничестве с мнимой семейной бедой невелика. Географическая разнесённость операций — звонящие в одной юрисдикции, курьеры в другой, финансовая инфраструктура в третьей — создаёт сложности с координацией, которые истощают ресурсы правоохранительных органов. Пострадавшие часто не обращаются. Те, кто обращается, нередко не могут дать сведений, пригодных для работы, потому что всё общение шло по телефону и на другом конце не было отслеживаемой личности.

Действующее законодательство большинства стран не выделяет клонирование голоса в мошенничестве в отдельный состав — дела ведут по имеющимся статьям о мошенничестве с использованием связи и о выдаче себя за другое лицо. Отсутствие специальных норм означает, что обвинению приходится доказывать состав без инструментов, созданных для преступлений с синтезированными медиа.

В 2024 году Федеральная комиссия по связи США постановила, что сгенерированные ИИ голоса в автообзвонах требуют согласия по Закону о защите потребителей телефонной связи, — узкое решение, касавшееся политических автообзвонов, но не затрагивающее устройство адресного мошенничества с мнимой семейной бедой, которое представляет собой не автоматический обзвон, а живой интерактивный обман.

Чего нельзя утверждать с уверенностью

Истинный масштаб мошенничества с мнимой семейной бедой, усиленного ИИ, неизвестен. 357 обращений в ФБР и 2,7 млн долларов задокументированных потерь в США за 2024 год — это только те случаи, о которых сообщили. О произошедшем хоть какому-нибудь федеральному органу сообщает менее одного из двадцати пострадавших от мошенничества в отношении пожилых. Главные преграды — стыд, самообвинение и уверенность, что обращение ничего не даст.

Что делает несомненным ход развития технологии: стоимость производства правдоподобного клона голоса будет и дальше падать. Поведенческая модель — собрать звук, синтезировать голос, изготовить беду, изъять деньги — уже сегодня не требует для исполнения никаких специальных технических навыков. Препятствие для развёртывания — не доступ к технологии. Это сценарий и подбор целей. И то и другое можно поставить на поток.