Перейти к контенту
AppCraft
Форензика голоса · собственный стек · ~10 секунд

Этот голос живой?
Мы умеем это различать.

Голосовая форензика, которую мы разворачиваем для банков, страховых и контакт-центров. Отличаем живую речь от синтезированной — по любому современному движку синтеза и клонирования голоса.

Модели работают на наших серверах в РоссииТри независимых канала детекцииОколо 10 секунд на вердикт
3
Независимых канала
10 сек
Достаточно для вердикта
API
Подключение по запросу

Собственные продукты AppCraft

Студия разработки AppCraft не только создает решения для клиентов, но и запускает собственные проекты. Это позволяет нам понимать все этапы роста IT продуктов, накапливать экспертизу в продуктовой сфере и оказывать клиентам услуги полного цикла.

Продуктовая экспертиза

Понимаем все этапы роста IT продуктов на практике

Полный цикл разработки

От идеи до масштабируемого продукта с реальными пользователями

Ценность и доход

Создаем не просто код, а продукты, приносящие пользу и прибыль

Что делает детектор голоса

По десяти секундам речи движок отдаёт вердикт, разбивку по трём каналам детекции и восемь измеренных сигналов. Анализ занимает около десяти секунд.

Технический скринер, а не приговор. Это информационная проверка, а не доказательство того, что голос живой или синтезированный. Качественный клон, прогнанный через телефонный кодек, может пройти, а живая речь — вызвать подозрение.

Где живут записи. Модели работают на наших серверах в России и на присланных записях не обучаются. В развёртывании у заказчика аудио не покидает его собственный контур.

Покрытие

Узнаём речь всех заметных синтезаторов.

Основной классификатор откалиброван под коммерческие нейросетевые вокодеры 2024–2026 годов — то есть под реальную поверхность атаки в вишинге и мошенничестве с голосовыми подтверждениями.

  • ElevenLabs
  • OpenAI TTS
  • Hume AI
  • Amazon Polly Neural
  • Microsoft Azure Neural Voice
  • Google WaveNet / Chirp
  • Yandex SpeechKit
  • SaluteSpeech
  • Speechify
  • Kokoro
  • Resemble AI
  • PlayHT
  • Bark / Coqui XTTS
  • и многие другие

Послушайте и сравните

Один живой голос. Один синтезированный. Разницу видно за десять секунд.

Два десятисекундных фрагмента: один — запись живого человека, второй сгенерирован современным коммерческим синтезатором. На слух это одинаково гладкая, размеренная речь. Детектор различает их примерно за десять секунд.

Живая запись

Человек · английский язык

Эталон: человек

Живой голос, записанный «в поле»

Фрагмент чтения вслух из общественного достояния. Естественное микродрожание высоты и темпа, нерегулярная фаза, выразительная просодия — ровно то, что сглаживают современные вокодеры.

Человек · 74%

Синтезированная речь

Нейросетевой синтез · английский язык · 2026

Эталон: синтез

Коммерческий нейросетевой синтез

Сгенерировано движком текущего поколения. Большинству слушателей звучит как обычная беглая речь. Основной классификатор ловит отпечаток вокодера уже по первым секундам записи.

Синтез · 70%

Оба примера — на английском языке: детектор работает с формой волны, а не с текстом, поэтому язык записи на вердикт почти не влияет — русская речь разбирается так же. Клонировать тембр конкретного человека для этой демонстрации мы не стали, поэтому в примерах звучат разные голоса и разные фразы. Важен вердикт: живой человек → «Живой голос», коммерческий синтез → «Синтезированный голос», оба с высокой уверенностью.

Как это устроено

Три независимых канала — и ни одного решающего в одиночку.

Один классификатор ошибается на нетипичном материале: телефонный кодек, шумная комната, непривычный акцент. Ансамбль из трёх разных по природе каналов ошибается на разном — и именно поэтому его труднее обмануть.

Канал 1

Основной классификатор

Wav2Vec2-XLS-R, дообученный на речи коммерческих систем синтеза. Работает не с текстом, а с формой волны — поэтому язык записи для него вторичен.

Канал 2

Вспомогательный классификатор

XLS-R 300M, обученный на данных семейства ASVspoof. Добавляет независимую точку зрения и намеренно смещён в сторону осторожных оценок.

Канал 3

Эвристики вокодера

Хаос фазы, стабильность основного тона, отношение гармоник к шуму, чистота уровня паузы, микродрожание MFCC. Это физика сигнала, а не обучающая выборка, — канал не устаревает вместе с моделями.

Плюс проверка вменяемости входа

Отдельная лёгкая модель подтверждает, что в записи вообще есть связная речь, и определяет её язык. Без этого детектор охотно выносил бы уверенный вердикт по музыкальному отрывку или тишине. Черновик расшифровки показывается только для наглядности и на вердикт не влияет.

Почему это важно сейчас

Телефонное мошенничество и клоны голоса в России.

Двадцати секунд чужой речи достаточно, чтобы собрать убедительную копию голоса. Звонок остаётся самым массовым каналом выхода мошенника на человека.

63%

Россиян столкнулись с телефонным фродом

Опрос «Народного фронта» среди 27 900 респондентов: столько людей лично сталкивались с попытками телефонного мошенничества в 2026 году.

Народный фронт, 2026

45,6%

Атак начинается со звонка или СМС

Самый частый способ выхода мошенника на жертву по опросу Банка России; ещё 15,7% приходится на мессенджеры.

Банк России, 2024

до 2 млн

Звонков с подменой номера блокируется в сутки

Система «Антифрод» ежедневно верифицирует 400–600 млн вызовов и отсекает от одного до двух миллионов подозрительных.

Роскомнадзор, 2025

20 секунд

Записи хватает, чтобы клонировать голос

Столько чистой речи с разной интонацией достаточно для убедительной синтезированной копии. Оценки экспертов расходятся в диапазоне от 3 до 30 секунд.

«Интернет-розыск», 2025

4 000

Пострадавших от подделки голоса и внешности

За пять месяцев 2026 года — при совокупном ущербе 21 млрд рублей.

МВД России, 2026

275–295 млрд ₽

Похищено у россиян за 2025 год

Оценка Сбербанка по всему кибермошенничеству, включая неучтённые случаи. Звонки и мессенджеры остаются основным каналом выхода на жертву.

Сбербанк, 2026

Источники: Банк России, МВД России, Роскомнадзор, Сбербанк, «Народный фронт». Данные 2024–2026 гг.

Для кого

Где это живёт в вашем контуре.

Мы разворачиваем голосовую форензику на вашей инфраструктуре, в вашем облаке или как управляемый REST / WebSocket-сервис за вашим ingress.

Банки и финтех

Вишинг и голосовые подтверждения

Оценивайте входящие звонки и голосовые сообщения на синтетическую речь до того, как разговор дойдёт до оператора. Задержка внутри звонка, журнал проверок для комплаенса.

Страхование

Аудио по убыткам

Звонки о наступлении события и записанные объяснения проходят через голосовую форензику. Сгенерированные «показания свидетеля» отсекаются до стола эксперта.

Контакт-центры и госуслуги

Аутентификация и обратные звонки

Слой детекции дипфейков поверх голосовой биометрии или скрининг заявок на обратный звонок в потоке.

Частые вопросы

MP3, WAV, M4A, AAC, OGG/Opus, FLAC, WebM и AMR — до 10 МБ. Анализируются первые 10 секунд записи, поэтому фрагмент должен начинаться с речи: длинная тишина или музыка в начале размывают сигнал.

Работают три независимых канала. Два нейросетевых классификатора на архитектуре Wav2Vec2-XLS-R: один дообучен на коммерческих системах синтеза речи, второй — на данных семейства ASVspoof. Третий канал — физические эвристики вокодера: хаос фазы, стабильность основного тона, отношение гармоник к шуму, чистота уровня паузы, микродрожание MFCC. Отдельная лёгкая модель подтверждает, что в записи вообще есть речь.

Точность выходит на плато быстро: признакам Wav2Vec2 хватает примерно трёх секунд речи, десять дают ансамблю комфортный запас — и удерживают время ответа примерно на том же уровне. В боевом развёртывании длительность не ограничена: там результат агрегируется по окнам.

Нет, детектор отвечает на вопрос «синтезировано ли это вообще». Сверка личности говорящего — отдельная задача: в продуктовом развёртывании поверх тех же признаков добавляется проверка «тот ли это человек» при наличии эталонной записи легитимного спикера.

Модели работают на наших серверах в России, на присланных записях они не обучаются. Голосовую форензику можно развернуть и на вашей инфраструктуре, в вашем облаке или как управляемый REST / WebSocket-сервис за вашим ingress — тогда аудио вообще не покидает ваш контур.

Разработчик сервиса – ООО "ЭппКрафт", продукты которого зарегистрированы в реестре отечественного ПО.

Для связи по вопросам сотрудничества, подключения API и сопровождения свяжитесь с нами по почте support@appcraft.pro