К содержимому
MoranaLabs
Research5 мин чтения4 просмотра

Речевая аналитика 100% звонков: контроль качества и продаж без ручной прослушки 

В колл-центре на 200 человек отдел качества слушает от силы 1% аудио. Вы теряете сделки, скрипты саботируются, а вы даже не знаете почему. Как развернуть on-premise транскрибацию и анализ разговоров ИИ для всего трафика.

0xReality

Колл-центр крупного банка, телекома или ритейла. Пятница, пиковая нагрузка. Триста операторов выжигают голосовой шлюз, принимая и совершая тысячи звонков в час. И где-то в углу опенспейса сидят три человека из отдела контроля качества. В их дешевых наушниках играет лотерея: физически они способны прослушать 1-2% от всего потока. Остальные 98% аудио улетают в пустоту. В MoranaLabs мы строим high-load инференс и edge-вычисления на железе клиентов, и я постоянно вижу эту иллюзию управления. Компании думают, что контролируют качество, опираясь на микроскопическую выборку. Речевая аналитика 100% звонков — это не космос и не хайп. Это базовая гигиена, без которой вы ведете бизнес с завязанными глазами.

«Но у нас опытные супервизоры. Мы слушаем проблемные звонки, где клиент поставил низкую оценку или где сделка сорвалась. Этого хватает для контроля качества и продаж».

Нет, не хватает. Вы слушаете патологоанатомический отчет. Сделка уже мертва, клиент уже ушел к конкуренту. Вы разбираете последствия, а не предиктивные паттерны. Более того, вы понятия не имеете, что в 40% внешне успешных звонков оператор забыл предложить апселл, и вы недополучили прибыль. Ручная прослушка — это ошибка выжившего в чистом виде.

Транскрибация и семантический анализ разговоров ИИ

«Аналитика звонков — это просто поиск по словам. Скрипты — это общие гайдлайны, а операторы быстро учатся обходить регулярные выражения и стоп-слова».

Ты застрял в эпохе динозавров, если думаешь, что современный ИИ ищет точное совпадение слов. Да, старые системы ломались, когда вместо «я не могу вам помочь» оператор говорил «данный вопрос вне моей компетенции». Но современная транскрибация и анализ разговоров ИИ работают с векторными представлениями текста (эмбеддингами) и LLM. Мы ищем не слова, мы ищем намерения (intents).

Нам плевать, какими именно изящными фразами оператор послал клиента или проигнорировал возражение. Семантическая модель поймает суть отказа. Контроль соблюдения скрипта и стоп-слов давно перестал быть тупым поиском по словарю.

import torch
from sentence_transformers import SentenceTransformer, util

# Модель крутится локально, никакого внешнего API
model = SentenceTransformer('cointegrated/rubert-tiny2')

script_intents = [
    "предложить дополнительную гарантию",
    "объяснить причину задержки доставки",
    "отработать возражение по цене"
]
intent_embeddings = model.encode(script_intents)

def check_script_compliance(transcription_chunks):
    chunk_embeddings = model.encode(transcription_chunks)
    # Ищем семантическое сходство фраз оператора с обязательными блоками скрипта
    cosine_scores = util.cos_sim(chunk_embeddings, intent_embeddings)
    
    # Если максимальный скор ниже порога — оператор забил на блок скрипта
    return (cosine_scores > 0.82).any(dim=0)

On-premise ИИ: приватность разговоров и железо

«Ну хорошо, транскрибация всего трафика — это здорово. Я просто солью аудиопоток в публичное облако, там транскрибация стоит копейки».

Сливай. Ровно до первой секунды, когда клиент продиктует оператору CVV-код карты, номер паспорта или диагноз. Один такой звонок, улетевший за периметр в публичный API, — это прямое нарушение PCI DSS, ФЗ-152, GDPR и NDA. Как только в дело вступает безопасность, публичные облака превращаются в юридическую мясорубку.

Речевая аналитика для enterprise-сектора существует только в формате on-premise. Инференс должен происходить локально. Аудио не имеет права покидать ваш контур. Это ровно то, за что нам платят в MoranaLabs: упаковать тяжелую акустическую модель в железо клиента так, чтобы она успевала переваривать 500 одновременных потоков в реалтайме, не сжигая сервера. И здесь начинается суровая инженерия.

Ты не можешь запустить 70-миллиардную модель на старых блейд-серверах. Тебе приходится использовать квантованные модели, оптимизировать ASR (Automatic Speech Recognition) для работы с зашумленным SIP-трафиком 8 kHz, и решать адскую проблему диаризации. Если система не может точно разделить спикеров на моно-канале, ASR склеит слова оператора и клиента. В итоге ИИ оштрафует оператора за матерное слово, которое на самом деле выкрикнул клиент.

Выявление причин оттока и упущенных продаж: проблема эмоций

«Нейросети все равно тупые, они не понимают интонаций. Клиент может саркастично пошутить, а машина решит, что он лоялен, или наоборот».

Здесь ты частично прав. Акустический анализ эмоций (prosody) на шумном телефонном звонке — это все еще скользкая территория. Сарказм ломает 90% акустических моделей на edge-устройствах. Но фишка в том, что тебе не нужен детектор сарказма, чтобы спасти продажи.

Тональность и эмоции клиента отлично считываются без акустической магии. Мы используем мета-признаки: факты перебиваний, изменения темпа речи (words per minute), соотношение времени говорения (silence ratio) и семантику транскрипта. Если клиент перебил оператора шесть раз за минуту, а в его репликах появились маркеры угрозы разрыва контракта — плевать, каким тоном он это сказал. Звонок помечается красным флагом.

Более того, выявление причин оттока через речевую аналитику дает инсайты не об операторах, а о продукте. Клиенты прямым текстом говорят, почему ваш конкурент лучше, но из-за того, что в CRM нет нужного поля, оператор ставит тег «Дорого» или «Отказ». Транскрибация и NLP вытаскивают реальные возражения из 100% звонков. Вы получаете карту болей рынка в реальном времени.


Бизнес-метрикаПри 1-2% ручной прослушки (QA)При 100% ИИ-аналитике звонков
Соблюдение обязательного скриптаОколо 95% (субъективная иллюзия)42% (объективная реальность в первую неделю)
Выявление упущенных кросс-сейловАнализируется постфактум, причины искаженыФиксируется в 100% диалогов, точная статистика отказов
Скорость реакции на конфликт (отток)Дни или недели (если повезет найти звонок)Минуты (реалтайм-алерт супервизору)
Охват оценки операторовСлучайные 3-5 звонков на сотрудника в месяцАбсолютно каждый диалог

Посмотри на эти цифры. Это то, что происходит, когда в темной комнате включается свет. Машина не устает. У нее не замыливается ухо к концу восьмичасовой смены. У нее нет любимчиков в коллективе, которым можно простить косяки в скрипте. Она методично, холодно и безжалостно разбирает каждый байт аудиопотока.

Ты можешь и дальше держать отдел контроля качества, который играет в рулетку с терабайтами аудиозаписей, надеясь выцепить тот самый звонок, из-за которого сорвался миллионный контракт. А можешь поручить инженерам развернуть локальный конвейер, который превратит сырой голос в размеченную, измеримую базу данных. Выбор всегда только между слепой верой в регламент и жестким контролем реальности.

  • #Edge Computing
  • #On-premise
  • #Quality Assurance
  • #Speech Analytics
ПоделитьсяTelegramX
рассылка

Новые статьи — на почту

Лонгриды про ML в проде, edge и компьютерное зрение — сразу после выхода.

Канал в Telegram: morana.log

Без спама. Нажимая «Подписаться», соглашаетесь с обработкой персональных данных

бесплатный pdf-гайд

Edge AI или облако: когда тащить нейросеть на железо

Признаки, фреймворк выбора и прикидка экономии — короткий PDF-гайд на почту.

PDF · 5 страниц · без спама. Нажимая «Получить», соглашаетесь с обработкой персональных данных

Читать дальше
— заявка

Опишите задачу  ответим как инженеры. 

Оставьте имя и Telegram — остальное обсудим. Без брифов на 40 слайдов и звонков по три раза.

Отвечаем за пару часовотвечает инженер, а не отдел продажNDA до передачи данных

Любой один канал — куда удобнее, туда и ответим

Или сразу написать в Telegram

Без спама и звонков-роботов. Нажимая кнопку, вы соглашаетесь с политикой конфиденциальности и обработкой персональных данных.