«AI оценил звонок на 7 из 10» — фраза, за которой обычно не видно механики, а без механики ей трудно доверять. Разберём по шагам, что происходит между аудиофайлом и оценкой, где система ошибается чаще всего и как проверить, что балл не взят с потолка.
Четыре шага между записью и баллом
Оценка звонка — не одно действие, а цепочка из четырёх, и ошибка на любом шаге портит результат всех последующих.
- Распознавание речи. Аудио превращается в текст. Здесь возникают ошибки в терминах, именах и числах.
- Разделение говорящих. Реплики размечаются: где менеджер, где клиент. Без этого шага чек-лист бессмысленен — непонятно, кто что сказал.
- Разметка смысла. В тексте находятся смысловые события: прозвучало возражение о цене, названо конкретное время, задан вопрос о сроках.
- Проверка по чек-листу. Найденные события сопоставляются с пунктами чек-листа, и каждый получает зачёт или незачёт с обоснованием.
Балл — это не мнение модели о разговоре, а арифметика по чек-листу, который написали вы. Если чек-лист плохой, точная модель даст точную оценку бесполезного набора пунктов.
Шаг 1: распознавание речи
Точность распознавания измеряется долей верно распознанных слов и на русскоязычных телефонных звонках достигает высоких значений, но не ста процентов и никогда не будет ровной по всей базе. На неё влияют качество линии, фоновый шум, темп речи, акцент, перебивания.
Важная деталь: ошибки распределены неравномерно. Обычные слова распознаются почти всегда, а страдают именно те, что важны для оценки, — названия продуктов, фамилии, суммы. Поэтому в системах контроля качества отраслевые термины обычно добавляют в словарь отдельно.
Шаг 2: разделение говорящих
Задача — понять, какая реплика чья. Если запись стереофоническая и каналы разделены телефонией, шаг тривиален. Если запись моно, говорящих приходится разделять по голосу, и здесь появляются ошибки на перебиваниях и при похожих голосах.
Это второй по значимости источник неверных оценок: реплика клиента, приписанная менеджеру, ломает проверку сразу нескольких пунктов. Практический вывод для внедрения: стереозапись со стороны телефонии стоит настроить до запуска аналитики, а не после.
Шаг 3: разметка смысла
Здесь система ищет не слова, а события. Разница принципиальная: «дорого», «не укладываемся в бюджет» и «у конкурентов дешевле» — три разные формулировки одного возражения о цене, и поиск по ключевым словам поймает только первую.
Именно на этом шаге языковые модели дают выигрыш перед прежними системами на регулярных выражениях: они опознают событие по смыслу, а не по совпадению строки. Обратная сторона — модель может увидеть событие там, где его не было, и это лечится только сверкой на реальных разговорах.
Шаг 4: проверка по чек-листу
Последний шаг самый прозрачный. Каждый пункт получает зачёт или ноль, и к нему прикладывается обоснование: цитата из разговора или указание, чего именно не прозвучало. Обоснование — не украшение отчёта, а единственный способ проверить систему: без него оценку нельзя оспорить, а значит, ей нельзя и доверять.
| Шаг | Типовая ошибка | Чем лечится |
|---|---|---|
| Распознавание | Термины, имена, суммы | Словарь отрасли |
| Разделение | Реплика приписана не тому | Стереозапись из телефонии |
| Смысл | Событие найдено там, где его нет | Калибровка на реальных звонках |
| Чек-лист | Пункт неоднозначен | Переписать формулировку |
Как проверить, что балл не взят с потолка
Три вопроса, которые стоит задать любой системе оценки — своей или чужой.
- Есть ли обоснование у каждого пункта? Оценка без цитаты непроверяема.
- Совпадает ли оценка с человеческой на калибровочной выборке? Несколько десятков звонков, размеченных руководителем, — минимальная проверка.
- Воспроизводится ли оценка? Один и тот же звонок, прогнанный дважды, должен дать тот же результат.
Коротко
- Оценка звонка — цепочка из четырёх шагов, ошибка на любом портит итог.
- Ошибки распознавания бьют именно по важным словам: терминам, именам, суммам.
- Разделение говорящих — второй по значимости источник неверных оценок; стереозапись настраивается до внедрения.
- Балл считается по вашему чек-листу, а не является мнением модели о разговоре.
- Оценка без обоснования непроверяема, а значит, бесполезна.
Как это устроено у нас — на странице речевой аналитики Эхо: по каждому звонку отдаются расшифровка, разбор по пунктам чек-листа и обоснование каждой оценки. Что получается на реальных внедрениях, видно в разборах.