Что такое диаризация речи и как она работает

Диаризация — это автоматическое разделение аудиозаписи по голосам участников. Она сокращает время на подготовку протоколов совещаний и расшифровок интервью в несколько раз по сравнению с ручной работой. А еще использование диаризации позволяет компаниям извлекать ценные данные из тысяч часов телефонных звонков и планерок.
Содержание

Зачем нужна диаризация

Вручную размечать спикеров — долго. А без разделения на спикеров текст читать почти невозможно — особенно если на записи спор или обсуждение нескольких вопросов подряд. На разметку часового разговора уходит в 4−5 раз больше времени, чем длится сама запись. Нейросеть справляется за минуты: распознает голоса и подписывает реплики автоматически. Вот почему стоит использовать диаризацию.
Облегчает работу с текстом
Часовая планерка — это примерно 8 000−10 000 слов. Читать такой документ без разделения на абзацы и спикеров — тяжелая и неэффективная работа. Приходится сверяться с исходным аудиофайлом, чтобы вспомнить, кто именно внес предложение или озвучил проблему. Автоматическая разметка решает эту проблему, превращая хаотичную запись в структурированный протокол.
Помогает фиксировать договоренности
В деловой среде важно фиксировать, кто именно взял на себя задачу. Автоматическое разделение спикеров позволяет быстро находить ключевые моменты:
  • Поручения руководителя конкретным исполнителям.
  • Ответы сотрудников о статусе текущих проектов.
  • Согласие или несогласие сторон во время переговоров.
Точные таймкоды рядом с каждой репликой позволяют мгновенно перейти к нужному фрагменту аудиозаписи.
Упрощает анализ разговора
Когда реплики подписаны, видно, кто говорит больше, кто перебивает, а кто отвечает односложно. Это полезно на встречах и звонках с клиентами или коллегами — по структуре разговора видно динамику.

Как работает диаризация

Технология состоит из четырех последовательных этапов обработки звуковой волны. Каждый этап критически важен для конечного результата, и ошибка на любом из них ведет к ухудшению общего качества разметки. 
Основные этапы работы алгоритма
1. Находит речь. Сначала алгоритм убирает из записи тишину, паузы, шорохи, вздохи и музыку.
2. Разделяет речь на короткие куски. Нейросеть делит звук на отрезки по 0,5−2 секунды и ищет моменты, где один голос сменяется другим.
3. Преобразует голос в набор чисел. Для каждого отрезка нейросеть анализирует особенности голоса — высоту, тембр, окраску звука — и превращает их в числовой отпечаток. Это как отпечаток пальца, только голосовой: у каждого человека он уникальный.
4. Группирует похожие голоса. Алгоритм сравнивает все отпечатки между собой. Похожие объединяет в одну группу — это и есть один спикер. Каждой группе присваивает номер: «Спикер 1», «Спикер 2» и так далее.

Точность разделения голосов в современных сервисах

Точность в современных автоматических системах достигает 85−95% при условии чистой записи. Качество работы измеряют метрикой DER (Diarization Error Rate) — она показывает, какой процент реплик алгоритм разметил неправильно. Чем ниже DER, тем точнее разделение.
Что снижает точность
Влияют физические параметры аудиозаписи:
  • Большое количество участников. Развести голоса двух человек — просто. Но если в разговоре 6−8 человек, и все перебивают друг друга, алгоритму сложнее понять, где чья реплика.
  • Акустика помещения. Эхо, гул кондиционера, шум за окном мешают алгоритму отделять речь от фона.
  • Похожие голоса. Если в разговоре участвуют люди с похожим тембром, нейросеть иногда путает их и объединяет реплики в одну группу.
  • Одновременная речь. Если два человека говорят в один момент, алгоритм может либо слить реплики в одну, либо потерять часть слов — это самый сложный случай для диаризации.
  • Сжатие и качество записи. Звонки через мобильную связь или мессенджеры часто пишутся с потерей качества. Из-за этого голосовые отпечатки размываются, и алгоритму сложнее отличить одного говорящего от другого.
  • Короткие реплики. Односложные ответы вроде «да» и «угу» — самые частые ошибки диаризации. На таком коротком отрезке речи алгоритму не хватает данных, чтобы точно определить, чей это голос, и он может приписать реплику не тому спикеру.
По данным исследования Interspeech, не менее 40% ошибок диаризации приходится на участки до и после смены говорящих. Именно поэтому короткие реплики, перебивания и быстрый обмен фразами остаются одними из самых сложных случаев для алгоритмов.

Сколько стоит автоматическая диаризация аудио

Стоимость в профессиональных сервисах, например, в Teamlogs включена в общую цену транскрибации. Стоимость за минуту варьируется от 6 до 10 рублей — в зависимости от пакета. Использование автоматических систем в десятки раз выгоднее ручной работы профессиональных стенографистов — их услуги на российском рынке стоят от 40 до 120 рублей за минуту записи.
Сравнение ручного труда и автоматических сервисов

Популярные сервисы с диаризацией

На российском рынке есть несколько сервисов с диаризацией — они отличаются функционалом и ограничениями. Рассказываем подробнее о популярных решениях.
  • Teamlogs — выдает транскрипт с разделением по спикерам, доплат за диаризацию нет. В веб-версии есть полезные функции: онлайн-редактор, автоматические отчеты, Умный чат для ответов на вопросы по расшифровке. Для интеграции в свои системы есть API — не обязательно ограничиваться веб-интерфейсом.
  • Войси — диаризация без ограничения по числу спикеров, работает как бот в Telegram, VK и MAX.
  • Шöпот — разделяет текст по спикерам и таймкодам, есть API для встраивания в свои системы.
  • Яндекс SpeechKit — диаризация встроена в API, но с ограничением: работает только для монозаписей и не различает больше двух спикеров одновременно.
  • Nexara — API-сервис для разработчиков, диаризация включается параметром запроса, серверы в России. Без веб-интерфейса — доступно только встраивание в собственный продукт.

Как расшифровать запись с разделением по спикерам: пример сервиса Teamlogs

Для использования диаризации в Teamlogs нужно выполнить три действия: загрузить файл, дождаться обработки и при необходимости переименовать спикеров. Всю техническую часть сервис берет на себя — вы получаете готовый структурированный текст.
Пошаговая инструкция по работе с сервисом
  1. Зарегистрируйтесь на teamlogs.ru — сервис дает 15 минут бесплатно, чтобы проверить качество распознавания.
  2. Загрузите файл — подойдет аудио или видео до 1,5 ГБ. Сервис принимает большинство форматов файлов.
  3. Дождитесь обработки — она занимает около 10−15 секунд на минуту записи. Часовая встреча обработается примерно за 2−3 минуты.
  4. Отредактируйте результат. Готовый транскрипт разбит на блоки с таймкодами и подписями спикеров. Если нужно — переименуйте их: это делается в один клик во встроенном редакторе. Например, вместо «Спикер 1» можете написать «Алексей» — сервис автоматически применит это имя ко всем репликам этого человека.

Интерфейс сервиса: список спикеров — в меню справа

5. Экспортируйте текст — в DOCX, XLSX или SRT, если нужны субтитры.
Работа сервиса на реальном примере
Мы загрузили в сервис Teamlogs запись судебного заседания длительностью две минуты — качество звука среднее, есть шумы, иногда фразы плохо слышно. Вот что у нас получилось.

Стенограмма была у нас через несколько секунд —  на почту пришло уведомление о готовности

Что в итоге

✅ Сервис точно разделил расшифровку по спикерам — назвал их «Спикер 0» и «Спикер 1». Изменить имена спикеров можно за пару кликов в меню.

Кроме того, Teamlogs верно распознал около 95% слов и расставил запятые — несмотря на то, что звук в записи был не всегда качественным.

Как подготовить аудиофайл для идеального разделения спикеров

Чтобы получить максимальную точность, можно записать каждого участника на отдельный качественный микрофон в тихом помещении без эха. Соблюдение простых правил записи позволяет поднять точность автоматической диаризации до 98%.
Как записать звук, чтобы диаризация была точной
  • Пишите каждого спикера отдельно. Если встреча очная, лучший вариант — петличные микрофоны и запись в разные аудиоканалы. Тогда голоса физически не смешиваются.
  • Уберите фоновый шум. Закройте окна, выключите кондиционер и вентилятор. Попросите участников не стучать ручкой по столу и не шуршать бумагой рядом с микрофоном — это самые частые помехи.
  • Не перебивайте друг друга. Одновременная речь двух и больше человек — главная причина ошибок в диаризации.

Как диаризация применяется в бизнесе

Технология разделения спикеров применяется для аналитики звонков в отделах продаж, протоколирования рабочих совещаний и создания контента. Перевод голосовых данных в текст открывает возможности для поиска и глубокого анализа информации.
Контроль отделов продаж. Записи звонков превращаются в текст, где разделены реплики менеджера и клиента. По тексту легко проверить, следовал ли менеджер скрипту, какие возражения озвучил клиент и как на них ответили. Без диаризации пришлось бы вручную выписывать, кто что сказал.
Протоколирование совещаний. Вместо конспекта от руки у вас будет расшифровка с разделением по спикерам. Можно легко увидеть, кто и какую задачу на себя взял. При этом протокол получается за минуты.
Качественные исследования. UX-исследователи и маркетологи загружают интервью и фокус-группы и получают текст с репликами каждого участника. Можно быстро найти нужную цитату или проблему пользователя, не пересматривая видео.

Автор — Ксения Букнис, редактор в сервисе teamlogs.ru

Часто задаваемые вопросы

Транскрибация преобразует устную речь в текст, а диаризация разделяет этот текст по голосам спикеров. Диаризация работает вместе с транскрибацией и анализирует тембральные особенности голоса, определяя, какому спикеру принадлежит каждый текстовый блок.