Адаптивная гибридная нейросетевая архитектура на основе внимания для идентификации дикторов в корпоративных совещаниях

  • Потапов Арсений Денисович, ПАО Сбербанк России
  • Лукьянов Никита Дмитриевич, Иркутский национальный исследовательский технический университет (Иркутск, Россия)

Актуальность исследования обусловлена ростом потребности в автоматизации ведения протоколов корпоративных встреч, которое является трудоёмким и затяжным процессом, сопровождающимся высоким риском ошибок. Современные системы распознавания речи (ASR – Automatic Speech Recognition) работают нестабильно при многопользовательских диалогах, перекрытиях голосовых фрагментов, фоновом шуме и использовании специализированной лексики. Особенно остро стоит проблема распознавания дикторов (Speaker Identification, SID), когда на одного сотрудника приходится мало эталонных записей, что вполне типично для офисной среды. Дополнительные трудности создаёт и акустическая обстановка: гулкие кабинеты, одновременные высказывания, отсутствие чёткого разделения голосов. Таким образом, цель данной работы – создание гибридной нейросетевой модели для точной транскрипции и надёжной атрибуции речи в групповых дискуссиях. В рамках работы проанализированы слабые места ASR-систем и методов SID, предложена трёхуровневая архитектура: сегментация аудиопотока VAD + SCD (VAD – Voice Activity Detection – определение активности речи), SCD – Speaker Change Detection – детектирование смены диктора), идентификация по голосовым эмбеддингам с механизмом внимания к эталонам, транскрибация1 с учётом личности говорящего, так же приведено математическое обоснование ключевых компонентов. Теоретическая значимость заключается в построении методики SID на основе механизма внимания, позволяющая эффективно решать задачи обучения с малым числом примеров (few-shot learning). В отличие от традиционных подходов, требующих обширных размеченных корпусов, новая архитектура учится сопоставлять речевые фрагменты с небольшим числом эталонных записей. Эффективность метода эмпирически подтверждена на реальных записях корпоративных совещаний (свыше 20 часов, пять участников). Модуль сегментации показал F1-меру VAD на уровне 0,885, а модуль идентификации диктора точность 62,5%, что в трое выше случайного уровня (20%). Транскрибация выполнена через внешнюю систему Whisper, гарантирующую высокую достоверность распознавания. Результаты позволяют построить систему автоматического ведения протоколов совещаний, а архитектура позволяет работать и с большим числом участников, а также легко адаптируется под разные форматы коммуникаций: от переговоров до встреч с участием клиентов. Функциональные возможности гибридной нейросетевой модели могут быть использованы при создании различных инструментов для протоколирования корпоративных встреч.

автоматическое распознавание речи, идентификация диктора, гибридная нейросетевая архитектура, механизм внимания, голосовые эмбеддинги, сегментация аудиопотока, транскрибация, корпоративные совещания

2026-09-03

Вернуться назад