스피커 디아라이제이션

Speaker diarisation

스피커 디아라이제이션(또는 디아라이제이션)은 입력 오디오 스트림을 스피커 아이덴티티에 따라 균일한 세그먼트로 분할하는 과정이다.오디오 스트림을 스피커 턴으로 구조화하여 자동 음성 전사의 가독성을 높이고, 스피커 인식 시스템과 함께 사용할 경우 스피커의 진정한 정체성을 제공함으로써 가독성을 높일 수 있다.[1]그것은 "누가 언제 말을 했는가?"[2]라는 질문에 답하기 위해 사용된다.스피커 분리는 스피커 분할과 스피커 클러스터링의 조합이다.첫 번째 목적은 오디오 스트림에서 스피커 전환 지점을 찾는 것이다.두 번째 목표는 스피커 특성에 기초하여 음성 세그먼트를 그룹화하는 것이다.null

매년 수집되는 방송, 회의 녹음, 음성 메일의 수가 증가함에 따라, 연설가 격리는 음성 커뮤니티로부터 많은 관심을 받아왔는데, 이는 전화 음성, 방송 뉴스 및 메틴에 대한 국가표준기술원의 후원으로 그것에 헌신한 구체적인 평가에서 나타난다.gs.[3]

주요 유형의 분무 시스템

스피커 디아라이징에서 가장 인기 있는 방법 중 하나는 가우스 혼합 모델을 사용하여 각 스피커를 모델링하고 히든 마르코프 모델의 도움을 받아 각 스피커에 해당하는 프레임을 할당하는 것이다.군집화 시나리오에는 크게 두 종류가 있다.첫 번째 것은 단연코 가장 인기가 많고 바텀업이라고 불린다.알고리즘은 전체 오디오 콘텐츠를 일련의 클러스터로 분할하는 것으로 시작하고 각 클러스터가 실제 스피커에 해당하는 상황에 도달하기 위해 점진적으로 중복 클러스터를 병합하려고 시도한다.두 번째 클러스터링 전략은 top-down이라고 불리며 모든 오디오 데이터에 대해 하나의 단일 클러스터로 시작하고 스피커 수와 동일한 수의 클러스터에 도달할 때까지 반복적으로 분할하려고 시도한다.2010년 리뷰는 [1]에서 확인할 수 있다.

오픈 소스 스피커 분리 소프트웨어

스피커 분리를 위한 몇 가지 오픈 소스 이니셔티브가 있다.

  • ALIZE 스피커 디아라이징(최종 리포지토리 업데이트:2016년 7월, 마지막 릴리스:2013년 2월 버전: 3.0: ALIZE Diarization System, Of Avitana University에서 개발된 버전 2.0을 사용할 수 있다[2].
  • SpkDiarization(마지막 릴리스:2013년 9월 버전: 8.4.1: LIUM_SpkDiarization 도구 [3]
  • Audiooseg(최종 리포지토리 업데이트:2014년 5월; 마지막 릴리스: 2010년 1월, 버전 1.2:AudioSeg는 오디오 분절 및 오디오 스트림 분류 전용 툴킷이다.[4].
  • SHOUT(마지막 업데이트:2010년 12월; 버전: 0.3:SHoUT는 음성 인식 연구를 돕기 위해 Twitne 대학에서 개발된 소프트웨어 패키지다.SHoUT는 20대 대학의 음성인식연구의 네덜란드어 약자다.[5]
  • pyAudioAnalysis(최종 리포지토리 업데이트:2018년 8월:Python 오디오 분석 라이브러리:기능 추출, 분류, 세분화 및 애플리케이션 [6]

참조

  1. ^ Zhu, Xuan; Barras, Claude; Meignier, Sylvain; Gauvain, Jean-Luc. "Improved speaker diarization using speaker identification". Retrieved 2012-01-25.
  2. ^ Kotti, Margarita; Moschou, Vassiliki; Kotropoulos, Constantine. "Speaker Segmentation and Clustering" (PDF). Retrieved 2012-01-25.
  3. ^ "Rich Transcription Evaluation Project". NIST. Retrieved 2012-01-25.

참고 문헌 목록