話者分離とは?
話者分離とは、複数人が参加する会話の音声データから、「誰が」「いつ」発言したかを自動的に区別する技術のことです。 文字起こしと組み合わせることで、発言者ごとに整理された議事録を作成できます。
仕組み
話者分離は、音声波形に含まれる声の高さ・話し方の特徴(声紋に近い特徴量)をもとに、同一人物の発言をグルーピングする処理です。音声認識がテキスト化そのものを担うのに対し、話者分離は「誰の発言か」というラベル付けを担う別の処理で、両方を組み合わせて初めて「Aさん: 〜と発言」のような形式の議事録になります。会議参加者の事前登録なしに声だけで話者を区別する方式と、事前に声紋を登録して氏名まで自動表示する方式の両方が存在します。
ビジネスでの使いどころ
複数人が参加するWeb会議や商談の議事録で、発言者ごとの発言内容・発言比率を整理したい場合に使われます。営業の商談解析では、話者分離の結果をもとに自社担当者と顧客の発話比率・話速を分析する用途もあります。