AIくらべは法人向けAIサービスの比較データベース。掲載12サービス・全情報に確認日を明記・広告掲載なし。

音声認識とは?

音声認識とは、人が話した音声をコンピューターが解析し、文字(テキスト)データに変換する技術のことです。 会議の発言をリアルタイムで文字起こししたり、音声で操作を指示したりするサービスの基盤技術として使われています。

仕組み

音声認識は、マイクで拾った音声波形を解析し、音の特徴を単語や文章の候補に変換する処理を行います。近年は生成AIと同様の技術を応用したモデルが登場し、雑音のある環境や話者ごとの発音の違いにも対応しやすくなっているほか、句読点の自動挿入や話者の識別まで行えるサービスも増えています。文字化されたテキストは、その後LLMに渡して要約や議事録作成に使うこともできます。

ビジネスでの使いどころ

会議やコールセンターの通話をリアルタイムで文字起こしして議事録・応対記録を自動作成する、営業や問い合わせの内容を音声のまま検索・分析できるようにするといった用途が代表的です。文字起こし後のテキストをLLMに渡せば、要約や対応すべき事項の抽出まで一連の流れとして自動化できます。

関連用語

LLM生成AIマルチモーダルAIチャットボット