適用製品
発話音声テキスト生成装置、発話音声テキスト生成プログラムおよび発話音声テキスト生成方法
目的
複数の発話音声を含んだ音声データと対応するテキストデータとから、発話区間ごとの音声データとテキストデータとを生成することが可能な発話音声テキスト生成装置、発話音声テキスト生成プログラムおよび発話音声テキスト生成方法を提供する。
効果
複数の発話音声からなる音声データとその音声データに対応するテキストデータとに時間的にずれがある場合でも、発話ごとの音声データとテキストデータとを対応付けて抽出することができる。
技術概要
複数の発話音声からなる音声データから、発話ごとの区間音声データの区切り位置を検出する音声区切り検出手段と、
前記区間音声データごとに音声認識を行う音声認識手段と、
前記音声認識手段の認識結果と、前記音声データの発話内容であるテキストデータとをマッチングすることで、前記区間音声データの時間に対応する区間テキストデータを推定するマッチング手段と、
前記区間テキストデータから、音素の情報と、当該音素が含まれるアクセント句および当該アクセント句に隣接するアクセント句に関する特徴を示すアクセント句情報とを少なくとも含む音素ごとのコンテキスト情報を生成するコンテキスト情報生成手段と、
音素列の前記コンテキスト情報を、音素の出現順の読みを表す文字と韻律を表す予め定めた文字とを含む第2の区間テキストデータに変換する変換手段と、
を備えることを特徴とする発話音声テキスト生成装置。