目的
品質の良い音声合成のために音声合成モデルに入力する言語データを簡易に作成することができる音声合成装置及びプログラムを提供する。
効果
品質の良い音声合成のために音声合成モデルに入力する言語データを簡易に作成することができる。
技術概要
発話における音素の情報と、前記発話において当該音素が含まれるアクセント句及び当該アクセント句に隣接するアクセント句に関する特徴を示すアクセント句情報とを少なくとも含むラベルデータを前記発話における前記音素の出現順に並べたコンテキストラベルデータから前記発話における出現順の前記音素の情報を抽出し、出現順の前記音素が表す読み方に対応した文字列に、前記音素と前記アクセント句情報との少なくとも一方に基づいて得られる韻律を表す文字又は文字列である韻律記号を付加したテキストデータを生成する変換部と、
シーケンス・ツー・シーケンス方式の音響特徴量生成モデルに前記変換部により生成された前記テキストデータを入力し、前記発話の推定の音響特徴量を生成する音響特徴量生成部と、
前記音響特徴量生成部が生成した前記音響特徴量を用いて音声波形を推定するボコーダ部と、
を備えることを特徴とする音声合成装置。