目的
品質の良い音声を低コストで合成できる音声合成装置及びプログラムを提供する。
効果
品質の良い音声を低コストにより合成することができる。
技術概要
近年、統計モデルを用いた音声合成技術が進歩したことにより、テキストから音声を合成する技術が知られている。例えば、ディープニューラルネットワーク(Deep Neural Network:DNN)を用いて話者の音声等の特徴を学習し、テキストから音声合成を行う技術が開発されている。また、英語で記述された文字列からメルスペクトログラムを推定し、このメルスペクトログラムから音声波形を生成する技術も開発されている
従来の統計的音声合成装置は、音響特徴量を算出して音声合成を行うために、音素ラベルファイルを用いた統計モデルにより音声を生成する。この音素ラベルファイルは、音素や音素の時間長、品詞等のラベルが含まれ、音声の音響特徴量からラベルを付与する。