適用製品
音声波形生成システム、音声波形生成方法、音声波形生成プログラム
目的
単語やフレーズを高品質に音声引き伸ばしできるモデルを提供する。
効果
単語やフレーズを高品質に音声引き伸ばしできるモデルを提供する。
技術概要
音素シーケンスをベクトル空間に順次配置して音素埋め込みを生成する埋め込み層と、
前記音素埋め込みから音響特徴量を生成する音響モデルと、
前記音響特徴量から音声波形を生成する波形生成モデルとを備え、
前記音響モデルは、前記音素埋め込みを連続表現に変換するエンコーダと、前記連続表現から各音素の継続長を予測するバリアンスアダプタと、前記バリアンスアダプタの出力から前記音響特徴量を予測するデコーダとを含み、
前記音素埋め込みに基づく特徴量を前記エンコーダより後段に加算するためのスキップコネクションをさらに備える、音声波形生成システム。