目的
対応可能な音声を変更した場合において、抽出精度を維持しつつ学習回数を低減させることができ、処理の高速化を図ることが可能な音声抽出装置およびそのプログラムを提供する。
効果
2段階の抽出により、新規の音声を抽出する場合であっても、全ての音声を学習することなく、新規の音声と環境音を分離するための学習が1回だけとなる。
そのため、対応可能な音声を変更した場合において、抽出精度を維持しつつ学習回数を低減させることができ、処理の高速化を図ることができる。
技術概要
学習用データセットを作成するデータセット作成手段と、
基本モデル、ユーザオリジナル基本モデル、第1段階抽出用モデルを生成するモデル生成手段と、
生成した基本モデル、ユーザオリジナル基本モデル、第1段階抽出用モデルを記憶するモデル記憶手段と、
記憶された基本モデル、ユーザオリジナル基本モデル、第1段階抽出用モデルを管理するモデル管理手段と、
ニューラルネットワークの演算により入力音声から、個別の環境音または前記所定の音声を抽出する抽出手段と、を備え、
抽出手段は、
第1段階抽出用モデルを用いて、ニューラルネットワークの演算により入力音声から、新規音声を第1段階で抽出し、
基本モデルおよびユーザオリジナル基本モデルを用いて、ニューラルネットワークの演算により第1段階で抽出した音声から、個別の環境音および前記所定の音声を第2段階で抽出し、
データセット作成手段は、新規音声と前記学習用データセットのうちの課題となるデータを組み合わせて新たな学習用データセットを作成し、
モデル生成手段は、データセット作成手段が作成した新たな学習用データセットで学習させることで第1段階抽出用モデルを生成する
音声抽出装置。