目的
ニューラルネットワークの特性を活かして、音声認識精度を高めることができる音声認識装置を提供する。
効果
従来のDNN-HMMフレームワークのようにHMMの出力形式にあわせてRNNの出力を変換することが不要であり、認識の効率を高めることができる。
End-to-end型NNを用いる従来の方式のように理論的根拠のない内挿スコアを用いるものと異なり、理論的にも認識の精度を高めることが可能となる。
技術概要
音声信号から得られた所定の音声特徴量からなる観測系列が与えられたときに、当該観測系列があるシンボル系列である確率を算出するための、End-to-End型ニューラルネットワークに基づく音響モデルと、
シンボル系列候補が与えられたときに、当該シンボル系列候補に対する単語列の事後確率を算出する事後確率算出手段と、
入力される観測系列に基づいて選択される複数のシンボル系列について、前記音響モデルにより算出される確率、及び、前記複数のシンボル系列の各々に対して前記事後確率算出手段により算出される事後確率に基づいて前記音声信号をデコードするデコーダとを含む、音声認識装置。