目的
入力データ(例えば、所定の単位(例えば変換先の単語等の区切り)に区切られていない映像(フレーム画像の系列))を入力し、その入力データに対応する記号列(例えば、所定の言語表現における単語列)を出力することのできる変換装置およびプログラムを提供する。
効果
データ(映像)を自動認識してその映像に対応する記号列を出力する処理において、認識精度を向上させることができる。
技術概要
ロス算出部(50)は、学習用入力データを基にエンコーダー部(20)とデコーダー部(30)とが生成した出力データと、学習用入力データに対応する正解データと、のロスを算出する。エンコーダー部(20)およびデコーダー部(30)は、前記ロスを基にパラメーターを調整する。さらに、第2エンコーダー部(60)は、正解データを基に状態データを生成する。第2ロス算出部は、エンコーダー部(20)および第2エンコーダー部(60)の出力から第2ロスを算出する。エンコーダー部(20)および第2エンコーダー部(60)は、第2ロスを基にパラメーターを調整する。