目的
所定の単位(例えば変換先の単語等の区切り)に区切られていない映像(時系列のフレーム画像)を入力し、その入力データに対応する記号列(例えば、所定の言語表現における単語列)を出力することのできる変換装置およびプログラムを提供する。
効果
時系列のフレーム画像のデータを自動認識してその映像に対応する記号列を出力する処理において、認識精度を向上させることができる。
技術概要
時系列のフレーム画像を取得し、前記フレーム画像の特徴情報を抽出するとともに、前記フレーム画像の特徴情報と前記フレーム画像の近傍の他のフレーム画像の特徴情報との差分である差分情報とを求め、前記特徴情報と前記差分情報とを含む入力情報を出力する入力処理部と、
前記入力情報を基に状態データを生成するエンコーダー部と、
前記状態データを基に所定の出力記号の系列を生成するデコーダー部と、
を備える変換装置であって、
前記特徴情報は、特徴ベクトルのデータであり、
前記差分情報は、特徴差分ベクトルのデータであり、
前記入力処理部は、前記特徴ベクトルと前記特徴差分ベクトルとを連結して成る特徴結合ベクトルを当該フレーム画像に対応する前記入力情報として出力する、
変換装置。