目的
動画の音声を、違和感なく他の言語の音声に変換するリアルタイム動画自動翻訳装置及び方法を提供する。
効果
動画の音声を、違和感なく他の言語の音声に変換することができる。
技術概要
画像と第1言語の音声波形とを含む動画のうち、前記音声波形を音声認識することにより、所定の処理単位に分割された複数個の前記第1言語のテキストを出力する音声認識装置と、
前記複数個の前記第1言語の前記テキストの各々を第2言語に翻訳することにより、前記第2言語の複数個の翻訳テキストを出力する自動翻訳部と、
前記処理単位の各々に対応する単位動画を記憶するためのダビングバッファとを含む動画自動翻訳装置であって、
前記単位動画は、
当該単位動画に含まれる前記処理単位から前記自動翻訳部により得られた前記複数個の前記翻訳テキストと、
前記複数個の前記翻訳テキストの各々の音声合成時の予測持続時間と、
前記動画のうちの、前記処理単位に対応する前記画像及び前記第1言語の前記音声波形と、
前記処理単位の前記第1言語の前記音声波形による音声の持続時間とを含み、
合成された音声を前記処理単位の前記画像と同期させて再生する再生部を含む、動画自動翻訳装置。