目的
従来技術と比較して、より自然に音声信号からジェスチャが生成可能なジェスチャ生成システム、及びジェスチャ生成方法を提供する。
効果
よりヒトのジェスチャに近い、自然でかつ音声とよく同期したジェスチャが得られる。
技術概要
命令群を格納するメモリと、
前記メモリに接続され、前記命令群を実行することにより、所定の処理を実行するプロセッサとを含む、ジェスチャデータ生成装置であって、
前記処理は、あらかじめ学習済の機械学習アルゴリズムを用いた逆拡散プロセスにより、音声データによって条件付けされたノイズから、前記音声データに適合したジェスチャデータを生成するジェスチャデータの生成処理を含み、
前記ノイズは、前記音声データにより条件付けられる複数のフレームを含み、
前記複数のフレームは、複数のパッチに分類され、
前記機械学習アルゴリズムは、
前記複数のパッチ間のアテンションであるパッチ間アテンションを用いたパッチ間アテンション機構と、
前記複数のパッチの各々において、当該パッチが含む複数の前記フレーム間のアテンションであるパッチ内アテンションを用いたパッチ内アテンション機構と、
を用いて、前記逆拡散プロセスにより前記ジェスチャデータを生成する、ジェスチャ生成システム。