目的
アナウンサ等の発話者によって項目ごとに進行される映像を、精度よく項目ごとに分割することが可能な映像分割装置およびそのプログラムを提供する。
効果
ニュース番組、情報番組等の種々の項目で構成される映像を、発話者が項目内容を紹介する映像区間と、それに続く項目の内容を表す映像区間とで構成される項目区間ごとに精度よく分割することができる。
これによって、ニュース番組等の映像に対して、項目ごとに情報を付与する作業を効率化することができる。
技術概要
項目の内容を紹介する発話者が映った映像区間であるリード区間と、項目の内容を表す映像区間である非リード区間とを含んだ複数の項目で構成された映像を、項目別に分割する映像分割装置であって、
映像からカット点を検出するカット点検出手段と、
カット点で区分される映像のカットごとに、カットに含まれる画像を画像分類用の畳み込みニューラルネットワークへ入力し、畳み込みニューラルネットワークの中間層の出力を画像特徴として算出する画像特徴算出手段と、
画像判別モデルを用いて、画像特徴から画像がリード区間の画像である度合いを示す画像スコアを算出し、画像スコアのカットごとの平均スコアをカットスコアとして算出するカットスコア算出手段と、
カットスコアに基づいて、カットの映像区間がリード区間であるか非リード区間であるかを判別し、リード区間とそれに続く非リード区間とを同一の項目区間として特定する区間特定手段と、を備え、
区間特定手段は、リード区間の映像に対応する音声から予め定めた時間長よりも長い非音声区間を検出し、非音声区間の直前のリード区間を、非リード区間を伴わない項目区間として特定することを特徴とする映像分割装置。