清華大学とShengshu Technologyがリアルタイム対話・編集可能な空間ビデオ生成モデル「Vidu S2」を発表、720p生成と指示追従を強化

arXiv (Tsinghua University, Shengshu Technology) China
概要
清華大学とShengshu Technologyの研究者が、リアルタイム対話型、編集可能、空間ビデオ生成モデル「Vidu S2」をarXivで発表しました。Vidu S2は、Vidu S2-Avatar(リアルタイム対話型デジタルキャラクターモデル)とVidu S2-Editing(リアルタイムビデオ編集モデル)で構成され、リアルタイム空間ビデオ生成の可能性を大きく広げます。前世代のVidu S1と比較して、Vidu S2-Avatarはリアルタイム720pビデオ生成、動的な参照による生成、より強力な指示追従能力をサポートし、大幅な性能向上を達成しています。
詳細

主要成果

清華大学とShengshu Technologyの研究チームが、リアルタイムでの対話と編集が可能な革新的な空間ビデオ生成モデル「Vidu S2」をarXivで発表しました。Vidu S2は、リアルタイム720pビデオ生成能力、動的な参照に基づく生成、そして強化された指示追従能力を特徴とし、特にデジタルキャラクターのリアルタイム対話型生成(Vidu S2-Avatar)とリアルタイムビデオ編集(Vidu S2-Editing)において、Vidu S1を凌駕する大幅な性能向上を実現しています。

技術詳細

Vidu S2は、主に二つのサブモデルから構成されます。一つは「Vidu S2-Avatar」で、これはユーザーからのテキストプロンプトや他の入力に基づいて、リアルタイムでデジタルキャラクターのビデオを生成し、対話的に操作することを可能にします。リアルタイム720pという高解像度での生成は、従来のモデルと比較して視覚的なリアリズムと没入感を大きく高めます。もう一つは「Vidu S2-Editing」で、これは既存のビデオコンテンツに対してリアルタイムで編集を加える能力を提供し、ユーザーは迅速にシーンの変更やオブジェクトの操作を行うことができます。このモデルは、空間的な一貫性を保ちながらビデオを生成・編集できる点に特筆すべき技術的強みがあります。

背景・業界文脈

ビデオ生成AIの分野は急速に進歩していますが、リアルタイムでの対話性や編集性、そして高解像度での空間的一貫性を同時に実現することは、長年の課題でした。特に、映画制作、ゲーム開発、バーチャルリアリティ(VR)、拡張現実(AR)などのクリエイティブ産業では、ユーザーが生成されたビデオコンテンツを自由に操作し、即座にフィードバックを得られるツールが強く求められています。Vidu S1がビデオ生成の可能性を示した一方で、Vidu S2はこれらの要求に応えるための重要なマイルストーンとなります。

今後の展望

Vidu S2の発表は、AIによるビデオコンテンツ生成の新たな時代の幕開けを告げるものです。リアルタイムの対話型ビデオ生成と編集能力は、プロのコンテンツクリエイターだけでなく、一般ユーザーにも高度な制作ツールを提供し、表現の自由度を大幅に拡大するでしょう。将来的には、Vidu S2のような技術が、メタバース環境でのアバターとの自然なインタラクション、AI駆動のライブストリーミング、パーソナライズされたメディア体験の創出など、多岐にわたる応用分野で中心的役割を果たすことが期待されます。このモデルの進化は、デジタルコンテンツの制作と消費の方法を根本的に変える可能性を秘めています。

元記事: https://arxiv.org/html/2609.11638v1

毎週の技術動向レポートを無料でお届け

各分野の分析レポートを読む価値があるかどうか一目で判断できるインフォグラフィックをメールで受け取れます。

📢 メールマガジンに無料登録(週刊・技術動向レポート)

ご登録いただくと、Troy-Technical から週刊で技術動向レポート(メールマガジン)をお届けします。

  • 取得したメールアドレス・選択分野は配信目的にのみ使用します。
  • 第三者へ提供することはありません。
  • 配信はいつでも解除できます(各メール下部のリンクから)。

詳しくはプライバシーポリシーをご覧ください。

登録は1分・いつでも解除できます

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

この記事を書いた人

コメント

コメントする

目次