ECCV 2026採択のLiveEditは、拡散モデルを3段階蒸留で軽量化し、AR指向マスクキャッシュと組み合わせることで12.66 FPSのリアルタイムストリーミング動画編集を実現した新フレームワークです。
NVIDIAらが提案するPhysisForcing は、ロボット操作ビデオ生成モデルに2段階の物理的整合性損失を導入し、R-Benchを最大22.3%改善。クローズドループ成功率も16.0%→24.0%に向上させた学習フレームワークです。
Oxford大学が提案するPhysiFormerは、3Dメッシュの物理挙動を世界座標系で直接予測する拡散トランスフォーマーです。剛体・弾性体を単一モデルで統一的に扱い、軌跡精度など全指標で自己回帰ベースラインを上回ります。
被写体駆動型の動画生成に新たなアプローチを提案する「DomainShuttle」を解説します。Domain-MoT・VR-DualRoPE・CCLの3コンポーネントで、クロスドメインスコアSOTA比18.7%向上を実現しています。
1枚の画像からカメラ移動・物体の動き・天気変化を単一モデルで独立制御してビデオを生成する「Holo-World」を解説。新データセットと統合アダプターにより、従来は困難だった複合制御を実現しました。
物理AI向け世界モデル「Kairos」は、3種の注意機構を組み合わせたハイブリッド時間アーキテクチャで誤差蓄積の上限を理論的に証明し、RoboTwin 2.0など複数ベンチマークで最高水準の性能を達成しました。
自己回帰型拡散モデルで生じる長尺動画の品質ドリフトを、追加学習なしで抑える「TetherCache」を解説します。GRABとTAMEの2機構により、240秒生成での品質ドリフトスコアを7.84から1.33に大幅削減しました。
MoVerse は1枚の写真から360°パノラマ生成・3D空間再構成を経て、RTX 4090で8 FPSのリアルタイム動画を出力する新手法です。VR/ARやゲーム、ロボティクスへの応用が期待されます。
Microsoft Researchらが提案するMirageは、動画ワールドモデルのメモリをピクセルではなく潜在空間の3D座標に直接持つことで、従来比10.57倍の高速化と55倍のメモリ削減を実現しました。
Dream.exeは8種類の動画生成モデルを101件のロボット操作タスクで評価し、視覚的品質と物理的実行成功率が無相関(r=−0.03)という事実を実証した新評価フレームワークです。
北京大学発の5Bパラメータ動画モデル「LoomVideo」は、MLLMをバックボーンに採用して動画生成と編集を統合。Scale-and-Add条件付けにより類似性能帯モデル比5.41倍の推論高速化を実現しています。
自己回帰動画生成を1ステップに圧縮するAAD-1を解説します。因果的な生成器と双方向識別器の非対称設計で動きの崩壊を克服し、VBenchで既存の4ステップ手法を上回るSOTAを達成しました。