同じ動きを異なる見た目で二重描画する「シャドウペア」で、動作と見た目を分離する動画ワールドモデル「ShadowDancer」を解説します。ラベルや微調整なしで動作を環境間転送し、人間動作PSNR22.4を達成しました。
線形注意KDAとMLAを融合したハイブリッド拡散Transformer「Chimera」を解説します。Wan-2.1比7.3倍の計算効率と、5秒学習から30秒動画へのゼロショット外挿でFID劣化6.5%を実現した手法と成果を紹介します。
PhiZeroは4秒の動画を256トークンの離散「物理言語」に圧縮し、VLMで未来を推論してから拡散モデルで描画する世界モデルです。Physics-IQ Verifiedなど主要ベンチマークで最高スコアを達成した仕組みを解説します。
コーディングエージェントがBlenderプログラムを書いて物理シミュレーションの下書きを作り、動画編集モデルで写実化する新手法VideoCoCoを解説。VBench-2.0の妥当性を52.18%から77.88%へ改善した仕組みを紹介します。
永続トークン「世界状態レジスタ」で複数エージェント間の世界状態を共有するストリーミング世界モデル「WorldWeaver」を解説します。二エージェントMinecraft生成でWorldScore 105.1、一貫性76.6%を達成しました。
NVIDIAのSANA-Video 2.0は、ソフトマックスアテンションを3対1で線形アテンションに置き換えるハイブリッド設計を採用。VBench 84.30を維持しつつ720pのDiT前向き計算を3.2倍高速化し、単一H100で13.2秒生成を実現した仕組みを解説します。
物体間の関係を表す相互作用グラフを制御入力とする画像から動画生成モデルGraphVidを解説します。Motion-I2V比でFIDを最大39.9%削減し、多物体の相互作用を精密に制御する新手法の仕組みと成果を紹介します。
自己回帰動画拡散の訓練に潜む勾配の欠落を突き止め、2パス訓練で解決したSelf Gradient Forcing(SGF)を解説します。5秒の学習だけで240秒の動画を破綻なく生成する仕組みと実験結果をまとめました。
RTX 5090 一枚で720p・最大16FPSの対話的世界生成を実現した動画ワールドモデル ABot-World-0 を解説。長時間生成を安定させる LongForcing と推論最適化の中身も紹介します。
LLMが3D軌跡とカメラ動作を計画し、画面外に消えたオブジェクトを正確に再現する「永続的動的オブジェクトメモリ」を備えたビデオ世界モデル「WorldDirector」を解説します。PSNRで18.1を達成し、既存手法を大幅に上回りました。
ストリーミング動画生成に特化した専用サービングシステム「TurboServe」が提案されました。マイグレーション対応の配置制御器とGPUオートスケーリングを組み合わせ、チャンクレイテンシを37.5%・GPU運用コストを37.2%削減します。
ECCV 2026採択のLiveEditは、拡散モデルを3段階蒸留で軽量化し、AR指向マスクキャッシュと組み合わせることで12.66 FPSのリアルタイムストリーミング動画編集を実現した新フレームワークです。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム