画像生成モデルとVLMの空間認知を、テキストではなく生成ピクセルで答えさせ同一指標で比較する新枠組みProVisEを解説。14サブタスク470問のベンチマークで、人間88%に対しGPT-5.4は61%にとどまる実態を紹介します。
永続トークン「世界状態レジスタ」で複数エージェント間の世界状態を共有するストリーミング世界モデル「WorldWeaver」を解説します。二エージェントMinecraft生成でWorldScore 105.1、一貫性76.6%を達成しました。
NVIDIAのSANA-Video 2.0は、ソフトマックスアテンションを3対1で線形アテンションに置き換えるハイブリッド設計を採用。VBench 84.30を維持しつつ720pのDiT前向き計算を3.2倍高速化し、単一H100で13.2秒生成を実現した仕組みを解説します。
RoPEの周波数を反周期的に設計し系列の両端をメビウス境界条件で結ぶ新手法Möbius RoPEを解説。ニードル検索の精度を文脈長512で63.3%から90.3%へ高め、乱数シードによる性能のばらつきを解消します。
拡散モデルの画像生成にLLM流の推論時スケーリングを持ち込む新手法Progressive Seed Pruningを解説します。多数のシードを初期段階で評価して有望な候補へ計算を集中させ、同じ予算でGenEvalと人手評価の両面でBest-of-Nを上回ります。
複数条件を満たす答えを探すディープリサーチ向けに、調査ループと自己改善ループを交互に回すエージェントAREXが登場。4Bと122B-A10Bの2モデルでBrowseComp 82.5%を達成した仕組みを解説します。
物体間の関係を表す相互作用グラフを制御入力とする画像から動画生成モデルGraphVidを解説します。Motion-I2V比でFIDを最大39.9%削減し、多物体の相互作用を精密に制御する新手法の仕組みと成果を紹介します。
自己回帰動画拡散の訓練に潜む勾配の欠落を突き止め、2パス訓練で解決したSelf Gradient Forcing(SGF)を解説します。5秒の学習だけで240秒の動画を破綻なく生成する仕組みと実験結果をまとめました。
PPO-Clipの固定幅クリップが方策空間の幾何と食い違い探索崩壊を招くと指摘した新手法RIPOを解説。確率に応じた等長クリップでQwen3-8Bの7ベンチマーク平均を28.5から38.5へ改善しました。
Huawei Ascend NPUクラスタで兆パラメータMoE「DeepSeek-V4」の全パラメータ事後学習を実現したSLAI T-Rexを解説。MFU 34.22%達成の階層的最適化とOR課題での性能向上を紹介します。
RTX 5090 一枚で720p・最大16FPSの対話的世界生成を実現した動画ワールドモデル ABot-World-0 を解説。長時間生成を安定させる LongForcing と推論最適化の中身も紹介します。
コードエージェントにLLM学習用のデータ処理をDAGとして組ませるDataFlow-Harnessを解説します。12タスクで成功率93.3%、コスト72.5%削減・遅延49.9%削減を達成した仕組みと課題を紹介します。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム