Oxford大学が提案するPhysiFormerは、3Dメッシュの物理挙動を世界座標系で直接予測する拡散トランスフォーマーです。剛体・弾性体を単一モデルで統一的に扱い、軌跡精度など全指標で自己回帰ベースラインを上回ります。
視覚的ワールドモデルの幻覚を初めて体系化した研究。65,600軌跡・427時間・23Mフレームの大規模MMBench2を構築し、知覚型など3種の幻覚モードを定義。PSNR +0.88 dBの改善を達成し、ロボット制御の信頼性向上に貢献します。
LLM推論を高速化する投機的デコーディングの根本的な限界を克服した「JetFlow」が登場。ツリー因果注意マスクにより、MATH-500で最大9.64倍の高速化を達成しています。
Proposer・Solver・Generatorの3役割が循環し、人間アノテーションなしに自己一貫性信号だけでモデルを改善するASGフレームワークを解説。MMMUで+3.5%、GenEvalで82%→85%の改善を達成しました。
RoPE(回転位置エンコーディング)の数学的構造を活かしKVキャッシュをブロック単位で量子化するBlock-GTQを解説。MAE(平均絶対誤差)を32〜80%削減し、fp16比3.24倍の圧縮と1.34倍の高速化を両立します。
被写体駆動型の動画生成に新たなアプローチを提案する「DomainShuttle」を解説します。Domain-MoT・VR-DualRoPE・CCLの3コンポーネントで、クロスドメインスコアSOTA比18.7%向上を実現しています。
ByteDance Seedが開発したiLLaDA 8Bは、完全双方向Attentionと12兆トークン学習でLLaDAをBBH+21.6点で大幅に上回り、自己回帰型Qwen2.5 7Bと競合水準を達成した拡散型言語モデルです。
Googleの研究チームが提案するFLATは、動画拡散モデルの潜在空間から三角形プリミティブを直接デコードし、幾何精度の高い3Dシーンを単一パスで生成します。ゲームエンジン対応のリアルタイムレンダリングも可能です。
21の拡散変換器モデルを訓練・比較した結果、ImageNet FIDとT2I生成品質のピアソン相関が-0.38〜-0.58と負であることが判明。長年の評価慣行を見直すDiffusionBenchを提案します。
Qwenチームが提案する言語世界モデル「Qwen-AgentWorld」。7ドメイン・1,000万件超の実環境軌跡データをCPT→SFT→RLの3段階で学習し、LLM自体が次状態を予測する環境シミュレーターとして機能します。AgentWorldBenchでGPT-4oやGemini 2.5 Proを超える性能を達成。
分子とタンパク質の配列・3D構造・自然言語テキストを単一モデルで処理する「BioMatrix」を解説。80のタスク中77でSOTAまたは競合性能を達成した、生物学向けマルチモーダル基盤モデルの仕組みと成果を紹介します。
静的な埋め込みモデルの限界を超え、逐次更新される潜在メモリで文脈に応じた動的ベクトルを生成する「EvoEmbedding」を解説。Qwen3-Embedding-8Bなど大規模モデルを凌ぎ、RAGやエージェント記憶に直接応用できます。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム