57名が共同提案する世界基盤モデル「Orca」を解説します。「次状態予測」という統一パラダイムでテキスト・画像・ロボット行動を1つのモデルに統合し、同規模の特化型モデルを複数のベンチマークで上回ることを実証しました。
CoLTはテキストによる推論ステップを潜在思考ベクトルに置き換えることで、マルチモーダルLLMの推論時間を10.1倍短縮、テキスト生成を22.6倍高速化します。8ベンチマークで平均精度79.1%を達成し、既存の潜在推論手法を大幅に上回りました。
ECCV 2026採択のLiveEditは、拡散モデルを3段階蒸留で軽量化し、AR指向マスクキャッシュと組み合わせることで12.66 FPSのリアルタイムストリーミング動画編集を実現した新フレームワークです。
「エージェントが適切に諦められるか」を3環境・28,000件超タスクで検証。大規模化でも棄権タイミングは改善されにくい実態と、ファインチューニング不要でAbsRec@1を2倍超に高めるCONVOLVEを紹介します。
35Bパラメータのモデルが平均45Kトークンの長期軌跡を学習する「エージェント水平スケーリング」により、Kimi-K2.6など1兆パラメータ超のモデルを複数ベンチマークで超えたAgents-A1を解説します。
NVIDIAらが提案するPhysisForcing は、ロボット操作ビデオ生成モデルに2段階の物理的整合性損失を導入し、R-Benchを最大22.3%改善。クローズドループ成功率も16.0%→24.0%に向上させた学習フレームワークです。
ピクセル空間の自己回帰(AR)画像生成が抱える2つの根本課題を並列ロールアウト近似(PRA)で解決。ImageNet 256×256でFID 1.94という新たな最高性能を511Mパラメータの実用的なモデルで達成した北京大学の研究を解説します。
安全ポリシーをモデルに埋め込まず実行時に切り替える新しいガードレール手法「SingGuard」を紹介します。fast-slow分離RLで3段階推論を最適化し、56,340例・80超のリスク分類を含むベンチマークで35ベンチマークファミリーにてSOTAを達成しました。
RL後訓練の方策モデルと参照モデルの対数確率比が、理論的に最適な優位関数と等価であることを証明した研究を紹介します。追加アノテーションなしで専用プロセス報酬モデルを上回る精度を達成し、テスト時スケーリング・不確実性定量化・失敗原因特定に即座に応用可能な Progress Advantage を解説します。
ByteDance Seedが提案するDanceOPDは、Flow MatchingモデルでT2I生成・ローカル編集・グローバル編集を1つのモデルに統合する際の能力干渉を、オンポリシー蒸留で解決するフレームワークです。
Tencent HunyuanのViQは、視覚特徴をテキスト空間で整合させてから離散コードに変換する2段階フレームワークです。マルチモーダル訓練を最大70%高速化しながら、連続エンコーダと同等の理解性能と高精度な画像再構成を実現しています。
67モデル・21プロバイダの実験から、全LLMが同時に失敗する確率βが組み合わせシステムの性能上限を決定することが判明。ペアワイズ相関はこの上限を2.5倍過小評価していました。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム