上海AI Labが知識を蓄えるFFNと推論を担うSelf-Attentionを分離した新アーキテクチャMobiusを提案。7Bは学習データ62.6%でTransformer同等、35BのIntern-S2-Mobiusは約4倍の推論高速化を実現しました。
論文執筆を13個の合成可能なスキルに分解した自動生成システム「Spark-to-Paper」を解説します。結果を見る前に証拠を規定する設計で捏造検出率を14%から92%へ高め、引用正確性99.5%、1本8.1ドルを実現しました。
どのクエリにも万能なLLMは存在しません。LLMRouterはルーティングを5要素で定式化し、汎用から視覚まで5トラックのベンチマークで16種以上のルーターを評価。学習型は固定モデル比で相対14.6%の改善を達成しました。
マスク拡散LLMが推論の途中で答えを先に固定してしまう欠陥を特定した研究を解説します。単一パラメータ「frontier-gated commitment」でGSM8K精度を0.528から0.852へ改善し、最大4倍の並列デコードを維持した成果を紹介します。
因果的自己注意を勾配経路として使い、報酬勾配を連続潜在状態へ直接割り当てるテスト時推論手法「GradCuit」を解説します。5つのLLMと3ベンチマークで平均64.5%を達成し、CoTを6.6ポイント上回りました。
35BのAIエージェント「Frontis-MA1」が機械学習開発の自己改善を実現しました。4つの進化操作と探索を組み合わせ、単一GPUでメダル獲得率を71.21%へ高めGPT-5.5+Codexを超えた仕組みを解説します。
デコーダ型LLMが記憶と推論を同じパラメータに詰め込む構造を分離する新手法「Memory Decoder」を解説します。410M本体に6.9Bの記憶を組み合わせ、総パラメータ39%減で12Bモデルを17ベンチマークで上回りました。
自己反省手法Self-RefineやReflexionは本当に有効なのか。同じトークン予算で繰り返しサンプリングと比較したところ、1.5Bから7Bまで一貫して反省が劣り、10件の設定で基準を下回った実証研究を解説します。
28段階・約450倍のコーパスで4つのRAG手法を統制比較した研究を解説します。1000万トークンを超えると古典的なBM25が密ベクトル検索やエージェント検索を約20ポイント上回り、構築コストも最小でした。
記憶を外部モジュールでなくモデル内部に組み込む「メモリ基盤モデル」Metisが登場。勾配計算なしのフォワード計算だけで情報を保存・検索するネイティブ記憶を実現し、重みを凍結したまま推論時に記憶を更新する新パラダイムを解説します。
オンポリシー蒸留で生徒が序盤の推論ミスを引きずる問題を、教師が要所で引き継ぐ軌跡リレー方式Relay-OPDで解決。Qwen3-1.7Bで標準OPD比+5.73%、学習軌跡長を50%以上短縮した新手法を解説します。
Salesforce Researchが発表したPC操作エージェントStateActを解説。画面ではなくプログラム状態を直接扱い、OSWorld 2.0で成功率を20.6%から26.9%へ改善しコストを約9分の1に削減した仕組みを紹介します。