NVIDIAが公開したMoE×Mambaハイブリッドの大規模言語モデル「Nemotron 3 Ultra」を解説。550億パラメータながら推論スループットが最大6倍に向上した仕組みを詳しく紹介します。
LLMエージェントの長期記憶を「検索」から「能動的な再構成」へ転換するMRAgentを解説します。Cue-Tag-ContentグラフとLLMによる多段階推論で、LoCoMoで23.3%、LongMemEvalで約32.8%の精度改善とトークン削減を同時に達成しました。
ICML 2026採択。軽量な予測ネットワークがLLMの各レイヤーをスキップ・反復する「Program-of-Layers(PoLar)」を動的生成し、訓練不要で数学推論の精度と計算効率を同時に改善する手法を解説します。
動的に変化する環境でLLMエージェントを評価するベンチマークEvoArenaと、記憶の更新履歴をパッチ形式で管理するEvoMemを解説します。最先端エージェントでも平均正解率39.6%という厳しい現実と改善策を紹介。
MiniMaxが開発した数学証明AI「MaxProof」の仕組みを解説。証明生成・検証・修復を統合したM3モデルが、IMO 2025で35/42問、USAMO 2026で36/42問を解き、いずれも金メダル基準を超えました。
MiniMax社のスパースAttention手法「MSA」を解説。1Mトークン時の注意計算量を28.4倍削減し、H800 GPUでプリフィル14.2倍・デコード7.6倍を達成しながら標準GQAと同等の精度を維持します。
中国人民大学NLPIR Labが提案するArborは、仮説・実験・知見を1本のツリーで累積管理する自律研究フレームワークです。6タスク全てでClaude Code比2.5倍以上の改善を実現し、MLE-Bench Liteでは86.36%を達成しました。
MoEモデルのルーター設計に数学的根拠を与えるManifold Power Iteration(MPI)を解説。エキスパート行列の主特異方向への整合で損失を改善し、下流タスク性能も向上させる新手法を紹介します。
CoT微調整がハイブリッドLLMの長文書検索性能を67%から9%へ激減させる「Attention Amnesia」問題と、追加学習不要の修復法QK-Restoreを解説します。
タスク固有の教師データなしでLLMエージェントがスキルを自己構築する「OpenSkill」を解説。SkillsBenchで43.6%のパス率を達成し、モデル間のスキル転移も実証しました。
Goedel-ArchitectはLean 4形式証明エージェント。補題の依存グラフを生成・洗練し、IMO 2025の6問中4問・MiniF2F-testで99.2%を達成。類似システムより最大500倍コスト効率に優れます。
ハイパーネットワークがリポジトリ固有のLoRAアダプターを自動生成する「Code2LoRA」を解説。推論時のトークンオーバーヘッドなしに+5.2ポイントの改善を達成した仕組みと、604リポジトリのベンチマーク「RepoPeftBench」を紹介します。