複数条件を満たす答えを探すディープリサーチ向けに、調査ループと自己改善ループを交互に回すエージェントAREXが登場。4Bと122B-A10Bの2モデルでBrowseComp 82.5%を達成した仕組みを解説します。
Huawei Ascend NPUクラスタで兆パラメータMoE「DeepSeek-V4」の全パラメータ事後学習を実現したSLAI T-Rexを解説。MFU 34.22%達成の階層的最適化とOR課題での性能向上を紹介します。
コーディングエージェント自身の隠れ状態から不要な行を判定するSWE-Pruner Proを解説します。最大39%のトークン削減とSWE-Bench Verified解決率+3.8%を両立した仕組みと実験結果をまとめました。
Tencent HY Teamが提案するHiLS-Attentionは、LM損失でチャンク選択を学習するスパース注意機構です。訓練長8Kから512K(64倍超)への外挿で90%超の検索精度を維持し、推論速度は全注意比最大15.7倍になります。
スコアリングトークンのlogit分布から連続スコアを算出し、検証を第三のスケーリング軸とする汎用フレームワーク。SWE-Bench Verified 78.2%・RoboRewardBench 87.4%など複数領域でSOTAを達成します。
LLMエージェントの長期タスクでコンテキストが肥大化する問題に対し、3層の有界メモリと型付き検索で解決するAgenticSTSを解説します。Slay the Spire 2上のベンチマークでエージェントの勝率を3/10から6/10に改善しました。
LLMエージェントのメモリ管理を「学習可能な認知スキル」として定式化したAutoMemフレームワークを解説します。スキャフォールド最適化と習熟度トレーニングの2段階で、Qwen2.5-32BモデルがClaude Opus 4.5と同等水準に達しました。
ByteDance Seedが提案するFlashMorphは、既存のフルAttention Transformerをゼロから再学習せずMamba/線形Attentionとのハイブリッドへ変換します。層選択をHALOの7.3分の1のGPU時間で完了し、256Kトークンでのプリフィルを2.81倍高速化します。
自然言語の処理仕様を4BコンパイラがLoRAアダプタに変換し、凍結した0.6Bモデル上で実行するProgram-as-Weightsを解説。Qwen3-32B相当の精度を推論メモリ約50分の1・MacBook M3で毎秒31トークンで実現します。
ByteDanceが開発した環境不要なコード検証フレームワーク「Dockerless」を紹介します。SWE-bench Verifiedで62.0%の解決率を実現しました。
「エージェントが適切に諦められるか」を3環境・28,000件超タスクで検証。大規模化でも棄権タイミングは改善されにくい実態と、ファインチューニング不要でAbsRec@1を2倍超に高めるCONVOLVEを紹介します。
35Bパラメータのモデルが平均45Kトークンの長期軌跡を学習する「エージェント水平スケーリング」により、Kimi-K2.6など1兆パラメータ超のモデルを複数ベンチマークで超えたAgents-A1を解説します。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム