7Bの密モデルZGCM-1が、エージェント検索でQwen3-235B-A22Bを上回り、数学では同規模帯を超えました。4.2倍の学習高速化の内訳と、全データレシピ公開の中身を解説します。
正解ラベル不要でLLMの推論力を高める新手法Negative Self-Distillationを解説。モデル自身に誤った推論を生成させて遠ざかる学習で、Qwen3-4BがAIME 2024を23.8%から35.8%へ改善しました。
LLMエージェントの防御層を進化的探索で自動設計する EvoSafeHarness を解説します。DecodingTrust-Agent で攻撃成功率を45.6%から10.0%へ下げ、AgentDojo では有用性82.8%と攻撃成功率0.0%を両立しました。
NVIDIAがNemotron 3 UltraをSFTと強化学習で鍛え、IMO 2026で30/42点の金メダル水準を達成。形式証明器を使わない自然言語のみの探索パイプラインと、完全公開されたレシピの中身を解説します。
隠れ状態を積量子化した「概念語彙」で次概念予測を行う8.9BモデルNCP-ArchPreviewを解説します。OLMo-3-7Bの事前学習損失に51.3%のトークン量で到達し、GSM8Kで+5.99ポイントを達成した仕組みを紹介します。
RadixArkが公開したオープンソースのRL post-training基盤Miles v0.1を解説。SGLangとMegatron-LM/FSDPの構成や、744BモデルをGB300 64台で1ステップ263秒で回した実測を紹介します。
複数モデルのルーティング記録を事後学習データに変える「NeoHorse-1」を解説。サブシーン分割と6観点評価により、11ベンチマーク平均で4Bが58.94→64.87、9Bが65.60→69.04に改善しました。
GoogleのMaxKernelは、計画・実装・デバッグ・計測を分担するLLMエージェント群がTPUカーネルを自動生成する枠組みです。JaxBenchで1.58倍、実モデルでは専門家の手動実装を上回る成果を解説します。
LLMの重みを自己回帰重みと拡散重みに分離する新手法Unoを解説。サンプラー族Ψ-Specによりドラフトモデルなしで出力を変えずに最大3倍高速化し、8Bで26Bモデルを上回った成果を紹介します。
Cerebrasらが2,400回超の実験で、LLM事前学習にレイヤードロップアウトを使うべきと実証。訓練FLOPsを最大25%削減し、early exitや自己投機的デコーディングで推論を最大1.55倍高速化する手法を解説します。
長文脈を連続メモリトークンに圧縮する新手法 LatentPress を解説。LongMemEval で 7.70 倍圧縮時に精度 0.504 と無圧縮の 0.490 を上回り、読み込みは 5〜9 倍高速化しました。
Salesforce AI ResearchらのRandom Attentionは、KVキャッシュをスコア計算なしでランダムに追い出すだけで既存手法と同等精度を保ち、vLLMで32〜43%高速化。仕組みと限界を解説します。