Googleが発表した Dream-RSI は、過去の探索履歴をリプレイシミュレータとして再利用し、探索方針を低コストで自己改善する枠組みです。3領域で同等性能を最大50分の1の予算で達成した仕組みを解説します。
7Bの密モデルZGCM-1が、エージェント検索でQwen3-235B-A22Bを上回り、数学では同規模帯を超えました。4.2倍の学習高速化の内訳と、全データレシピ公開の中身を解説します。
MoEのルーティング自体を摂動させ、エキスパート空間で探索する強化学習手法ESRLを解説します。Qwen3-30B-A3BでGRPO比Pass@1 +3.2ポイントを追加コストなしで達成した仕組みを紹介します。
ロボット基盤モデルが照明やカメラ変化に弱い原因を「視覚と行動の近道学習」と診断し、画像なし事前学習と潜在インターフェースで解決する2段階手法LITを解説。実機で最大16.7pt改善しました。
Shengshuが公開したVidu S2は、720pのリアルタイム対話アバター生成と実時間ビデオ編集、さらに立体動画生成を1つの枠組みに統合しました。技術の仕組みと評価結果を解説します。
正解ラベル不要でLLMの推論力を高める新手法Negative Self-Distillationを解説。モデル自身に誤った推論を生成させて遠ざかる学習で、Qwen3-4BがAIME 2024を23.8%から35.8%へ改善しました。
LLMエージェントの防御層を進化的探索で自動設計する EvoSafeHarness を解説します。DecodingTrust-Agent で攻撃成功率を45.6%から10.0%へ下げ、AgentDojo では有用性82.8%と攻撃成功率0.0%を両立しました。
KAISTらが積み木の合成データ1.5万件でLVLMの空間推論を訓練するSpatialBlockを公開。3B規模モデルが積み木ベンチで29.9%から94.8%、実写のMindCubeでも10ポイント改善した手法を解説します。
NVIDIAがNemotron 3 UltraをSFTと強化学習で鍛え、IMO 2026で30/42点の金メダル水準を達成。形式証明器を使わない自然言語のみの探索パイプラインと、完全公開されたレシピの中身を解説します。
隠れ状態を積量子化した「概念語彙」で次概念予測を行う8.9BモデルNCP-ArchPreviewを解説します。OLMo-3-7Bの事前学習損失に51.3%のトークン量で到達し、GSM8Kで+5.99ポイントを達成した仕組みを紹介します。
RadixArkが公開したオープンソースのRL post-training基盤Miles v0.1を解説。SGLangとMegatron-LM/FSDPの構成や、744BモデルをGB300 64台で1ステップ263秒で回した実測を紹介します。
専用のVLAを訓練せず、汎用VLMに意味的なアクション単位を与えるだけでロボット操作を実現するShow-Harnessを解説します。ゼロショット制御の仕組みと、π0.5との比較結果、残る空間グラウンディングの課題まで紹介します。