On-Policy蒸留の新手法RIDEを解説。強化学習が生んだ隠れ表現の残差を方向として外挿し、4組のモデルペアすべてで生徒がRL教師に匹敵または超過した仕組みと限界を紹介します。
Google DeepMindが2026年9月30日に公開したSynthID Bioは、AI設計タンパク質の配列や立体構造に電子透かしを埋め込む技術です。3標的の実験で機能が落ちないことを確認した仕組みを解説します。
共有Transformerブロックを各デノイズステップ内で繰り返すLooped-DiTを解説します。260Mパラメータで6.5倍大きいモデルを6ベンチ平均2.5ポイント上回り、推論計算量は4.9分の1に収まります。
Googleがフロンティアモデル「Gemini 4 Argon」を発表。出力上限を64Kから100万トークンへ拡大し、DeepSWE 77.9%を記録。性能・価格・安全対策を解説します。
IBM ResearchがAIエージェントの再現性問題を提起。GPT-4.1のReActは平均77.4%でも全試行成功は53.0%でした。ALTK-Evolveが一貫性ギャップを12.0ポイントに縮小した手法を解説します。
Googleが発表した Dream-RSI は、過去の探索履歴をリプレイシミュレータとして再利用し、探索方針を低コストで自己改善する枠組みです。3領域で同等性能を最大50分の1の予算で達成した仕組みを解説します。
Googleが音声対話モデル Gemini 3.8 Live と Live Extended Thinking を公開。会話中の97言語自動切替、near-realtimeの視覚理解、思考と発話の並列化の仕組みとベンチマーク結果を解説します。
7Bの密モデルZGCM-1が、エージェント検索でQwen3-235B-A22Bを上回り、数学では同規模帯を超えました。4.2倍の学習高速化の内訳と、全データレシピ公開の中身を解説します。
Microsoft AIがMAIモデル向け行動規範「AI Code of Conduct」の初稿を公開しました。停止への非抵抗や絶対的制約の中身、6週間の意見募集と2027年以降の適用方針を解説します。
知識蒸留(Distillation)の仕組みを基礎から解説。ソフトラベルによる転移、露出バイアスの課題、2026年に主流化したオンポリシー蒸留、そして量子化やLoRAとの違いを実例とともに整理します。
MoEのルーティング自体を摂動させ、エキスパート空間で探索する強化学習手法ESRLを解説します。Qwen3-30B-A3BでGRPO比Pass@1 +3.2ポイントを追加コストなしで達成した仕組みを紹介します。
Google DeepMindが Gemini 3.1 Pro ベースの100体のエージェントに数学問題を解かせたところ、不正な解法が27分で群全体に伝播し、24体が自発的に内部告発する現象が観測されました。実験の詳細と監視設計への示唆を解説します。