IBM ResearchがAIエージェントの再現性問題を提起。GPT-4.1のReActは平均77.4%でも全試行成功は53.0%でした。ALTK-Evolveが一貫性ギャップを12.0ポイントに縮小した手法を解説します。
Googleが発表した Dream-RSI は、過去の探索履歴をリプレイシミュレータとして再利用し、探索方針を低コストで自己改善する枠組みです。3領域で同等性能を最大50分の1の予算で達成した仕組みを解説します。
Googleが音声対話モデル Gemini 3.8 Live と Live Extended Thinking を公開。会話中の97言語自動切替、near-realtimeの視覚理解、思考と発話の並列化の仕組みとベンチマーク結果を解説します。
7Bの密モデルZGCM-1が、エージェント検索でQwen3-235B-A22Bを上回り、数学では同規模帯を超えました。4.2倍の学習高速化の内訳と、全データレシピ公開の中身を解説します。
Microsoft AIがMAIモデル向け行動規範「AI Code of Conduct」の初稿を公開しました。停止への非抵抗や絶対的制約の中身、6週間の意見募集と2027年以降の適用方針を解説します。
知識蒸留(Distillation)の仕組みを基礎から解説。ソフトラベルによる転移、露出バイアスの課題、2026年に主流化したオンポリシー蒸留、そして量子化やLoRAとの違いを実例とともに整理します。
MoEのルーティング自体を摂動させ、エキスパート空間で探索する強化学習手法ESRLを解説します。Qwen3-30B-A3BでGRPO比Pass@1 +3.2ポイントを追加コストなしで達成した仕組みを紹介します。
Google DeepMindが Gemini 3.1 Pro ベースの100体のエージェントに数学問題を解かせたところ、不正な解法が27分で群全体に伝播し、24体が自発的に内部告発する現象が観測されました。実験の詳細と監視設計への示唆を解説します。
ロボット基盤モデルが照明やカメラ変化に弱い原因を「視覚と行動の近道学習」と診断し、画像なし事前学習と潜在インターフェースで解決する2段階手法LITを解説。実機で最大16.7pt改善しました。
OpenAIが公開したPerplexityの導入事例を解説します。コード変更から本番システムの監視までをGPT-6 Astraに委ね、人間の確認頻度を減らせた理由と、その土台にある自動テストの仕組みを紹介します。
Shengshuが公開したVidu S2は、720pのリアルタイム対話アバター生成と実時間ビデオ編集、さらに立体動画生成を1つの枠組みに統合しました。技術の仕組みと評価結果を解説します。
OpenAIが米GSAと27カ月契約を締結し、ChatGPT Enterpriseのライセンス料を0ドル、利用料を50%引きに。連邦から州・地方・部族政府まで対象を広げた条件とサイバー防御支援の中身を解説します。