隠れ状態を積量子化した「概念語彙」で次概念予測を行う8.9BモデルNCP-ArchPreviewを解説します。OLMo-3-7Bの事前学習損失に51.3%のトークン量で到達し、GSM8Kで+5.99ポイントを達成した仕組みを紹介します。
OpenAIがエージェント実行をクラウドで管理するAgents APIをパブリックベータで公開しました。Codexハーネスを基盤にセッション管理、コンテキスト圧縮、サブエージェント並列実行を提供する仕組みを解説します。
MCP(Model Context Protocol)の仕組みをHost/Client/Serverの基礎から解説し、ステートレス化やMRTR、CIMD認可など2026-07-28版の大改訂と移行の要点まで紹介します。
RadixArkが公開したオープンソースのRL post-training基盤Miles v0.1を解説。SGLangとMegatron-LM/FSDPの構成や、744BモデルをGB300 64台で1ステップ263秒で回した実測を紹介します。
OpenAIがChatGPT Work向けに「Data agent」を発表。Snowflakeなど社内データに接続し、自然言語の質問から分析と対話型ダッシュボードを自動生成する機能の詳細を解説します。
専用のVLAを訓練せず、汎用VLMに意味的なアクション単位を与えるだけでロボット操作を実現するShow-Harnessを解説します。ゼロショット制御の仕組みと、π0.5との比較結果、残る空間グラウンディングの課題まで紹介します。
OpenAIがアライメント研究者Paul Christiano氏の財団理事就任を発表。RLHFの基礎を築きNIST傘下のCAISIでも活動した同氏の役割と、営利部門を監督するガバナンス体制の変化を解説します。
音声生成、内容編集、強調分離、パラ言語編集、音響編集の5タスクを自然言語指示で統一的に扱う基盤モデルAuKを解説。195万時間の学習データと4.5倍高速な蒸留版の性能を紹介します。
IBM Research が時系列基盤モデル Granite PatchTST-FM-r2 を公開しました。GIFT-Eval のゼロショット部門で2位、Apache 2.0 で商用利用も可能なモデルの構成と性能を解説します。
複数モデルのルーティング記録を事後学習データに変える「NeoHorse-1」を解説。サブシーン分割と6観点評価により、11ベンチマーク平均で4Bが58.94→64.87、9Bが65.60→69.04に改善しました。
OpenAIがミレニアム懸賞問題ナビエ・ストークスの証明に到達したと発表。約1万エージェント並列という手法と、先行研究のクレジットを巡る数学界の議論を解説します。
GoogleのMaxKernelは、計画・実装・デバッグ・計測を分担するLLMエージェント群がTPUカーネルを自動生成する枠組みです。JaxBenchで1.58倍、実モデルでは専門家の手動実装を上回る成果を解説します。