複数モデルのルーティング記録を事後学習データに変える「NeoHorse-1」を解説。サブシーン分割と6観点評価により、11ベンチマーク平均で4Bが58.94→64.87、9Bが65.60→69.04に改善しました。
OpenAIがミレニアム懸賞問題ナビエ・ストークスの証明に到達したと発表。約1万エージェント並列という手法と、先行研究のクレジットを巡る数学界の議論を解説します。
GoogleのMaxKernelは、計画・実装・デバッグ・計測を分担するLLMエージェント群がTPUカーネルを自動生成する枠組みです。JaxBenchで1.58倍、実モデルでは専門家の手動実装を上回る成果を解説します。
Google DeepMindがヒトゲノムの一塩基変異90億件の分子影響を予測した1PBのデータセット「AlphaGenome Atlas」を公開。AVIスコアの仕組みと研究成果、利用方法を解説します。
LLMの重みを自己回帰重みと拡散重みに分離する新手法Unoを解説。サンプラー族Ψ-Specによりドラフトモデルなしで出力を変えずに最大3倍高速化し、8Bで26Bモデルを上回った成果を紹介します。
Googleが2026年9月8日にGemini 3.8 Flashの一般提供を開始。100万トークン文脈、思考レベル3段階、エージェント基盤への標準採用と料金体系を解説します。
Cerebrasらが2,400回超の実験で、LLM事前学習にレイヤードロップアウトを使うべきと実証。訓練FLOPsを最大25%削減し、early exitや自己投機的デコーディングで推論を最大1.55倍高速化する手法を解説します。
Gartnerが2026年版ハイプ・サイクルを発表しました。フィジカルAIが初登場でピーク期に入り、幻滅期にあったエージェント型AIが再浮上した背景と、導入判断への示唆を解説します。
音声対話モデルの隠れ状態から全身モーションを直接生成するMotion-Omniを解説します。単語誤り率2.62%を保ちつつ、教師カスケード比で応答を5.4倍高速化した仕組みと実験結果を紹介します。
Artificial Analysis が Intelligence Index を v4.2 に更新。非公開データを40%へ倍増し、GPQA Diamond を除外した改訂内容と、首位 Claude Fable 5.1 のスコアを解説します。
長文脈を連続メモリトークンに圧縮する新手法 LatentPress を解説。LongMemEval で 7.70 倍圧縮時に精度 0.504 と無圧縮の 0.490 を上回り、読み込みは 5〜9 倍高速化しました。
OpenAI が社内研究者のコーディングエージェント利用データを公開しました。1日600ドル超の推論消費、人間1人日あたり3.1エージェント人日、4〜8時間タスクの介入率など実測値を解説します。