Xiaomi の MiMo-V2.6 は強化学習の計算量をバッチ規模・環境の多様性・採点計算の3軸で拡大。MoE ルーター凍結や4層の報酬ハッキング対策、公開された9B蒸留モデルの成果まで解説します。
Asanaがブラウザ操作エージェントのモデルコストを76分の1、処理時間を5分の1に削減しました。GPT-6.1 Solとプロンプトキャッシュ最適化による改善の中身と、144回の検証結果を解説します。
トークン単位でLLMを切り替えるルーティングを高速化する推論サービングシステム「TokenRouter」を解説。サブサーバの非同期実行と遅延バッチングでデコードスループットを最大64.15倍に改善した仕組みと実験結果を紹介します。
実運用中の採用プラットフォームの履歴書19万6682通を調査した研究で、約1%にAIだけが読める隠し文字が見つかりました。手口の分類と検出手法、企業に必要な対策を解説します。
LLMの推論と学習に必要なVRAMを、重み・KVキャッシュ・オプティマイザ状態のバイト単位の計算式から解説。量子化による削減幅と24GBから141GBまでのGPU選びの指針も整理します。
線形アテンションの再帰状態を4bit量子化する新手法STEPQuantを解説。誤差の寿命と位置に応じた精度配分で、Qwenの長文精度80.51%を維持しつつ総サービングメモリを68.7%削減しました。
GoogleがGeminiを目標ベースで動くAIエージェントに拡張すると発表。サブエージェント委任、タスクインボックスでの過程可視化、Claude選択、専用Workspaceアカウントまで解説します。
NVIDIAらのLong-WAMは、ロボット制御の視覚履歴を19.2秒まで拡張しRoboCasa GR-1で63.3%から78.7%へ改善。RTX 5090で107.4msの実時間制御を実現した手法を解説します。
Anthropicが小型モデル Claude Haiku 5.5 を公開しました。前世代比で利用コスト約75%減、Haikuクラス初のeffort設定対応、ベンチマーク結果と安全性の課題を解説します。
凍結したLLMの内部表現から検索クエリを作り、コーパス検索と長文脈推論を1モデルで扱うUNREALを解説。追加50万パラメータ未満でHotpotQA再現率を49.1%から73.2%へ改善しました。
OpenAIがGPT-6をChatGPTの全ユーザーへ展開しました。応答を図表や操作できるUIで返す「Intelligent UI」の仕組み、プラン別のモデル、44%の応答高速化と安全性の更新点を解説します。
Qwenチームの論文TRACEを解説します。ロールアウト側の量子化結果で学習側の丸めを誘導し、重み・活性化・KVキャッシュをすべてFP4にしてもBF16同等のRL性能を保ちながら最大5.4倍の高速化を実現した手法です。