推論を伴う画像編集を測るベンチマークRISEBench++を解説します。6推論次元1000問で58手法を評価し、最高はGPT-Image-2.5 Sunburstの56.6%。学習不要のRISE-Agentも紹介します。
Ai2がGPUクラスタのスケジューラを優先度制からGPU時間の予算制へ刷新しました。階層型フェアシェアと最小実行時間8時間の契約でデバッグ待ちP90を2時間から30秒に短縮した設計と実測値を解説します。
ゲームエンジンと動画モデル由来のレンダラーを分離した「コード世界」を提案するAgentGartenを解説。Adversarial Forcingの仕組みと、かくれんぼでラウンド4に行動が現れた結果を紹介します。
詩の形式の問いで24モデルの拒否機構が突破され、安全分類器は計算コストを24%押し上げました。MIT Technology Reviewの報告をもとに、AIの拒否が抱える不確実さと過剰拒否、政治的な偏りを解説します。
Xiaomi の MiMo-V2.6 は強化学習の計算量をバッチ規模・環境の多様性・採点計算の3軸で拡大。MoE ルーター凍結や4層の報酬ハッキング対策、公開された9B蒸留モデルの成果まで解説します。
Asanaがブラウザ操作エージェントのモデルコストを76分の1、処理時間を5分の1に削減しました。GPT-6.1 Solとプロンプトキャッシュ最適化による改善の中身と、144回の検証結果を解説します。
トークン単位でLLMを切り替えるルーティングを高速化する推論サービングシステム「TokenRouter」を解説。サブサーバの非同期実行と遅延バッチングでデコードスループットを最大64.15倍に改善した仕組みと実験結果を紹介します。
実運用中の採用プラットフォームの履歴書19万6682通を調査した研究で、約1%にAIだけが読める隠し文字が見つかりました。手口の分類と検出手法、企業に必要な対策を解説します。
LLMの推論と学習に必要なVRAMを、重み・KVキャッシュ・オプティマイザ状態のバイト単位の計算式から解説。量子化による削減幅と24GBから141GBまでのGPU選びの指針も整理します。
線形アテンションの再帰状態を4bit量子化する新手法STEPQuantを解説。誤差の寿命と位置に応じた精度配分で、Qwenの長文精度80.51%を維持しつつ総サービングメモリを68.7%削減しました。
GoogleがGeminiを目標ベースで動くAIエージェントに拡張すると発表。サブエージェント委任、タスクインボックスでの過程可視化、Claude選択、専用Workspaceアカウントまで解説します。
NVIDIAらのLong-WAMは、ロボット制御の視覚履歴を19.2秒まで拡張しRoboCasa GR-1で63.3%から78.7%へ改善。RTX 5090で107.4msの実時間制御を実現した手法を解説します。