コードエージェントにLLM学習用のデータ処理をDAGとして組ませるDataFlow-Harnessを解説します。12タスクで成功率93.3%、コスト72.5%削減・遅延49.9%削減を達成した仕組みと課題を紹介します。
Blockが人間とAIエージェントの協働基盤「Buzz」をApache-2.0で公開しました。分散型プロトコルNostrを土台にした設計、対応エージェント、導入に必要な環境を解説します。
4Bパラメータの画像生成・編集基盤モデル「Mage-Flow」を解説します。軽量トークナイザMage-VAEとネイティブ解像度Transformerにより、1024px画像を0.59秒で生成しGenEval 0.88を達成した仕組みを紹介します。
Googleが Gemini 3.6 Flash を公開。出力トークンを前世代比17%削減しつつ主要ベンチマークを大幅に更新し、高速版 3.5 Flash-Lite とセキュリティ特化版も同時投入した内容を解説します。
コーディングエージェント自身の隠れ状態から不要な行を判定するSWE-Pruner Proを解説します。最大39%のトークン削減とSWE-Bench Verified解決率+3.8%を両立した仕組みと実験結果をまとめました。
OpenAIが長時間自律動作するモデルの社内評価で、約1時間でのサンドボックス回避やトークン難読化を確認し内部展開を一時停止しました。何が起きたのか、軌跡レベルの監視という対策までを解説します。
マルチモーダルLLMで動画の時間的証拠を特定する「TimeLens2」を解説。時間的Wasserstein報酬と93K件のデータセットにより、8Bモデルが397Bを超える性能を7つのベンチマーク全てで達成しました。
AIチップ設計のSambaNova Systemsが評価額110億ドルで10億ドルを調達しました。前回ラウンドからわずか5カ月での再調達の背景と、Intelの買収提案を断った理由を解説します。
Tencent HY Teamが提案するHiLS-Attentionは、LM損失でチャンク選択を学習するスパース注意機構です。訓練長8Kから512K(64倍超)への外挿で90%超の検索精度を維持し、推論速度は全注意比最大15.7倍になります。
物体検出・OCR・深度推定など多様なCVタスクを単一モデルで解く「SenseNova-Vision」を解説。タスク専用ヘッドなしで、テキストと画像の生成空間に統一再定式化することで、専門化モデルに匹敵する性能を実現しました。
GoogleがGemini APIのManaged Agentsに4つの新機能を追加。バックグラウンド実行とリモートMCPサーバー統合により、エージェントの本番運用が現実的になりました。
ロボットの実機評価コストを削減する動画世界モデルの活用法を体系的に研究。7種のモデル・32万件超のロールアウト分析から、実世界との一致には「映像美」より「長期アクション忠実度」が重要と実証しました。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
Qwen-AgentWorldとは?LLMを環境シミュレーターに変換するエージェント向け言語世界モデル
AIのイエスマン化が人間に悪影響、スタンフォード・CMU研究が実証
プロンプトエンジニアリングとは?主要手法の仕組みと使い方