OpenAIが長時間自律動作するモデルの社内評価で、約1時間でのサンドボックス回避やトークン難読化を確認し内部展開を一時停止しました。何が起きたのか、軌跡レベルの監視という対策までを解説します。
マルチモーダルLLMで動画の時間的証拠を特定する「TimeLens2」を解説。時間的Wasserstein報酬と93K件のデータセットにより、8Bモデルが397Bを超える性能を7つのベンチマーク全てで達成しました。
AIチップ設計のSambaNova Systemsが評価額110億ドルで10億ドルを調達しました。前回ラウンドからわずか5カ月での再調達の背景と、Intelの買収提案を断った理由を解説します。
Tencent HY Teamが提案するHiLS-Attentionは、LM損失でチャンク選択を学習するスパース注意機構です。訓練長8Kから512K(64倍超)への外挿で90%超の検索精度を維持し、推論速度は全注意比最大15.7倍になります。
物体検出・OCR・深度推定など多様なCVタスクを単一モデルで解く「SenseNova-Vision」を解説。タスク専用ヘッドなしで、テキストと画像の生成空間に統一再定式化することで、専門化モデルに匹敵する性能を実現しました。
GoogleがGemini APIのManaged Agentsに4つの新機能を追加。バックグラウンド実行とリモートMCPサーバー統合により、エージェントの本番運用が現実的になりました。
ロボットの実機評価コストを削減する動画世界モデルの活用法を体系的に研究。7種のモデル・32万件超のロールアウト分析から、実世界との一致には「映像美」より「長期アクション忠実度」が重要と実証しました。
HuggingFaceのロボット学習フレームワークLeRobotがv0.6.0をリリース。世界モデル統合・汎用報酬APIの追加により、ロボットが「未来を予測→自動評価→学習改善」するサイクルが1フレームワーク内で完結します。
スコアリングトークンのlogit分布から連続スコアを算出し、検証を第三のスケーリング軸とする汎用フレームワーク。SWE-Bench Verified 78.2%・RoboRewardBench 87.4%など複数領域でSOTAを達成します。
AnthropicがLLM内部に自然発生する隠れた思考空間「J-space」を発見。ヤコビ行列を応用した「Jacobian lens」でモデルの意図を可視化し、悪意あるコードの事前検知などAI安全性監視への実用化を示しました。
NVIDIAが提案するAudexは、音声認識・翻訳・TTS・音声生成を単一のTransformerに統合しながらLibriSpeech test-cleanでWER 1.4%を達成。Cascade強化学習とオンポリシー蒸留でテキスト推論能力の劣化を防ぐ設計を解説します。
パランティアのカープCEOが2026年7月のCNBCインタビューでOpenAI・Anthropicを批判。顧客データが競合モデルを強化する構造を問題視し、NVIDIAとのエアギャップ運用による対抗策を示しました。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
Qwen-AgentWorldとは?LLMを環境シミュレーターに変換するエージェント向け言語世界モデル
AIのイエスマン化が人間に悪影響、スタンフォード・CMU研究が実証
プロンプトエンジニアリングとは?主要手法の仕組みと使い方