正解ラベル不要でLLMの推論力を高める新手法Negative Self-Distillationを解説。モデル自身に誤った推論を生成させて遠ざかる学習で、Qwen3-4BがAIME 2024を23.8%から35.8%へ改善しました。
OpenAIのSam Altman CEOが2026年のIPOを否定しました。理由は安全性をめぐる業界の状況で、機密S-1提出済みながら上場時期は事業と社会の準備次第と説明。発言の背景と含意を解説します。
LLMエージェントの防御層を進化的探索で自動設計する EvoSafeHarness を解説します。DecodingTrust-Agent で攻撃成功率を45.6%から10.0%へ下げ、AgentDojo では有用性82.8%と攻撃成功率0.0%を両立しました。
GoogleがWindows 10/11向けGeminiデスクトップアプリを提供開始。Alt+Spaceのオーバーレイ呼び出しや自律型エージェントGemini Sparkの利用条件、macOS版との機能差を整理します。
CognitionがDevinにGPT-6 Astraを統合し、AI自身がテストを実行して動作の証拠を提示する運用を開始。iPhoneゲームの検証事例やコードレビュー負荷の削減に向けた狙いを解説します。
KAISTらが積み木の合成データ1.5万件でLVLMの空間推論を訓練するSpatialBlockを公開。3B規模モデルが積み木ベンチで29.9%から94.8%、実写のMindCubeでも10ポイント改善した手法を解説します。
OpenAIが金融機関向け「ChatGPT for Financial Services」を発表。GPT-6 Astraと有料金融データを統合し、リサーチや財務モデル作成を支援する構成を解説します。
NVIDIAがNemotron 3 UltraをSFTと強化学習で鍛え、IMO 2026で30/42点の金メダル水準を達成。形式証明器を使わない自然言語のみの探索パイプラインと、完全公開されたレシピの中身を解説します。
OpenAIがChatGPTを支える内部ストレージ基盤Habitatの設計を公開しました。毎秒7000万リクエスト超を処理する構成、PythonからRustへの書き直しで得た効率と運用上の教訓を解説します。
隠れ状態を積量子化した「概念語彙」で次概念予測を行う8.9BモデルNCP-ArchPreviewを解説します。OLMo-3-7Bの事前学習損失に51.3%のトークン量で到達し、GSM8Kで+5.99ポイントを達成した仕組みを紹介します。
OpenAIがエージェント実行をクラウドで管理するAgents APIをパブリックベータで公開しました。Codexハーネスを基盤にセッション管理、コンテキスト圧縮、サブエージェント並列実行を提供する仕組みを解説します。
MCP(Model Context Protocol)の仕組みをHost/Client/Serverの基礎から解説し、ステートレス化やMRTR、CIMD認可など2026-07-28版の大改訂と移行の要点まで紹介します。