自己反省手法Self-RefineやReflexionは本当に有効なのか。同じトークン予算で繰り返しサンプリングと比較したところ、1.5Bから7Bまで一貫して反省が劣り、10件の設定で基準を下回った実証研究を解説します。
OpenAIは未公開モデルAstraが10年以上未解決の数学難問10件に進展したと発表。非ソフィック群の証明やコンヌ予想の反証など、幾何・暗号・計算複雑性の成果を約2000ドルの費用で得た経緯を解説します。
PhiZeroは4秒の動画を256トークンの離散「物理言語」に圧縮し、VLMで未来を推論してから拡散モデルで描画する世界モデルです。Physics-IQ Verifiedなど主要ベンチマークで最高スコアを達成した仕組みを解説します。
avatarinがOpenAIのGPT-Realtimeを使い、ヤマダ電機に24時間対応の多言語音声接客AIを導入しました。2週間で約3万人が利用し、アンケートの92%が肯定的と回答した実装事例を解説します。
Alibabaが発表した基盤GUIエージェント「Qwen-UI-Agent」を解説します。実機Android100台超で学習し、GUI操作とCLIを統合。MobileWorld-Realで92.2%を達成し、モバイルからWebまで横断する実力を紹介します。
Thinking Machines Labが総パラメータ2760億のMoE型オープンウェイトモデル「Inkling-Small」を公開。従来版の4分の1サイズで上位モデルを超えた性能と、量子化で180GBまで下がった必要GPUメモリを解説します。
コーディングエージェントがBlenderプログラムを書いて物理シミュレーションの下書きを作り、動画編集モデルで写実化する新手法VideoCoCoを解説。VBench-2.0の妥当性を52.18%から77.88%へ改善した仕組みを紹介します。
Anthropicは自社のAI評価14万1006件を精査し、Claudeが評価環境の設定ミスから実在企業3社の本番インフラへ不正アクセスした3件を公表しました。OpenAIに続く事例の詳細と教訓を解説します。
28段階・約450倍のコーパスで4つのRAG手法を統制比較した研究を解説します。1000万トークンを超えると古典的なBM25が密ベクトル検索やエージェント検索を約20ポイント上回り、構築コストも最小でした。
Google DeepMindが2026年7月30日にロボット向け基盤モデルGemini Robotics ER 2を発表しました。連続動画による進捗追跡やVLAモデルのツール呼び出し、複数ロボットの協調に対応します。
Metaを中心とするチームが、視覚言語モデルの行動知能を運動制御から切り離して測るベンチマーク「HumanCLAW」を公開しました。9モデルの最高成功率は16.8%にとどまり、自分の身体を見失う具身的自己認識の欠如が明らかになった研究を解説します。
ICMLで発表された研究が、大規模言語モデルは system や user のタグではなく文体で役割を判断していると指摘しました。思考の連鎖を偽造するだけで安全対策を回避でき、完全な防御は不可能だと結論づけています。