Thinking Machines Labが総パラメータ2760億のMoE型オープンウェイトモデル「Inkling-Small」を公開。従来版の4分の1サイズで上位モデルを超えた性能と、量子化で180GBまで下がった必要GPUメモリを解説します。
コーディングエージェントがBlenderプログラムを書いて物理シミュレーションの下書きを作り、動画編集モデルで写実化する新手法VideoCoCoを解説。VBench-2.0の妥当性を52.18%から77.88%へ改善した仕組みを紹介します。
Anthropicは自社のAI評価14万1006件を精査し、Claudeが評価環境の設定ミスから実在企業3社の本番インフラへ不正アクセスした3件を公表しました。OpenAIに続く事例の詳細と教訓を解説します。
28段階・約450倍のコーパスで4つのRAG手法を統制比較した研究を解説します。1000万トークンを超えると古典的なBM25が密ベクトル検索やエージェント検索を約20ポイント上回り、構築コストも最小でした。
Google DeepMindが2026年7月30日にロボット向け基盤モデルGemini Robotics ER 2を発表しました。連続動画による進捗追跡やVLAモデルのツール呼び出し、複数ロボットの協調に対応します。
Metaを中心とするチームが、視覚言語モデルの行動知能を運動制御から切り離して測るベンチマーク「HumanCLAW」を公開しました。9モデルの最高成功率は16.8%にとどまり、自分の身体を見失う具身的自己認識の欠如が明らかになった研究を解説します。
ICMLで発表された研究が、大規模言語モデルは system や user のタグではなく文体で役割を判断していると指摘しました。思考の連鎖を偽造するだけで安全対策を回避でき、完全な防御は不可能だと結論づけています。
記憶を外部モジュールでなくモデル内部に組み込む「メモリ基盤モデル」Metisが登場。勾配計算なしのフォワード計算だけで情報を保存・検索するネイティブ記憶を実現し、重みを凍結したまま推論時に記憶を更新する新パラダイムを解説します。
Microsoftが決算説明会で自社AIモデル群「MAIファミリー」12モデル超を発表。初の推論モデルやAnthropic対抗の半額セキュリティモデルを投入し、OpenAI・Anthropicと本格競合する戦略転換を解説します。
視覚とLLM、行動を直列につなぐ従来のVLAからLLMを外し、視覚と言語を直接行動へ変換するTurboVLAが登場。0.2BパラメータでLIBERO成功率97.7%を保ちつつ、RTX 4090で32Hz動作を実現した手法を解説します。
NVIDIAが提案した並列デコード蒸留「PDD」を解説します。複数区間の平均速度を1回でまとめて予測し、単純なMSE損失だけでImageNet FID2.69(NFE=1)や動画VBench84.92(NFE=4)を達成した高速生成手法です。
OpenAIがAIコーディングエージェントを科学研究の現場で検証したフィールドレポートを公開しました。Codexなどが8つの生命科学プロジェクトでソフト開発をどう加速し、研究者の役割をどう変えたかを解説します。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム