PhiZeroは4秒の動画を256トークンの離散「物理言語」に圧縮し、VLMで未来を推論してから拡散モデルで描画する世界モデルです。Physics-IQ Verifiedなど主要ベンチマークで最高スコアを達成した仕組みを解説します。
Alibabaが発表した基盤GUIエージェント「Qwen-UI-Agent」を解説します。実機Android100台超で学習し、GUI操作とCLIを統合。MobileWorld-Realで92.2%を達成し、モバイルからWebまで横断する実力を紹介します。
コーディングエージェントがBlenderプログラムを書いて物理シミュレーションの下書きを作り、動画編集モデルで写実化する新手法VideoCoCoを解説。VBench-2.0の妥当性を52.18%から77.88%へ改善した仕組みを紹介します。
28段階・約450倍のコーパスで4つのRAG手法を統制比較した研究を解説します。1000万トークンを超えると古典的なBM25が密ベクトル検索やエージェント検索を約20ポイント上回り、構築コストも最小でした。
Metaを中心とするチームが、視覚言語モデルの行動知能を運動制御から切り離して測るベンチマーク「HumanCLAW」を公開しました。9モデルの最高成功率は16.8%にとどまり、自分の身体を見失う具身的自己認識の欠如が明らかになった研究を解説します。
記憶を外部モジュールでなくモデル内部に組み込む「メモリ基盤モデル」Metisが登場。勾配計算なしのフォワード計算だけで情報を保存・検索するネイティブ記憶を実現し、重みを凍結したまま推論時に記憶を更新する新パラダイムを解説します。
視覚とLLM、行動を直列につなぐ従来のVLAからLLMを外し、視覚と言語を直接行動へ変換するTurboVLAが登場。0.2BパラメータでLIBERO成功率97.7%を保ちつつ、RTX 4090で32Hz動作を実現した手法を解説します。
NVIDIAが提案した並列デコード蒸留「PDD」を解説します。複数区間の平均速度を1回でまとめて予測し、単純なMSE損失だけでImageNet FID2.69(NFE=1)や動画VBench84.92(NFE=4)を達成した高速生成手法です。
オンポリシー蒸留で生徒が序盤の推論ミスを引きずる問題を、教師が要所で引き継ぐ軌跡リレー方式Relay-OPDで解決。Qwen3-1.7Bで標準OPD比+5.73%、学習軌跡長を50%以上短縮した新手法を解説します。
Salesforce Researchが発表したPC操作エージェントStateActを解説。画面ではなくプログラム状態を直接扱い、OSWorld 2.0で成功率を20.6%から26.9%へ改善しコストを約9分の1に削減した仕組みを紹介します。
音声と動画を別々に符号化してきた従来手法に対し、単一VAEで統一潜在空間を学習する「OmniVAE」を解説します。セグメント単位の対照学習と特徴蒸留でクロスモーダル同期を高め、text-to-audio-video生成の品質を一貫して向上させました。
Moonshot AIが総2.8兆パラメータのMoEモデル「Kimi K3」をオープン重みで公開。Kimi Delta AttentionとStable LatentMoEでK2比約2.5倍の学習効率を実現し、1M文脈と視覚対応を備えた新モデルを解説します。
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
OpenAI、AIが数学の難問10件に進展 — 幾何・暗号・計算複雑性で成果
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム