ロボット基盤モデルが照明やカメラ変化に弱い原因を「視覚と行動の近道学習」と診断し、画像なし事前学習と潜在インターフェースで解決する2段階手法LITを解説。実機で最大16.7pt改善しました。
専用のVLAを訓練せず、汎用VLMに意味的なアクション単位を与えるだけでロボット操作を実現するShow-Harnessを解説します。ゼロショット制御の仕組みと、π0.5との比較結果、残る空間グラウンディングの課題まで紹介します。
音声対話モデルの隠れ状態から全身モーションを直接生成するMotion-Omniを解説します。単語誤り率2.62%を保ちつつ、教師カスケード比で応答を5.4倍高速化した仕組みと実験結果を紹介します。
初期検索の失敗を手がかりに推論するRetrieval-Centric CoTを提案する新手法UniME-R1を解説します。埋め込みモデルとアドバイザーを組み合わせ、MMEB-V2など多様なマルチモーダル検索で既存手法を上回りました。
Meta AIが統合マルチモーダルモデルの事前学習を体系的に解剖。言語・視覚理解・視覚生成間の知識伝達の非対称性、共有Attention+モダリティ別FFN、早期統合の優位性を実証し、標準の5%の計算量で高い生成性能を達成したレシピを解説します。
音声・映像・テキストを扱うオムニモーダルLLMを学習不要で高速化する2段階トークン圧縮OmniPackを解説。Qwen2.5-Omni-7BでFLOPsを16.7%に抑えつつ性能98.0%を維持する仕組みを紹介します。
Tencentが公開したHunyuan3D-Buffalo 1.0は、3Dの生成・理解・編集・パーツ生成を単一モデルに統合した基盤モデルです。テキストから3D生成で選好率約3倍、編集でChamfer距離86.7%削減を達成した仕組みを解説します。
Alibabaが発表した基盤GUIエージェント「Qwen-UI-Agent」を解説します。実機Android100台超で学習し、GUI操作とCLIを統合。MobileWorld-Realで92.2%を達成し、モバイルからWebまで横断する実力を紹介します。
Metaを中心とするチームが、視覚言語モデルの行動知能を運動制御から切り離して測るベンチマーク「HumanCLAW」を公開しました。9モデルの最高成功率は16.8%にとどまり、自分の身体を見失う具身的自己認識の欠如が明らかになった研究を解説します。
視覚とLLM、行動を直列につなぐ従来のVLAからLLMを外し、視覚と言語を直接行動へ変換するTurboVLAが登場。0.2BパラメータでLIBERO成功率97.7%を保ちつつ、RTX 4090で32Hz動作を実現した手法を解説します。
音声と動画を別々に符号化してきた従来手法に対し、単一VAEで統一潜在空間を学習する「OmniVAE」を解説します。セグメント単位の対照学習と特徴蒸留でクロスモーダル同期を高め、text-to-audio-video生成の品質を一貫して向上させました。
外部教師や正解を使わずVLMの視覚推論を鍛える自己蒸留手法VCSDを解説します。画像を消した対照との対比信号でトークンを選別し、Qwen3-VLで2Bから8Bまで全規模の精度を一貫して向上させました。