マルチモーダルLLMで動画の時間的証拠を特定する「TimeLens2」を解説。時間的Wasserstein報酬と93K件のデータセットにより、8Bモデルが397Bを超える性能を7つのベンチマーク全てで達成しました。
物体検出・OCR・深度推定など多様なCVタスクを単一モデルで解く「SenseNova-Vision」を解説。タスク専用ヘッドなしで、テキストと画像の生成空間に統一再定式化することで、専門化モデルに匹敵する性能を実現しました。
NVIDIAが提案するAudexは、音声認識・翻訳・TTS・音声生成を単一のTransformerに統合しながらLibriSpeech test-cleanでWER 1.4%を達成。Cascade強化学習とオンポリシー蒸留でテキスト推論能力の劣化を防ぐ設計を解説します。
ロボットVLAモデルの専門家データ不足を解決する2段階事前学習「TAP」を解説。失敗軌跡も含む未ラベルデータで動作スキルを先習得し、行動模倣学習比+10%の向上とカメラ擾乱下25%の成功率を達成しました。
「知覚(証拠の特定)」と「推論(回答生成)」を明示的に切り離した2段階フレームワークP2Rを提案。4BモデルでV-Star 93.2%・HR-Bench-4K 81.9%のSOTA性能を達成しました。
57名が共同提案する世界基盤モデル「Orca」を解説します。「次状態予測」という統一パラダイムでテキスト・画像・ロボット行動を1つのモデルに統合し、同規模の特化型モデルを複数のベンチマークで上回ることを実証しました。
CoLTはテキストによる推論ステップを潜在思考ベクトルに置き換えることで、マルチモーダルLLMの推論時間を10.1倍短縮、テキスト生成を22.6倍高速化します。8ベンチマークで平均精度79.1%を達成し、既存の潜在推論手法を大幅に上回りました。
安全ポリシーをモデルに埋め込まず実行時に切り替える新しいガードレール手法「SingGuard」を紹介します。fast-slow分離RLで3段階推論を最適化し、56,340例・80超のリスク分類を含むベンチマークで35ベンチマークファミリーにてSOTAを達成しました。
Tencent HunyuanのViQは、視覚特徴をテキスト空間で整合させてから離散コードに変換する2段階フレームワークです。マルチモーダル訓練を最大70%高速化しながら、連続エンコーダと同等の理解性能と高精度な画像再構成を実現しています。
Proposer・Solver・Generatorの3役割が循環し、人間アノテーションなしに自己一貫性信号だけでモデルを改善するASGフレームワークを解説。MMMUで+3.5%、GenEvalで82%→85%の改善を達成しました。
分子とタンパク質の配列・3D構造・自然言語テキストを単一モデルで処理する「BioMatrix」を解説。80のタスク中77でSOTAまたは競合性能を達成した、生物学向けマルチモーダル基盤モデルの仕組みと成果を紹介します。
拡散言語モデルの並列デコードを活かし、画像内の複数マスク領域を一括でキャプション生成するPerceptionDLMを解説します。スループット3.44倍を達成し、新ベンチマークParaDLC-Benchで62.4%の精度を記録しています。