ロボットVLAモデルの専門家データ不足を解決する2段階事前学習「TAP」を解説。失敗軌跡も含む未ラベルデータで動作スキルを先習得し、行動模倣学習比+10%の向上とカメラ擾乱下25%の成功率を達成しました。
LLMが3D軌跡とカメラ動作を計画し、画面外に消えたオブジェクトを正確に再現する「永続的動的オブジェクトメモリ」を備えたビデオ世界モデル「WorldDirector」を解説します。PSNRで18.1を達成し、既存手法を大幅に上回りました。
強化学習で視覚生成モデルを改善する際に生じるモードコラプスを、生成分布全体を評価するDistribution-wise Rewardで解決する手法をICML 2026論文が提案。SiTモデルでFID-50Kを8.30から5.77に改善しました。
医療VQAの推論連鎖エラーを断ち切るRL手法「MRPO」を解説。初期推論エラー率を64.0%から13.0%に削減し、8B規模のQwen3-VL-8BがHuatuoGPT-Vision-34Bを2.79ポイント上回る精度を実現しました。
分布マッチング(MMD損失+14エンコーダ)で1ステップ画像生成のSOTAを更新したiRDMを解説します。FLUX.2を90 H200 GPU時間で1ステップ化し、GenEvalで4ステップ版を超える0.826を達成しました。
ByteDance Seedが提案するFlashMorphは、既存のフルAttention Transformerをゼロから再学習せずMamba/線形Attentionとのハイブリッドへ変換します。層選択をHALOの7.3分の1のGPU時間で完了し、256Kトークンでのプリフィルを2.81倍高速化します。
自然言語の処理仕様を4BコンパイラがLoRAアダプタに変換し、凍結した0.6Bモデル上で実行するProgram-as-Weightsを解説。Qwen3-32B相当の精度を推論メモリ約50分の1・MacBook M3で毎秒31トークンで実現します。
FLUXを追加学習なしで最大25倍高速化するMrFlowを解説します。4段階のマルチ解像度パイプラインで画質劣化を1%以内に抑えながら、既存モデルへの大幅な推論コスト削減を実現する手法です。
NVIDIAが提案したロボット向け継続学習フレームワーク「ASPIRE」を解説します。LLMによるコード生成・自律デバッグ・スキルライブラリ構築の3要素で、LIBERO-Proマニピュレーションで既存手法比77%向上を実現しました。
「知覚(証拠の特定)」と「推論(回答生成)」を明示的に切り離した2段階フレームワークP2Rを提案。4BモデルでV-Star 93.2%・HR-Bench-4K 81.9%のSOTA性能を達成しました。
ストリーミング動画生成に特化した専用サービングシステム「TurboServe」が提案されました。マイグレーション対応の配置制御器とGPUオートスケーリングを組み合わせ、チャンクレイテンシを37.5%・GPU運用コストを37.2%削減します。
ByteDanceが開発した環境不要なコード検証フレームワーク「Dockerless」を紹介します。SWE-bench Verifiedで62.0%の解決率を実現しました。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム