凍結した視覚基盤モデル(VFM)を画像トークナイザーへ転用するVFMTokを解説します。領域適応的量子化とセマンティック再構成目標により、ImageNetでgFID 1.36を達成し、収束速度3倍・推論速度最大4倍の高速化も実現します。
自己回帰型画像生成のトークナイザが抱えるテキスト文字の潰れ・顔ディテール喪失を、コンテンツ対応の局所知覚損失で解決する新手法「InsightTok」を解説します。NED精度95.83%、顔類似度でEmu3.5-IBQを超える結果を16kコードブックで達成。
VGGT-Editは、テキスト指示によるネイティブ3Dシーン編集をフィードフォワード推論で実現する新手法です。深度同期テキスト注入とレジデュアル変換ヘッドで多視点一貫性を保ちながら、従来手法比2〜120倍の速度で高品質な編集を達成します。
Stanford大学発のフロー生成モデル「AsymFlow」が、ノイズ成分を低ランク部分空間に限定する非対称速度パラメータ化によりImageNet 256×256でFID 1.57を達成。FLUX.2 kleinをピクセル空間に変換する初の手法も提案しています。
QwenチームのQwen-Image-2.0はQwen3-VLとMultimodal Diffusion Transformerを組み合わせ、生成と編集を1モデルに統合。1,000トークン対応で多言語タイポグラフィも大幅改善しました。
拡散モデルの超深層化で発生するトークン均質化崩壊「Mean Mode Screaming」を初特定。MV-Split残差で世界初の1000層DiT安定学習とFID 2.68を達成した研究を解説します。
Continuous-Time Distribution Matching(CDM)は、固定離散タイムステップへの依存を動的連続スケジュールで置き換えることで拡散モデルの蒸留を刷新。GANや報酬モデル不要で過平滑化を解消し、SD3-MediumとLongcat-Imageで4ステップの高品質生成を実現した新手法を解説します。
拡散モデルのRL微調整で美的品質・テキスト描画・構図理解など5つの報酬を同時改善する「MARBLE」を解説。二次計画法による勾配ハーモナイゼーションで従来の加重和法が抱えるスペシャリストサンプル問題を解決します。
Flow MatchingモデルFluxの後訓練アライメントを、長い生成軌跡の2ステップへの圧縮で効率化した手法LeapAlignを解説。HPSv2.1スコアで既存手法を6ポイント超上回り、CVPR 2026に採択されました。
GoogleがImageNet-512でFID 1.4、Kinetics-600でFVD 1.3を達成する新フレームワーク「Unified Latents(UL)」を提案。拡散事前分布で潜在空間を正則化し、Stable Diffusionより少ない学習FLOPsで優れた品質を実現する潜在表現学習の仕組みを解説します。
再学習不要でDiffusion Transformerを最大3.52倍高速化するDDiTの仕組みと検証結果を解説。FLUX-1.DevやWan 2.1に即適用でき、推論コスト削減に活用できます。
拡散トランスフォーマーベースの命令駆動型画像編集システム「FireRed-Image-Edit 1.0」が登場。16億サンプルの大規模データと強化学習を組み合わせ、独自ベンチマークREDEdit-Benchの全15カテゴリで商用システムと同等以上の性能を達成します。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム