FLUXを追加学習なしで最大25倍高速化するMrFlowを解説します。4段階のマルチ解像度パイプラインで画質劣化を1%以内に抑えながら、既存モデルへの大幅な推論コスト削減を実現する手法です。
ピクセル空間の自己回帰(AR)画像生成が抱える2つの根本課題を並列ロールアウト近似(PRA)で解決。ImageNet 256×256でFID 1.94という新たな最高性能を511Mパラメータの実用的なモデルで達成した北京大学の研究を解説します。
ByteDance Seedが提案するDanceOPDは、Flow MatchingモデルでT2I生成・ローカル編集・グローバル編集を1つのモデルに統合する際の能力干渉を、オンポリシー蒸留で解決するフレームワークです。
Googleの研究チームが提案するFLATは、動画拡散モデルの潜在空間から三角形プリミティブを直接デコードし、幾何精度の高い3Dシーンを単一パスで生成します。ゲームエンジン対応のリアルタイムレンダリングも可能です。
21の拡散変換器モデルを訓練・比較した結果、ImageNet FIDとT2I生成品質のピアソン相関が-0.38〜-0.58と負であることが判明。長年の評価慣行を見直すDiffusionBenchを提案します。
コミュニティLoRAを合成データ生成の足場として活用し、スタイルと内容を独立制御するデュアルリファレンス画像生成「FreeStyle」。注意機構レベル制約と周波数対応RoPE変調で高品質な分離を実現しました。
ルターガース大学のチームが発表したSSDは、画像トークンの2次元空間構造を活かした投機的デコードで自己回帰型画像生成を最大13.3倍に高速化。DPG-BenchとGenEvalで生成品質を維持したまま高速化を達成しています。
わずか0.22Bパラメータで産業用10Bモデル「FLUX.1-Fill-Dev」に匹敵する画像修復品質を実現する軽量フレームワーク「Moebius」を紹介します。LλMIブロックと適応的多粒度蒸留により推論速度15倍超を達成し、個人開発者のGPUでも高品質な画像修復が可能です。
単一のDiTモデルで画像と深度マップを同時生成する「Modality Forcing」を解説。疎な実世界深度データで学習し、従来手法比AbsRelエラーを57%削減した仕組みと成果を紹介します。
スタンフォード大が300以上の実験で体系化したテキスト→画像拡散モデルの設計レシピ。公開データのみで訓練した3Bパラメータモデルが5ベンチマーク平均で既存オープンモデルを29.5pt上回る性能を達成しました。
拡散モデルの生成タイムラインをde Boorの等分配原理で自動分割する「複雑性均衡拡散分割(CBS)」を解説します。SiT-XL/2でFIDを35%改善しながら推論コストは変わりません。
ペアデータなしで画像・動画編集モデルを訓練できるフレームワーク「ByG」がICML 2026に採択されました。凍結した基盤モデルのEMAコピーで疑似ターゲットを生成し、循環一貫性と勾配ルーティングで100万ペアの教師あり手法を上回る性能を実証しています。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム