推論、検索、画像生成を1つのモデルに統合したエージェント型画像生成ToolArtistを解説します。Emu3.5とRAD-GRPO強化学習でWISE0.79を達成し、Qwen-Imageを上回った手法を紹介します。
1枚の画像から3Dシーンを再構成する新視点合成手法InfiniSplatを解説します。ピクセル整列ではなく深度から導く表面構造にガウスを配置し、大きな視点変化でもSOTAを達成しました。
拡散Transformer訓練を2倍以上高速化する最適化手法CMuonを解説します。重み行列を機能ごとに分割してから直交化することで収束停滞を解消し、ImageNet 256でFID 1.18を200エポックで達成しました。
ByteDance Seedが、拡散モデルの収束損失がプロンプト内の構造化言語量に応じて下がる新法則を発見。尤度指標GPGと属性指標EDで定量化し、構造化プロンプトと自動生成器で画像生成のSOTAを達成した成果を解説します。
頂点集合VAEとFlow Matchingを組み合わせた3Dメッシュ生成手法「Meshy T2」を解説します。画像からメッシュまでを中央値6秒で生成し自己回帰手法の10倍以上高速、面数制御やマルチパート資産にも対応します。
NVIDIAが提案した並列デコード蒸留「PDD」を解説します。複数区間の平均速度を1回でまとめて予測し、単純なMSE損失だけでImageNet FID2.69(NFE=1)や動画VBench84.92(NFE=4)を達成した高速生成手法です。
物理の三体散乱に着想した1ステップ生成モデルTBSMが登場しました。実サンプルへの引力と生成サンプルへの斥力で学習し、敵対的批評器なしでImageNet-256のFID1.63を達成した新手法をわかりやすく解説します。
拡散モデルの画像生成にLLM流の推論時スケーリングを持ち込む新手法Progressive Seed Pruningを解説します。多数のシードを初期段階で評価して有望な候補へ計算を集中させ、同じ予算でGenEvalと人手評価の両面でBest-of-Nを上回ります。
4Bパラメータの画像生成・編集基盤モデル「Mage-Flow」を解説します。軽量トークナイザMage-VAEとネイティブ解像度Transformerにより、1024px画像を0.59秒で生成しGenEval 0.88を達成した仕組みを紹介します。
FLUX.1・Wan 2.1など主要な拡散モデルを、サンプルデータ不要でW4A4・W2A4量子化する手法OrbitQuantを解説します。RPBH変換で活性化分布を安定化し、W2A4で唯一実用的な出力を維持した点が大きな特徴です。
強化学習で視覚生成モデルを改善する際に生じるモードコラプスを、生成分布全体を評価するDistribution-wise Rewardで解決する手法をICML 2026論文が提案。SiTモデルでFID-50Kを8.30から5.77に改善しました。
分布マッチング(MMD損失+14エンコーダ)で1ステップ画像生成のSOTAを更新したiRDMを解説します。FLUX.2を90 H200 GPU時間で1ステップ化し、GenEvalで4ステップ版を超える0.826を達成しました。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム