本文へスキップ
AI-Papers

UniWeTokとは?超大規模コードブック2^128で画像再構成・理解・生成を統合する新手法

(更新: 2026年9月27日)
UniWeTokとは?超大規模コードブック2^128で画像再構成・理解・生成を統合する新手法
  • 2^128サイズのバイナリコードブックを持つ視覚トークナイザー「UniWeTok」が、高忠実度再構成・意味理解・生成適性を単一モデルで同時実現
  • REPA比8分の1以下の33Bトークンで訓練しながらFID 1.38を達成。DPGスコア86.63ではFLUX.1(83.84)を上回る
  • Pre-Post蒸留と生成対応事前分布を組み合わせた3段階訓練フレームワークで、理解・生成・編集を統合したマルチモーダルLLMを構築

研究の背景

マルチモーダルLLM(画像とテキストを同時に扱う大規模言語モデル)の発展において、「視覚トークナイザー」は中心的な役割を担っています。トークナイザーとは、連続的な画像データを離散的なトークン(記号列)に変換し、LLMが処理できる形式にする仕組みのことです。

従来のトークナイザーには根本的なトレードオフがありました。高忠実度の画像再構成に特化した手法は意味理解の精度が低く、逆に意味抽出を重視した設計は細部の再現に弱いという問題です。結果として、画像の「理解」と「生成」を単一のシステムで高水準に扱うことは難しいとされてきました。

研究チームはこの問題を解決するため、コードブック(トークンの語彙集)のサイズを根本から見直すアプローチを採用しました。従来手法が数千〜数万程度のコードブックサイズを使うのに対し、2^128という桁違いの規模を実現する「バイナリトークナイザー」を設計しています。

2^128は地球上の砂粒の総数(約10^19個)をはるかに上回る大きさであり、この膨大な表現空間が高精度な画像表現を可能にしています。

提案手法:UniWeTok

図1: UniWeTokのモデルアーキテクチャ詳細。畳み込みとトランスフォーマーを組み合わせたハイブリッド構造に独自のSigLu活性化関数を採用している
図1: UniWeTokのモデルアーキテクチャ詳細。畳み込みとトランスフォーマーを組み合わせたハイブリッド構造に独自のSigLu活性化関数を採用している(論文 Figure 5)

UniWeTok(Unified Weighted Tokenizer)の核心は、128ビットのバイナリコードを使ったトークン表現にあります。各トークンは128個の0か1からなるビット列で表現され、コードブックサイズは2^128通りという超大規模なものです。アーキテクチャは畳み込みネットワーク(局所的な特徴抽出が得意)とトランスフォーマー層(広域的な文脈理解が得意)を組み合わせたハイブリッド構造を採用しています。

独自の活性化関数「SigLu」も設計上の要点です。数式で表すとSigLu(x) = (1-e^x)/(1+e^x)となり、出力値を[-1, 1]の範囲に収めます。この設計により、バイナリ化の過程で生じる「コミットメント損失」と「トークンエントロピー損失」の最適化が互いに競合する問題を解消し、安定した学習につなげました。

図2: UniWeTokの訓練フレームワーク。事前学習済み意味エンコーダを用いたPre-Post蒸留(左)と、軽量生成モデルを活用した生成対応事前分布(右)の仕組みを示す
図2: UniWeTokの訓練フレームワーク。事前学習済み意味エンコーダを用いたPre-Post蒸留(左)と、軽量生成モデルを活用した生成対応事前分布(右)の仕組みを示す(論文 Figure 2)

訓練には2つの中核的な工夫が組み込まれています。第一は「Pre-Post蒸留(Pre-Post Distillation, PPD)」で、事前学習済みの教師エンコーダから知識を転移させることで、バイナリトークンに豊かな意味情報を付与します。量子化の前後で特徴を意味的に整列させ、ゼロショット分類精度を大きく高めました。

第二は「生成対応事前分布(Generative-Aware Prior, GAP)」で、バイナリトークンを用いた自己回帰生成手法BitDanceの軽量版モデルを補助的に活用します。次トークン拡散タスクを通じて生成目標を学習過程に組み込むことで、トークンが生成タスクにも適した分布を持つよう誘導しています。

図3: UniWeTokの3段階訓練パイプライン。基本再構成→複数解像度・顔テキスト精細化→意味理解と生成適性の統合という順序で段階的に能力を獲得する
図3: UniWeTokの3段階訓練パイプライン。基本再構成→複数解像度・顔テキスト精細化→意味理解と生成適性の統合という順序で段階的に能力を獲得する(論文 Figure 3)

訓練は3段階に分けて実施されます。まず基本的な画像再構成能力を獲得し、次に複数解像度への対応と顔・テキスト領域の精細化を行い、最後に意味理解と生成適性を統合するという順序です。この段階的な進め方により、REPA(比較手法)が必要とする262Bトークンの約8分の1以下となる33Bトークンだけで訓練が完了しました。

実験結果

図4: UniWeTok-Chatによるマルチモーダル理解の可視化結果。画像内容の説明、視覚的な質問応答など多様なタスクで高精度な応答を示している
図4: UniWeTok-Chatによるマルチモーダル理解の可視化結果。画像内容の説明、視覚的な質問応答など多様なタスクで高精度な応答を示している(論文 Figure 6)

画像の品質、テキスト指示への追従、編集精度、訓練コストの4点で、UniWeTokは既存手法と比較されました。主な数値は次のとおりです。

項目

UniWeTok

比較手法

FID(低いほど高品質)

1.38

1.42(REPA)

DPG-Bench

86.63

83.84(FLUX.1 [Dev])

GEditスコア

5.09

5.06(OmniGen)

訓練トークン数

33B

262B(REPA)

画像生成・再構成の品質指標であるFID(Fréchet Inception Distance、値が低いほど高品質)では、比較手法REPAを上回りました。訓練効率の差はさらに大きく、必要なトークン数を262Bから33Bへと約8分の1以下に削減しながら品質を高めています。

テキスト指示に基づく画像生成を評価するDPG-Benchでは、プロフェッショナル向け画像生成AI「FLUX.1 [Dev]」を超えました。画像編集の評価指標GEditスコアでも、統合型生成モデル「OmniGen」をわずかに上回っています。

図5: UniWeTok-Editによる画像編集の可視化結果。テキスト指示に基づく精密な編集が可能で、元画像の構図や詳細を保持しながら指示内容を反映している
図5: UniWeTok-Editによる画像編集の可視化結果。テキスト指示に基づく精密な編集が可能で、元画像の構図や詳細を保持しながら指示内容を反映している(論文 Figure 7)

推論時に使用するトークン数はわずか64トークンで、これは実用的な処理速度の確保にも貢献しています。比較対象にはLlamaGen、Janus、Chameleon、Emu3といった著名な統合マルチモーダルモデルが含まれており、複数の指標で競合手法を上回る結果が示されました。

まとめと今後の展望

UniWeTokは、これまでトレードオフとされてきた「再構成精度」「意味理解」「生成適性」を単一の視覚トークナイザーで同時に高い水準で実現しました。2^128という超大規模なコードブックを実現するバイナリ表現と、PPD・GAPという訓練上の工夫が互いを補う形で機能しています。

訓練効率の大幅な改善(33B対262Bトークン)は、計算資源の制約が大きい環境でのマルチモーダルLLM開発に道を開くもので、研究コミュニティへの影響は小さくありません。一方で、2^128規模のコードブックを持つモデルの推論時メモリ消費や実際のデプロイ環境での応答速度、さらにビデオなど時間的次元を持つデータへの拡張については、今後の検証が必要です。

マルチモーダルLLMの統一基盤として、UniWeTokのアプローチは今後の研究における参照点となる可能性があります。理解・生成・編集の三機能を統合したシステムは、より自然な人間とAIのやり取りの実現に向けた着実な一歩といえるでしょう。

論文情報: "UniWeTok: An Unified Binary Tokenizer with Codebook Size 2128\mathit{2^{128}} for Unified Multimodal Large Language Model"(Shaobin Zhuang et al., 2026) arXiv:2602.14178, CC BY 4.0

本記事の図(図1〜図5)は上記論文より引用しています(縮小・形式変換あり)。

シェア:

投稿には GitHub アカウントが必要です。投稿内容は公開され、利用規約に反するものは予告なく削除します。