本文へスキップ
AI-Papers

「1-bit Bonsai」8B LLMを1.15GBに圧縮、スマホ動作を実現

(更新: 2026年9月12日)
「1-bit Bonsai」8B LLMを1.15GBに圧縮、スマホ動作を実現
  • PrismMLが発表した「1-bit Bonsai 8B」は、80億パラメーターLLMを1.15GBに圧縮し、スマートフォンを含むエッジ環境での実用動作を実現した
  • 事後量子化ではなく、埋め込み層からLMヘッドまで全体を最初から1ビット設計で学習する独自アプローチを採用している
  • 独自指標「インテリジェンス密度」でQwen3 8Bの10倍超となる1.06/GBを記録。Apache 2.0ライセンスで公開済み

1-bit Bonsaiとは

米カリフォルニア工科大学発のAIスタートアップPrismMLは2026年3月31日、Large Language Model(LLM)「1-bit Bonsai」を発表した。80億パラメーター(8B)のモデルをわずか1.15GBに収めながら、同クラスのモデルと同等水準の推論精度を達成しているとされる。

モデルの重みはApache 2.0ライセンスで公開されており、研究・商用を問わず無償で利用できる。「Bonsai(盆栽)」という名称は、大規模なモデルを小さく整える手法を盆栽になぞらえたものとみられる。

事後量子化とは異なる設計思想

LLMのメモリ使用量を削減する一般的な手法として、学習済みモデルの重みを低ビット精度に変換する「量子化」がある。ただしビット数を極端に下げると推論精度が損なわれるため、実用レベルの1ビット量子化は技術的に困難とされてきた。

1-bit Bonsaiはこの課題を、アーキテクチャ全体を最初から1ビット設計で学習する手法で回避した。テキストを数値に変換する埋め込み層、文脈を読み取るアテンション層、回答を生成するLanguage Modeling Head(LMヘッド)まで、モデルの全層を1ビットで統一設計している。

事後的にビット幅を落とすのではなく、1ビット精度でも高い性能を発揮できるよう学習方法自体を最初から最適化した。この点が従来手法との根本的な違いとなる。

ベンチマーク性能と指標の比較

PrismMLが公開したベンチマーク結果によると、1-bit Bonsai 8Bは同クラスの8Bモデルと匹敵するスコアを記録したという。ただし同社が示す定量的な根拠は、独自に定義する「インテリジェンス密度」(ベンチマークの平均エラー率の負の対数をモデルサイズで割った指標)の比較にとどまる。

この指標での比較は次の通り。

モデル

インテリジェンス密度

1-bit Bonsai 8B

1.06/GB

Qwen3 8B

0.10/GB

同じ8BクラスのQwen3 8Bと比べ、1-bit Bonsaiは10倍以上の値を示している。インテリジェンス密度という指標は、同一パラメーター数ではなく同一ストレージ容量でのモデル比較を可能にするもので、軽量モデル同士の実用的な比較に適している。

オープンな軽量モデルとしてはGoogleがエージェントタスクやAndroid向けに最適化したGemma 4も注目されているが、1-bit Bonsaiはストレージ効率という異なる切り口から競争力を示した形だ。

対応環境とオンデバイス展開

デバイス対応面では、Apple Siliconを搭載したデバイス向けにMLXフレームワーク経由での動作をサポートする。NVIDIA GPU環境ではllama.cpp(CUDAバックエンド)で動作する。1.15GBという容量はiPhoneやMacのストレージ・メモリ要件を十分に満たし得るサイズであり、クラウドAPIへの依存なしにローカルで推論を完結できる。

オンデバイス処理はプライバシー保護の観点からも有効だ。入力テキストを外部サーバーに送信せずに完結するため、医療・法務・金融など機密情報を扱う業務での活用が想定される。

通信環境が制限される現場での利用や、アプリ組み込みによるオフライン動作など、クラウド型LLMでは対応が難しかった用途への展開も視野に入る。モバイルアプリ開発者や組み込みシステム開発者にとっては、LLM統合コストを抑えながら推論性能を確保する選択肢が一つ増えた形だ。

シェア:

投稿には GitHub アカウントが必要です。投稿内容は公開され、利用規約に反するものは予告なく削除します。