リポジトリ: https://huggingface.co/prism-ml/Bonsai-27B-gguf
核心要約: 27B級の推論能力を実効1.125 bit/weightに圧縮し、配布サイズ約3.9GBを達成したモデル。FP16対比89.5%の平均性能を維持しながらノートPC・スマートフォンでの単体機器駆動を可能にした、「極限の軽量化 × 実用的推論」のトレードオフの事例である。
出張が多い環境で常時インターネット接続を保証できず、多様な業務を処理する際に補助するLLMを探していたところ、27B級の推論能力を持つBonsaiを見つけた。
1. プロジェクト概要
Bonsai-27B-guufは27Bパラメータモデルを1ビット重み(実効1.125 bit/weight、Q1_0_g128フォーマット)に量子化したGGUF配布版である。既存の低ビット量子化(2-bit IQ2、Q2_K系列)が複雑な推論課題で性能が急激に崩壊するのとは異なり、数学・コーディングなど推論中心のベンチマークで87点以上を維持することが差別点である。
| 項目 | 仕様 |
|---|---|
| パラメータ規模 | 27B |
| 配布サイズ | |
| 実効ビット幅 | 1.125 bit/weight |
| 量子化フォーマット | Q1_0_g128(PrismML llama.cppフォーク必須) |
| コンテキスト長 | 262Kトークン |
| KVキャッシュ | 4-bit、262Kフルコンテキスト時ピークメモリ~9.4GB |
| マルチモーダル | 4-bit HQQビジョンタワー(選択的、画像入力時のみロード) |
| 推論加速 | DSparkアクセラレータ、無損失1.37倍速度向上(CUDA基準) |
2. 強み分析
2.1 圧倒的な軽量化
- FP16対比約14.2倍小さい~3.9GBで、一般的なノートPC・単一GPUでの27Bモデル駆動が可能である。
- 実効1.125 bit/weightという透明なビット幅の公開は、低ビット量子化モデルでは珍しい正直なスペック表記といえる。
2.2 性能-サイズ効率(Intelligence Density)
| 指標 | 数値 | 備考 |
|---|---|---|
| Thinking Avg | 76.11 | FP16対比89.5% |
| 数学 | 91.66 | 性能低下最小 |
| コーディング | 81.88 | 性能低下最小 |
| Intelligence Density | 0.530 | サイズ対比性能、同級最高水準 |
2.3 オンデバイス駆動性能
| デバイス | 推論速度 | 備考 |
|---|---|---|
| Apple M5 Max | 66.4 tokens/s | |
| Apple M5 Pro | 44 tokens/s | |
| iPhone 17 Pro Max | ~11 tokens/s | MLXバージョン |
262Kトークンの長文コンテキストをオンデバイスで処理しながら、4-bit KVキャッシュでピークメモリを~9.4GBに抑えた点は、実用面でリソースが限られた環境でも効率的な利用を可能にする。
3. 弱み分析
3.1 課題別性能のばらつき
| 課題 | 点数 | 評価 |
|---|---|---|
| 指示追従 | 65.74 | 低下幅大きい |
| エージェント課題 | 66.03 | 低下幅大きい |
| IFBench(prompt-loose) | 52.36 | FP16対比半分程度 |
平均89.5%維持というヘッドライン数値の裏で、指示追従・エージェントワークフローでは体感低下が大きい。「数学は得意だが指示通りに動かないモデル」になり得る点を、導入前に必ず検証する必要がある。
3.2 使用ケースの制限
- 長期エージェントコーディング(複数ファイル、実行-テスト-修正ループ)は現在サポート対象ではなく、ロードマップ段階である。
- テキスト推論に最適化されており、ビジョンタワーは画像入力時のみロードされる付加機能である。
3.3 エコシステム依存
- Q1_0_g128フォーマットはPrismML専用llama.cppフォークでのみ動作する。アップストリームのllama.cpp、Ollama、LM Studioなど標準エコシステムとの互換性が断たれている点は運用リスクである。
- Apple Siliconでは、DSparkアクセラレータがデフォルトで無効化されており、CUDA環境対比で速度優位性が制限される。
4. 競合モデルとの比較
| モデル | サイズ | 平均性能 | FP16対比 |
|---|---|---|---|
| 1-bit Bonsai 27B | 3.9 GB | 76.11 | 89.5% |
| Ternary Bonsai 27B | 5.9 GB | 80.49 | 94.6% |
| Qwen3.6-27B IQ2_XXS(「2-bit」) | 9.4 GB | 72.73 | 85.5% |
| Gemma-4-31B Q2_K_XL(「2-bit」) | 11.8 GB | 73.31 | 86.2% |
核心ポイント
- 半分以下のサイズでより高い性能 — 同級27Bおよび上位31Bモデルの2-bit量子化対比、サイズは半分以下、平均性能は3〜4点優位。
- 推論能力の保存 — AIME、LiveCodeBenchなど既存の低ビット量子化が崩壊する課題で87点以上を維持。
- Ternaryバージョンとの選択肢 — 2GBを追加で使えるならTernary(5.9GB、94.6%)がバランスポイントになり得、デバイスメモリ予算に応じた段階的選択が可能。
5. 実際の使用シナリオ
シナリオ1: オフラインCTI初動分析(セキュリティ実務)
状況: インシデント対応(IR)現場で外部ネットワークが遮断されたクリーンルーム環境。クラウドLLM API使用がセキュリティポリシー上不可。
活用: M5 ProのMacBookにBonsai-27Bを搭載し、262Kコンテキストを活用して数MB分量のログファイル・IOCリスト・マルウェアデコンパイル結果を一度に投入、初動タイムライン再構成とTTP仮説生成を行う。
適合理由: データが機器外に出ないため、TLP:RED資料も処理可能。44 tokens/sは対話型分析に十分な速度。ただし指示追従性能の低下(65.74)を考慮し、出力フォーマット強制(YAMLテーブルなど)は後処理スクリプトで補完するのが安全である。
シナリオ2: 機内・出張中の文書作業(モバイル生産性)
状況: ソウル-東京出張フライト中にインターネットなしで契約書草案レビュー、会議資料要約、発表ロジック点検が必要な場合。
活用: iPhone 17 Pro MaxのMLXバージョン(~11 tokens/s)で文書要約・質疑応答を行い、着陸後にクラウドモデルで最終検収する2段階ワークフローを構成する。
適合理由: 11 tokens/sはリアルタイムチャット用としては遅いが、「質問を投げて他の作業をしながら後で確認する」非同期使用パターンには実用的である。機密契約条件が外部サーバーに記録されない点が核心的価値である。
シナリオ3: 数学・アルゴリズム問題解決補助(教育/研究)
状況: 大学院生またはクォンツリサーチャーがGPUなしのノートPCで数式導出、アルゴリズム検証、コードスニペット生成を繰り返し行う。
活用: 数学91.66、コーディング81.88という推論特化性能を活用し、ローカル常駐「数学アシスタント」として運用する。API課金なしで無制限に繰り返し質問可能。
適合理由: このモデルの性能プロファイル(推論強い、指示追従弱い)と最も適合する使用先である。正解導出能力が重要で、出力フォーマットの厳格性はさほど重要でない領域だからである。
シナリオ4: プライバシー機密データの一次前処理(エンタープライズ)
状況: 医療・法律・金融文書をクラウドLLMに送信する前に、個人情報マスキングと機密度分類が必要なパイプライン。
活用: オンプレミスサーバー(単一GPU + DSparkアクセラレーションで1.37倍速度)でBonsaiが一次匿名化・分類を行い、マスキングされた結果のみを上位クラウドモデルに渡すハイブリッド構造を作る。
適合理由: 配布サイズ3.9GBのためコンテナイメージが軽量で、数十台のエッジノードへ同時展開するコストが低い。ただし、PrismMLフォーク依存のため標準llama.cpp基盤のインフラとは別のビルドパイプラインが必要な点を運用設計に反映すべきである。
シナリオ5: 長文文書対照分析(リサーチ)
状況: 判決文、学術論文、白書など数百ページ規模の文書複数件を相互比較し、論理矛盾・核心争点を抽出。
活用: 262Kコンテキストに文書全体を投入し、4-bit KVキャッシュのおかげでピークメモリ~9.4GBに抑え、32GB級ノートPCでもフルコンテキスト分析が可能になる。
適合理由: チャンキング(chunking)なしで文書全体を単一コンテキストとして処理すれば、文書間の参照関係追跡品質が大幅に向上する。クラウド長文コンテキストAPIの高いトークンコストを回避できる。
導入前に留意すべき不適合シナリオ
| 使用先 | 不適合理由 |
|---|---|
| マルチファイルエージェントコーディング | 実行-テスト-修正ループ未サポート、ロードマップ段階 |
| 厳格な出力フォーマットが必須な自動化パイプライン | IFBench 52.36、指示追従信頼度が低い |
| 既存llama.cpp/Ollamaインフラへの即時統合 | 専用フォーク必須、標準エコシステム非互換 |
| Apple Siliconで最大処理量が必要なバッチ作業 | DSpark未サポートによりCUDA対比速度優位性が制限 |
6. 総合評価
Bonsai-27B-guufは「極限の軽量化と実用的推論能力の絶妙なバランス」を達成したモデルである。1-bit量子化がすなわち性能崩壊を意味するという通念を破り、27B級推論を3.9GBに収めてノートPCとスマートフォンにもたらしたという点で、オンデバイスAIの道標的な事例である。
ただし、導入判断は性能プロファイルの非対称性を直視した上で行われるべきである。このモデルは「賢いが言うことをよく聞かない」特性を持ち、推論能力が核心となる用途(数学・コーディング・分析)には卓越しているが、指示追従とエージェント信頼性が核心となる用途(自動化パイプライン・長期エージェント)にはまだ不適合である。専用フォーク依存という運用リスクまで考慮すると、現時点での最適ポジションはプライバシー中心の個人・エッジ推論ワークロードである。
作成日: 2026-07-18