本文へスキップ
hdknr blog

ローカルLLM比較(2026年春)

2026年春時点のローカル実行可能LLMの比較。Gemma 4、Qwen3.5、BitNetの特性とユースケース別の選び方

概要

2026年春時点でローカル実行(オンプレミス・デバイス上)が現実的な主要 LLM の比較。いずれも Apache 2.0 または MIT ライセンスで商用利用可能。API 従量課金に依存しないアーキテクチャの実現に活用される。

主要3モデルの特性比較

項目Gemma 4 31BQwen3.5-27BBitNet b1.58 2B
開発元Google DeepMindAlibaba QwenMicrosoft Research
パラメータ31B27B2.4B
ライセンスApache 2.0Apache 2.0MIT
4bit メモリ約19GB約16.7GB0.4GB(ネイティブ1.58bit)
CPU 推論llama.cpp 経由llama.cpp 経由ネイティブ対応
マルチモーダル画像・音声画像・音声・動画テキストのみ
コンテキスト長256K262K(最大1M)限定的
MMLU Pro85.2%86.1%—(MMLU 約52%)

ユースケース別の選び方

ユースケース推奨モデル理由
推論・数学タスクGemma 4 31BAIME 89.2%の突出した性能
コーディング支援Qwen3.5-27BSWE-bench 72.4%の実務対応力
マルチモーダル(OCR含む)Gemma 4 31B日本語テキスト画像にも対応
24GB メモリ環境での運用Qwen3.5-27B4bit で 16.7GB と余裕がある
省メモリ・省電力最優先BitNet 2B0.4GB で動作、最大82%省エネ
GPU なしのローエンド PCBitNet 2BCPU 専用最適化カーネルで高速
長コンテキスト(1M)Qwen3.5-27B1M トークンへの拡張対応

Apple Silicon での実行

モデルOllamaMLX サポート推奨メモリ
Gemma 4 31B対応vMLX 1.3.26+ が必要32GB 以上
Qwen3.5-27B対応mlx-community で成熟24GB 以上
BitNet 2B要確認8GB でも動作可能

Claude レート制限フォールバック構成

Claude Max のレート制限($200/月で3時間で消費する事例あり)への対策として、Mac Mini + ローカルモデルの組み合わせが有効。

API 経済への影響

Gemma 4 の Apache 2.0 ライセンスと E2B モデルのスマートフォンオフライン動作は、SaaS の API 従量課金構造を変える可能性がある:

何をローカルモデルに委譲するか

開発ループの一部をローカルの小さいモデル(27B クラス)に振るとき、節約の成否は「どのモデルが安いか」ではなく その工程が高ボリューム・低判断かどうかの一点に収束する。

「安そうな工程」という直感は当たらない。なお haiku ティアを使えば 0 インフラで同じ分担が組める場合がある。

関連ページ

ソース記事