本文へスキップ
hdknr blog

Gemma 4

Google DeepMind が開発したオープンソース LLM シリーズ。Apache 2.0 ライセンスで商用利用可能。26B MoE はアクティブパラメータ約 3.8B、E2B はスマートフォンで動作する

概要

Google DeepMind が 2026年4月にリリースした LLM シリーズ。Apache 2.0 ライセンスで商用利用に制限がなく、31B Dense から E2B(スマートフォン動作)まで4バリアントを提供。特に 26B MoE は総パラメータ数は 26B だが推論時アクティブは約 3.8B にとどまるため、一般的な GPU で実用的に動作する。

モデルラインナップ

モデルパラメータ推論時アクティブコンテキスト主な用途
31B Dense31B31B256Kサーバー/ワークステーション
26B MoE26B約 3.8B256Kサーバー/ワークステーション
E4B約 4B128Kエッジデバイス
E2B約 2.3B128Kスマートフォン

主な特徴

API 経済へのインパクト

Gemma 4 は外部 LLM API に依存する SaaS のコスト構造を変える可能性を持つ。

従来: ユーザーリクエスト → 自社サーバー → OpenAI/Anthropic API(リクエストごと課金)
Gemma 4: ユーザーリクエスト → 自社サーバー(Gemma 4 稼働)→ インフラ固定費のみ

E2B モデルは量子化により 1.5GB 未満のメモリで動作し、スマートフォン上でオフライン推論が可能。API 呼び出しゼロのオフライン AI アプリが商用レベルで実現できる。

Qwen3.5-27B との比較

観点Gemma 4 31BQwen3.5-27B
推論・数学AIME 89.2%(優位)
コーディングSWE-bench 72.4%(優位)
メモリ(Q4)約 19GB約 16.7GB(効率的)
マルチモーダルテキスト・画像・音声テキスト・画像・音声・動画
MLX 対応vMLX 必要mlx-community で充実

推論・数学・マルチモーダルには Gemma 4、コーディング・メモリ効率・MLX エコシステムには Qwen3.5 が向いている。

Abliteration(安全性除去)モデル

Gemma 4 31B をベースに安全性制限を除去した「CRACK」モデルが Hugging Face で公開されている。

詳細は Abliteration を参照。

ローカル実行

# Ollama で実行
ollama run gemma4:31b

Apple Silicon では標準の mlx_lm は未対応(2026年4月時点)。vMLX を使う必要がある。

関連ページ

ソース記事