新規モデル · 2026-09-04

Gemma 4の12Bと26B-A4B、自分の機器ならどちらか

Gemma 4には複数のサイズがあり、選択するのはむしろ難しいです。小さなモデルを取得しても、より大きなモデルの回答を逃す可能性があるのではと懸念されます。しかし、自分の機器で常に稼働させながら使えるかどうかという点も重要です。12Bと26B-A4Bを中心にその違いを読んでみます。

モデルの大きさより、使う場面を先に考える

ノートブックで短いドキュメントを整理するモデルと、長いコードを継続的に生成するモデルの条件は異なる可能性があります。テキスト以外に、画像や音声入力が必要かどうかを確認すべきです。製品ライン全体で導入された機能が、すべてのサイズや変換バージョンで同じように機能するとは限りません。

最初は、通常の質問をいくつか、小さな候補に送ってみます。その回答が十分か、誤った部分を確認しやすいかを確認することが出発点です。サイズが小さいからといって即座に却下するのは、既に持っている設備で行えることを見逃す可能性があります。

ノートパソコンと小型コンピュータのそばに、カメラとマイク、ヘッドフォンが置かれたローカルマルチモーダルワークデスクの写真
Gemma 4の小型モデルは、ノートブックや小型デスクトップでドキュメント・画像・音声入力などを1つのモデルで処理したい場合に適しています。

12Bと26B-A4Bは数字だけが異なるものではありません

12Bは密モデルです。26B-A4Bは、各トークンの計算に重みの一部を使うMoEです。総パラメータ数が大きくても、トークンごとの計算量が同じ割合で増えるわけではありません。ただし、メモリには有効な部分だけを載せればよい、という意味でもありません。

実際に取得するQ4ファイルと、実行後のキャッシュ・作業空間を合計してみてください。12Bの公式重みは約24GBの規模であることが確認されていますが、これはデスクトップQ4ファイルの要件と混同してはなりません。オリジナルと変換版は異なる実行条件です。

連続計算装置と複数の専門モジュールを内蔵した大型装置を並べた比較モデル写真
12Bの密集モデルと26B-A4B MoEは、名称の規模だけではなく、全体のロード量およびトークンあたりのアクティブ計算量も異なります。

メモリが少ないとき、まず確認すること

16GBクラスのデバイスであれば、12B Q4を短い文脈と1つのリクエストで試す形でアプローチすることは可能です。マックでは、オペレーティングシステム以外のアプリも同じメモリを共有しているため、表示される容量だけを見て成功を保証することはできません。

26B-A4Bは全体の専門家重みを保持するための空間がより必要です。現在の設備で一部がRAMに移された場合、低い活性計算量の利点が送信待ちに隠れてしまう可能性があります。メモリに十分に収まる条件と速度を同時に確認してください。

作業台の上に、薄いノートブックと大型のデスクトップコンピュータが並べられている。
16GBクラスでは12B Q4の軽量使用から始め、24GB以上では26B-A4B Q4および長い文脈を検討する出発点になります。

画像や音声も扱うなら

テキストの質問がしっかりできた後、画像や音声を一つずつ追加します。現在のモデルサイズとアプリがサポートする入力の有無を確認し、メモリ使用量と最初のトークン生成時間の変化を観察します。入力処理のコンポーネントが追加されると、以前はテキストのみを表示していた状態と比べて余裕が異なる可能性があります。

最大文脈長を最初からすべて設定する必要はありません。実際のドキュメント長から始め、徐々に拡大しながら重要な情報を適切に取得できるか確認してください。長いドキュメントを受け入れたことと、そのドキュメントを正確に終まで活用できたことは別々の話です。

大きなモデルに変更する理由が生じたとき

小さなモデルで繰り返し間違える質問を大きなモデルにも送ってみてください。実際のエラーが減り、待ち時間に耐えられる場合、追加メモリを使う必要はありません。結果の差が小さい場合、小さなモデルを余裕を持って維持する選択も可能です。

新しい製品ラインの最も大きなモデルをすべて対応する必要はありません。現在のドキュメントおよびコードを処理する1つのモデルを安定的に残すことも良い選択です。機器の比較は、そのモデルおよび入力長が確定した後に行うこともできます。