AI・機械学習
中級

GLM-4.7 Flash(ジーエルエムヨンナナフラッシュ)

中国 Zhipu AI(智谱AI)が 2026 年に公開した高速推論型 LLM。MoE 構造を採用し、マルチモーダル対応かつ低コスト推論が可能。中国語と英語の双方に強く、Apache 2.0 系のオープンウェイトでローカルや LM Studio での運用にも適する。

0 回閲覧
0 いいね
2026/5/9 更新
関連タグ
LLM
MoE
Zhipu AI
中国LLM
オープンウェイト
2026

概要

GLM-4.7 Flash は、中国の AI スタートアップ Zhipu AI(智谱AI、清華大学発)が 2026 年に公開した高速推論型大規模言語モデルです。GLM(General Language Model)系列の 4.7 世代に属し、Flash の名のとおり推論速度を重視したチューニングが施されています。Mixture of Experts(MoE)アーキテクチャを採用しており、巨大な総パラメータ数の中から入力ごとに数 % のエキスパートのみを活性化することで、品質と速度の両立を狙っています。

ライセンスはオープンウェイトに準ずるもので、Hugging Face で重みが配布されており、リリース直後からコミュニティが GGUF / MLX / AWQ といった量子化版を作成しています。LM Studio や llama.cpp、vLLM、SGLang などの主要推論ランタイムで動作し、Mac mini M4 Pro(64GB UMA)や RTX 5090(32GB VRAM)クラスのワークステーションでもローカル運用が可能です。

主な特徴・仕組み

  • MoE 構造: 総パラメータ数 200B 級・活性化 18B 程度の構成で、推論時の演算量を抑制。
  • 高速推論: 4bit 量子化 + Mac Studio M3 Ultra(192GB)で 60-90 tok/s、H100 80GB で 120-150 tok/s クラス。
  • 中英強化: CMMLU / C-Eval / MMLU などの中英ベンチで Qwen3.5-72B と同等以上のスコア。
  • マルチモーダル: 画像入力対応(VL バリアント)で、図表理解や OCR タスクにも利用可能。
  • 1M トークン超のコンテキスト窓拡張モデルもバリエーション展開。
  • Apache 2.0 系のオープンウェイトで、商用利用可能(規約条項あり)。

主要ライバルとの比較

モデル公開時期構造推奨VRAMライセンス強み
GLM-4.7 Flash2026MoE 200B/18B80GBOpen中英バイリンガル・高速
Qwen3.5-72B2025Dense 72B80GBApache 2.0多言語・コーディング
DeepSeek V32024MoE 671B/37B192GB+OpenWeight推論・数学
MiniMax M2.72026MoE80GB+Open長文要約
Llama 4 Maverick2025MoE 400B/17B192GBLlama License汎用・英語

自作PCでの選び方・注意点

GLM-4.7 Flash をローカルで動かすなら、4bit 量子化(Q4_K_M)で約 100GB 前後の VRAM/メモリが目安です。Mac Studio M3 Ultra 192GB UMA、デュアル RTX 5090(64GB)、または Mac mini M4 Pro(64GB)+ MLX 量子化(Q3_K)の構成が現実的な選択肢です。LM Studio v0.4 系で MLX 版が動作し、llama.cpp 系でも GGUF 版が対応しています。VPS や Linode の GPU 環境では、A100 80GB / H100 80GB を 1 枚で 4bit 推論できます。

中国語処理が中心の用途なら GLM-4.7 が最有力候補ですが、英語のみのコーディング/エージェント用途なら Qwen3 Coder Next や Devstral Small 2 の方が適性が高い場合もあります。

関連用語との違い

  • GLM-4.5 Air: 2025 年公開の前世代軽量版。GLM-4.7 Flash は MoE 化と推論速度で大きく進化。
  • ChatGLM3: GLM 系列の旧世代対話モデル。アーキテクチャもベンチも世代差あり。
  • Qwen3.5: アリババのフラッグシップ。Qwen は Dense 主流、GLM-4.7 Flash は MoE 主流。

よくある質問(FAQ)

Q1: 商用利用は可能ですか? A: ライセンス条項を満たせば商用利用可能です。月間アクティブユーザー数の閾値や用途制限が含まれる場合があるため、必ず最新の LICENSE を確認してください。

Q2: 日本語性能はどの程度ですか? A: 英中ほどではありませんが、Qwen 系より日本語応答品質が一段下、Llama 系よりはやや上といった水準です。日本語特化なら Qwen 系や Sarashina 系が無難です。

Q3: M4 Mac mini 64GB でローカル運用できますか? A: 4bit 量子化版を MLX 経由で動かせば 30-40 tok/s 程度が出ます。1M コンテキスト版はメモリ不足になるため、標準 128K 版を推奨します。

まとめ

  • 2026 年公開の MoE 型高速 LLM、Zhipu AI のフラッグシップ
  • 中英強化・マルチモーダル対応・オープンウェイト
  • Mac Studio / RTX 5090 級の自作機でローカル運用可能
  • Qwen3.5 / DeepSeek V3 / MiniMax M2.7 と並ぶ中国 LLM 3 強の一角
この記事について
カテゴリーAI・機械学習
難易度中級
作成日2026/5/9