内蔵GPUでQwen3-8Bを動かしたら 6 t/s だった

2026-09-21

「ローカル LLM を動かすには、それなりの GPU が必要」とよく言われる。だが、手元のノート PC の内蔵 GPUでどこまで動くのか、実際に測ってみた。

結論から書く。

生成は毎秒6トークン。速くはない。だが「動く」ではなく、数字で語れる状態になった。

測り方

llama.cpp を Vulkan 有効でビルドし、llama-bench で計測する。

llama-bench -m Qwen3-8B-Q4_K_M.gguf -ngl 999 -p 128 -n 64 -r 1

結果:

| model                  |   size |  params | backend | ngl | test |    t/s |
| qwen3 8B Q4_K - Medium | 4.68 GiB | 8.19 B | Vulkan  | 999 | pp128 | 156.20 |
| qwen3 8B Q4_K - Medium | 4.68 GiB | 8.19 B | Vulkan  | 999 |  tg64 |   6.04 |

pp128 がプロンプト処理、tg64 が生成。生成が遅いのは、推論がメモリ帯域に律速されるからで、内蔵 GPU は CPU と同じメモリを共有するため、ここが上限になる。

わかったこと

注意点

内蔵 GPU はメモリを CPU と共有する。だから巨大なモデルを読み込むと、デスクトップ全体が重くなる。実際、30B 級の MoE(約18GB)を読み込むと、操作がもたついた。普段使いは 8B まで、が現実的だと感じている。

まとめ

高い GPU がなくても、ローカル LLM は動く。速さは 6 t/s だが、要約・翻訳・校正のような用途には足りる。次は、この上で実際に使えるアプリを作る。