内蔵GPUでQwen3-8Bを動かしたら 6 t/s だった
「ローカル LLM を動かすには、それなりの GPU が必要」とよく言われる。だが、手元のノート PC の内蔵 GPUでどこまで動くのか、実際に測ってみた。
結論から書く。
- モデル: Qwen3-8B Q4_K_M(4.68 GiB)
- 環境: Radeon 860M(RDNA3.5、内蔵)/ Vulkan(RADV)/ 共有メモリ(GTT 24GB)
- プロンプト処理: 156 t/s
- 生成: 6.04 t/s
生成は毎秒6トークン。速くはない。だが「動く」ではなく、数字で語れる状態になった。
測り方
llama.cpp を Vulkan 有効でビルドし、llama-bench で計測する。
llama-bench -m Qwen3-8B-Q4_K_M.gguf -ngl 999 -p 128 -n 64 -r 1
結果:
| model | size | params | backend | ngl | test | t/s |
| qwen3 8B Q4_K - Medium | 4.68 GiB | 8.19 B | Vulkan | 999 | pp128 | 156.20 |
| qwen3 8B Q4_K - Medium | 4.68 GiB | 8.19 B | Vulkan | 999 | tg64 | 6.04 |
pp128 がプロンプト処理、tg64 が生成。生成が遅いのは、推論がメモリ帯域に律速されるからで、内蔵 GPU は CPU と同じメモリを共有するため、ここが上限になる。
わかったこと
- プロンプト処理は十分速い(156 t/s)。長文を読ませるのは苦にならない。
- 生成 6 t/s は、対話には遅い。要約や翻訳のような「一気に出して終わり」の処理なら許容範囲。
- メモリ帯域がすべて。計算性能(TOPS)をいくら足しても、生成は速くならない。
注意点
内蔵 GPU はメモリを CPU と共有する。だから巨大なモデルを読み込むと、デスクトップ全体が重くなる。実際、30B 級の MoE(約18GB)を読み込むと、操作がもたついた。普段使いは 8B まで、が現実的だと感じている。
まとめ
高い GPU がなくても、ローカル LLM は動く。速さは 6 t/s だが、要約・翻訳・校正のような用途には足りる。次は、この上で実際に使えるアプリを作る。