Qwen3.6 27b は性能が良く、Local LLM で UE5 の Blueprint 編集もできるなど使い勝手の良いモデルです。ただし Dense モデルなので推論速度はあまり速くありません。以下様々な環境での Qwen 3.6 27b の比較です。tps の値が大きい方が高速です。
| CPU | GPU | MTPなし | MTPあり |
|---|---|---|---|
| Ryzen 7 7840HS DDR5-5600 | — (CPUのみ) | 2.16 tps | 3.84 tps |
| Ryzen 7 7840HS DDR5-5600 | Radeon 780M (8GB) | 2.39 tps | 5.28 tps |
| Ryzen 7 4750G DDR4-3200 | Radeon 7600 8GB | 2.78 tps | 4.12 tps |
| Ryzen 7 5700X DDR4-3200 | GeForce RTX 5060Ti 16GB | 8.70 tps | 10.24 tps |
| Ryzen 9 3950X DDR4-3200 | GeForce RTX 4060Ti 16GB | 8.76 tps | 10.75 tps |
| Core i7-13700 DDR5-5600 | GeForce RTX 4060Ti 16GB | 10.39 tps | 11.26 tps |
| Mac mini M4 Pro 12Core | Apple Silicon 16 Core | 11.71 tps | |
| Ryzen AI Max+ 395 LPDDR5X-8000 | Radeon 8060S (96GB) | 12.96 tps | 23.11 tps |
| Ryzen 7 9700X DDR5-5600 | Radeon AI PRO R9700 32GB | 33.10 tps | 55.73 tps |
- llama.cpp b9957, Qwen3.6 27b UD-Q4_K_M, ctx 4096, PC 側はいずれも Performance Mode に設定
コンパクトなので比較的多くの環境で動きますが、Dense モデルなので快適に使用するためにはそれなりの性能が必要となります。また実際の用途では ctx サイズを増やす必要があり、速度はさらに遅くなります。特にエージェントでは入力プロンプトも長くなるため、追加で Prefill による待ち時間も考慮する必要があります。Prefill では演算性能も重要となりさらに条件が厳しくなります。以下は llama.cpp の llama-bench による pp の値です。値が大きい方が高速です。
| CPU/GPU | pp512 | tg128 | |
|---|---|---|---|
| Ryzen 7 7840HS + Radeon 780M (8GB) | CPU+GPU | 57.32 ± 0.06 | 2.49 ± 1.02 |
| Ryzen 7 5700X + GeForce RTX5060 Ti 16GB | CPU+GPU | 28.54 ± 0.05 | 8.58 ± 0.02 |
| Mac mini M4 Pro 12Core / 16Core | GPU | 100.07 ± 0.02 | 11.87 ± 0.04 |
| Ryzen AI Max+ 395 128GB (EVO-X2) | GPU | 274.92 ± 2.41 | 13.02 ± 0.01 |
| Radeon AI PRO R9700 32GB | GPU | 806.69 ± 0.87 | 33.36 ± 0.01 |
Ryzen AI Max+ 395 の場合は Active パラメータが少なく、代わりに RAM 容量を活かせる 122B-A10B の方が向いていると思うのですが、Qwen3.6 でこのサイズが無いのが残念です。