Hur mycket VRAM behöver man för lokala AI-modeller? Uppmätt på 17 modeller
Uppmätt: fil på disk mot VRAM vid körning
Tumregeln "VRAM = filstorleken" stämmer inte. I vår mätning låg kvoten VRAM/disk mellan 0.11 och 1.92 beroende på modell, eftersom Ollama lägger till kontextminne (KV-cache) och overhead ovanpå vikterna. Tabellen visar exakt vad varje modell tog.
| Modell | Disk (GB) | VRAM vid körning (GB) | Kvot | Helt i VRAM på 24 GB |
|---|---|---|---|---|
qwen2.5-coder:32b | 19.9 | 23.1 | 1.16 | ✘ |
deepseek-r1:32b | 19.9 | 23.07 | 1.16 | ✘ |
huihui_ai/deepseek-r1-abliterated:32b-qwen-distill-q4_K_M | 19.9 | 23.07 | 1.16 | ✘ |
nemotron-3-nano:30b | 24.3 | 22.74 | 0.94 | ✘ |
ornith:35b | 21.2 | 21.75 | 1.03 | ✔ |
qwen3:30b-a3b | 18.6 | 21.72 | 1.17 | ✔ |
nemotron-3.5-lightning:latest | 25.4 | 21.38 | 0.84 | ✘ |
laguna-xs-2.1:latest | 20.3 | 20.42 | 1.01 | ✔ |
gemma4:31b | 19.9 | 19.61 | 0.99 | ✘ |
mistral-small:24b | 14.3 | 19.58 | 1.37 | ✔ |
north-mini-code-1.0:latest | 18.6 | 19.09 | 1.03 | ✔ |
hf.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED:Q4_K_M | 16.8 | 18.29 | 1.09 | ✔ |
qwen3.8:27b | 17.7 | 17.4 | 0.98 | ✔ |
muse-glimmer:30b-q4_K_M | 18.2 | 16.55 | 0.91 | ✔ |
qwen3:8b | 5.2 | 9.97 | 1.92 | ✔ |
gemma3:12b | 8.1 | 8.07 | 1.0 | ✔ |
muse-glimmer:30b-q4_K_M-dflash | 19.8 | 2.2 | 0.11 | ✔ |
Vilka modeller ryms på hur mycket VRAM
24 GB är uppmätt på riktigt. Övriga nivåer är beräknade från det uppmätta VRAM-behovet vid Ollamas standardkontext – med kortare kontext ryms mer, med längre mindre.
- 32 GB (RTX 5090, beräknat):
qwen3:30b-a3b(189.6 tok/s),laguna-xs-2.1:latest(180.0 tok/s),north-mini-code-1.0:latest(177.1 tok/s),ornith:35b(156.5 tok/s),qwen3:8b(129.4 tok/s),nemotron-3-nano:30b(119.3 tok/s),nemotron-3.5-lightning:latest(99.6 tok/s),gemma3:12b(82.5 tok/s),muse-glimmer:30b-q4_K_M-dflash(65.1 tok/s),qwen3.8:27b(55.8 tok/s),mistral-small:24b(52.9 tok/s),muse-glimmer:30b-q4_K_M(42.8 tok/s),hf.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED:Q4_K_M(41.6 tok/s),gemma4:31b(24.4 tok/s),qwen2.5-coder:32b(8.0 tok/s),deepseek-r1:32b(7.9 tok/s),huihui_ai/deepseek-r1-abliterated:32b-qwen-distill-q4_K_M(7.9 tok/s). - 24 GB (RTX 3090/4090, RX 7900 XTX):
qwen3:30b-a3b(189.6 tok/s),laguna-xs-2.1:latest(180.0 tok/s),north-mini-code-1.0:latest(177.1 tok/s),ornith:35b(156.5 tok/s),qwen3:8b(129.4 tok/s),gemma3:12b(82.5 tok/s),muse-glimmer:30b-q4_K_M-dflash(65.1 tok/s),qwen3.8:27b(55.8 tok/s),mistral-small:24b(52.9 tok/s),muse-glimmer:30b-q4_K_M(42.8 tok/s),hf.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED:Q4_K_M(41.6 tok/s). - 16 GB (RTX 5060 Ti 16 GB, 5070 Ti, 5080, RX 9070 XT):
qwen3:8b(129.4 tok/s),gemma3:12b(82.5 tok/s),muse-glimmer:30b-q4_K_M-dflash(65.1 tok/s). - 12 GB:
qwen3:8b(129.4 tok/s),gemma3:12b(82.5 tok/s),muse-glimmer:30b-q4_K_M-dflash(65.1 tok/s). - 8 GB:
muse-glimmer:30b-q4_K_M-dflash(65.1 tok/s).
Tre saker som avgör mer än man tror
- Kvantisering. Q4 tar ungefär en fjärdedel av fp16. Alla våra modeller är Ollamas standardkvantisering (kolumnen Kvant i fullständiga tabellen).
- Kontextfönster. Varje token i kontexten kostar VRAM. Sätt
num_ctxefter behov i stället för max. - MoE-modeller.
qwen3:30b-a3bhar 30B parametrar men aktiverar 3B per token – därför 189.6 tok/s trots 21.72 GB VRAM. Storleken avgör minnet, aktiva parametrar avgör farten.
Korten som matchar nivåerna, med dagens priser: grafikkortsguiden.
Vanliga frågor
Varför tar modellen mer VRAM än filen på disk?
Vikterna är bara en del. Ollama reserverar minne för kontextfönstret (KV-cache) och för beräkningsbuffertar. Ju längre kontext, desto mer minne – oberoende av modellens storlek.
Kan jag köra en modell som är större än mitt VRAM?
Ja, Ollama delar då lagren mellan GPU och CPU. Uppmätt hos oss: de 6 modeller som inte rymdes i 24 GB gav 7.9–119.3 tokens/s, mot minst 41.6 tok/s för dem som rymdes. Det fungerar, men det är en annan upplevelse.
Räcker 16 GB för qwen3:30b-a3b?
Nej enligt vår mätning: modellen tog 21.72 GB vid standardkontext. Med kraftigt kortad kontext kan det gå, men då förlorar du det modellen är bra på.
Källor och metod
- Egen mätning 22 september 2026, Ollama 0.34.0, /api/ps size_vram per modell. Rådata: – https://hemmalabb.pages.dev/data/benchmark.json