Uppdaterad 22 september 2026 · mätdata från 22 september 2026 · priser hämtade 22 september 2026

Hur mycket VRAM behöver man för lokala AI-modeller? Uppmätt på 17 modeller

Kort svar: Räkna med 0.11–1.92 gånger filstorleken i VRAM vid Ollamas standardkontext. 8B-modeller behöver 12 GB-kort, 30B-klassen 24 GB. Tabellen nedan är uppmätt, inte uppskattad.

Uppmätt: fil på disk mot VRAM vid körning

Tumregeln "VRAM = filstorleken" stämmer inte. I vår mätning låg kvoten VRAM/disk mellan 0.11 och 1.92 beroende på modell, eftersom Ollama lägger till kontextminne (KV-cache) och overhead ovanpå vikterna. Tabellen visar exakt vad varje modell tog.

ModellDisk (GB)VRAM vid körning (GB)KvotHelt i VRAM på 24 GB
qwen2.5-coder:32b19.923.11.16
deepseek-r1:32b19.923.071.16
huihui_ai/deepseek-r1-abliterated:32b-qwen-distill-q4_K_M19.923.071.16
nemotron-3-nano:30b24.322.740.94
ornith:35b21.221.751.03
qwen3:30b-a3b18.621.721.17
nemotron-3.5-lightning:latest25.421.380.84
laguna-xs-2.1:latest20.320.421.01
gemma4:31b19.919.610.99
mistral-small:24b14.319.581.37
north-mini-code-1.0:latest18.619.091.03
hf.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED:Q4_K_M16.818.291.09
qwen3.8:27b17.717.40.98
muse-glimmer:30b-q4_K_M18.216.550.91
qwen3:8b5.29.971.92
gemma3:12b8.18.071.0
muse-glimmer:30b-q4_K_M-dflash19.82.20.11

Vilka modeller ryms på hur mycket VRAM

24 GB är uppmätt på riktigt. Övriga nivåer är beräknade från det uppmätta VRAM-behovet vid Ollamas standardkontext – med kortare kontext ryms mer, med längre mindre.

Tre saker som avgör mer än man tror

Korten som matchar nivåerna, med dagens priser: grafikkortsguiden.

Vanliga frågor

Varför tar modellen mer VRAM än filen på disk?

Vikterna är bara en del. Ollama reserverar minne för kontextfönstret (KV-cache) och för beräkningsbuffertar. Ju längre kontext, desto mer minne – oberoende av modellens storlek.

Kan jag köra en modell som är större än mitt VRAM?

Ja, Ollama delar då lagren mellan GPU och CPU. Uppmätt hos oss: de 6 modeller som inte rymdes i 24 GB gav 7.9–119.3 tokens/s, mot minst 41.6 tok/s för dem som rymdes. Det fungerar, men det är en annan upplevelse.

Räcker 16 GB för qwen3:30b-a3b?

Nej enligt vår mätning: modellen tog 21.72 GB vid standardkontext. Med kraftigt kortad kontext kan det gå, men då förlorar du det modellen är bra på.

Källor och metod