Uppmätt: 17 lokala AI-modeller på RTX 3090 – tokens/s, VRAM och effekt
Kort svar: Snabbast:
qwen3:30b-a3b 189.6 tok/s. Största som ryms helt i 24 GB: ornith:35b. GPU:n drar 44.5 W i vila och i snitt 178 W när en modell genererar (topp 419.4 W).Alla textmodeller, sorterade efter hastighet
| Modell | Parametrar | Kvant | Disk (GB) | VRAM vid körning (GB) | Helt i VRAM | Genererar (tok/s) | Läser prompt (tok/s) | GPU-effekt medel (W) |
|---|---|---|---|---|---|---|---|---|
qwen3:30b-a3b | 30.5B | Q4_K_M | 18.6 | 21.72 | ✔ | 189.6 | 289.7 | 152.3 |
laguna-xs-2.1:latest | 33.4B | Q4_K_M | 20.3 | 20.42 | ✔ | 180.0 | 242.7 | 138.4 |
north-mini-code-1.0:latest | 30.5B | Q4_K_M | 18.6 | 19.09 | ✔ | 177.1 | 295.7 | 150.8 |
ornith:35b | 34.7B | Q4_K_M | 21.2 | 21.75 | ✔ | 156.5 | 400.8 | 150.3 |
qwen3:8b | 8.2B | Q4_K_M | 5.2 | 9.97 | ✔ | 129.4 | 389.0 | 212.9 |
nemotron-3-nano:30b | 31.6B | Q4_K_M | 24.3 | 22.74 | ✘ | 119.3 | 200.2 | 121.9 |
nemotron-3.5-lightning:latest | 32.9B | Q4_K_M | 25.4 | 21.38 | ✘ | 99.6 | 191.9 | 116.6 |
gemma3:12b | 12.2B | Q4_K_M | 8.1 | 8.07 | ✔ | 82.5 | 251.3 | 250.3 |
muse-glimmer:30b-q4_K_M-dflash | 27.9B | Q4_K_M | 19.8 | 2.2 | ✔ | 65.1 | 404.5 | 198.6 |
qwen3.8:27b | 27.3B | Q4_K_M | 17.7 | 17.4 | ✔ | 55.8 | 224.3 | 220.8 |
mistral-small:24b | 23.6B | Q4_K_M | 14.3 | 19.58 | ✔ | 52.9 | 1212.5 | 252.0 |
muse-glimmer:30b-q4_K_M | 27.9B | Q4_K_M | 18.2 | 16.55 | ✔ | 42.8 | 326.0 | 243.7 |
hf.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED:Q4_K_M | 27.3B | unknown | 16.8 | 18.29 | ✔ | 41.6 | 419.0 | 274.0 |
gemma4:31b | 31.3B | Q4_K_M | 19.9 | 19.61 | ✘ | 24.4 | 208.0 | 216.5 |
qwen2.5-coder:32b | 32.8B | Q4_K_M | 19.9 | 23.1 | ✘ | 8.0 | 321.5 | 106.9 |
deepseek-r1:32b | 32.8B | Q4_K_M | 19.9 | 23.07 | ✘ | 7.9 | 239.2 | 113.5 |
huihui_ai/deepseek-r1-abliterated:32b-qwen-distill-q4_K_M | 32.8B | Q4_K_M | 19.9 | 23.07 | ✘ | 7.9 | 239.0 | 105.0 |
Embeddingmodeller (genererar inte text): nomic-embed-text:latest, bge-m3:latest.
Maskinen
- GPU: NVIDIA GeForce RTX 3090, 24576 MiB, drivrutin 610.62
- CPU: AMD Ryzen 9 5950X 16-Core Processor, RAM 64 GB
- Microsoft Windows 11 Pro 10.0.26200, Ollama 0.34.0, Python 3.13.14
- GPU-effekt i vila (ingen modell laddad): 44.5 W
Metod
- Alla modeller i Ollamas lista körs i tur och ordning, en i taget, och laddas ur efter varje mätning.
- Samma prompt till alla (256 genererade tokens, temperatur 0). Två körningar; bästa genereringshastigheten redovisas.
- Tokens/s =
eval_count / eval_durationur Ollamas svar. Laddtid =load_duration. - VRAM =
size_vramfrån/api/psmedan modellen är laddad. "Helt i VRAM" = size_vram ≥ 99,5 % av size. - Effekt = nvidia-smi
power.drawen gång per sekund under körningen (medel och topp).
Skriptet körs automatiskt varje vecka; tabellen ovan är från 22 september 2026. Prompten och alla råvärden finns i benchmark.json.
Vanliga frågor
Varför är qwen3:30b-a3b snabbare än mindre modeller?
Den är en MoE-modell (mixture of experts): 30B parametrar i minnet men bara omkring 3B aktiva per token. Minnet kostar som 30B, beräkningen som 3B.
Är siffrorna jämförbara med andra sajters?
Bara om de mäter samma sak. Vi redovisar Ollamas egna räknare (eval_count/eval_duration) med fast prompt och temperatur 0, så att du kan upprepa mätningen på din maskin med samma modellnamn.
Källor och metod
- Egen mätning, skriptet är öppet i rådatan (prompt_id i filen). Rådata: – https://hemmalabb.pages.dev/data/benchmark.json
- Ollama API-referens (generate, ps) – https://docs.ollama.com/api