Uppdaterad 22 september 2026 · mätdata från 22 september 2026 · priser hämtade 22 september 2026

Uppmätt: 17 lokala AI-modeller på RTX 3090 – tokens/s, VRAM och effekt

Kort svar: Snabbast: qwen3:30b-a3b 189.6 tok/s. Största som ryms helt i 24 GB: ornith:35b. GPU:n drar 44.5 W i vila och i snitt 178 W när en modell genererar (topp 419.4 W).

Alla textmodeller, sorterade efter hastighet

ModellParametrarKvantDisk (GB)VRAM vid körning (GB)Helt i VRAMGenererar (tok/s)Läser prompt (tok/s)GPU-effekt medel (W)
qwen3:30b-a3b30.5BQ4_K_M18.621.72189.6289.7152.3
laguna-xs-2.1:latest33.4BQ4_K_M20.320.42180.0242.7138.4
north-mini-code-1.0:latest30.5BQ4_K_M18.619.09177.1295.7150.8
ornith:35b34.7BQ4_K_M21.221.75156.5400.8150.3
qwen3:8b8.2BQ4_K_M5.29.97129.4389.0212.9
nemotron-3-nano:30b31.6BQ4_K_M24.322.74119.3200.2121.9
nemotron-3.5-lightning:latest32.9BQ4_K_M25.421.3899.6191.9116.6
gemma3:12b12.2BQ4_K_M8.18.0782.5251.3250.3
muse-glimmer:30b-q4_K_M-dflash27.9BQ4_K_M19.82.265.1404.5198.6
qwen3.8:27b27.3BQ4_K_M17.717.455.8224.3220.8
mistral-small:24b23.6BQ4_K_M14.319.5852.91212.5252.0
muse-glimmer:30b-q4_K_M27.9BQ4_K_M18.216.5542.8326.0243.7
hf.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED:Q4_K_M27.3Bunknown16.818.2941.6419.0274.0
gemma4:31b31.3BQ4_K_M19.919.6124.4208.0216.5
qwen2.5-coder:32b32.8BQ4_K_M19.923.18.0321.5106.9
deepseek-r1:32b32.8BQ4_K_M19.923.077.9239.2113.5
huihui_ai/deepseek-r1-abliterated:32b-qwen-distill-q4_K_M32.8BQ4_K_M19.923.077.9239.0105.0

Embeddingmodeller (genererar inte text): nomic-embed-text:latest, bge-m3:latest.

Maskinen

Metod

  1. Alla modeller i Ollamas lista körs i tur och ordning, en i taget, och laddas ur efter varje mätning.
  2. Samma prompt till alla (256 genererade tokens, temperatur 0). Två körningar; bästa genereringshastigheten redovisas.
  3. Tokens/s = eval_count / eval_duration ur Ollamas svar. Laddtid = load_duration.
  4. VRAM = size_vram från /api/ps medan modellen är laddad. "Helt i VRAM" = size_vram ≥ 99,5 % av size.
  5. Effekt = nvidia-smi power.draw en gång per sekund under körningen (medel och topp).

Skriptet körs automatiskt varje vecka; tabellen ovan är från 22 september 2026. Prompten och alla råvärden finns i benchmark.json.

Vanliga frågor

Varför är qwen3:30b-a3b snabbare än mindre modeller?

Den är en MoE-modell (mixture of experts): 30B parametrar i minnet men bara omkring 3B aktiva per token. Minnet kostar som 30B, beräkningen som 3B.

Är siffrorna jämförbara med andra sajters?

Bara om de mäter samma sak. Vi redovisar Ollamas egna räknare (eval_count/eval_duration) med fast prompt och temperatur 0, så att du kan upprepa mätningen på din maskin med samma modellnamn.

Källor och metod