🌱⚡
GPU Garden
Développez votre propre puissance de calcul
Lien copié dans le presse-papiers ! Prêt à partager.

Mon GPU peut-il exécuter l'IA Open-Weight ?

Estimation VRAM précise côté client pour LLaMA 3.1, Qwen 2.5, DeepSeek et FLUX. Intègre les poids quantifiés, le KV-Cache Grouped Query Attention (GQA) et les réserves du pilote CUDA.

Scénarios rapides :

GGUF / Ollama / vLLM
8k tokens
Précision du KV-Cache :
Verdict Matériel
Tourne confortablement

VRAM Totale Requise
7.64 GB
Capacité VRAM du GPU
8.00 GB
Marge Libre Disponible
+0.36 GB
Débit Estimé
~68 tok/s
Répartition de l'Allocation VRAM 100% capacité
Poids : 4.74 GB
KV-Cache : 1.00 GB
CUDA/Tampon : 1.90 GB
Marge libre : 0.36 GB
1. Formule de Mémoire des Poids 4.74 GB
Params * (BPW / 8) * overhead
8.03B params × (4.50 BPW / 8) × 1.05 overhead = 4.74 GB
2. Formule de Mémoire KV-Cache 1.00 GB
2 * Layers * KV_Heads * Head_Dim * Context_Tokens * Precision_Bytes
2 × 32 layers × 8 KV heads × 128 dim × 8,192 ctx × 2B (FP16) = 1.00 GB
3. Tampon d'Activation Transitoire & Réserve du Pilote (1.50 GB) 1.90 GB
Transient Activation Buffer & Driver Baseline (1.50 GB)
Activations (0.40 GB) + Driver Baseline (1.50 GB) = 1.90 GB
4. VRAM Totale Requise vs Capacité Disponible & Marge Libre 7.64 GB
Total Required VRAM vs Available Capacity & Headroom
Requis : 4.74 GB + 1.00 GB + 1.90 GB = 7.64 GB
Disponible : 8.00 GB Marge : +0.36 GB
Fiche de Référence

Compatibilité VRAM des GPU Populaires & Configurations Idéales

Trouvez les exigences de mémoire précises pour l'IA ouverte sur votre matériel. Cliquez sur une carte pour tester immédiatement les paramètres et la marge KV-Cache.

Mis à jour pour LLaMA 3.2, Qwen 2.5 & FLUX.1
24GB GDDR6X 1,008 GB/s

NVIDIA GeForce RTX 4090

Le champion incontesté du grand public. Fait tourner Qwen 2.5 Coder 32B en Q4 avec 32k de contexte, FLUX.1 [dev] en FP16 natif et LLaMA 3.1 8B FP16 à plus de 120 tokens/sec.

Amazon →
48GB VRAM (Dual) 1,872+ GB/s

Dual NVIDIA RTX 3090 / 4090 Rig

La référence absolue des homelabs sur r/LocalLLaMA. 48 Go de VRAM combinée accueillent Meta LLaMA 3.3 70B et Qwen 2.5 72B en Q4_K_M avec 32k de contexte sans aucun déchargement CPU.

Amazon →
16GB GDDR6X 672 GB/s

NVIDIA GeForce RTX 4070 Ti Super

La référence rapport performances/prix en 16 Go. Dotée d'un bus 256 bits idéal pour Qwen 2.5 14B, LLaMA 3.2 11B Vision, Mistral Small 24B (Q4) et FLUX Schnell.

Amazon →
12GB GDDR6 360 GB/s

NVIDIA GeForce RTX 3060 12GB

Le roi incontesté de l'entrée de gamme à moins de 300 $. Ses 12 Go de VRAM généreux prennent en charge LLaMA 3.1 8B avec d'immenses contextes de 64k et les 14B en Q4_K_M sans crash OOM.

Amazon →
~48GB Allocatable 400 GB/s

Apple M3 / M4 Max (64GB Unified)

La station de travail silencieuse pour développeurs. L'architecture Metal alloue ~48 Go de mémoire unifiée à llama.cpp et MLX, exécutant des modèles 70B en Q4_K_M avec 128k de contexte.

Amazon →
16GB GDDR6 288 GB/s

NVIDIA GeForce RTX 4060 Ti 16GB

Le ticket d'entrée le plus économique vers 16 Go de VRAM moderne (~449 $). Fonctionne à 165 W TDP très modérés, faisant tourner FLUX.1 Schnell NF4 et Qwen 2.5 14B sans effort.

Amazon →
Matrice de Référence

Guide des Exigences VRAM & Matrice de Compatibilité Matérielle

Exigences exactes de mémoire VRAM en 4-Bit (Q4_K_M), 8-Bit (Q8_0) et 16-Bit (FP16) avec configurations matérielles recommandées.

Quantized GGUF • AWQ • FP16 / bfloat16
Modèle & Architecture Paramètres 4-Bit (Q4_K_M) VRAM 8-Bit (Q8_0) VRAM 16-Bit (FP16) VRAM VRAM Min. Recommandée GPU Idéal Action
LLaMA 3.3 70B
Meta AI • Flagship LLM
70.6B Dense GQA
128k context
~41.7 GB
46.1 GB w/ 8k KV
~77.3 GB
81.7 GB w/ 8k KV
~144.0 GB
148.4 GB w/ 8k KV
48 GB
Dual RTX 3090 / 4090
48GB VRAM (Dual GPU)
Qwen 2.5 Coder 32B
Alibaba Cloud • SOTA Coding
32.5B Dense GQA
128k context
~19.2 GB
23.1 GB w/ 8k KV
~35.6 GB
39.5 GB w/ 8k KV
~66.3 GB
70.2 GB w/ 8k KV
24 GB
RTX 4090 24GB
1,008 GB/s (Consumer King)
DeepSeek V2.5 / V3 MoE
DeepSeek • MLA MoE
236B MoE MLA
21B active params
~139.4 GB
142.5 GB w/ 8k KV
~258.3 GB
261.4 GB w/ 8k KV
~481.4 GB
484.6 GB w/ 8k KV
64 GB+ (Offload)
Apple M3 Max 64GB
Unified RAM / Dual 3090
Mistral Small 24B
Mistral AI • Math & Reasoning
23.6B Dense
128k context
~14.2 GB
17.8 GB w/ 8k KV
~26.3 GB
29.9 GB w/ 8k KV
~49.0 GB
52.6 GB w/ 8k KV
16 GB
RTX 4070 Ti Super 16GB
672 GB/s (256-bit bus)
LLaMA 3.2 11B Vision
Meta AI • Multimodal Vision
13.8B Multimodal
128k context
~8.2 GB
11.1 GB w/ 8k KV
~15.1 GB
18.0 GB w/ 8k KV
~28.2 GB
31.1 GB w/ 8k KV
12 GB - 16 GB
RTX 4070 Ti Super 16GB
Full 16GB Headroom
LLaMA 3.1 8B
Meta AI • Open Benchmark
8.03B Dense
128k context
~4.7 GB
7.6 GB w/ 8k KV
~8.8 GB
11.7 GB w/ 8k KV
~16.4 GB
19.3 GB w/ 8k KV
8 GB
RTX 3060 12GB
Budget King (<$300)
FLUX.1 [dev]
Black Forest Labs • SOTA DiT
12.0B DiT
+4.9B T5-XXL / CLIP
~10.2 GB
15.5 GB w/ Act
~18.7 GB
24.0 GB w/ Act
~34.6 GB
39.9 GB w/ Act
16 GB (Q4) / 24 GB
RTX 4090 24GB
Native FP16 / FP8
SDXL 1.0
Stability AI • UNet 1024px
2.6B UNet
+0.8B CLIP-L/G
~3.3 GB
7.0 GB w/ Act
~4.7 GB
8.4 GB w/ Act
~7.1 GB
10.8 GB w/ Act
8 GB - 12 GB
RTX 3060 12GB
Full LoRA + ControlNet Headroom