Mon GPU peut-il exécuter l'IA Open-Weight ?
Estimation VRAM précise côté client pour LLaMA 3.1, Qwen 2.5, DeepSeek et FLUX. Intègre les poids quantifiés, le KV-Cache Grouped Query Attention (GQA) et les réserves du pilote CUDA.
Inspecter les formules mathématiques et le détail Détail du calcul
Params * (BPW / 8) * overhead
2 * Layers * KV_Heads * Head_Dim * Context_Tokens * Precision_Bytes
Transient Activation Buffer & Driver Baseline (1.50 GB)
Total Required VRAM vs Available Capacity & Headroom
Compatibilité VRAM des GPU Populaires & Configurations Idéales
Trouvez les exigences de mémoire précises pour l'IA ouverte sur votre matériel. Cliquez sur une carte pour tester immédiatement les paramètres et la marge KV-Cache.
NVIDIA GeForce RTX 4090
Le champion incontesté du grand public. Fait tourner Qwen 2.5 Coder 32B en Q4 avec 32k de contexte, FLUX.1 [dev] en FP16 natif et LLaMA 3.1 8B FP16 à plus de 120 tokens/sec.
Dual NVIDIA RTX 3090 / 4090 Rig
La référence absolue des homelabs sur r/LocalLLaMA. 48 Go de VRAM combinée accueillent Meta LLaMA 3.3 70B et Qwen 2.5 72B en Q4_K_M avec 32k de contexte sans aucun déchargement CPU.
NVIDIA GeForce RTX 4070 Ti Super
La référence rapport performances/prix en 16 Go. Dotée d'un bus 256 bits idéal pour Qwen 2.5 14B, LLaMA 3.2 11B Vision, Mistral Small 24B (Q4) et FLUX Schnell.
NVIDIA GeForce RTX 3060 12GB
Le roi incontesté de l'entrée de gamme à moins de 300 $. Ses 12 Go de VRAM généreux prennent en charge LLaMA 3.1 8B avec d'immenses contextes de 64k et les 14B en Q4_K_M sans crash OOM.
Apple M3 / M4 Max (64GB Unified)
La station de travail silencieuse pour développeurs. L'architecture Metal alloue ~48 Go de mémoire unifiée à llama.cpp et MLX, exécutant des modèles 70B en Q4_K_M avec 128k de contexte.
NVIDIA GeForce RTX 4060 Ti 16GB
Le ticket d'entrée le plus économique vers 16 Go de VRAM moderne (~449 $). Fonctionne à 165 W TDP très modérés, faisant tourner FLUX.1 Schnell NF4 et Qwen 2.5 14B sans effort.
Guide des Exigences VRAM & Matrice de Compatibilité Matérielle
Exigences exactes de mémoire VRAM en 4-Bit (Q4_K_M), 8-Bit (Q8_0) et 16-Bit (FP16) avec configurations matérielles recommandées.
| Modèle & Architecture | Paramètres | 4-Bit (Q4_K_M) VRAM | 8-Bit (Q8_0) VRAM | 16-Bit (FP16) VRAM | VRAM Min. Recommandée | GPU Idéal | Action |
|---|---|---|---|---|---|---|---|
|
LLaMA 3.3 70B
Meta AI • Flagship LLM
|
70.6B Dense GQA
128k context
|
~41.7 GB
46.1 GB w/ 8k KV
|
~77.3 GB
81.7 GB w/ 8k KV
|
~144.0 GB
148.4 GB w/ 8k KV
|
48 GB |
Dual RTX 3090 / 4090
48GB VRAM (Dual GPU)
|
|
|
Qwen 2.5 Coder 32B
Alibaba Cloud • SOTA Coding
|
32.5B Dense GQA
128k context
|
~19.2 GB
23.1 GB w/ 8k KV
|
~35.6 GB
39.5 GB w/ 8k KV
|
~66.3 GB
70.2 GB w/ 8k KV
|
24 GB |
RTX 4090 24GB
1,008 GB/s (Consumer King)
|
|
|
DeepSeek V2.5 / V3 MoE
DeepSeek • MLA MoE
|
236B MoE MLA
21B active params
|
~139.4 GB
142.5 GB w/ 8k KV
|
~258.3 GB
261.4 GB w/ 8k KV
|
~481.4 GB
484.6 GB w/ 8k KV
|
64 GB+ (Offload) |
Apple M3 Max 64GB
Unified RAM / Dual 3090
|
|
|
Mistral Small 24B
Mistral AI • Math & Reasoning
|
23.6B Dense
128k context
|
~14.2 GB
17.8 GB w/ 8k KV
|
~26.3 GB
29.9 GB w/ 8k KV
|
~49.0 GB
52.6 GB w/ 8k KV
|
16 GB |
RTX 4070 Ti Super 16GB
672 GB/s (256-bit bus)
|
|
|
LLaMA 3.2 11B Vision
Meta AI • Multimodal Vision
|
13.8B Multimodal
128k context
|
~8.2 GB
11.1 GB w/ 8k KV
|
~15.1 GB
18.0 GB w/ 8k KV
|
~28.2 GB
31.1 GB w/ 8k KV
|
12 GB - 16 GB |
RTX 4070 Ti Super 16GB
Full 16GB Headroom
|
|
|
LLaMA 3.1 8B
Meta AI • Open Benchmark
|
8.03B Dense
128k context
|
~4.7 GB
7.6 GB w/ 8k KV
|
~8.8 GB
11.7 GB w/ 8k KV
|
~16.4 GB
19.3 GB w/ 8k KV
|
8 GB |
RTX 3060 12GB
Budget King (<$300)
|
|
|
FLUX.1 [dev]
Black Forest Labs • SOTA DiT
|
12.0B DiT
+4.9B T5-XXL / CLIP
|
~10.2 GB
15.5 GB w/ Act
|
~18.7 GB
24.0 GB w/ Act
|
~34.6 GB
39.9 GB w/ Act
|
16 GB (Q4) / 24 GB |
RTX 4090 24GB
Native FP16 / FP8
|
|
|
SDXL 1.0
Stability AI • UNet 1024px
|
2.6B UNet
+0.8B CLIP-L/G
|
~3.3 GB
7.0 GB w/ Act
|
~4.7 GB
8.4 GB w/ Act
|
~7.1 GB
10.8 GB w/ Act
|
8 GB - 12 GB |
RTX 3060 12GB
Full LoRA + ControlNet Headroom
|