手元のGPUで オープンAIモデルは動く?
LLaMA 3.1、Qwen 2.5、DeepSeek、FLUXの高精度クライアントサイドVRAM見積もり。量子化モデル重み、Grouped Query Attention (GQA) KV-Cache、CUDAドライババッファを網羅。
数式と計算根拠を確認する 計算詳細を表示
Params * (BPW / 8) * overhead
2 * Layers * KV_Heads * Head_Dim * Context_Tokens * Precision_Bytes
Transient Activation Buffer & Driver Baseline (1.50 GB)
Total Required VRAM vs Available Capacity & Headroom
人気GPU VRAM互換性&モデル推奨スイートスポット
手元のハードウェアにおけるオープンAIモデルの厳密なメモリ消費を確認。カードをクリックすると上部ツールに即座に反映されます。
NVIDIA GeForce RTX 4090
コンシューマー向け絶対王者。32kコンテキストQ4のQwen 2.5 Coder 32B、非圧縮FP16のFLUX.1 [dev]、120+ tok/sのLLaMA 3.1 8B FP16を完璧に実行。
Dual NVIDIA RTX 3090 / 4090 Rig
r/LocalLLaMAで絶大な支持を集めるホームラボの金字塔。48GBの合計VRAMにより、Meta LLaMA 3.3 70BとQwen 2.5 72B(Q4_K_M/32k)をCPU退避なしで完全動作。
NVIDIA GeForce RTX 4070 Ti Super
16GB VRAMクラス屈指のコスパ機。256-bitバスを備え、Qwen 2.5 14B、LLaMA 3.2 11B Vision、Mistral Small 24B (Q4)、FLUX Schnellに最適。
NVIDIA GeForce RTX 3060 12GB
300ドル未満の圧倒的バジェットキング。余裕の12GB VRAMにより、LLaMA 3.1 8Bでの64k長文コンテキストや14B Q4_K_MをOOMエラーなしで快適に実行。
Apple M3 / M4 Max (64GB Unified)
静音ポータブル開発ワークステーション。macOS Metalにより約48GBをllama.cppとMLXに直接割り当て、128kコンテキストで70B Q4_K_Mを実行可能。
NVIDIA GeForce RTX 4060 Ti 16GB
最新16GB VRAMへの最安エントリーモデル(約449ドル)。超低発熱な165W TDPで、FLUX.1 Schnell NF4やQwen 2.5 14Bを手軽に動作。
AIモデル VRAM要件ガイド&スイートスポット・マトリクス
4-Bit (Q4_K_M)、8-Bit (Q8_0)、16-Bit (FP16) の高精度VRAM要件と推奨スイートスポットハードウェア一覧。
| モデルとアーキテクチャ | パラメータ | 4-Bit (Q4_K_M) VRAM | 8-Bit (Q8_0) VRAM | 16-Bit (FP16) VRAM | 推奨最小VRAM | 推奨GPU | アクション |
|---|---|---|---|---|---|---|---|
|
LLaMA 3.3 70B
Meta AI • Flagship LLM
|
70.6B Dense GQA
128k context
|
~41.7 GB
46.1 GB w/ 8k KV
|
~77.3 GB
81.7 GB w/ 8k KV
|
~144.0 GB
148.4 GB w/ 8k KV
|
48 GB |
Dual RTX 3090 / 4090
48GB VRAM (Dual GPU)
|
|
|
Qwen 2.5 Coder 32B
Alibaba Cloud • SOTA Coding
|
32.5B Dense GQA
128k context
|
~19.2 GB
23.1 GB w/ 8k KV
|
~35.6 GB
39.5 GB w/ 8k KV
|
~66.3 GB
70.2 GB w/ 8k KV
|
24 GB |
RTX 4090 24GB
1,008 GB/s (Consumer King)
|
|
|
DeepSeek V2.5 / V3 MoE
DeepSeek • MLA MoE
|
236B MoE MLA
21B active params
|
~139.4 GB
142.5 GB w/ 8k KV
|
~258.3 GB
261.4 GB w/ 8k KV
|
~481.4 GB
484.6 GB w/ 8k KV
|
64 GB+ (Offload) |
Apple M3 Max 64GB
Unified RAM / Dual 3090
|
|
|
Mistral Small 24B
Mistral AI • Math & Reasoning
|
23.6B Dense
128k context
|
~14.2 GB
17.8 GB w/ 8k KV
|
~26.3 GB
29.9 GB w/ 8k KV
|
~49.0 GB
52.6 GB w/ 8k KV
|
16 GB |
RTX 4070 Ti Super 16GB
672 GB/s (256-bit bus)
|
|
|
LLaMA 3.2 11B Vision
Meta AI • Multimodal Vision
|
13.8B Multimodal
128k context
|
~8.2 GB
11.1 GB w/ 8k KV
|
~15.1 GB
18.0 GB w/ 8k KV
|
~28.2 GB
31.1 GB w/ 8k KV
|
12 GB - 16 GB |
RTX 4070 Ti Super 16GB
Full 16GB Headroom
|
|
|
LLaMA 3.1 8B
Meta AI • Open Benchmark
|
8.03B Dense
128k context
|
~4.7 GB
7.6 GB w/ 8k KV
|
~8.8 GB
11.7 GB w/ 8k KV
|
~16.4 GB
19.3 GB w/ 8k KV
|
8 GB |
RTX 3060 12GB
Budget King (<$300)
|
|
|
FLUX.1 [dev]
Black Forest Labs • SOTA DiT
|
12.0B DiT
+4.9B T5-XXL / CLIP
|
~10.2 GB
15.5 GB w/ Act
|
~18.7 GB
24.0 GB w/ Act
|
~34.6 GB
39.9 GB w/ Act
|
16 GB (Q4) / 24 GB |
RTX 4090 24GB
Native FP16 / FP8
|
|
|
SDXL 1.0
Stability AI • UNet 1024px
|
2.6B UNet
+0.8B CLIP-L/G
|
~3.3 GB
7.0 GB w/ Act
|
~4.7 GB
8.4 GB w/ Act
|
~7.1 GB
10.8 GB w/ Act
|
8 GB - 12 GB |
RTX 3060 12GB
Full LoRA + ControlNet Headroom
|