🌱⚡
GPU Garden
自前の計算機環境を構築する
リンクをクリップボードにコピーしました!

手元のGPUで オープンAIモデルは動く?

LLaMA 3.1、Qwen 2.5、DeepSeek、FLUXの高精度クライアントサイドVRAM見積もり。量子化モデル重み、Grouped Query Attention (GQA) KV-Cache、CUDAドライババッファを網羅。

クイック設定プリセット:

GGUF / Ollama / vLLM
8k tokens
KV-Cache 精度:
ハードウェア判定
快適に動作可能

必要総VRAM
7.64 GB
GPU VRAM容量
8.00 GB
利用可能バッファ余量
+0.36 GB
推定生成スループット
~68 tok/s
VRAM割り当ての内訳 100% 容量
モデル重み: 4.74 GB
KV-Cache: 1.00 GB
CUDA/バッファ: 1.90 GB
空き容量: 0.36 GB
1. モデル重み計算式 4.74 GB
Params * (BPW / 8) * overhead
8.03B params × (4.50 BPW / 8) × 1.05 overhead = 4.74 GB
2. KV-Cache 計算式 1.00 GB
2 * Layers * KV_Heads * Head_Dim * Context_Tokens * Precision_Bytes
2 × 32 layers × 8 KV heads × 128 dim × 8,192 ctx × 2B (FP16) = 1.00 GB
3. 一時アクティベーション&ドライバ予約 (1.50 GB) 1.90 GB
Transient Activation Buffer & Driver Baseline (1.50 GB)
Activations (0.40 GB) + Driver Baseline (1.50 GB) = 1.90 GB
4. 必要総VRAM vs 利用可能容量&余量 7.64 GB
Total Required VRAM vs Available Capacity & Headroom
必要量: 4.74 GB + 1.00 GB + 1.90 GB = 7.64 GB
利用可能: 8.00 GB 余量: +0.36 GB
クイックリファレンス

人気GPU VRAM互換性&モデル推奨スイートスポット

手元のハードウェアにおけるオープンAIモデルの厳密なメモリ消費を確認。カードをクリックすると上部ツールに即座に反映されます。

LLaMA 3.2、Qwen 2.5、FLUX.1 に対応
24GB GDDR6X 1,008 GB/s

NVIDIA GeForce RTX 4090

コンシューマー向け絶対王者。32kコンテキストQ4のQwen 2.5 Coder 32B、非圧縮FP16のFLUX.1 [dev]、120+ tok/sのLLaMA 3.1 8B FP16を完璧に実行。

Amazon →
48GB VRAM (Dual) 1,872+ GB/s

Dual NVIDIA RTX 3090 / 4090 Rig

r/LocalLLaMAで絶大な支持を集めるホームラボの金字塔。48GBの合計VRAMにより、Meta LLaMA 3.3 70BとQwen 2.5 72B(Q4_K_M/32k)をCPU退避なしで完全動作。

Amazon →
16GB GDDR6X 672 GB/s

NVIDIA GeForce RTX 4070 Ti Super

16GB VRAMクラス屈指のコスパ機。256-bitバスを備え、Qwen 2.5 14B、LLaMA 3.2 11B Vision、Mistral Small 24B (Q4)、FLUX Schnellに最適。

Amazon →
12GB GDDR6 360 GB/s

NVIDIA GeForce RTX 3060 12GB

300ドル未満の圧倒的バジェットキング。余裕の12GB VRAMにより、LLaMA 3.1 8Bでの64k長文コンテキストや14B Q4_K_MをOOMエラーなしで快適に実行。

Amazon →
~48GB Allocatable 400 GB/s

Apple M3 / M4 Max (64GB Unified)

静音ポータブル開発ワークステーション。macOS Metalにより約48GBをllama.cppとMLXに直接割り当て、128kコンテキストで70B Q4_K_Mを実行可能。

Amazon →
16GB GDDR6 288 GB/s

NVIDIA GeForce RTX 4060 Ti 16GB

最新16GB VRAMへの最安エントリーモデル(約449ドル)。超低発熱な165W TDPで、FLUX.1 Schnell NF4やQwen 2.5 14Bを手軽に動作。

Amazon →
スペック照合マトリクス

AIモデル VRAM要件ガイド&スイートスポット・マトリクス

4-Bit (Q4_K_M)、8-Bit (Q8_0)、16-Bit (FP16) の高精度VRAM要件と推奨スイートスポットハードウェア一覧。

Quantized GGUF • AWQ • FP16 / bfloat16
モデルとアーキテクチャ パラメータ 4-Bit (Q4_K_M) VRAM 8-Bit (Q8_0) VRAM 16-Bit (FP16) VRAM 推奨最小VRAM 推奨GPU アクション
LLaMA 3.3 70B
Meta AI • Flagship LLM
70.6B Dense GQA
128k context
~41.7 GB
46.1 GB w/ 8k KV
~77.3 GB
81.7 GB w/ 8k KV
~144.0 GB
148.4 GB w/ 8k KV
48 GB
Dual RTX 3090 / 4090
48GB VRAM (Dual GPU)
Qwen 2.5 Coder 32B
Alibaba Cloud • SOTA Coding
32.5B Dense GQA
128k context
~19.2 GB
23.1 GB w/ 8k KV
~35.6 GB
39.5 GB w/ 8k KV
~66.3 GB
70.2 GB w/ 8k KV
24 GB
RTX 4090 24GB
1,008 GB/s (Consumer King)
DeepSeek V2.5 / V3 MoE
DeepSeek • MLA MoE
236B MoE MLA
21B active params
~139.4 GB
142.5 GB w/ 8k KV
~258.3 GB
261.4 GB w/ 8k KV
~481.4 GB
484.6 GB w/ 8k KV
64 GB+ (Offload)
Apple M3 Max 64GB
Unified RAM / Dual 3090
Mistral Small 24B
Mistral AI • Math & Reasoning
23.6B Dense
128k context
~14.2 GB
17.8 GB w/ 8k KV
~26.3 GB
29.9 GB w/ 8k KV
~49.0 GB
52.6 GB w/ 8k KV
16 GB
RTX 4070 Ti Super 16GB
672 GB/s (256-bit bus)
LLaMA 3.2 11B Vision
Meta AI • Multimodal Vision
13.8B Multimodal
128k context
~8.2 GB
11.1 GB w/ 8k KV
~15.1 GB
18.0 GB w/ 8k KV
~28.2 GB
31.1 GB w/ 8k KV
12 GB - 16 GB
RTX 4070 Ti Super 16GB
Full 16GB Headroom
LLaMA 3.1 8B
Meta AI • Open Benchmark
8.03B Dense
128k context
~4.7 GB
7.6 GB w/ 8k KV
~8.8 GB
11.7 GB w/ 8k KV
~16.4 GB
19.3 GB w/ 8k KV
8 GB
RTX 3060 12GB
Budget King (<$300)
FLUX.1 [dev]
Black Forest Labs • SOTA DiT
12.0B DiT
+4.9B T5-XXL / CLIP
~10.2 GB
15.5 GB w/ Act
~18.7 GB
24.0 GB w/ Act
~34.6 GB
39.9 GB w/ Act
16 GB (Q4) / 24 GB
RTX 4090 24GB
Native FP16 / FP8
SDXL 1.0
Stability AI • UNet 1024px
2.6B UNet
+0.8B CLIP-L/G
~3.3 GB
7.0 GB w/ Act
~4.7 GB
8.4 GB w/ Act
~7.1 GB
10.8 GB w/ Act
8 GB - 12 GB
RTX 3060 12GB
Full LoRA + ControlNet Headroom