LLM Cost Calculator for Local vs Cloud API Decision Making
Compare running LLMs on local hardware vs cloud APIs - full cost breakdown including hardware, electricity, quality trade-offs, and break-even timing.
Recommended Setup
Cost Comparison: All Cloud Models
Based on 50M input + 15M output tokens/month
| Model | Provider | Monthly cost |
|---|---|---|
| gpt-oss-20b | OpenAI | $3.45 |
| Qwen3.7 Flash | Qwen (Alibaba) | $3.45 |
| Llama 3.1 8B (Groq) | Groq | $3.70 |
| Gemma 3 4B | $4.00 | |
| gpt-oss-120b | OpenAI | $4.55 |
| Gemma 3 12B | $4.75 | |
| Gemma 3n 4B | $4.80 | |
| Qwen3 30B A3B Instruct 2507 | Qwen (Alibaba) | $5.35 |
| Doubao Seed 2.0 Mini | Doubao (ByteDance) | $5.85 |
| DeepSeek V4 Flash | DeepSeek | $7.05 |
| Qwen3.5-9B | Qwen (Alibaba) | $7.25 |
| Qwen3.5-Flash | Qwen (Alibaba) | $7.40 |
| Qwen3 Coder 30B A3B Instruct | Qwen (Alibaba) | $7.70 |
| Qwen2.5 7B Instruct | Qwen (Alibaba) | $8.00 |
| GPT-5 Nano | OpenAI | $8.50 |
| gpt-oss-safeguard-20b | OpenAI | $8.50 |
| Gemma 4 26B A4B | $8.60 | |
| GLM-4.7 Flash | Zhipu AI (GLM) | $9.00 |
| Qwen3 14B | Qwen (Alibaba) | $9.60 |
| Doubao Pro 32K | Doubao (ByteDance) | $9.70 |
| Hunyuan TurboS | Hunyuan (Tencent) | $9.70 |
| Gemma 4 31B | $10.10 | |
| Llama 4 Scout (Groq) | Groq | $10.60 |
| Gemma 3 27B | $10.75 | |
| GPT-4.1 Nano | OpenAI | $11.00 |
| Gemini 2.5 Flash-Lite | $11.00 | |
| DeepSeek V4 Flash 0731 | DeepSeek | $11.20 |
| Qwen3 VL 32B Instruct | Qwen (Alibaba) | $11.30 |
| Qwen3.5-Flash | Qwen (Alibaba) | $12.75 |
| Qwen3 VL 8B Instruct | Qwen (Alibaba) | $12.75 |
| Qwen3 235B A22B Instruct 2507 | Qwen (Alibaba) | $12.75 |
| Qwen3 30B A3B | Qwen (Alibaba) | $13.50 |
| Qwen3 VL 30B A3B Instruct | Qwen (Alibaba) | $14.30 |
| Hunyuan T1 | Hunyuan (Tencent) | $15.40 |
| GPT-4o-mini | OpenAI | $16.50 |
| GPT-OSS 120B (Groq) | Groq | $16.50 |
| Qwen3 Coder Next | Qwen (Alibaba) | $18.00 |
| DeepSeek V3.2 | DeepSeek | $18.70 |
| GLM 4.5 Air | Zhipu AI (GLM) | $19.25 |
| Qwen3 Next 80B A3B Instruct | Qwen (Alibaba) | $21.50 |
| Qwen3.6 35B A3B | Qwen (Alibaba) | $22.00 |
| Qwen3 32B (Groq) | Groq | $23.35 |
| Qwen2.5 72B Instruct | Qwen (Alibaba) | $24.00 |
| Qwen3 Coder Flash | Qwen (Alibaba) | $24.70 |
| Qwen3.5-Plus | Qwen (Alibaba) | $24.70 |
| Qwen3 Next 80B A3B Thinking | Qwen (Alibaba) | $25.50 |
| Qwen3.6 Flash | Qwen (Alibaba) | $26.45 |
| DeepSeek V3 0324 | DeepSeek | $27.50 |
| GPT-5.6 Luna | OpenAI | $28.00 |
| GPT-5.6 Luna Pro | OpenAI | $28.00 |
| DeepSeek V3 | DeepSeek | $28.45 |
| DeepSeek V3.1 Terminus | DeepSeek | $28.50 |
| GLM 4.6V | Zhipu AI (GLM) | $28.50 |
| GPT-5.4 Nano | OpenAI | $28.75 |
| DeepSeek V3 (Mar 2025) | DeepSeek | $30.00 |
| Qwen3 Coder 480B A35B | Qwen (Alibaba) | $30.00 |
| Qwen3.5-35B-A3B | Qwen (Alibaba) | $31.25 |
| Qwen3.5-27B | Qwen (Alibaba) | $33.40 |
| Gemini 3.1 Flash-Lite | $35.00 | |
| Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image) | $35.00 | |
| Qwen3.7 Plus | Qwen (Alibaba) | $35.20 |
| Qwen3.5 Plus 2026-02-15 | Qwen (Alibaba) | $36.40 |
| Qwen3 VL 235B A22B Instruct | Qwen (Alibaba) | $39.00 |
| Qwen3 VL 8B Thinking | Qwen (Alibaba) | $40.50 |
| Llama 3.3 70B (Groq) | Groq | $41.35 |
| GPT-5 Mini | OpenAI | $42.50 |
| GPT-5.1-Codex-Mini | OpenAI | $42.50 |
| GPT-4.1 Mini | OpenAI | $44.00 |
| Qwen3.5-122B-A10B | Qwen (Alibaba) | $44.20 |
| Qwen3.6 Plus | Qwen (Alibaba) | $45.75 |
| Qwen3 VL 30B A3B Thinking | Qwen (Alibaba) | $46.00 |
| Qwen3 30B A3B Thinking 2507 | Qwen (Alibaba) | $46.00 |
| Qwen3 235B A22B Thinking 2507 | Qwen (Alibaba) | $46.00 |
| GLM 4.7 | Zhipu AI (GLM) | $46.25 |
| DeepSeek V4 Pro | DeepSeek | $46.40 |
| Gemini 3.7 Flash | $47.20 | |
| Qwen2.5 Coder 32B Instruct | Qwen (Alibaba) | $48.00 |
| Qwen3-Max | Qwen (Alibaba) | $49.80 |
| R1 Distill Llama 70B | DeepSeek | $52.00 |
| DeepSeek V3.1 | DeepSeek | $52.25 |
| Gemini 2.5 Flash | $52.50 | |
| Gemini 3.5 Flash Lite | $52.50 | |
| Nano Banana (Gemini 2.5 Flash Image) | $52.50 | |
| Qwen2.5 VL 72B Instruct | Qwen (Alibaba) | $55.00 |
| GLM 4.6 | Zhipu AI (GLM) | $55.00 |
| GLM 4.5V | Zhipu AI (GLM) | $57.00 |
| Llama 3.3 70B (Together) | Together AI | $57.20 |
| R1 0528 | DeepSeek | $57.25 |
| Doubao Seed 2.0 Pro | Doubao (ByteDance) | $59.05 |
| Qwen3.8 27B | Qwen (Alibaba) | $59.75 |
| Kimi K2 | Kimi (Moonshot AI) | $63.00 |
| GLM 4.5 | Zhipu AI (GLM) | $63.00 |
| Qwen3.6 27B | Qwen (Alibaba) | $64.00 |
| GPT Audio Mini | OpenAI | $66.00 |
| Kimi K2.5 (Together) | Together AI | $67.00 |
| Kimi K2 Thinking | Kimi (Moonshot AI) | $67.50 |
| Kimi K2 0905 | Kimi (Moonshot AI) | $67.50 |
| Nano Banana 2 (Gemini 3.1 Flash Image) | $70.00 | |
| DeepSeek R1 | DeepSeek | $72.50 |
| Kimi K2.5 | Kimi (Moonshot AI) | $75.00 |
| Qwen3.5 397B A17B | Qwen (Alibaba) | $79.00 |
| Qwen3 VL 235B A22B Thinking | Qwen (Alibaba) | $80.00 |
| Qwen3 Coder Plus | Qwen (Alibaba) | $81.25 |
| Qwen3.5 397B (Together) | Together AI | $84.00 |
| Gemini 3.6 Flash | $93.75 | |
| Qwen3 Max Thinking | Qwen (Alibaba) | $97.50 |
| GLM-5 | Zhipu AI (GLM) | $98.00 |
| Claude 3.5 Haiku | Anthropic | $100 |
| GPT-5.4 Mini | OpenAI | $105 |
| DeepSeek V4 Pro 0813 | DeepSeek | $107 |
| Kimi K2.7 Code | Kimi (Moonshot AI) | $108 |
| Kimi K2.6 | Kimi (Moonshot AI) | $108 |
| GLM-5-Turbo | Zhipu AI (GLM) | $120 |
| GLM 5V Turbo | Zhipu AI (GLM) | $120 |
| o4-mini | OpenAI | $121 |
| o3 Mini | OpenAI | $121 |
| o4 Mini High | OpenAI | $121 |
| o3 Mini High | OpenAI | $121 |
| Claude Haiku 4.5★ recommended | Anthropic | $125 |
| GLM-5.1 | Zhipu AI (GLM) | $136 |
| GLM 5.3 | Zhipu AI (GLM) | $136 |
| Qwen3.7 Max | Qwen (Alibaba) | $140 |
| GPT-5 Image Mini | OpenAI | $155 |
| DeepSeek V4 Pro (Together) | Together AI | $171 |
| Moonshot V1 (128K) | Kimi (Moonshot AI) | $175 |
| Qwen3.8 2.4T A95B | Qwen (Alibaba) | $190 |
| Qwen3.8 Max | Qwen (Alibaba) | $190 |
| Gemini 3.5 Flash | $210 | |
| GPT-5 | OpenAI | $213 |
| GPT-5 Codex | OpenAI | $213 |
| GPT-5.1-Codex-Max | OpenAI | $213 |
| GPT-5.1 | OpenAI | $213 |
| GPT-5.1-Codex | OpenAI | $213 |
| Gemini 2.5 Pro | $213 | |
| Gemini 2.5 Pro Preview 05-06 | $213 | |
| Kimi K2.7 Code HighSpeed | Kimi (Moonshot AI) | $215 |
| GPT-4.1 | OpenAI | $220 |
| o3 | OpenAI | $220 |
| o4 Mini Deep Research | OpenAI | $220 |
| GPT-5.6 Sol Pro | OpenAI | $250 |
| Claude Sonnet 5 | Anthropic | $250 |
| GPT-4o | OpenAI | $275 |
| GPT Audio | OpenAI | $275 |
| GPT-5.6 Terra | OpenAI | $280 |
| GPT-5.6 Terra Pro | OpenAI | $280 |
| Gemini 3.1 Pro Preview | $280 | |
| Nano Banana Pro (Gemini 3 Pro Image) | $280 | |
| Gemini 3.1 Pro Preview Custom Tools | $280 | |
| GPT-5.3 Chat | OpenAI | $298 |
| GPT-5.3-Codex | OpenAI | $298 |
| GPT-5.2-Codex | OpenAI | $298 |
| GPT-5.2 Chat | OpenAI | $298 |
| GPT-5.2 | OpenAI | $298 |
| GPT-5.4 | OpenAI | $350 |
| Claude Sonnet 4.6 | Anthropic | $375 |
| Claude Sonnet 4.5 | Anthropic | $375 |
| Claude Sonnet 4 | Anthropic | $375 |
| Kimi K3 | Kimi (Moonshot AI) | $375 |
| GPT-5.4 Image 2 | OpenAI | $625 |
| Claude Opus 4.7 | Anthropic | $625 |
| Claude Opus 4.6 | Anthropic | $625 |
| Claude Opus 4.8 | Anthropic | $625 |
| Claude Opus 4.5 | Anthropic | $625 |
| Claude Opus 5 | Anthropic | $625 |
| GPT-5 Image | OpenAI | $650 |
| GPT-5.6 Sol | OpenAI | $700 |
| GPT-5.5 | OpenAI | $700 |
| GLM-5.2 | Zhipu AI (GLM) | $820 |
| o3 Deep Research | OpenAI | $1,100 |
| Claude Opus 4.8 (Fast) | Anthropic | $1,250 |
| Claude Opus 5 (Fast) | Anthropic | $1,250 |
| Claude Fable 5 | Anthropic | $1,250 |
| o1 | OpenAI | $1,650 |
| Claude Opus 4.1 | Anthropic | $1,875 |
| Claude Opus 4 | Anthropic | $1,875 |
| o3 Pro | OpenAI | $2,200 |
| GPT-5 Pro | OpenAI | $2,550 |
| GPT-5.2 Pro | OpenAI | $3,570 |
| Claude Opus 4.7 (Fast) | Anthropic | $3,750 |
| Claude Opus 4.6 (Fast) | Anthropic | $3,750 |
| GPT-5.5 Pro | OpenAI | $4,200 |
| GPT-5.4 Pro | OpenAI | $4,200 |
| o1-pro | OpenAI | $16,500 |
Frequently Asked Questions
What hardware do I need to run Llama 3.1 70B locally, and what does it cost per month?
Llama 3.1 70B at 4-bit quantization (Q4_K_M) fits in 40GB VRAM and runs at 20-35 tokens/second on 2� NVIDIA RTX 3090 cards (~$1,400 combined used) or a single RTX 4090 at higher throughput. At 8 hours/day usage and $0.12/kWh, electricity costs roughly $25-35/month per GPU. Total monthly ownership cost (amortized hardware + electricity + tooling) runs approximately $85-120/month for a dual-3090 setup.
How do I calculate my effective cost per million tokens for local hardware?
Divide total monthly cost by monthly token throughput. For a single RTX 4090 running at 30 tokens/second for 10 hours/day: monthly throughput = 30 � 36,000 seconds � 30 days = 32.4M tokens. At $75/month total cost, your effective rate is $2.31/M tokens - competitive with GPT-4o input pricing but still more expensive than Gemini Flash for sustained input-heavy workloads. The advantage grows linearly with utilization hours.
What quality gap should I realistically expect between Llama 70B and GPT-4o?
On standard benchmarks (MMLU, HumanEval, MATH-500), Llama 3.1 70B scores approximately 79-85% of GPT-4o performance. For practical tasks - customer support, summarization, structured data extraction, and code completion for common patterns - many teams report only 5-10% degradation with prompt engineering. The gap is most pronounced in multi-step reasoning and novel instruction following; for repeatable, well-defined tasks, the difference is often negligible.