LLM Cost Calculator

RAG Pipeline LLM API Cost Estimator

Estimate monthly LLM costs for a Retrieval-Augmented Generation (RAG) pipeline. RAG pipelines have higher input token counts due to retrieved context.

Recommended Setup

Model
Claude Haiku 4.5
Anthropic
Monthly tokens
230M
200M in / 30M out
Estimated monthly cost
$350

Cost Comparison: All Cloud Models

Based on 200M input + 30M output tokens/month

ModelProviderMonthly cost
gpt-oss-20bOpenAI$9.90
Qwen3.7 FlashQwen (Alibaba)$9.90
Llama 3.1 8B (Groq)Groq$12.40
Gemma 3 4BGoogle$13.00
gpt-oss-120bOpenAI$13.10
Gemma 3 12BGoogle$14.50
Doubao Seed 2.0 MiniDoubao (ByteDance)$14.70
Gemma 3n 4BGoogle$15.60
Qwen3 30B A3B Instruct 2507Qwen (Alibaba)$15.70
Qwen3.5-FlashQwen (Alibaba)$21.80
GPT-5 NanoOpenAI$22.00
Qwen3 Coder 30B A3B InstructQwen (Alibaba)$22.40
DeepSeek V4 FlashDeepSeek$23.10
GLM-4.7 FlashZhipu AI (GLM)$24.00
Gemma 4 26B A4B Google$24.20
Qwen3.5-9BQwen (Alibaba)$24.50
gpt-oss-safeguard-20bOpenAI$25.00
Qwen2.5 7B InstructQwen (Alibaba)$26.00
Gemma 3 27BGoogle$29.50
Gemma 4 31BGoogle$30.20
Doubao Pro 32KDoubao (ByteDance)$30.40
Hunyuan TurboSHunyuan (Tencent)$30.40
Qwen3 14BQwen (Alibaba)$31.20
GPT-4.1 NanoOpenAI$32.00
Gemini 2.5 Flash-LiteGoogle$32.00
Llama 4 Scout (Groq)Groq$32.20
Qwen3 VL 32B InstructQwen (Alibaba)$32.60
Qwen3 235B A22B Instruct 2507Qwen (Alibaba)$34.50
DeepSeek V4 Flash 0731DeepSeek$36.40
Qwen3.5-FlashQwen (Alibaba)$37.50
Qwen3 VL 8B InstructQwen (Alibaba)$37.50
Qwen3 30B A3BQwen (Alibaba)$39.00
Qwen3 VL 30B A3B InstructQwen (Alibaba)$41.60
Hunyuan T1Hunyuan (Tencent)$44.80
GPT-4o-miniOpenAI$48.00
GPT-OSS 120B (Groq)Groq$48.00
Qwen3 Coder NextQwen (Alibaba)$48.00
GLM 4.5 AirZhipu AI (GLM)$51.50
Qwen3 Next 80B A3B InstructQwen (Alibaba)$53.00
Qwen3.6 35B A3BQwen (Alibaba)$58.00
DeepSeek V3.2DeepSeek$63.40
Qwen3 Next 80B A3B ThinkingQwen (Alibaba)$66.00
Qwen3 Coder FlashQwen (Alibaba)$69.40
Qwen3.6 FlashQwen (Alibaba)$71.90
Qwen3.5-PlusQwen (Alibaba)$75.40
Qwen3 32B (Groq)Groq$75.70
GPT-5.6 LunaOpenAI$76.00
GPT-5.6 Luna ProOpenAI$76.00
GPT-5.4 NanoOpenAI$77.50
DeepSeek V3 0324DeepSeek$80.00
DeepSeek V3DeepSeek$82.90
DeepSeek V3.1 TerminusDeepSeek$84.00
Qwen2.5 72B InstructQwen (Alibaba)$84.00
Qwen3.5-27BQwen (Alibaba)$86.80
DeepSeek V3 (Mar 2025)DeepSeek$87.00
GLM 4.6VZhipu AI (GLM)$87.00
Qwen3.5-35B-A3BQwen (Alibaba)$87.50
Qwen3 Coder 480B A35BQwen (Alibaba)$90.00
Gemini 3.1 Flash-LiteGoogle$95.00
Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)Google$95.00
Qwen3.5 Plus 2026-02-15Qwen (Alibaba)$98.80
Qwen3 VL 235B A22B InstructQwen (Alibaba)$99.00
Qwen3 VL 8B ThinkingQwen (Alibaba)$99.00
Qwen3.7 PlusQwen (Alibaba)$102
GPT-5 MiniOpenAI$110
GPT-5.1-Codex-MiniOpenAI$110
Qwen3 VL 30B A3B ThinkingQwen (Alibaba)$112
Qwen3 30B A3B Thinking 2507Qwen (Alibaba)$112
Qwen3.5-122B-A10BQwen (Alibaba)$114
Qwen3 235B A22B Thinking 2507Qwen (Alibaba)$115
Qwen3.6 PlusQwen (Alibaba)$125
GPT-4.1 MiniOpenAI$128
Gemini 3.7 FlashGoogle$132
GLM 4.7Zhipu AI (GLM)$133
Gemini 2.5 FlashGoogle$135
Gemini 3.5 Flash LiteGoogle$135
Nano Banana (Gemini 2.5 Flash Image)Google$135
Llama 3.3 70B (Groq)Groq$142
Qwen3-MaxQwen (Alibaba)$145
DeepSeek V4 ProDeepSeek$151
DeepSeek V3.1DeepSeek$160
Qwen3.6 27BQwen (Alibaba)$160
GLM 4.6Zhipu AI (GLM)$160
Qwen2.5 Coder 32B InstructQwen (Alibaba)$162
Qwen3.8 27BQwen (Alibaba)$163
R1 0528DeepSeek$165
Doubao Seed 2.0 ProDoubao (ByteDance)$165
GLM 4.5VZhipu AI (GLM)$174
Kimi K2Kimi (Moonshot AI)$183
Kimi K2.5 (Together)Together AI$184
R1 Distill Llama 70BDeepSeek$184
GLM 4.5Zhipu AI (GLM)$186
Nano Banana 2 (Gemini 3.1 Flash Image)Google$190
Qwen2.5 VL 72B InstructQwen (Alibaba)$190
GPT Audio MiniOpenAI$192
Kimi K2 ThinkingKimi (Moonshot AI)$195
Kimi K2 0905Kimi (Moonshot AI)$195
Qwen3 VL 235B A22B ThinkingQwen (Alibaba)$200
Llama 3.3 70B (Together)Together AI$202
Qwen3.5 397B A17BQwen (Alibaba)$208
Kimi K2.5Kimi (Moonshot AI)$210
DeepSeek R1DeepSeek$215
Qwen3 Coder PlusQwen (Alibaba)$228
Qwen3.5 397B (Together)Together AI$228
Gemini 3.6 FlashGoogle$263
Qwen3 Max ThinkingQwen (Alibaba)$273
Claude 3.5 HaikuAnthropic$280
GPT-5.4 MiniOpenAI$285
GLM-5Zhipu AI (GLM)$296
Kimi K2.7 CodeKimi (Moonshot AI)$310
Kimi K2.6Kimi (Moonshot AI)$310
DeepSeek V4 Pro 0813DeepSeek$325
Claude Haiku 4.5★ recommendedAnthropic$350
o4-miniOpenAI$352
o3 MiniOpenAI$352
o4 Mini HighOpenAI$352
o3 Mini HighOpenAI$352
GLM-5-TurboZhipu AI (GLM)$360
GLM 5V TurboZhipu AI (GLM)$360
GLM-5.1Zhipu AI (GLM)$412
GLM 5.3Zhipu AI (GLM)$412
Qwen3.7 MaxQwen (Alibaba)$429
GPT-5OpenAI$550
GPT-5 CodexOpenAI$550
GPT-5.1-Codex-MaxOpenAI$550
GPT-5.1OpenAI$550
GPT-5.1-CodexOpenAI$550
Gemini 2.5 ProGoogle$550
Gemini 2.5 Pro Preview 05-06Google$550
Moonshot V1 (128K)Kimi (Moonshot AI)$550
DeepSeek V4 Pro (Together)Together AI$552
GPT-5 Image MiniOpenAI$560
Gemini 3.5 FlashGoogle$570
Qwen3.8 2.4T A95BQwen (Alibaba)$580
Qwen3.8 MaxQwen (Alibaba)$580
Kimi K2.7 Code HighSpeedKimi (Moonshot AI)$620
GPT-4.1OpenAI$640
o3OpenAI$640
o4 Mini Deep ResearchOpenAI$640
GPT-5.6 Sol ProOpenAI$700
Claude Sonnet 5Anthropic$700
GPT-5.6 TerraOpenAI$760
GPT-5.6 Terra ProOpenAI$760
Gemini 3.1 Pro PreviewGoogle$760
Nano Banana Pro (Gemini 3 Pro Image)Google$760
Gemini 3.1 Pro Preview Custom ToolsGoogle$760
GPT-5.3 ChatOpenAI$770
GPT-5.3-CodexOpenAI$770
GPT-5.2-CodexOpenAI$770
GPT-5.2 ChatOpenAI$770
GPT-5.2OpenAI$770
GPT-4oOpenAI$800
GPT AudioOpenAI$800
GPT-5.4OpenAI$950
Claude Sonnet 4.6Anthropic$1,050
Claude Sonnet 4.5Anthropic$1,050
Claude Sonnet 4Anthropic$1,050
Kimi K3Kimi (Moonshot AI)$1,050
Claude Opus 4.7Anthropic$1,750
Claude Opus 4.6Anthropic$1,750
Claude Opus 4.8Anthropic$1,750
Claude Opus 4.5Anthropic$1,750
Claude Opus 5Anthropic$1,750
GPT-5.6 SolOpenAI$1,900
GPT-5.5OpenAI$1,900
GPT-5.4 Image 2OpenAI$2,050
GPT-5 ImageOpenAI$2,300
GLM-5.2Zhipu AI (GLM)$2,440
o3 Deep ResearchOpenAI$3,200
Claude Opus 4.8 (Fast)Anthropic$3,500
Claude Opus 5 (Fast)Anthropic$3,500
Claude Fable 5Anthropic$3,500
o1OpenAI$4,800
Claude Opus 4.1Anthropic$5,250
Claude Opus 4Anthropic$5,250
o3 ProOpenAI$6,400
GPT-5 ProOpenAI$6,600
GPT-5.2 ProOpenAI$9,240
Claude Opus 4.7 (Fast)Anthropic$10,500
Claude Opus 4.6 (Fast)Anthropic$10,500
GPT-5.5 ProOpenAI$11,400
GPT-5.4 ProOpenAI$11,400
o1-proOpenAI$48,000

Frequently Asked Questions

Why are RAG pipeline token costs higher than regular chatbots?

RAG injects retrieved document chunks into every prompt. Each retrieval adds 500–2,000 tokens of context. A moderate RAG system serving 5,000 queries/day can consume 100–500M input tokens per month.

Which LLM is best for RAG pipelines?

Claude Haiku 4.5 ($1/1M input) and GPT-5.4 Nano ($0.20/1M) are popular choices. For RAG with very long context windows, Gemini 3.5 Flash ($1.50/1M) supports 1M tokens per request and has excellent price/performance. For budget-focused RAG, Gemini 2.5 Flash-Lite ($0.10/1M) is the cheapest option with 1M context.

Should I self-host the LLM for my RAG pipeline?

If your RAG pipeline consumes 500M+ tokens/month, a self-hosted A100 or two RTX 4090s may become cost-competitive. Use this calculator to find your break-even point.