Agentic AI Workflow LLM Cost Estimator
AI agents call LLMs multiple times per task — plan, execute, reflect, retry. Estimate monthly costs for multi-step agentic pipelines with tool use and long context.
Recommended Setup
Cost Comparison: All Cloud Models
Based on 400M input + 120M output tokens/month
| Model | Provider | Monthly cost |
|---|---|---|
| gpt-oss-20b | OpenAI | $27.60 |
| Qwen3.7 Flash | Qwen (Alibaba) | $27.60 |
| Llama 3.1 8B (Groq) | Groq | $29.60 |
| Gemma 3 4B | $32.00 | |
| gpt-oss-120b | OpenAI | $36.40 |
| Gemma 3 12B | $38.00 | |
| Gemma 3n 4B | $38.40 | |
| Qwen3 30B A3B Instruct 2507 | Qwen (Alibaba) | $42.80 |
| Doubao Seed 2.0 Mini | Doubao (ByteDance) | $46.80 |
| DeepSeek V4 Flash | DeepSeek | $56.40 |
| Qwen3.5-9B | Qwen (Alibaba) | $58.00 |
| Qwen3.5-Flash | Qwen (Alibaba) | $59.20 |
| Qwen3 Coder 30B A3B Instruct | Qwen (Alibaba) | $61.60 |
| Qwen2.5 7B Instruct | Qwen (Alibaba) | $64.00 |
| GPT-5 Nano | OpenAI | $68.00 |
| gpt-oss-safeguard-20b | OpenAI | $68.00 |
| Gemma 4 26B A4B | $68.80 | |
| GLM-4.7 Flash | Zhipu AI (GLM) | $72.00 |
| Qwen3 14B | Qwen (Alibaba) | $76.80 |
| Doubao Pro 32K | Doubao (ByteDance) | $77.60 |
| Hunyuan TurboS | Hunyuan (Tencent) | $77.60 |
| Gemma 4 31B | $80.80 | |
| Llama 4 Scout (Groq) | Groq | $84.80 |
| Gemma 3 27B | $86.00 | |
| GPT-4.1 Nano | OpenAI | $88.00 |
| Gemini 2.5 Flash-Lite | $88.00 | |
| DeepSeek V4 Flash 0731 | DeepSeek | $89.60 |
| Qwen3 VL 32B Instruct | Qwen (Alibaba) | $90.40 |
| Qwen3.5-Flash | Qwen (Alibaba) | $102 |
| Qwen3 VL 8B Instruct | Qwen (Alibaba) | $102 |
| Qwen3 235B A22B Instruct 2507 | Qwen (Alibaba) | $102 |
| Qwen3 30B A3B | Qwen (Alibaba) | $108 |
| Qwen3 VL 30B A3B Instruct | Qwen (Alibaba) | $114 |
| Hunyuan T1 | Hunyuan (Tencent) | $123 |
| GPT-4o-mini | OpenAI | $132 |
| GPT-OSS 120B (Groq) | Groq | $132 |
| Qwen3 Coder Next | Qwen (Alibaba) | $144 |
| DeepSeek V3.2 | DeepSeek | $150 |
| GLM 4.5 Air | Zhipu AI (GLM) | $154 |
| Qwen3 Next 80B A3B Instruct | Qwen (Alibaba) | $172 |
| Qwen3.6 35B A3B | Qwen (Alibaba) | $176 |
| Qwen3 32B (Groq) | Groq | $187 |
| Qwen2.5 72B Instruct | Qwen (Alibaba) | $192 |
| Qwen3 Coder Flash | Qwen (Alibaba) | $198 |
| Qwen3.5-Plus | Qwen (Alibaba) | $198 |
| Qwen3 Next 80B A3B Thinking | Qwen (Alibaba) | $204 |
| Qwen3.6 Flash | Qwen (Alibaba) | $212 |
| DeepSeek V3 0324 | DeepSeek | $220 |
| GPT-5.6 Luna | OpenAI | $224 |
| GPT-5.6 Luna Pro | OpenAI | $224 |
| DeepSeek V3 | DeepSeek | $228 |
| DeepSeek V3.1 Terminus | DeepSeek | $228 |
| GLM 4.6V | Zhipu AI (GLM) | $228 |
| GPT-5.4 Nano | OpenAI | $230 |
| DeepSeek V3 (Mar 2025) | DeepSeek | $240 |
| Qwen3 Coder 480B A35B | Qwen (Alibaba) | $240 |
| Qwen3.5-35B-A3B | Qwen (Alibaba) | $250 |
| Qwen3.5-27B | Qwen (Alibaba) | $267 |
| Gemini 3.1 Flash-Lite | $280 | |
| Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image) | $280 | |
| Qwen3.7 Plus | Qwen (Alibaba) | $282 |
| Qwen3.5 Plus 2026-02-15 | Qwen (Alibaba) | $291 |
| Qwen3 VL 235B A22B Instruct | Qwen (Alibaba) | $312 |
| Qwen3 VL 8B Thinking | Qwen (Alibaba) | $324 |
| Llama 3.3 70B (Groq) | Groq | $331 |
| GPT-5 Mini | OpenAI | $340 |
| GPT-5.1-Codex-Mini | OpenAI | $340 |
| GPT-4.1 Mini | OpenAI | $352 |
| Qwen3.5-122B-A10B | Qwen (Alibaba) | $354 |
| Qwen3.6 Plus | Qwen (Alibaba) | $366 |
| Qwen3 VL 30B A3B Thinking | Qwen (Alibaba) | $368 |
| Qwen3 30B A3B Thinking 2507 | Qwen (Alibaba) | $368 |
| Qwen3 235B A22B Thinking 2507 | Qwen (Alibaba) | $368 |
| GLM 4.7 | Zhipu AI (GLM) | $370 |
| DeepSeek V4 Pro | DeepSeek | $371 |
| Gemini 3.7 Flash | $378 | |
| Qwen2.5 Coder 32B Instruct | Qwen (Alibaba) | $384 |
| Qwen3-Max | Qwen (Alibaba) | $398 |
| R1 Distill Llama 70B | DeepSeek | $416 |
| DeepSeek V3.1 | DeepSeek | $418 |
| Gemini 2.5 Flash | $420 | |
| Gemini 3.5 Flash Lite | $420 | |
| Nano Banana (Gemini 2.5 Flash Image) | $420 | |
| Qwen2.5 VL 72B Instruct | Qwen (Alibaba) | $440 |
| GLM 4.6 | Zhipu AI (GLM) | $440 |
| GLM 4.5V | Zhipu AI (GLM) | $456 |
| Llama 3.3 70B (Together) | Together AI | $458 |
| R1 0528 | DeepSeek | $458 |
| Doubao Seed 2.0 Pro | Doubao (ByteDance) | $472 |
| Qwen3.8 27B | Qwen (Alibaba) | $478 |
| Kimi K2 | Kimi (Moonshot AI) | $504 |
| GLM 4.5 | Zhipu AI (GLM) | $504 |
| Qwen3.6 27B | Qwen (Alibaba) | $512 |
| GPT Audio Mini | OpenAI | $528 |
| Kimi K2.5 (Together) | Together AI | $536 |
| Kimi K2 Thinking | Kimi (Moonshot AI) | $540 |
| Kimi K2 0905 | Kimi (Moonshot AI) | $540 |
| Nano Banana 2 (Gemini 3.1 Flash Image) | $560 | |
| DeepSeek R1 | DeepSeek | $580 |
| Kimi K2.5 | Kimi (Moonshot AI) | $600 |
| Qwen3.5 397B A17B | Qwen (Alibaba) | $632 |
| Qwen3 VL 235B A22B Thinking | Qwen (Alibaba) | $640 |
| Qwen3 Coder Plus | Qwen (Alibaba) | $650 |
| Qwen3.5 397B (Together) | Together AI | $672 |
| Gemini 3.6 Flash | $750 | |
| Qwen3 Max Thinking | Qwen (Alibaba) | $780 |
| GLM-5 | Zhipu AI (GLM) | $784 |
| Claude 3.5 Haiku | Anthropic | $800 |
| GPT-5.4 Mini | OpenAI | $840 |
| DeepSeek V4 Pro 0813 | DeepSeek | $852 |
| Kimi K2.7 Code | Kimi (Moonshot AI) | $860 |
| Kimi K2.6 | Kimi (Moonshot AI) | $860 |
| GLM-5-Turbo | Zhipu AI (GLM) | $960 |
| GLM 5V Turbo | Zhipu AI (GLM) | $960 |
| o4-mini | OpenAI | $968 |
| o3 Mini | OpenAI | $968 |
| o4 Mini High | OpenAI | $968 |
| o3 Mini High | OpenAI | $968 |
| Claude Haiku 4.5 | Anthropic | $1,000 |
| GLM-5.1 | Zhipu AI (GLM) | $1,088 |
| GLM 5.3 | Zhipu AI (GLM) | $1,088 |
| Qwen3.7 Max | Qwen (Alibaba) | $1,124 |
| GPT-5 Image Mini | OpenAI | $1,240 |
| DeepSeek V4 Pro (Together) | Together AI | $1,368 |
| Moonshot V1 (128K) | Kimi (Moonshot AI) | $1,400 |
| Qwen3.8 2.4T A95B | Qwen (Alibaba) | $1,520 |
| Qwen3.8 Max | Qwen (Alibaba) | $1,520 |
| Gemini 3.5 Flash | $1,680 | |
| GPT-5 | OpenAI | $1,700 |
| GPT-5 Codex | OpenAI | $1,700 |
| GPT-5.1-Codex-Max | OpenAI | $1,700 |
| GPT-5.1 | OpenAI | $1,700 |
| GPT-5.1-Codex | OpenAI | $1,700 |
| Gemini 2.5 Pro | $1,700 | |
| Gemini 2.5 Pro Preview 05-06 | $1,700 | |
| Kimi K2.7 Code HighSpeed | Kimi (Moonshot AI) | $1,720 |
| GPT-4.1 | OpenAI | $1,760 |
| o3 | OpenAI | $1,760 |
| o4 Mini Deep Research | OpenAI | $1,760 |
| GPT-5.6 Sol Pro | OpenAI | $2,000 |
| Claude Sonnet 5 | Anthropic | $2,000 |
| GPT-4o | OpenAI | $2,200 |
| GPT Audio | OpenAI | $2,200 |
| GPT-5.6 Terra | OpenAI | $2,240 |
| GPT-5.6 Terra Pro | OpenAI | $2,240 |
| Gemini 3.1 Pro Preview | $2,240 | |
| Nano Banana Pro (Gemini 3 Pro Image) | $2,240 | |
| Gemini 3.1 Pro Preview Custom Tools | $2,240 | |
| GPT-5.3 Chat | OpenAI | $2,380 |
| GPT-5.3-Codex | OpenAI | $2,380 |
| GPT-5.2-Codex | OpenAI | $2,380 |
| GPT-5.2 Chat | OpenAI | $2,380 |
| GPT-5.2 | OpenAI | $2,380 |
| GPT-5.4 | OpenAI | $2,800 |
| Claude Sonnet 4.6★ recommended | Anthropic | $3,000 |
| Claude Sonnet 4.5 | Anthropic | $3,000 |
| Claude Sonnet 4 | Anthropic | $3,000 |
| Kimi K3 | Kimi (Moonshot AI) | $3,000 |
| GPT-5.4 Image 2 | OpenAI | $5,000 |
| Claude Opus 4.7 | Anthropic | $5,000 |
| Claude Opus 4.6 | Anthropic | $5,000 |
| Claude Opus 4.8 | Anthropic | $5,000 |
| Claude Opus 4.5 | Anthropic | $5,000 |
| Claude Opus 5 | Anthropic | $5,000 |
| GPT-5 Image | OpenAI | $5,200 |
| GPT-5.6 Sol | OpenAI | $5,600 |
| GPT-5.5 | OpenAI | $5,600 |
| GLM-5.2 | Zhipu AI (GLM) | $6,560 |
| o3 Deep Research | OpenAI | $8,800 |
| Claude Opus 4.8 (Fast) | Anthropic | $10,000 |
| Claude Opus 5 (Fast) | Anthropic | $10,000 |
| Claude Fable 5 | Anthropic | $10,000 |
| o1 | OpenAI | $13,200 |
| Claude Opus 4.1 | Anthropic | $15,000 |
| Claude Opus 4 | Anthropic | $15,000 |
| o3 Pro | OpenAI | $17,600 |
| GPT-5 Pro | OpenAI | $20,400 |
| GPT-5.2 Pro | OpenAI | $28,560 |
| Claude Opus 4.7 (Fast) | Anthropic | $30,000 |
| Claude Opus 4.6 (Fast) | Anthropic | $30,000 |
| GPT-5.5 Pro | OpenAI | $33,600 |
| GPT-5.4 Pro | OpenAI | $33,600 |
| o1-pro | OpenAI | $132,000 |
Frequently Asked Questions
Why are agentic workflows so much more expensive than single-shot LLM calls?
Each agent step re-sends the full conversation history plus tool outputs. A 5-step agent task with a 10k-token context uses 50k input tokens total — 5× more than a direct request. Multi-agent pipelines multiply this further. Budget 3–10× the tokens you'd expect from a single-turn interaction.
Which model is best for running AI agents?
Claude Sonnet 4.6 ($3/1M input) is the leading choice for agentic tasks — it reliably follows tool-use schemas and handles complex multi-step reasoning. Claude Opus 4.8 ($5/1M) is better for high-stakes agents where accuracy matters most. For cost-optimized agents with simpler tasks, GPT-5.4 Mini ($0.75/1M) is a strong mid-tier option.
How can I reduce costs for agentic AI workflows?
Key strategies: (1) limit context accumulation — prune tool outputs after each step; (2) use a small model for planning/routing and a large model only for execution; (3) cap retry loops with max_iterations; (4) cache repeated tool results with a key-value store. These cuts can reduce token use by 40–70%.