LLM Cost Calculator

Document Summarization LLM Cost Estimator

How much does it cost to summarize legal contracts, research papers, or support tickets at scale? This calculator breaks down API costs for long-document summarization pipelines.

Recommended Setup

Model
Claude Haiku 4.5
Anthropic
Monthly tokens
220M
200M in / 20M out
Estimated monthly cost
$300

Cost Comparison: All Cloud Models

Based on 200M input + 20M output tokens/month

ModelProviderMonthly cost
gpt-oss-20bOpenAI$8.60
Qwen3.7 FlashQwen (Alibaba)$8.60
gpt-oss-120bOpenAI$11.40
Llama 3.1 8B (Groq)Groq$11.60
Doubao Seed 2.0 MiniDoubao (ByteDance)$11.80
Gemma 3 4BGoogle$12.00
Gemma 3 12BGoogle$13.00
Qwen3 30B A3B Instruct 2507Qwen (Alibaba)$13.80
Gemma 3n 4BGoogle$14.40
GPT-5 NanoOpenAI$18.00
Qwen3.5-FlashQwen (Alibaba)$19.20
Qwen3 Coder 30B A3B InstructQwen (Alibaba)$19.60
GLM-4.7 FlashZhipu AI (GLM)$20.00
Gemma 4 26B A4B Google$20.80
DeepSeek V4 FlashDeepSeek$21.40
gpt-oss-safeguard-20bOpenAI$22.00
Qwen3.5-9BQwen (Alibaba)$23.00
Qwen2.5 7B InstructQwen (Alibaba)$24.00
Gemma 3 27BGoogle$25.00
Gemma 4 31BGoogle$26.80
Doubao Pro 32KDoubao (ByteDance)$27.60
Hunyuan TurboSHunyuan (Tencent)$27.60
GPT-4.1 NanoOpenAI$28.00
Gemini 2.5 Flash-LiteGoogle$28.00
Qwen3 VL 32B InstructQwen (Alibaba)$28.40
Llama 4 Scout (Groq)Groq$28.80
Qwen3 14BQwen (Alibaba)$28.80
Qwen3 235B A22B Instruct 2507Qwen (Alibaba)$29.00
Qwen3.5-FlashQwen (Alibaba)$33.00
Qwen3 VL 8B InstructQwen (Alibaba)$33.00
DeepSeek V4 Flash 0731DeepSeek$33.60
Qwen3 30B A3BQwen (Alibaba)$34.00
Qwen3 VL 30B A3B InstructQwen (Alibaba)$36.40
Hunyuan T1Hunyuan (Tencent)$39.20
Qwen3 Coder NextQwen (Alibaba)$40.00
GPT-4o-miniOpenAI$42.00
GPT-OSS 120B (Groq)Groq$42.00
Qwen3 Next 80B A3B InstructQwen (Alibaba)$42.00
GLM 4.5 AirZhipu AI (GLM)$43.00
Qwen3.6 35B A3BQwen (Alibaba)$48.00
Qwen3 Next 80B A3B ThinkingQwen (Alibaba)$54.00
DeepSeek V3.2DeepSeek$59.60
Qwen3 Coder FlashQwen (Alibaba)$59.60
Qwen3.6 FlashQwen (Alibaba)$60.60
GPT-5.6 LunaOpenAI$64.00
GPT-5.6 Luna ProOpenAI$64.00
GPT-5.4 NanoOpenAI$65.00
Qwen3.5-PlusQwen (Alibaba)$67.60
Qwen3 32B (Groq)Groq$69.80
DeepSeek V3 0324DeepSeek$70.00
Qwen3.5-27BQwen (Alibaba)$71.20
DeepSeek V3DeepSeek$72.60
DeepSeek V3.1 TerminusDeepSeek$74.00
Qwen3.5-35B-A3BQwen (Alibaba)$75.00
DeepSeek V3 (Mar 2025)DeepSeek$76.00
Qwen3 VL 8B ThinkingQwen (Alibaba)$78.00
GLM 4.6VZhipu AI (GLM)$78.00
Gemini 3.1 Flash-LiteGoogle$80.00
Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)Google$80.00
Qwen3 VL 235B A22B InstructQwen (Alibaba)$80.00
Qwen3 Coder 480B A35BQwen (Alibaba)$80.00
Qwen2.5 72B InstructQwen (Alibaba)$80.00
Qwen3.5 Plus 2026-02-15Qwen (Alibaba)$83.20
Qwen3 VL 30B A3B ThinkingQwen (Alibaba)$88.00
Qwen3 30B A3B Thinking 2507Qwen (Alibaba)$88.00
Qwen3.7 PlusQwen (Alibaba)$89.60
GPT-5 MiniOpenAI$90.00
GPT-5.1-Codex-MiniOpenAI$90.00
Qwen3 235B A22B Thinking 2507Qwen (Alibaba)$92.00
Qwen3.5-122B-A10BQwen (Alibaba)$93.60
Qwen3.6 PlusQwen (Alibaba)$105
Gemini 2.5 FlashGoogle$110
Gemini 3.5 Flash LiteGoogle$110
Nano Banana (Gemini 2.5 Flash Image)Google$110
GPT-4.1 MiniOpenAI$112
Gemini 3.7 FlashGoogle$114
GLM 4.7Zhipu AI (GLM)$115
Qwen3-MaxQwen (Alibaba)$126
Qwen3.6 27BQwen (Alibaba)$128
Llama 3.3 70B (Groq)Groq$134
Qwen3.8 27BQwen (Alibaba)$137
DeepSeek V4 ProDeepSeek$139
GLM 4.6Zhipu AI (GLM)$140
Doubao Seed 2.0 ProDoubao (ByteDance)$141
DeepSeek V3.1DeepSeek$143
R1 0528DeepSeek$143
Qwen2.5 Coder 32B InstructQwen (Alibaba)$152
Kimi K2.5 (Together)Together AI$156
GLM 4.5VZhipu AI (GLM)$156
Nano Banana 2 (Gemini 3.1 Flash Image)Google$160
Qwen3 VL 235B A22B ThinkingQwen (Alibaba)$160
Kimi K2Kimi (Moonshot AI)$160
GLM 4.5Zhipu AI (GLM)$164
GPT Audio MiniOpenAI$168
Kimi K2 ThinkingKimi (Moonshot AI)$170
Kimi K2 0905Kimi (Moonshot AI)$170
Qwen3.5 397B A17BQwen (Alibaba)$172
R1 Distill Llama 70BDeepSeek$176
Qwen2.5 VL 72B InstructQwen (Alibaba)$180
Kimi K2.5Kimi (Moonshot AI)$180
DeepSeek R1DeepSeek$190
Qwen3.5 397B (Together)Together AI$192
Llama 3.3 70B (Together)Together AI$194
Qwen3 Coder PlusQwen (Alibaba)$195
Gemini 3.6 FlashGoogle$225
Qwen3 Max ThinkingQwen (Alibaba)$234
GPT-5.4 MiniOpenAI$240
Claude 3.5 HaikuAnthropic$240
GLM-5Zhipu AI (GLM)$264
Kimi K2.7 CodeKimi (Moonshot AI)$270
Kimi K2.6Kimi (Moonshot AI)$270
DeepSeek V4 Pro 0813DeepSeek$291
Claude Haiku 4.5★ recommendedAnthropic$300
o4-miniOpenAI$308
o3 MiniOpenAI$308
o4 Mini HighOpenAI$308
o3 Mini HighOpenAI$308
GLM-5-TurboZhipu AI (GLM)$320
GLM 5V TurboZhipu AI (GLM)$320
GLM-5.1Zhipu AI (GLM)$368
GLM 5.3Zhipu AI (GLM)$368
Qwen3.7 MaxQwen (Alibaba)$385
GPT-5OpenAI$450
GPT-5 CodexOpenAI$450
GPT-5.1-Codex-MaxOpenAI$450
GPT-5.1OpenAI$450
GPT-5.1-CodexOpenAI$450
Gemini 2.5 ProGoogle$450
Gemini 2.5 Pro Preview 05-06Google$450
Gemini 3.5 FlashGoogle$480
Moonshot V1 (128K)Kimi (Moonshot AI)$500
DeepSeek V4 Pro (Together)Together AI$508
Qwen3.8 2.4T A95BQwen (Alibaba)$520
Qwen3.8 MaxQwen (Alibaba)$520
GPT-5 Image MiniOpenAI$540
Kimi K2.7 Code HighSpeedKimi (Moonshot AI)$540
GPT-4.1OpenAI$560
o3OpenAI$560
o4 Mini Deep ResearchOpenAI$560
GPT-5.6 Sol ProOpenAI$600
Claude Sonnet 5Anthropic$600
GPT-5.3 ChatOpenAI$630
GPT-5.3-CodexOpenAI$630
GPT-5.2-CodexOpenAI$630
GPT-5.2 ChatOpenAI$630
GPT-5.2OpenAI$630
GPT-5.6 TerraOpenAI$640
GPT-5.6 Terra ProOpenAI$640
Gemini 3.1 Pro PreviewGoogle$640
Nano Banana Pro (Gemini 3 Pro Image)Google$640
Gemini 3.1 Pro Preview Custom ToolsGoogle$640
GPT-4oOpenAI$700
GPT AudioOpenAI$700
GPT-5.4OpenAI$800
Claude Sonnet 4.6Anthropic$900
Claude Sonnet 4.5Anthropic$900
Claude Sonnet 4Anthropic$900
Kimi K3Kimi (Moonshot AI)$900
Claude Opus 4.7Anthropic$1,500
Claude Opus 4.6Anthropic$1,500
Claude Opus 4.8Anthropic$1,500
Claude Opus 4.5Anthropic$1,500
Claude Opus 5Anthropic$1,500
GPT-5.6 SolOpenAI$1,600
GPT-5.5OpenAI$1,600
GPT-5.4 Image 2OpenAI$1,900
GLM-5.2Zhipu AI (GLM)$2,160
GPT-5 ImageOpenAI$2,200
o3 Deep ResearchOpenAI$2,800
Claude Opus 4.8 (Fast)Anthropic$3,000
Claude Opus 5 (Fast)Anthropic$3,000
Claude Fable 5Anthropic$3,000
o1OpenAI$4,200
Claude Opus 4.1Anthropic$4,500
Claude Opus 4Anthropic$4,500
GPT-5 ProOpenAI$5,400
o3 ProOpenAI$5,600
GPT-5.2 ProOpenAI$7,560
Claude Opus 4.7 (Fast)Anthropic$9,000
Claude Opus 4.6 (Fast)Anthropic$9,000
GPT-5.5 ProOpenAI$9,600
GPT-5.4 ProOpenAI$9,600
o1-proOpenAI$42,000

Frequently Asked Questions

How many tokens does a typical document summarization job use?

A 10-page PDF averages 4,000–8,000 input tokens. A 1-page summary output is ~300–600 tokens. Summarizing 10,000 documents/month = 40–80M input tokens and 3–6M output tokens. Long legal contracts or research papers can hit 50,000+ input tokens per document.

Which model handles long documents best?

For very long documents (50k–200k tokens), Gemini 3.5 Flash (1M context, $1.50/1M) or Claude models with 200k context windows are ideal. For medium-length documents (under 32k tokens), Claude Haiku 4.5 ($1/1M) gives excellent quality at low cost. For maximum context, Gemini models support 1M tokens per request.

Is summarization a good use case for a local LLM?

Yes — summarization is a quality-tolerant batch task. Llama 3 70B or Mistral Large run locally on 2× RTX 4090s and produce high-quality summaries. At 200M tokens/month, that's roughly $200–400 in cloud API costs vs ~$100–150 amortized GPU cost at that scale.