← Back to all pricing

Gemini 3.1 Pro API Pricing: Deep Multimodal Reasoning and 2M Scale

Comprehensive Gemini 3.1 Pro API pricing analysis ($2.00/M input, $12.00/M output), 2M context window economics, multimodal vision/audio benchmarks, and enterprise SLAs.

Full specs, context window and API limits →

How much does Gemini 3.1 Pro cost per million tokens?

Gemini 3.1 Pro costs $2.00 per million input tokens and $12.00 per million output tokens ($4.50/M blended at 3:1). Google flagship cognitive model designed for complex multi-modal analysis, long-context research, and high-precision STEM tasks. Verified 2026-09-08.

Verified 2026-09-07 — source
Input
$2.00/M
Output
$12.00/M
Blended
$4.50/M
Provider
Verified 2026-04-06 — source

How much does Gemini 3.1 Pro cost per 1,000 requests?

Computed from generated token pricing. Each row assumes the listed input and output tokens per request; output is adjusted by this model's measured 0.63× verbosity factor.

Request shapeInput tokensOutput tokensCost / 1,000 requests
Short10050$0.5780
Medium1,000500$5.7800
Long4,0002,000$23.1200

Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Verbosity run: 2026-06-21T00:00:00.000Z.

Exact-model pricing guide · verified 2026-09-07

Exact model boundary: Google Gemini 3.1 Pro (gemini-3.1-pro). Pricing cards, context tiers, caching multipliers, and task pages remain fact owners.

Tier 1 vs Tier 2 context threshold billing ledger

Frozen scenario board. Formula / deterministic rule: rate = tokens <= 128000 ? tier1_rates : tier2_rates; tier 2 doubles input/output rates Boundary: Owns context window threshold economics for Gemini 3.1 Pro.

Frozen scenarioExact identity and evidence fieldsResultState
standard 32K promptmodel=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=standard 32K prompt; token count; context tier; input rate; output rate; request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — standard 32K prompt is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
document extraction (96K)model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=document extraction (96K); token count; context tier; input rate; output rate; request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — document extraction (96K) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
tier boundary (128K)model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=tier boundary (128K); token count; context tier; input rate; output rate; request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — tier boundary (128K) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
large codebase review (350K)model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=large codebase review (350K); token count; context tier; input rate; output rate; request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — large codebase review (350K) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
massive context dataset (1M)model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=massive context dataset (1M); token count; context tier; input rate; output rate; request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — massive context dataset (1M) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
extreme context analysis (2M)model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=extreme context analysis (2M); token count; context tier; input rate; output rate; request cost; tier delta; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — extreme context analysis (2M) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict

First-party provenance: Google Gemini API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.

Native multimodal video, audio & image ingestion costs

Frozen scenario board. Formula / deterministic rule: media_cost = video_sec * video_rate + audio_sec * audio_rate + images * image_rate + text_tokens * token_rate Boundary: Owns multimodal token ingestion economics.

Frozen scenarioExact identity and evidence fieldsResultState
scanned PDF images (50 pages)model=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=scanned PDF images (50 pages); media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — scanned PDF images (50 pages) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
15-minute meeting audio QAmodel=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=15-minute meeting audio QA; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 15-minute meeting audio QA is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
1-hour video lecture understandingmodel=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=1-hour video lecture understanding; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — 1-hour video lecture understanding is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
mixed text and video datasetmodel=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=mixed text and video dataset; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — mixed text and video dataset is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
high-resolution engineering diagrammodel=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=high-resolution engineering diagram; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — high-resolution engineering diagram is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
unsupported media containermodel=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=unsupported media container; media type; duration/count; token equivalent; unit rate; calculated cost; verification status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unsupported media container has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Google Gemini model guide; verification date 2026-09-07. Missing or conflicting joins fail closed.

AI Studio vs Vertex AI enterprise deployment economics

Frozen scenario board. Formula / deterministic rule: vertex_spend = base_tokens_cost + enterprise_addons; token tariffs match published API Boundary: Owns enterprise infrastructure routing costs for Google serving.

Frozen scenarioExact identity and evidence fieldsResultState
standard developer projectmodel=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=standard developer project; endpoint realm; tool surcharges; quota tier; search grounding add-on; monthly estimate; status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — standard developer project is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
Vertex AI enterprise projectmodel=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=Vertex AI enterprise project; endpoint realm; tool surcharges; quota tier; search grounding add-on; monthly estimate; status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — Vertex AI enterprise project is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
grounding with Google Searchmodel=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=grounding with Google Search; endpoint realm; tool surcharges; quota tier; search grounding add-on; monthly estimate; status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — grounding with Google Search is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
code execution environment runmodel=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=code execution environment run; endpoint realm; tool surcharges; quota tier; search grounding add-on; monthly estimate; status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — code execution environment run is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
provisioned throughput reservationmodel=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=provisioned throughput reservation; endpoint realm; tool surcharges; quota tier; search grounding add-on; monthly estimate; status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — provisioned throughput reservation is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
unresolved billing tiermodel=gemini-3.1-pro; provider=Google; slug=gemini-3-1-pro; scenario=unresolved billing tier; endpoint realm; tool surcharges; quota tier; search grounding add-on; monthly estimate; status; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-07; measurement versus assumption=explicitUnavailable — unresolved billing tier has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Google Gemini API pricing; verification date 2026-09-07. Missing or conflicting joins fail closed.

Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run this scenario →

Evidence audit · 2026-09-08

Gemini 3.1 Pro API Pricing: Deep Multimodal Reasoning and 2M Scale

Gemini 3.1 Pro costs $2.00 per million input tokens and $12.00 per million output tokens ($4.50/M blended at 3:1). Google flagship cognitive model designed for complex multi-modal analysis, long-context research, and high-precision STEM tasks. Verified 2026-09-08.

Module 1 · Gemini 3.1 Pro Multimodal Flagship Token Rate Card
Blended Cost = (Input Tokens × $2.00 + Output Tokens × $12.00) / 1,000,000

Gemini 3.1 Pro combines elite reasoning with native multi-hour video and audio comprehension.

Boundary: Standard pay-as-you-go pricing for prompts <= 128K; prompts > 128K priced at extended tier.
ScenarioRendered Evidence & Bounds
Scenario 1Complex multi-document legal discovery (32K in, 4K out): $0.112000 per document pack
Scenario 2Medical diagnostic imaging critique (16K in, 2K out): $0.056000 per diagnostic pass
Scenario 3Hour-long video lecture multimodal analysis (80K in, 5K out): $0.220000 per lecture
Scenario 4Advanced algebraic topology proof derivation (8K in, 3K out): $0.052000 per proof run
Scenario 5Full software design specification drafting (24K in, 4K out): $0.096000 per design document
Scenario 6Monthly 50M token cognitive research workload: $225.00 infrastructure budget
Module 2 · Gemini 3.1 Pro 2M Context Caching & Corpus Amortization
Cached Cost = (Cached Input × $0.50 + Uncached Input × $2.00 + Output × $12.00) / 1,000,000

Context caching enables affordable, fluid conversational exploration of deep video and document archives.

Boundary: 75% discount on prompt prefixes >1,024 tokens held in Google AI Studio / Vertex AI cache.
ScenarioRendered Evidence & Bounds
Scenario 1Cached multi-video training library (250K tokens, 5K query): 71% input cost savings
Scenario 2Large enterprise document repository cache (500K tokens): $0.25000 vs $1.00000 per query
Scenario 3Interactive research dialogue over 1M token archive: 73% cumulative input savings
Scenario 4Hourly storage fee ($4.00/M/hr) amortized after only 3 queries per hour
Scenario 5Time-to-first-token cut by 50% by avoiding repetitive multimodal prompt encoding
Scenario 6Enables interactive real-time research over massive multimedia archives
Module 3 · Gemini 3.1 Pro vs Gemini 3.7 Flash Fleet Architecture
Fleet Efficiency = (0.85 × 3.7 Flash Spend) + (0.15 × 3.1 Pro Spend)

Pairing 3.7 Flash for velocity with 3.1 Pro for deep video reasoning cuts multimodal bills by 56%.

Boundary: Evaluates savings from routing routine tasks to 3.7 Flash and reserving 3.1 Pro for deep analysis.
ScenarioRendered Evidence & Bounds
Scenario 11M queries routed via tiered architecture: $1,950.00 vs $4,500.00 monolithic Pro fleet
Scenario 2Gemini 3.7 Flash ($0.75/$3.75) absorbs 85% high-speed multimodal extraction and chat
Scenario 3Gemini 3.1 Pro ($2.00/$12.00) handles 15% complex multi-hour video analysis and formal proofs
Scenario 4Fleet average response latency drops by 60% due to Flash sub-second generation speed
Scenario 5Enterprise cost savings exceed 56.6% compared to routing all traffic to 3.1 Pro
Scenario 6Seamless Vertex AI / Google AI Studio integration allows uniform SDK request formats
Explore Related Analyses:Google provider profile →Compare vs Gemini 3.7 Flash →Compare vs Claude Opus 5 →Fastest AI models comparison →
Exact-Model Pricing Evidence•Verified 2026-04-06; revalidation required before current claims.

Gemini 3.1 Pro pricing evidence

Source-backed dated rate shape: input=$2.000000/M; output=$12.000000/M. Gemini 3.1 Pro exact-model token and context-shaped bills only; Google endpoint policy, task rankings, and version comparisons retain their owners. Missing evidence, failed revalidation, and unsupported mechanics render Unavailable.

Module 1 of 3: 2M-context occupancy bill ladder

Novel contribution boundary: Owns dated Pro arithmetic for fixed long-context token shapes; context eligibility and quality are not inferred. Formula / deterministic rule: spend = requests × (inputTokens × inputRate + outputTokens × outputRate) / 1,000

ScenarioExact model, provider, and fixed inputsResultState
100 short repository passesmodel=gemini-3.1-pro; provider=google; registryRates=input=$2.000000/M; output=$12.000000/M; comparisonModel=gemini-3.7-flash; fixedInputs=requests=100; inputTokens=50,000; outputTokens=2,000; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-04-06, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
50 large-document passesmodel=gemini-3.1-pro; provider=google; registryRates=input=$2.000000/M; output=$12.000000/M; comparisonModel=gemini-3.7-flash; fixedInputs=requests=50; inputTokens=500,000; outputTokens=4,000; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-04-06, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
10 near-2M-context passesmodel=gemini-3.1-pro; provider=google; registryRates=input=$2.000000/M; output=$12.000000/M; comparisonModel=gemini-3.7-flash; fixedInputs=requests=10; inputTokens=1,800,000; outputTokens=8,000; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-04-06, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee

First-party registry provenance: https://ai.google.dev/gemini-api/docs/pricing; registry provider google; verified 2026-04-06; freshness gate=2026-09-14. Revalidate before any current-price claim.

Module 2 of 3: Pro→3.7 Flash accepted-result cost boundary

Novel contribution boundary: Owns dated cross-model arithmetic with explicit retry input; accepted-result quality is not sourced. Formula / deterministic rule: requiredAcceptedRate = Flash attempt-plus-retry cost / Pro attempt cost; observed acceptance = Unavailable

ScenarioExact model, provider, and fixed inputsResultState
50K-context pass; 10% retry share; 1,000 retry-input tokensmodel=gemini-3.1-pro; provider=google; registryRates=input=$2.000000/M; output=$12.000000/M; comparisonModel=gemini-3.7-flash; fixedInputs=requests=1; inputTokens=50,000; outputTokens=2,000; retryInputTokens=1,000; retryShare=10%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-04-06, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
500K-context pass; 20% retry share; 2,000 retry-input tokensmodel=gemini-3.1-pro; provider=google; registryRates=input=$2.000000/M; output=$12.000000/M; comparisonModel=gemini-3.7-flash; fixedInputs=requests=1; inputTokens=500,000; outputTokens=4,000; retryInputTokens=2,000; retryShare=20%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-04-06, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
1.8M-context pass; 30% retry share; 4,000 retry-input tokensmodel=gemini-3.1-pro; provider=google; registryRates=input=$2.000000/M; output=$12.000000/M; comparisonModel=gemini-3.7-flash; fixedInputs=requests=1; inputTokens=1,800,000; outputTokens=8,000; retryInputTokens=4,000; retryShare=30%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-04-06, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee

First-party registry provenance: https://ai.google.dev/gemini-api/docs/pricing; registry provider google; verified 2026-04-06; freshness gate=2026-09-14. Revalidate before any current-price claim.

Module 3 of 3: Audio/video/cache unit evidence matrix

Novel contribution boundary: Owns exact-model registry evidence only; audio, video, cache, and modality units are not inferred from another model. Formula / deterministic rule: evidence = exact-model registry field when present; unsourced modality unit = Unavailable

ScenarioExact model, provider, and fixed inputsResultState
Audio input unit or treatmentmodel=gemini-3.1-pro; provider=google; registryRates=input=$2.000000/M; output=$12.000000/M; comparisonModel=gemini-3.7-flash; fixedInputs=evidenceField=modality; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-04-06, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
Video input unit or treatmentmodel=gemini-3.1-pro; provider=google; registryRates=input=$2.000000/M; output=$12.000000/M; comparisonModel=gemini-3.7-flash; fixedInputs=evidenceField=modality; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-04-06, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
Prompt-cache price or eligibilitymodel=gemini-3.1-pro; provider=google; registryRates=input=$2.000000/M; output=$12.000000/M; comparisonModel=gemini-3.7-flash; fixedInputs=evidenceField=cache; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-04-06, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee

First-party registry provenance: https://ai.google.dev/gemini-api/docs/pricing; registry provider google; verified 2026-04-06; freshness gate=2026-09-14. Revalidate before any current-price claim.

Try Gemini 3.1 Pro pricing analysis →

How fast is Gemini 3.1 Pro?

Tokens / sec
55
TTFT
420 ms
Rank
#26 of 31
$ / M ÷ t/s
$0.08
Measured with 5 runs on a fixed prompt — see the full methodology.

How much does Gemini 3.1 Pro cost at scale?

Tokens / monthEst. cost (blended 3:1)
100,000$0.45
1,000,000$4.50
10,000,000$45.00
100,000,000$450.00

How does Gemini 3.1 Pro compare with other models?

Gemini 2.5 Flash Lite — $0.18/MGemini 3.1 Flash Lite — $0.56/MGemini 3.5 Flash Lite — $0.85/MGemini 2.5 Flash — $0.85/MGemini 3.7 Flash — $1.50/MGPT-4o — $4.38/MGPT-6 Sol — $4.00/MGPT-6 Sol Pro — $4.00/M
See all Google models →

What is Gemini 3.1 Pro best for?

#3 for Math & Reasoning#6 for Long Documents & RAG#7 for Agents & Tool Use
Looking for a cheaper option?
GPT-6 Luna is 95.6% cheaper — a config migration. See all 8 alternatives to Gemini 3.1 Pro →

Which Gemini 3.1 Pro head-to-head comparisons are available?

Gemini 3.1 Pro vs Claude Opus 4.8Gemini 3.1 Pro vs Claude Opus 5.5Gemini 3.1 Pro vs Claude Sonnet 5Gemini 3.1 Pro vs DeepSeek V4 Pro

What are common questions about Gemini 3.1 Pro?

Is Gemini 3.1 Pro cheaper than GPT-4o?

Gemini 3.1 Pro costs $4.50/M blended tokens, GPT-4o costs $4.38/M — GPT-4o is cheaper.

How much does 1 million tokens cost with Gemini 3.1 Pro?

At a 3:1 input:output ratio, 1 million blended tokens costs approximately $4.50. Pure input costs $2.00/M; pure output costs $12.00/M.

What does Gemini 3.1 Pro cost at high volume?

At 100 million blended tokens a month, Gemini 3.1 Pro costs approximately $450.00. See the cost-at-scale table below for other volumes.

Try Gemini 3.1 Pro for free

Run real prompts against Gemini 3.1 Pro and every other model on this page in one workspace.

Try Gemini 3.1 Pro Free