Ministral 8B API Pricing: Symmetric Token Rates for Edge & Cloud
Examine Ministral 8B API pricing ($0.15/M input, $0.15/M output), symmetric token rates, edge on-device inference, and sub-second classification speed.
Full specs, context window and API limits →How much does Ministral 8B cost per million tokens?
Ministral 8B costs $0.15 per million input tokens and $0.15 per million output tokens ($0.15/M blended at 3:1). Features unique symmetric pricing, 128K context, and ultra-compact edge deployment. Verified 2026-09-08.
How much does Ministral 8B cost per 1,000 requests?
Computed from generated token pricing. Each row assumes the listed input and output tokens per request; output is adjusted by this model's measured 0.93× verbosity factor.
| Request shape | Input tokens | Output tokens | Cost / 1,000 requests |
|---|---|---|---|
| Short | 100 | 50 | $0.0220 |
| Medium | 1,000 | 500 | $0.2198 |
| Long | 4,000 | 2,000 | $0.8790 |
Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Verbosity run: 2026-06-16T20:31:30.728Z.
Three model-specific pricing decisions
Ministral 8B is evaluated as an edge-class, high-volume API row. Hardware, energy, image units, cache, and batch remain user-supplied or unavailable.
1. Requests-per-month ladder for routing, tagging, and extraction
| Workload | Input / output | 100K requests | 1M requests | 10M requests |
|---|---|---|---|---|
| Routing | 200 / 30 | $3.45 | $34.50 | $345.00 |
| Tagging | 500 / 80 | $8.70 | $87.00 | $870.00 |
| Short extraction | 1,000 / 250 | $18.75 | $187.50 | $1875.00 |
Formula: requests × token shape × listed $/M. Output expansion is not silently added.
2. Equal-input-rate audit against Mistral Small
| Fixed input / output | Ministral 8B | Mistral Small 3.1 | Narrow decision boundary |
|---|---|---|---|
| Routing · 200 / 30 | $3.45 | $4.80 | 10% accepted-result uplift required |
| Extraction · 1,000 / 250 | $18.75 | $30.00 | 15% accepted-result uplift required |
Formula: requests × (input tokens × input $/M + output tokens × output $/M) ÷ 1,000,000. The uplift is a planning threshold, not a measured quality claim.
3. API price/latency versus edge-deployment inputs
| Option | Dated calculation | Input ledger | Boundary |
|---|---|---|---|
| Ministral API | $18.75 | 158 tokens/sec; TTFT 210 ms; 5 measured samples | API cost is sourced |
| Edge deployment | Unavailable | Hardware, utilization, energy, image units, cache, batch | Collect user inputs before comparing |
Verified 2026-08-14. “Unavailable” means no compatible dated evidence was found; it is never treated as zero. First-party price source · Run this scenario.
All three decisions below are computed for Ministral 8B; fixed inputs, formulas, dated sources, speed sample state, and unavailable mechanics are visible.
Exact-model pricing guide · verified 2026-09-08
Exact model boundary: Mistral ministral-8b (slug ministral-8b). First-party provider pricing and API documentation remain fact owners.
Symmetric token pricing and high-volume spend matrix
Frozen scenario board. Formula / deterministic rule: monthly_spend = calls * ((in_tokens * 0.15 + out_tokens * 0.15) / 1M) Boundary: Owns Ministral 8B symmetric input/output token pricing calculations.
| Frozen scenario | Model, identity, provider, and evidence fields | Result | State |
|---|---|---|---|
| 100K compact classification queries | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=100K compact classification queries; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 100K compact classification queries is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| 250K agent reasoning step checks | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=250K agent reasoning step checks; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 250K agent reasoning step checks is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| 1M high-volume IoT telemetry passes | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=1M high-volume IoT telemetry passes; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 1M high-volume IoT telemetry passes is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| long-output code generation pass | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=long-output code generation pass; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — long-output code generation pass is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| batch processing queue (50% discount) | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=batch processing queue (50% discount); workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — batch processing queue (50% discount) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| unresolved billing currency | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unresolved billing currency; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — unresolved billing currency has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
First-party provenance: Mistral AI model pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.
Edge on-device versus managed cloud API latency audit
Frozen scenario board. Formula / deterministic rule: turnaround = ttft + (tokens_out / tps); edge provides zero network overhead Boundary: Owns on-device quantization and cloud API response time benchmarks.
| Frozen scenario | Model, identity, provider, and evidence fields | Result | State |
|---|---|---|---|
| sub-50ms local edge classification | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=sub-50ms local edge classification; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — sub-50ms local edge classification is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| smart appliance embedded assistant (<100ms) | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=smart appliance embedded assistant (<100ms); environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — smart appliance embedded assistant (<100ms) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| cloud API call with network transit (<250ms) | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=cloud API call with network transit (<250ms); environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — cloud API call with network transit (<250ms) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| high-concurrency edge sensor stream | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=high-concurrency edge sensor stream; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — high-concurrency edge sensor stream is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| quantization accuracy degradation canary | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=quantization accuracy degradation canary; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — quantization accuracy degradation canary is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| unsupported embedded runtime | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unsupported embedded runtime; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — unsupported embedded runtime has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
First-party provenance: Mistral AI documentation; verification date 2026-09-08. Missing or conflicting joins fail closed.
Local VRAM deployment break-even: RTX 4090 vs Cloud API
Frozen scenario board. Formula / deterministic rule: cloud_spend = monthly_tokens * 0.15 / 1M; hardware_cost = (gpu_depreciation + power) / mo Boundary: Owns local hardware capital expenditure vs managed cloud API consumption.
| Frozen scenario | Model, identity, provider, and evidence fields | Result | State |
|---|---|---|---|
| low edge volume (<5M tokens/mo) | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=low edge volume (<5M tokens/mo); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — low edge volume (<5M tokens/mo) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| 25M monthly tokens (cloud optimal) | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=25M monthly tokens (cloud optimal); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 25M monthly tokens (cloud optimal) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| 100M tokens/month (hardware break-even) | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=100M tokens/month (hardware break-even); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 100M tokens/month (hardware break-even) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| 500M high-volume saturation (local optimal) | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=500M high-volume saturation (local optimal); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 500M high-volume saturation (local optimal) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| unplanned hardware failure and downtime | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unplanned hardware failure and downtime; monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — unplanned hardware failure and downtime has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
| unresolved local electricity tariff | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unresolved local electricity tariff; monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — unresolved local electricity tariff has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
First-party provenance: Mistral AI model pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.
Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run this scenario →
Ministral 8B API Pricing: Symmetric Token Rates for Edge & Cloud
Ministral 8B costs $0.15 per million input tokens and $0.15 per million output tokens ($0.15/M blended at 3:1). Features unique symmetric pricing, 128K context, and ultra-compact edge deployment. Verified 2026-09-08.
Symmetric token pricing and high-volume spend matrix
Frozen scenario board. Formula / deterministic rule: monthly_spend = calls * ((in_tokens * 0.15 + out_tokens * 0.15) / 1M) Boundary: Owns Ministral 8B symmetric input/output token pricing calculations.
| Frozen scenario | Model, identity, provider, and evidence fields | Result | State |
|---|---|---|---|
| 100K compact classification queries | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=100K compact classification queries; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 100K compact classification queries is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| 250K agent reasoning step checks | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=250K agent reasoning step checks; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 250K agent reasoning step checks is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| 1M high-volume IoT telemetry passes | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=1M high-volume IoT telemetry passes; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 1M high-volume IoT telemetry passes is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| long-output code generation pass | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=long-output code generation pass; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — long-output code generation pass is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| batch processing queue (50% discount) | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=batch processing queue (50% discount); workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — batch processing queue (50% discount) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| unresolved billing currency | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unresolved billing currency; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — unresolved billing currency has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
First-party provenance: Mistral AI model pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.
Edge on-device versus managed cloud API latency audit
Frozen scenario board. Formula / deterministic rule: turnaround = ttft + (tokens_out / tps); edge provides zero network overhead Boundary: Owns on-device quantization and cloud API response time benchmarks.
| Frozen scenario | Model, identity, provider, and evidence fields | Result | State |
|---|---|---|---|
| sub-50ms local edge classification | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=sub-50ms local edge classification; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — sub-50ms local edge classification is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| smart appliance embedded assistant (<100ms) | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=smart appliance embedded assistant (<100ms); environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — smart appliance embedded assistant (<100ms) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| cloud API call with network transit (<250ms) | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=cloud API call with network transit (<250ms); environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — cloud API call with network transit (<250ms) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| high-concurrency edge sensor stream | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=high-concurrency edge sensor stream; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — high-concurrency edge sensor stream is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| quantization accuracy degradation canary | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=quantization accuracy degradation canary; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — quantization accuracy degradation canary is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| unsupported embedded runtime | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unsupported embedded runtime; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — unsupported embedded runtime has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
First-party provenance: Mistral AI documentation; verification date 2026-09-08. Missing or conflicting joins fail closed.
Local VRAM deployment break-even: RTX 4090 vs Cloud API
Frozen scenario board. Formula / deterministic rule: cloud_spend = monthly_tokens * 0.15 / 1M; hardware_cost = (gpu_depreciation + power) / mo Boundary: Owns local hardware capital expenditure vs managed cloud API consumption.
| Frozen scenario | Model, identity, provider, and evidence fields | Result | State |
|---|---|---|---|
| low edge volume (<5M tokens/mo) | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=low edge volume (<5M tokens/mo); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — low edge volume (<5M tokens/mo) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| 25M monthly tokens (cloud optimal) | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=25M monthly tokens (cloud optimal); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 25M monthly tokens (cloud optimal) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| 100M tokens/month (hardware break-even) | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=100M tokens/month (hardware break-even); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 100M tokens/month (hardware break-even) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| 500M high-volume saturation (local optimal) | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=500M high-volume saturation (local optimal); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — 500M high-volume saturation (local optimal) is a frozen fixture pending exact identity, configuration, and denominator joins. | UNTESTED — assumption cannot establish a verdict |
| unplanned hardware failure and downtime | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unplanned hardware failure and downtime; monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — unplanned hardware failure and downtime has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
| unresolved local electricity tariff | model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unresolved local electricity tariff; monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicit | Unavailable — unresolved local electricity tariff has no matched, dated bilateral observation. | FAIL CLOSED — manual, probe, or source evidence required |
First-party provenance: Mistral AI model pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.
Ministral 8B pricing evidence
Source-backed dated rate shape: dated input=$0.150000/M; output=$0.150000/M. Ministral 8B exact-model unit economics only; Mistral residency, local hardware guarantees, and cheapest rankings retain their owners. Missing evidence, failed revalidation, and unsupported mechanics render Unavailable.
Module 1 of 3: Tagging and routing volume ladder
Novel contribution boundary: Owns dated Ministral 8B arithmetic for fixed high-volume token shapes; edge latency and local deployment are not asserted. Formula / deterministic rule: spend = requests × (inputTokens × inputCostPer1k + outputTokens × outputCostPer1k) / 1,000
| Scenario | Exact model, provider, dated rates, and fixed inputs | Result | State |
|---|---|---|---|
| 100K tagging requests | model=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=requests=100,000; inputTokens=300; outputTokens=80; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
| 1M routing requests | model=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=requests=1,000,000; inputTokens=600; outputTokens=120; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
| 10M compact extraction requests | model=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=requests=10,000,000; inputTokens=1,000; outputTokens=200; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
First-party provenance: https://docs.mistral.ai/models/model-cards/ministral-3-8b-25-12; registry provider mistral; verified 2026-08-14; freshness gate=2026-09-14. Revalidate before any current-price claim.
Module 2 of 3: Ministral→Small output-cost boundary
Novel contribution boundary: Owns dated cross-model cost arithmetic with explicit retry input; accepted-result quality and edge/cloud routing are not sourced. Formula / deterministic rule: requiredAcceptedRate = SmallAttemptCost / MinistralAttemptCost; observed acceptance = Unavailable
| Scenario | Exact model, provider, dated rates, and fixed inputs | Result | State |
|---|---|---|---|
| 300-token tag; 10% retry share; 100 retry-input tokens | model=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=requests=1; inputTokens=300; outputTokens=80; retryInputTokens=100; retryShare=10%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
| 600-token route; 20% retry share; 250 retry-input tokens | model=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=requests=1; inputTokens=600; outputTokens=120; retryInputTokens=250; retryShare=20%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
| 1K-token extraction; 30% retry share; 500 retry-input tokens | model=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=requests=1; inputTokens=1,000; outputTokens=200; retryInputTokens=500; retryShare=30%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
First-party provenance: https://docs.mistral.ai/models/model-cards/ministral-3-8b-25-12; registry provider mistral; verified 2026-08-14; freshness gate=2026-09-14. Revalidate before any current-price claim.
Module 3 of 3: API-versus-edge evidence ledger
Novel contribution boundary: Owns exact-model Ministral registry evidence only; hardware, energy, cache, batch, and image behavior are not fabricated. Formula / deterministic rule: evidence = exact-model registry field when present; hardware, energy, cache, batch, and image inputs = Unavailable
| Scenario | Exact model, provider, dated rates, and fixed inputs | Result | State |
|---|---|---|---|
| Local hardware or VRAM requirement | model=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=evidenceField=hardware; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
| Cache or batch treatment | model=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=evidenceField=cache; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
| Image input unit or accounting | model=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=evidenceField=image-unit; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicit | Unavailable — Last verified 2026-08-14, before revalidation date 2026-09-14. | FAIL CLOSED — no revalidated observation or provider guarantee |
First-party provenance: https://docs.mistral.ai/models/model-cards/ministral-3-8b-25-12; registry provider mistral; verified 2026-08-14; freshness gate=2026-09-14. Revalidate before any current-price claim.
How fast is Ministral 8B?
How much does Ministral 8B cost at scale?
| Tokens / month | Est. cost (blended 3:1) |
|---|---|
| 100,000 | $0.01 |
| 1,000,000 | $0.15 |
| 10,000,000 | $1.50 |
| 100,000,000 | $15.00 |
How does Ministral 8B compare with other models?
What is Ministral 8B best for?
What should you explore next for Ministral 8B?
What are common questions about Ministral 8B?
Is Ministral 8B cheaper than GPT-5 Nano?
Ministral 8B costs $0.15/M blended tokens, GPT-5 Nano costs $0.14/M — GPT-5 Nano is cheaper.
How much does 1 million tokens cost with Ministral 8B?
At a 3:1 input:output ratio, 1 million blended tokens costs approximately $0.15. Pure input costs $0.15/M; pure output costs $0.15/M.
What does Ministral 8B cost at high volume?
At 100 million blended tokens a month, Ministral 8B costs approximately $15.00. See the cost-at-scale table below for other volumes.
