← Back to all pricing

Ministral 8B API Pricing: Symmetric Token Rates for Edge & Cloud

Examine Ministral 8B API pricing ($0.15/M input, $0.15/M output), symmetric token rates, edge on-device inference, and sub-second classification speed.

Full specs, context window and API limits →

How much does Ministral 8B cost per million tokens?

Ministral 8B costs $0.15 per million input tokens and $0.15 per million output tokens ($0.15/M blended at 3:1). Features unique symmetric pricing, 128K context, and ultra-compact edge deployment. Verified 2026-09-08.

Verified 2026-09-08 — source
Input
$0.15/M
Output
$0.15/M
Blended
$0.15/M
Provider
Verified 2026-08-14 — source

How much does Ministral 8B cost per 1,000 requests?

Computed from generated token pricing. Each row assumes the listed input and output tokens per request; output is adjusted by this model's measured 0.93× verbosity factor.

Request shapeInput tokensOutput tokensCost / 1,000 requests
Short10050$0.0220
Medium1,000500$0.2198
Long4,0002,000$0.8790

Formula: ((input price × input tokens) + (output price × output tokens × verbosity factor)) ÷ 1,000,000 × 1,000. Assumptions: short 100/50, medium 1,000/500, long 4,000/2,000 input/output tokens per request. Verbosity run: 2026-06-16T20:31:30.728Z.

Three model-specific pricing decisions

Ministral 8B is evaluated as an edge-class, high-volume API row. Hardware, energy, image units, cache, and batch remain user-supplied or unavailable.

1. Requests-per-month ladder for routing, tagging, and extraction

WorkloadInput / output100K requests1M requests10M requests
Routing200 / 30$3.45$34.50$345.00
Tagging500 / 80$8.70$87.00$870.00
Short extraction1,000 / 250$18.75$187.50$1875.00

Formula: requests × token shape × listed $/M. Output expansion is not silently added.

2. Equal-input-rate audit against Mistral Small

Fixed input / outputMinistral 8BMistral Small 3.1Narrow decision boundary
Routing · 200 / 30$3.45$4.8010% accepted-result uplift required
Extraction · 1,000 / 250$18.75$30.0015% accepted-result uplift required

Formula: requests × (input tokens × input $/M + output tokens × output $/M) ÷ 1,000,000. The uplift is a planning threshold, not a measured quality claim.

3. API price/latency versus edge-deployment inputs

OptionDated calculationInput ledgerBoundary
Ministral API$18.75158 tokens/sec; TTFT 210 ms; 5 measured samplesAPI cost is sourced
Edge deploymentUnavailableHardware, utilization, energy, image units, cache, batchCollect user inputs before comparing

Verified 2026-08-14. “Unavailable” means no compatible dated evidence was found; it is never treated as zero. First-party price source · Run this scenario.

All three decisions below are computed for Ministral 8B; fixed inputs, formulas, dated sources, speed sample state, and unavailable mechanics are visible.

Exact-model pricing guide · verified 2026-09-08

Exact model boundary: Mistral ministral-8b (slug ministral-8b). First-party provider pricing and API documentation remain fact owners.

Symmetric token pricing and high-volume spend matrix

Frozen scenario board. Formula / deterministic rule: monthly_spend = calls * ((in_tokens * 0.15 + out_tokens * 0.15) / 1M) Boundary: Owns Ministral 8B symmetric input/output token pricing calculations.

Frozen scenarioModel, identity, provider, and evidence fieldsResultState
100K compact classification queriesmodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=100K compact classification queries; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 100K compact classification queries is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
250K agent reasoning step checksmodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=250K agent reasoning step checks; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 250K agent reasoning step checks is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
1M high-volume IoT telemetry passesmodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=1M high-volume IoT telemetry passes; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 1M high-volume IoT telemetry passes is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
long-output code generation passmodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=long-output code generation pass; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — long-output code generation pass is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch processing queue (50% discount)model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=batch processing queue (50% discount); workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — batch processing queue (50% discount) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
unresolved billing currencymodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unresolved billing currency; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unresolved billing currency has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Mistral AI model pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.

Edge on-device versus managed cloud API latency audit

Frozen scenario board. Formula / deterministic rule: turnaround = ttft + (tokens_out / tps); edge provides zero network overhead Boundary: Owns on-device quantization and cloud API response time benchmarks.

Frozen scenarioModel, identity, provider, and evidence fieldsResultState
sub-50ms local edge classificationmodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=sub-50ms local edge classification; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — sub-50ms local edge classification is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
smart appliance embedded assistant (<100ms)model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=smart appliance embedded assistant (<100ms); environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — smart appliance embedded assistant (<100ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
cloud API call with network transit (<250ms)model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=cloud API call with network transit (<250ms); environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — cloud API call with network transit (<250ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
high-concurrency edge sensor streammodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=high-concurrency edge sensor stream; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — high-concurrency edge sensor stream is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
quantization accuracy degradation canarymodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=quantization accuracy degradation canary; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — quantization accuracy degradation canary is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
unsupported embedded runtimemodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unsupported embedded runtime; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unsupported embedded runtime has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Mistral AI documentation; verification date 2026-09-08. Missing or conflicting joins fail closed.

Local VRAM deployment break-even: RTX 4090 vs Cloud API

Frozen scenario board. Formula / deterministic rule: cloud_spend = monthly_tokens * 0.15 / 1M; hardware_cost = (gpu_depreciation + power) / mo Boundary: Owns local hardware capital expenditure vs managed cloud API consumption.

Frozen scenarioModel, identity, provider, and evidence fieldsResultState
low edge volume (<5M tokens/mo)model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=low edge volume (<5M tokens/mo); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — low edge volume (<5M tokens/mo) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
25M monthly tokens (cloud optimal)model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=25M monthly tokens (cloud optimal); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 25M monthly tokens (cloud optimal) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
100M tokens/month (hardware break-even)model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=100M tokens/month (hardware break-even); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 100M tokens/month (hardware break-even) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
500M high-volume saturation (local optimal)model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=500M high-volume saturation (local optimal); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 500M high-volume saturation (local optimal) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
unplanned hardware failure and downtimemodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unplanned hardware failure and downtime; monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unplanned hardware failure and downtime has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required
unresolved local electricity tariffmodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unresolved local electricity tariff; monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unresolved local electricity tariff has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Mistral AI model pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.

Method and limitations: formulas are deterministic; observed and assumed inputs are labeled; no missing provider, host, account, region, realm, alias, snapshot, revision, weight, artifact, control, tool, modality, workload, rate-period, timestamp, or result is transferred. Run this scenario →

Verified Model Pricing Intelligence•Audit date: 2026-09-08

Ministral 8B API Pricing: Symmetric Token Rates for Edge & Cloud

Ministral 8B costs $0.15 per million input tokens and $0.15 per million output tokens ($0.15/M blended at 3:1). Features unique symmetric pricing, 128K context, and ultra-compact edge deployment. Verified 2026-09-08.

Symmetric token pricing and high-volume spend matrix

Frozen scenario board. Formula / deterministic rule: monthly_spend = calls * ((in_tokens * 0.15 + out_tokens * 0.15) / 1M) Boundary: Owns Ministral 8B symmetric input/output token pricing calculations.

Frozen scenarioModel, identity, provider, and evidence fieldsResultState
100K compact classification queriesmodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=100K compact classification queries; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 100K compact classification queries is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
250K agent reasoning step checksmodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=250K agent reasoning step checks; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 250K agent reasoning step checks is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
1M high-volume IoT telemetry passesmodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=1M high-volume IoT telemetry passes; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 1M high-volume IoT telemetry passes is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
long-output code generation passmodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=long-output code generation pass; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — long-output code generation pass is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
batch processing queue (50% discount)model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=batch processing queue (50% discount); workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — batch processing queue (50% discount) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
unresolved billing currencymodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unresolved billing currency; workload; prompt tokens; completion tokens; input cost; output cost; monthly spend; efficiency verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unresolved billing currency has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Mistral AI model pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.

Edge on-device versus managed cloud API latency audit

Frozen scenario board. Formula / deterministic rule: turnaround = ttft + (tokens_out / tps); edge provides zero network overhead Boundary: Owns on-device quantization and cloud API response time benchmarks.

Frozen scenarioModel, identity, provider, and evidence fieldsResultState
sub-50ms local edge classificationmodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=sub-50ms local edge classification; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — sub-50ms local edge classification is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
smart appliance embedded assistant (<100ms)model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=smart appliance embedded assistant (<100ms); environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — smart appliance embedded assistant (<100ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
cloud API call with network transit (<250ms)model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=cloud API call with network transit (<250ms); environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — cloud API call with network transit (<250ms) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
high-concurrency edge sensor streammodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=high-concurrency edge sensor stream; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — high-concurrency edge sensor stream is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
quantization accuracy degradation canarymodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=quantization accuracy degradation canary; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — quantization accuracy degradation canary is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
unsupported embedded runtimemodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unsupported embedded runtime; environment; task; TTFT; generation speed; SLA compliance; deployment recommendation; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unsupported embedded runtime has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Mistral AI documentation; verification date 2026-09-08. Missing or conflicting joins fail closed.

Local VRAM deployment break-even: RTX 4090 vs Cloud API

Frozen scenario board. Formula / deterministic rule: cloud_spend = monthly_tokens * 0.15 / 1M; hardware_cost = (gpu_depreciation + power) / mo Boundary: Owns local hardware capital expenditure vs managed cloud API consumption.

Frozen scenarioModel, identity, provider, and evidence fieldsResultState
low edge volume (<5M tokens/mo)model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=low edge volume (<5M tokens/mo); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — low edge volume (<5M tokens/mo) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
25M monthly tokens (cloud optimal)model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=25M monthly tokens (cloud optimal); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 25M monthly tokens (cloud optimal) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
100M tokens/month (hardware break-even)model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=100M tokens/month (hardware break-even); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 100M tokens/month (hardware break-even) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
500M high-volume saturation (local optimal)model=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=500M high-volume saturation (local optimal); monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — 500M high-volume saturation (local optimal) is a frozen fixture pending exact identity, configuration, and denominator joins.UNTESTED — assumption cannot establish a verdict
unplanned hardware failure and downtimemodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unplanned hardware failure and downtime; monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unplanned hardware failure and downtime has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required
unresolved local electricity tariffmodel=ministral-8b; slug=ministral-8b; provider=Mistral; scenario=unresolved local electricity tariff; monthly token volume; cloud API spend; local RTX 4090 monthly TCO; financial break-even; deployment verdict; prompt/config/input/output/result/cache/checkpoint/artifact hashes=required; evidence=2026-09-08; measurement versus assumption=explicitUnavailable — unresolved local electricity tariff has no matched, dated bilateral observation.FAIL CLOSED — manual, probe, or source evidence required

First-party provenance: Mistral AI model pricing; verification date 2026-09-08. Missing or conflicting joins fail closed.

Exact-Model Pricing Evidence•Verified 2026-08-14; revalidation required before current claims.

Ministral 8B pricing evidence

Source-backed dated rate shape: dated input=$0.150000/M; output=$0.150000/M. Ministral 8B exact-model unit economics only; Mistral residency, local hardware guarantees, and cheapest rankings retain their owners. Missing evidence, failed revalidation, and unsupported mechanics render Unavailable.

Module 1 of 3: Tagging and routing volume ladder

Novel contribution boundary: Owns dated Ministral 8B arithmetic for fixed high-volume token shapes; edge latency and local deployment are not asserted. Formula / deterministic rule: spend = requests × (inputTokens × inputCostPer1k + outputTokens × outputCostPer1k) / 1,000

ScenarioExact model, provider, dated rates, and fixed inputsResultState
100K tagging requestsmodel=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=requests=100,000; inputTokens=300; outputTokens=80; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
1M routing requestsmodel=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=requests=1,000,000; inputTokens=600; outputTokens=120; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
10M compact extraction requestsmodel=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=requests=10,000,000; inputTokens=1,000; outputTokens=200; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee

First-party provenance: https://docs.mistral.ai/models/model-cards/ministral-3-8b-25-12; registry provider mistral; verified 2026-08-14; freshness gate=2026-09-14. Revalidate before any current-price claim.

Module 2 of 3: Ministral→Small output-cost boundary

Novel contribution boundary: Owns dated cross-model cost arithmetic with explicit retry input; accepted-result quality and edge/cloud routing are not sourced. Formula / deterministic rule: requiredAcceptedRate = SmallAttemptCost / MinistralAttemptCost; observed acceptance = Unavailable

ScenarioExact model, provider, dated rates, and fixed inputsResultState
300-token tag; 10% retry share; 100 retry-input tokensmodel=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=requests=1; inputTokens=300; outputTokens=80; retryInputTokens=100; retryShare=10%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
600-token route; 20% retry share; 250 retry-input tokensmodel=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=requests=1; inputTokens=600; outputTokens=120; retryInputTokens=250; retryShare=20%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
1K-token extraction; 30% retry share; 500 retry-input tokensmodel=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=requests=1; inputTokens=1,000; outputTokens=200; retryInputTokens=500; retryShare=30%; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee

First-party provenance: https://docs.mistral.ai/models/model-cards/ministral-3-8b-25-12; registry provider mistral; verified 2026-08-14; freshness gate=2026-09-14. Revalidate before any current-price claim.

Module 3 of 3: API-versus-edge evidence ledger

Novel contribution boundary: Owns exact-model Ministral registry evidence only; hardware, energy, cache, batch, and image behavior are not fabricated. Formula / deterministic rule: evidence = exact-model registry field when present; hardware, energy, cache, batch, and image inputs = Unavailable

ScenarioExact model, provider, dated rates, and fixed inputsResultState
Local hardware or VRAM requirementmodel=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=evidenceField=hardware; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
Cache or batch treatmentmodel=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=evidenceField=cache; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee
Image input unit or accountingmodel=ministral-8b; provider=mistral; registryRates=dated input=$0.150000/M; output=$0.150000/M; comparisonModel=mistral-small; fixedInputs=evidenceField=image-unit; FAIL CLOSED — no revalidated observation or provider guarantee; measurement versus assumption=explicitUnavailable — Last verified 2026-08-14, before revalidation date 2026-09-14.FAIL CLOSED — no revalidated observation or provider guarantee

First-party provenance: https://docs.mistral.ai/models/model-cards/ministral-3-8b-25-12; registry provider mistral; verified 2026-08-14; freshness gate=2026-09-14. Revalidate before any current-price claim.

Try Ministral 8B pricing analysis →

How fast is Ministral 8B?

Tokens / sec
158
TTFT
210 ms
Rank
#8 of 31
$ / M ÷ t/s
$0.0009
Measured with 5 runs on a fixed prompt — see the full methodology.

How much does Ministral 8B cost at scale?

Tokens / monthEst. cost (blended 3:1)
100,000$0.01
1,000,000$0.15
10,000,000$1.50
100,000,000$15.00

How does Ministral 8B compare with other models?

Mistral Small 3.1 — $0.26/MCodestral — $0.45/MMistral Large 3 — $0.75/MMistral Medium 3 — $3.00/MGPT-5 Nano — $0.14/MGPT-OSS 20B — $0.13/MMuse Spark 1.3 Contributor — $0.13/M
See all Mistral models →

What is Ministral 8B best for?

#7 for Writing & Content#8 for Coding#11 for Structured Data Extraction

What are common questions about Ministral 8B?

Is Ministral 8B cheaper than GPT-5 Nano?

Ministral 8B costs $0.15/M blended tokens, GPT-5 Nano costs $0.14/M — GPT-5 Nano is cheaper.

How much does 1 million tokens cost with Ministral 8B?

At a 3:1 input:output ratio, 1 million blended tokens costs approximately $0.15. Pure input costs $0.15/M; pure output costs $0.15/M.

What does Ministral 8B cost at high volume?

At 100 million blended tokens a month, Ministral 8B costs approximately $15.00. See the cost-at-scale table below for other volumes.

Try Ministral 8B for free

Run real prompts against Ministral 8B and every other model on this page in one workspace.

Try Ministral 8B Free