Gemini 2.5 Flash
Not tested yet
No published category-wide ranking is available for this model.
Entries 1-12 of 57. Page 1 of 5.
Each chart compares models in the same documented test and highlights the current model.
Consistency
What this benchmark measures: Reliability evaluation on 165 GAIA tasks with repetitions and perturbations.
Context: Accuracy, reliability, consistency, predictability, robustness, and safety are separate metrics.
Scale: 0 rating - 0.81 rating
Accuracy
What this benchmark measures: Reliability evaluation on 165 GAIA tasks with repetitions and perturbations.
Context: Accuracy, reliability, consistency, predictability, robustness, and safety are separate metrics.
Scale: 0% - 100%
Predictability
What this benchmark measures: Reliability evaluation on 165 GAIA tasks with repetitions and perturbations.
Context: Accuracy, reliability, consistency, predictability, robustness, and safety are separate metrics.
Scale: 0 rating - 0.84 rating
Reliability
What this benchmark measures: Reliability evaluation on 165 GAIA tasks with repetitions and perturbations.
Context: Accuracy, reliability, consistency, predictability, robustness, and safety are separate metrics.
Scale: 0 rating - 0.85 rating
Robustness
What this benchmark measures: Reliability evaluation on 165 GAIA tasks with repetitions and perturbations.
Context: Accuracy, reliability, consistency, predictability, robustness, and safety are separate metrics.
Scale: 0 rating - 1 rating
Safety
What this benchmark measures: Reliability evaluation on 165 GAIA tasks with repetitions and perturbations.
Context: Accuracy, reliability, consistency, predictability, robustness, and safety are separate metrics.
Scale: 0 rating - 1 rating
Consistency
What this benchmark measures: 26 cleaned customer-service tasks involving dialogue, policy compliance, and mutating backend tools.
Context: The cleaned subset removes 24 broken or ambiguous tasks. Accuracy and reliability dimensions measure different properties.
Scale: 0 rating - 0.88 rating
Accuracy
What this benchmark measures: 26 cleaned customer-service tasks involving dialogue, policy compliance, and mutating backend tools.
Context: The cleaned subset removes 24 broken or ambiguous tasks. Accuracy and reliability dimensions measure different properties.
Scale: 0% - 100%
Predictability
What this benchmark measures: 26 cleaned customer-service tasks involving dialogue, policy compliance, and mutating backend tools.
Context: The cleaned subset removes 24 broken or ambiguous tasks. Accuracy and reliability dimensions measure different properties.
Scale: 0 rating - 0.87 rating
Reliability
What this benchmark measures: 26 cleaned customer-service tasks involving dialogue, policy compliance, and mutating backend tools.
Context: The cleaned subset removes 24 broken or ambiguous tasks. Accuracy and reliability dimensions measure different properties.
Scale: 0 rating - 0.89 rating
Robustness
What this benchmark measures: 26 cleaned customer-service tasks involving dialogue, policy compliance, and mutating backend tools.
Context: The cleaned subset removes 24 broken or ambiguous tasks. Accuracy and reliability dimensions measure different properties.
Scale: 0 rating - 0.98 rating
Safety
What this benchmark measures: 26 cleaned customer-service tasks involving dialogue, policy compliance, and mutating backend tools.
Context: The cleaned subset removes 24 broken or ambiguous tasks. Accuracy and reliability dimensions measure different properties.
Scale: 0 rating - 0.99 rating
Every observation retains its source value and published test conditions.
Our model tests
Compare how the models respond to the same prompt. Each test shows the first attempt, with no subsequent fixes to the generated code. These results do not contribute to an overall score.
A community classic for free-form SVG drawing.
Gemini 2.5 Flash
Not tested yet
Generate an SVG of a pelican riding a bicycle
Token limit including reasoning: 8,192 tokens
Task origin (Simon Willison)Profile
Published information about this model. Existing estimates are explicitly labeled.
Dated documentation and model-card observations. Provider limits, native context and extended context can differ. Configuration notes retain the source wording.
Pricing
Prices apply to the stated unit. Resolution, output length, and provider can change the cost.
Cost example
$0.155
100 requests with 1,000 input and 500 output tokens each calculate to $0.155. Input accounts for $0.03; output accounts for $0.125.
The calculation uses documented token prices and no cache discount. It excludes extra tools, tax, reasoning tokens, and further hidden output tokens.
Open sourceHead-to-head comparisons
Each matchup compares this model with exactly one other model from the same category.
There are no published direct comparisons for this model yet.
Evidence
Every statement links to its underlying documentation or leaderboard.
Google, Non-reasoning. Output speed after the first streaming chunk, not total response time. Classified as deprecated by Artificial Analysis. Artificial Analysis maintains only the default 10K-input workload there. Retrieved September 8, 2026.
Base API prices without caching or batch discounts. Higher context tiers and other rates are listed under Costs.
Documented modalities. Retrieved September 8, 2026.
Documented modalities. Retrieved September 8, 2026.
Research date September 8, 2026. 4 source URLs checked. This documents the inspected sources, not an exhaustive inventory of every publication.
Not found in the inspected sources
parameters-billions. Google does not publish a parameter count on the Gemini API model page.
Not found in the inspected sources
active-parameters-billions. Google does not publish active parameter counts for Gemini API models.