Model Cards / Google DeepMind

Gemini 2.5 Pro Model Card

model card7,198 words·31 min read·Mar 31, 2026·Source
Summary

Gemini 2.5 Pro Model Card

A 588-word brief of a 7,198-word document. Published by Google DeepMind. Version dated Mar 31, 2026.
01

What this is

Gemini 2.5 Pro is a natively multimodal reasoning model from Google DeepMind, described as the next iteration in the Gemini 2.0 series and Google's most advanced model for complex tasks. The model card was last updated June 27, 2025, reflecting the model's transition to general availability (GA). It supersedes Gemini 2.5 Pro Experimental (03-25) and Gemini 2.5 Pro Preview (05-06), which are also documented in the same card.

02

Capabilities

The model accepts text, images, audio, and video inputs with a 1M token context window and produces up to 64K tokens of text output. On Humanity's Last Exam it scores 21.6%; on GPQA Diamond (pass@1) 86.4%; on AIME 2025 (pass@1) 88.0%; and on Aider Polyglot 82.2% diff-fenced. SWE-bench Verified scores 59.6% single attempt and 67.2% multiple attempts. The architecture is a sparse mixture-of-experts transformer, which decouples total model capacity from per-token computation cost.

03

Evaluation methodology

Gemini results were run via the AI Studio API with default sampling settings, and multiple trials were averaged for smaller benchmarks to reduce variance. Non-Gemini results were sourced from providers' self-reported numbers unless otherwise noted; Vibe-Eval used Gemini as judge. The MRCR v2 methodology changed to a harder 8-needle evaluation going forward, making those results not directly comparable to previously published figures. Benchmark contamination controls are not explicitly described in the card.

04

Safety testing

Google DeepMind conducted human red teaming by specialist teams, automated red teaming at scale, continuous training-phase evaluations, and independent assurance evaluations held out from the model team to prevent overfitting. The internal Responsibility and Safety Council reviewed capability assessments and made release decisions. FSF evaluations covered four domains—CBRN, cybersecurity, ML R&D, and deceptive alignment—and no Critical Capability Levels (CCLs) were reached across any domain for any version. The Cyber Uplift Level 1 alert threshold was reached in earlier versions, triggering a response plan with more frequent testing and accelerated mitigations; the GA version did not reach this threshold. Deceptive Alignment evaluations for Gemini 2.5 Pro GA are stated as "not yet completed."

05

Mitigations

Safety mitigations span the full training and deployment lifecycle: dataset filtering, conditional pre-training, supervised fine-tuning, reinforcement learning from human and critic feedback, safety policies and desiderata, and product-level safety filtering. In response to the Cyber Uplift Level 1 alert threshold being reached in earlier versions, an active response plan involving higher-frequency testing and accelerated mitigations is in place.

06

Deployment and access

Gemini 2.5 Pro reached general availability as of June 2025 and is accessible via the AI Studio API. Three versioned model IDs are documented: gemini-2.5-pro-preview-06-05 (GA), gemini-2.5-pro-preview-05-06, and gemini-2.5-pro-exp-03-25. The card does not disclose specific license terms, pricing tiers, or detailed access restrictions.

07

Limitations

The lab flags hallucinations, weak causal understanding, complex logical deduction failures, and limited counterfactual reasoning as known limitations of the model. The knowledge cutoff is January 2025. Known safety limitations include over-refusals and responses that can still come across as "preachy," though tone and instruction following have improved over Gemini 1.5. A slight increase in image-to-text safety violation rates (+1.8% versus Gemini 1.5 Pro 002) was observed for the GA version; manual review found losses "overwhelmingly either false positives or not egregious."

08

What's new

The June 27, 2025 update added GA evaluation results alongside existing Experimental (03-25) and Preview (05-06) data, and changed the model's deployment status to general availability. The benchmark comparison table was expanded to include Claude 4 Opus, Claude 4 Sonnet, and DeepSeek R1 05-28. The MRCR v2 benchmark was updated to a harder 8-needle variant, breaking comparability with prior results. No new CCL alert thresholds were reached in GA evaluations, though Deceptive Alignment testing for the GA version remains incomplete.

Generated by Claude sonnet from the cleaned source on Apr 23, 2026. Passages in double quotes are verbatim from the source; other text is neutral paraphrase. For citation, use the original: original document · source SHA b45372cc97c4.

Extracted Evaluations(131 results)

Sort by:0/131 rows fully reproducible (0%)
BenchmarkCategoryStateScoreSetupSource
/ verified
codingscored
80.2%
resolve rate
majority-votingmissing: shot countmissing: languagemissing: training state
self-reported
/ verified
codingscored
79.4%
resolve rate
majority-votingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2024_10_to_2025_02
codingscored
79.4
pass at 1
majority-votingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2025_01_to_2025_05
codingscored
75.8
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2024_10_to_2025_02
codingscored
75.6
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
72.7%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
72.5%
resolve rate
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2025_01_to_2025_05
codingscored
72.0
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2024_10_to_2025_02
codingscored
70.6
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2025_01_to_2025_05
codingscored
70.5
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2024_10_to_2025_02
codingscored
70.4
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
69.1%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025_01_to_2025_05
codingscored
69.0
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
68.1%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
67.2%
resolve rate
majority-votingmissing: shot countmissing: languagemissing: training state
self-reported
/ verified
codingscored
63.8%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
63.2%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
59.6%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
57.6%
resolve rate
majority-votingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2025_01_to_2025_05
codingscored
51.1
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2025_01_to_2025_05
codingscored
48.9
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ global_lite
knowledgescored
89.8%
accuracy
Averagemissing: shot countmissing: methodmissing: training state
self-reported
/ global_lite
knowledgescored
89.2%
accuracy
Averagemissing: shot countmissing: methodmissing: training state
self-reported
/ global_lite
knowledgescored
88.6%
accuracy
Averagemissing: shot countmissing: methodmissing: training state
self-reported
/ 2025
mathscored
92.7%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025
mathscored
88.9%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025
mathscored
88.0%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025
mathscored
87.5%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025
mathscored
86.7%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025
mathscored
83.0%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025
mathscored
77.3%
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2025
mathscored
75.5%
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2025
mathscored
70.5%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ 128k
otherscored
94.5
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ 128k
otherscored
93.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
87.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ audio_visual_subtitles
otherscored
86.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ audio_visual_subtitles
otherscored
84.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
VideoMMMU
otherscored
83.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ 1m
otherscored
83.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ 1m
otherscored
82.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
82.4
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diff_fenced
otherscored
82.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diff
otherscored
79.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
79.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
77.7
accuracy
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ whole
otherscored
76.5
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
74.8
accuracy
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ whole
otherscored
74.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diff
otherscored
72.7
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diff
otherscored
72.0
accuracy
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ diff
otherscored
72.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
71.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
69.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Vibe-Eval
otherscored
69.4
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diff
otherscored
68.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Vibe-Eval
otherscored
67.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Vibe-Eval
otherscored
65.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
62.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diff
otherscored
61.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ v2_8needle_128k
otherscored
58.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ v2_8needle_128k
otherscored
57.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
54.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diff
otherscored
53.3
accuracy
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
52.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
50.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
48.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
43.6
accuracy
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
MRCR/ v2_8needle_128k
otherscored
39.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ v2_8needle_128k
otherscored
36.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ v2_8needle_128k
otherscored
34.0
accuracy
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
27.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
21.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
20.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
19.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
18.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
18.4
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
18.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
17.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ v2_8needle_1m
otherscored
16.4
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ v2_8needle_128k
otherscored
16.1
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
Instruction Following
otherscored
14.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
14.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Instruction Following
otherscored
10.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
10.7
accuracy
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
7.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
7.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
5.7
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Instruction Following
otherscored
4.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
1.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
0.7
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
-0.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
-0.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
-1.9
accuracy
Averagemissing: shot countmissing: methodmissing: training state
self-reported
otherscored
-2.1
accuracy
Averagemissing: shot countmissing: methodmissing: training state
self-reported
otherscored
-2.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
-3.5
accuracy
Averagemissing: shot countmissing: methodmissing: training state
self-reported
otherscored
-7.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
-8.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Hack the Box/ hard
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
InterCode-CTF
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
WMDP/ chemistry
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
WMDP/ biology
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Lab-Bench/ seq_qa
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Lab-Bench/ cloning_scenarios
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Lab-Bench/ protocol_qa
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
SecureBio VMQA/ single_choice
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
86.4%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
84.0%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
83.3%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
83.0%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
81.4%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
81.0%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
80.2%
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
79.6%
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
75.4%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
visionscored
82.9%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
visionscored
82.0%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
visionscored
81.7%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
visionscored
81.6%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
visionscored
79.6%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
visionscored
78.0%
accuracy
majority-votingmissing: shot countmissing: languagemissing: training state
self-reported
visionscored
76.5%
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
visionscored
76.0%
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
visionscored
74.4%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported