model card7,198 words·31 min read·Mar 31, 2026·Source
Summary
Gemini 2.5 Pro Model Card
A 588-word brief of a 7,198-word document. Published by Google DeepMind. Version dated Mar 31, 2026.
01
What this is
Gemini 2.5 Pro is a natively multimodal reasoning model from Google DeepMind, described as the next iteration in the Gemini 2.0 series and Google's most advanced model for complex tasks. The model card was last updated June 27, 2025, reflecting the model's transition to general availability (GA). It supersedes Gemini 2.5 Pro Experimental (03-25) and Gemini 2.5 Pro Preview (05-06), which are also documented in the same card.
02
Capabilities
The model accepts text, images, audio, and video inputs with a 1M token context window and produces up to 64K tokens of text output. On Humanity's Last Exam it scores 21.6%; on GPQA Diamond (pass@1) 86.4%; on AIME 2025 (pass@1) 88.0%; and on Aider Polyglot 82.2% diff-fenced. SWE-bench Verified scores 59.6% single attempt and 67.2% multiple attempts. The architecture is a sparse mixture-of-experts transformer, which decouples total model capacity from per-token computation cost.
03
Evaluation methodology
Gemini results were run via the AI Studio API with default sampling settings, and multiple trials were averaged for smaller benchmarks to reduce variance. Non-Gemini results were sourced from providers' self-reported numbers unless otherwise noted; Vibe-Eval used Gemini as judge. The MRCR v2 methodology changed to a harder 8-needle evaluation going forward, making those results not directly comparable to previously published figures. Benchmark contamination controls are not explicitly described in the card.
04
Safety testing
Google DeepMind conducted human red teaming by specialist teams, automated red teaming at scale, continuous training-phase evaluations, and independent assurance evaluations held out from the model team to prevent overfitting. The internal Responsibility and Safety Council reviewed capability assessments and made release decisions. FSF evaluations covered four domains—CBRN, cybersecurity, ML R&D, and deceptive alignment—and no Critical Capability Levels (CCLs) were reached across any domain for any version. The Cyber Uplift Level 1 alert threshold was reached in earlier versions, triggering a response plan with more frequent testing and accelerated mitigations; the GA version did not reach this threshold. Deceptive Alignment evaluations for Gemini 2.5 Pro GA are stated as "not yet completed."
05
Mitigations
Safety mitigations span the full training and deployment lifecycle: dataset filtering, conditional pre-training, supervised fine-tuning, reinforcement learning from human and critic feedback, safety policies and desiderata, and product-level safety filtering. In response to the Cyber Uplift Level 1 alert threshold being reached in earlier versions, an active response plan involving higher-frequency testing and accelerated mitigations is in place.
06
Deployment and access
Gemini 2.5 Pro reached general availability as of June 2025 and is accessible via the AI Studio API. Three versioned model IDs are documented: gemini-2.5-pro-preview-06-05 (GA), gemini-2.5-pro-preview-05-06, and gemini-2.5-pro-exp-03-25. The card does not disclose specific license terms, pricing tiers, or detailed access restrictions.
07
Limitations
The lab flags hallucinations, weak causal understanding, complex logical deduction failures, and limited counterfactual reasoning as known limitations of the model. The knowledge cutoff is January 2025. Known safety limitations include over-refusals and responses that can still come across as "preachy," though tone and instruction following have improved over Gemini 1.5. A slight increase in image-to-text safety violation rates (+1.8% versus Gemini 1.5 Pro 002) was observed for the GA version; manual review found losses "overwhelmingly either false positives or not egregious."
08
What's new
The June 27, 2025 update added GA evaluation results alongside existing Experimental (03-25) and Preview (05-06) data, and changed the model's deployment status to general availability. The benchmark comparison table was expanded to include Claude 4 Opus, Claude 4 Sonnet, and DeepSeek R1 05-28. The MRCR v2 benchmark was updated to a harder 8-needle variant, breaking comparability with prior results. No new CCL alert thresholds were reached in GA evaluations, though Deceptive Alignment testing for the GA version remains incomplete.
Extracted Evaluations(131 results)
Sort by:0/131 rows fully reproducible (0%)
Benchmark
Category
State
Score
Setup
Source
/ verified
coding
scored
80.2%
resolve rate
majority-votingmissing: shot countmissing: languagemissing: training state
self-reported
/ verified
coding
scored
79.4%
resolve rate
majority-votingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2024_10_to_2025_02
coding
scored
79.4
pass at 1
majority-votingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2025_01_to_2025_05
coding
scored
75.8
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2024_10_to_2025_02
coding
scored
75.6
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
coding
scored
72.7%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
coding
scored
72.5%
resolve rate
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2025_01_to_2025_05
coding
scored
72.0
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2024_10_to_2025_02
coding
scored
70.6
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2025_01_to_2025_05
coding
scored
70.5
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2024_10_to_2025_02
coding
scored
70.4
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
coding
scored
69.1%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025_01_to_2025_05
coding
scored
69.0
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
coding
scored
68.1%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
coding
scored
67.2%
resolve rate
majority-votingmissing: shot countmissing: languagemissing: training state
self-reported
/ verified
coding
scored
63.8%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
coding
scored
63.2%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
coding
scored
59.6%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
coding
scored
57.6%
resolve rate
majority-votingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2025_01_to_2025_05
coding
scored
51.1
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2025_01_to_2025_05
coding
scored
48.9
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ global_lite
knowledge
scored
89.8%
accuracy
Averagemissing: shot countmissing: methodmissing: training state
self-reported
/ global_lite
knowledge
scored
89.2%
accuracy
Averagemissing: shot countmissing: methodmissing: training state
self-reported
/ global_lite
knowledge
scored
88.6%
accuracy
Averagemissing: shot countmissing: methodmissing: training state
self-reported
/ 2025
math
scored
92.7%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025
math
scored
88.9%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025
math
scored
88.0%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025
math
scored
87.5%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025
math
scored
86.7%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025
math
scored
83.0%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025
math
scored
77.3%
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2025
math
scored
75.5%
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ 2025
math
scored
70.5%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ 128k
other
scored
94.5
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ 128k
other
scored
93.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
87.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ audio_visual_subtitles
other
scored
86.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ audio_visual_subtitles
other
scored
84.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
VideoMMMU
other
scored
83.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ 1m
other
scored
83.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ 1m
other
scored
82.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
82.4
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diff_fenced
other
scored
82.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diff
other
scored
79.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
79.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
77.7
accuracy
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ whole
other
scored
76.5
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
74.8
accuracy
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ whole
other
scored
74.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diff
other
scored
72.7
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diff
other
scored
72.0
accuracy
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ diff
other
scored
72.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
71.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
69.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Vibe-Eval
other
scored
69.4
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diff
other
scored
68.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Vibe-Eval
other
scored
67.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Vibe-Eval
other
scored
65.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
62.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diff
other
scored
61.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ v2_8needle_128k
other
scored
58.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ v2_8needle_128k
other
scored
57.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
54.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diff
other
scored
53.3
accuracy
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
other
scored
52.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
50.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
48.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
43.6
accuracy
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
MRCR/ v2_8needle_128k
other
scored
39.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ v2_8needle_128k
other
scored
36.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ v2_8needle_128k
other
scored
34.0
accuracy
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
other
scored
27.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
21.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
20.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
19.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
18.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
18.4
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
18.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
17.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ v2_8needle_1m
other
scored
16.4
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR/ v2_8needle_128k
other
scored
16.1
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
Instruction Following
other
scored
14.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
14.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Instruction Following
other
scored
10.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
10.7
accuracy
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
other
scored
7.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
7.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
5.7
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Instruction Following
other
scored
4.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
1.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
0.7
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
-0.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
-0.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
-1.9
accuracy
Averagemissing: shot countmissing: methodmissing: training state
self-reported
other
scored
-2.1
accuracy
Averagemissing: shot countmissing: methodmissing: training state
self-reported
other
scored
-2.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
-3.5
accuracy
Averagemissing: shot countmissing: methodmissing: training state
self-reported
other
scored
-7.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
scored
-8.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
mentioned
—
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Hack the Box/ hard
other
mentioned
—
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
InterCode-CTF
other
cited
—
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
WMDP/ chemistry
other
mentioned
—
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
WMDP/ biology
other
mentioned
—
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Lab-Bench/ seq_qa
other
mentioned
—
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Lab-Bench/ cloning_scenarios
other
mentioned
—
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Lab-Bench/ protocol_qa
other
mentioned
—
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
mentioned
—
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
mentioned
—
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
mentioned
—
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
mentioned
—
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
other
mentioned
—
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
SecureBio VMQA/ single_choice
other
mentioned
—
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoning
scored
86.4%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoning
scored
84.0%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoning
scored
83.3%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoning
scored
83.0%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoning
scored
81.4%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoning
scored
81.0%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoning
scored
80.2%
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ diamond
reasoning
scored
79.6%
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
/ diamond
reasoning
scored
75.4%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
vision
scored
82.9%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
vision
scored
82.0%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
vision
scored
81.7%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
vision
scored
81.6%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
vision
scored
79.6%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
vision
scored
78.0%
accuracy
majority-votingmissing: shot countmissing: languagemissing: training state
self-reported
vision
scored
76.5%
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
vision
scored
76.0%
pass at 1
extended-thinkingmissing: shot countmissing: languagemissing: training state
self-reported
vision
scored
74.4%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state