Model Cards / OpenAI

o3 System Card

model card9,991 words·43 min read·Aug 20, 2026·Source
Version History
Chaptered summary is still being generated for this document. Showing a heuristic brief in the meantime.
Summary
9,991-word document condensed to 136 words. OpenAI · Aug 20, 2026
TL;DR

OpenAI o3 and OpenAI o4-mini combine state-of-the-art reasoning with full tool capabilities — web browsing, Python, image and file analysis, image generation, canvas, automations, file search, and memory. These models excel at solving complex math, coding, and scientific challenges while demonstrating strong visual perception and analysis.

Top benchmarks
BenchmarkVariantScore
SWE-Lancerno-tools, ic_swe, dollars_earned86100.00
SWE-Lancerwith-tools, ic_swe, dollars_earned76250.00
Biorisk Red-Teaming Monitor Evaluationpost-mitigation, recall98.7%
SWE-Lancerwith-tools, ic_swe, accuracy55.0%
Cyber Range Evaluationevasion, success_rate51.0%
Cyber Range Evaluationevasion, success_rate51.0%
Cyber Range Evaluationvulnerability_discovery_exploitation, success_rate34.0%
Cyber Range Evaluationnetwork_attack_simulation, success_rate29.0%

Showing top 8 of 66. See full list below.

Capability claim
  • We introduce a new cybersecurity evaluation: Cyber Range.
Mitigations
  • mitigations include post-training our reasoning models to refuse requests to identify a person based on an image, and to refuse requests for ungrounded inferences.
  • we have deployed significant mitigations in Preparedness risk areas, and we describe those below after the Capabilities Assessment.
Deployment scope
  • released under Version 2 of our Preparedness Framework.

Every italicized passage is a verbatim substring of the source document (checked deterministically after extraction). Field selection is heuristic — some quotes may lack surrounding context and some claims may be absent if no matching pattern appeared. For citation, open the source: original model card · source SHA 0b08b9dee641 · version dated Aug 20, 2026.

Extracted Evaluations(66 results)

Sort by:0/66 rows fully reproducible (0%)
BenchmarkCategoryStateScoreSetupSource
/ verified
codingmentioned
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingmentioned
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingmentioned
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
SWE-Lancer/ ic_swe
otherscored
86100.0
dollars earned
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
SWE-Lancer/ ic_swe
otherscored
76250.0
dollars earned
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
Biorisk Red-Teaming Monitor Evaluation
otherscored
98.7
recall
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
SWE-Lancer/ ic_swe
otherscored
55.0
accuracy
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
Cyber Range Evaluation/ evasion
otherscored
51.0
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Evaluation/ evasion
otherscored
51.0
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Evaluation/ vulnerability_discovery_exploitation
otherscored
34.0
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Evaluation/ network_attack_simulation
otherscored
29.0
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Evaluation/ vulnerability_discovery_exploitation
otherscored
29.0
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Evaluation/ network_attack_simulation
otherscored
25.0
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
24.0
pass at 1
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
23.0
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
18.0
pass at 1
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
Cyber Range Evaluation/ easy
otherscored
16.0
solve count
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Evaluation/ easy
otherscored
14.0
solve count
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Evaluation/ medium
otherscored
9.0
solve count
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Evaluation/ medium
otherscored
7.0
solve count
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ sexual_exploitative
otherscored
1.0
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ self_harm_instructions
otherscored
1.0
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ sexual_exploitative
otherscored
1.0
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ self_harm_intent
otherscored
1.0
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ self_harm_intent
otherscored
1.0
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ self_harm_instructions
otherscored
1.0
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ self_harm_intent
otherscored
1.0
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ sexual_exploitative
otherscored
1.0
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ self_harm_instructions
otherscored
0.9
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
0.8
hallucination rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
0.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Sabotage Capability Evaluation/ ai_r&d_backdoor
otherscored
0.6
f1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
0.5
hallucination rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
0.5
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
0.5
hallucination rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
0.5
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
0.5
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
0.4
hallucination rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
0.4
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
0.3
hallucination rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
0.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Sabotage Capability Evaluation/ ai_r&d_backdoor
otherscored
0.2
f1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
0.2
hallucination rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Sabotage Capability Evaluation/ ai_r&d_backdoor
otherscored
0.1
f1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Evaluation/ hard
otherscored
0.0
solve count
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Evaluation/ hard
otherscored
0.0
solve count
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
OpenAI Research Engineer Interview/ multiple_choice
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Lab-Bench
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Online Retailer Scenario
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Privilege Escalation Scenario
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Privilege Escalation Scenario
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Privilege Escalation Scenario
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Privilege Escalation Scenario
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range Privilege Escalation Scenario
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Vision Red-Teaming ELO Evaluation
othermentioned
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Vision Red-Teaming ELO Evaluation
othermentioned
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
OpenAI Research Engineer Interview/ multiple_choice
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
OpenAI Research Engineer Interview/ multiple_choice
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
SWE-Lancer/ swe_manager
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
OpenAI Research Engineer Interview/ coding
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
OpenAI Research Engineer Interview/ coding
othermentioned
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Vision Red-Teaming ELO Evaluation
othermentioned
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Vision Red-Teaming ELO Evaluation
othermentioned
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
safetycited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported