Model Cards / OpenAI

GPT-5.2 System Card

model card7,246 words·32 min read·Aug 20, 2026·Source
Version History
Chaptered summary is still being generated for this document. Showing a heuristic brief in the meantime.
Summary
7,246-word document condensed to 142 words. OpenAI · Aug 20, 2026
TL;DR

GPT-5.2 is the latest model family in the GPT-5 series, and explained in our blog. The comprehensive safety mitigation approach for these models is largely the same as that described in the GPT-5 System Card and GPT-5.1 System Card.

Top benchmarks
BenchmarkVariantScore
CharXivwithout-mitigations, missing_image_strict_output, deception_rate88.8%
CharXivwithout-mitigations, missing_image_lenient_output, deception_rate54.0%
CharXivwithout-mitigations, missing_image_strict_output, deception_rate34.3%
CharXivwithout-mitigations, missing_image_lenient_output, deception_rate34.1%
Coding Deceptionwithout-mitigations, deception_rate25.6%
Coding Deceptionwithout-mitigations, deception_rate17.6%
Deception Evaluationwithout-mitigations, adversarial, deception_rate11.8%
Browsing Broken Toolswithout-mitigations, deception_rate9.4%

Showing top 8 of 81. See full list below.

Capability claim
  • We trained gpt-5.2-thinking integrations to provide maximally helpful support on educational/cy- bersecurity topics while refusing or de-escalating operational guidance for cyber abuse, including areas such as malware creation, credential theft, and chained exploitation.
Mitigations
  • we have deployed system-level safeguards in ChatGPT intended to mitigate this behavior.
Deployment scope
  • available on the internet, information that we partner with third parties to access, and information that our users or human trainers and researchers provide or generate.

Every italicized passage is a verbatim substring of the source document (checked deterministically after extraction). Field selection is heuristic — some quotes may lack surrounding context and some claims may be absent if no matching pattern appeared. For citation, open the source: original model card · source SHA a2a0676aa905 · version dated Aug 20, 2026.

Extracted Evaluations(81 results)

Sort by:0/81 rows fully reproducible (0%)
BenchmarkCategoryStateScoreSetupSource
knowledgescored
0.9%
accuracy
0-shotcotSpanishmissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotItalianmissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotPortuguesemissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotPortuguesemissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotSpanishmissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotIndonesianmissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotItalianmissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotIndonesianmissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotGermanmissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotArabicmissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotChinesemissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotFrenchmissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotArabicmissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotChinesemissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotHindimissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotHindimissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotFrenchmissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotJapanesemissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotJapanesemissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotKoreanmissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotGermanmissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotKoreanmissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotBengalimissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotBengalimissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotSwahilimissing: training state
self-reported
knowledgescored
0.9%
accuracy
0-shotcotSwahilimissing: training state
self-reported
knowledgescored
0.8%
accuracy
0-shotcotYorubamissing: training state
self-reported
knowledgescored
0.8%
accuracy
0-shotcotYorubamissing: training state
self-reported
/ consensus
medicalscored
1.0
rubric score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ consensus
medicalscored
0.9
rubric score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ consensus
medicalscored
0.9
rubric score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ consensus
medicalscored
0.9
rubric score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
medicalscored
0.6
rubric score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
medicalscored
0.6
rubric score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
medicalscored
0.5
rubric score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
medicalscored
0.5
rubric score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ hard
medicalscored
0.4
rubric score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ hard
medicalscored
0.4
rubric score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ hard
medicalscored
0.2
rubric score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ hard
medicalscored
0.2
rubric score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
CharXiv/ missing_image_strict_output
otherscored
88.8
deception rate
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
CharXiv/ missing_image_lenient_output
otherscored
54.0
deception rate
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
CharXiv/ missing_image_strict_output
otherscored
34.3
deception rate
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
CharXiv/ missing_image_lenient_output
otherscored
34.1
deception rate
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
25.6
deception rate
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
17.6
deception rate
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
Deception Evaluation/ adversarial
otherscored
11.8
deception rate
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
9.4
deception rate
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
9.1
deception rate
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
8.0
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Deception Evaluation/ production_traffic
otherscored
7.7
deception rate
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
Deception Evaluation/ adversarial
otherscored
5.4
deception rate
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
Deception Evaluation/ production_traffic
otherscored
1.6
deception rate
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
Cyber Safety Evaluation/ synthetic_data
otherscored
1.0
policy compliance rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Safety Evaluation/ production_traffic
otherscored
1.0
policy compliance rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ illicit
otherscored
1.0
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Safety Evaluation/ synthetic_data
otherscored
0.9
policy compliance rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Safety Evaluation/ synthetic_data
otherscored
0.9
policy compliance rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Safety Evaluation/ production_traffic
otherscored
0.9
policy compliance rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Safety Evaluation/ production_traffic
otherscored
0.9
policy compliance rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ illicit
otherscored
0.9
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ illicit
otherscored
0.9
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ illicit
otherscored
0.8
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
First-Person Fairness
otherscored
0.0
harm overall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
First-Person Fairness
otherscored
0.0
harm overall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Capture the Flag
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ open_ended
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Tacit Knowledge and Troubleshooting
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Apollo Research Scheming Evaluation
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
pass at 1
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
othermentioned
pass at 1
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
External Evaluations for Cyber Capabilities
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cyber Range
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
CVE-Bench
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cybersecurity Evaluations
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported