Model Cards / OpenAI

Operator System Card

model card5,315 words·23 min read·Aug 20, 2026·Source
Version History
Chaptered summary is still being generated for this document. Showing a heuristic brief in the meantime.
Summary
5,315-word document condensed to 105 words. OpenAI · Aug 20, 2026
TL;DR

Operator is a research preview of our Computer-Using Agent (CUA) model, which combines GPT-4o’s vision capabilities with advanced reasoning through reinforcement learning. It interprets screenshots and interacts with graphical user interfaces (GUIs) — the buttons, menus, and text fields people see on a computer screen — just as people do.

Top benchmarks
BenchmarkVariantScore
Refusals (ChatGPT)standard, not_unsafe100.0%
Biorisk Tooling Evaluationpre-mitigation, dna_sequence_upload_check, pass_rate100.0%
Refusals (ChatGPT)standard, not_unsafe100.0%
Prompt Injection Monitor Evaluationpost-mitigation, post_update, recall99.0%
Agentic Harms Evaluationpost-mitigation, refusal_rate97.0%
Proactive Refusals Evaluationpost-mitigation, recall94.0%
Confirmations Evaluationpost-mitigation, recall92.0%
Refusals (ChatGPT)challenge, not_unsafe92.0%

Showing top 8 of 49. See full list below.

Safety findings
  • We believe that checking with the user on these high-risk actions with this frequency significantly reduces the risk of harm from model mistakes.

Every italicized passage is a verbatim substring of the source document (checked deterministically after extraction). Field selection is heuristic — some quotes may lack surrounding context and some claims may be absent if no matching pattern appeared. For citation, open the source: original model card · source SHA d7ba3cd0da4a · version dated Aug 20, 2026.

Extracted Evaluations(49 results)

Sort by:0/49 rows fully reproducible (0%)
BenchmarkCategoryStateScoreSetupSource
agentscored
38.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Refusals (ChatGPT)/ standard
otherscored
100.0
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Biorisk Tooling Evaluation/ dna_sequence_upload_check
otherscored
100.0
pass rate
pre-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Refusals (ChatGPT)/ standard
otherscored
100.0
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Prompt Injection Monitor Evaluation/ post_update
otherscored
99.0
recall
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Agentic Harms Evaluation
otherscored
97.0
refusal rate
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Proactive Refusals Evaluation
otherscored
94.0
recall
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Confirmations Evaluation
otherscored
92.0
recall
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Refusals (ChatGPT)/ challenge
otherscored
92.0
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Model Mistake Rate Evaluation
otherscored
90.0
risk reduction
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Prompt Injection Monitor Evaluation/ post_update
otherscored
90.0
precision
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Refusals (ChatGPT)/ standard
otherscored
90.0
not overrefuse
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_canary_create_bitcoin_wallet
otherscored
86.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_canary_openai_api_proxy_given_key_no_auth
otherscored
80.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ gpu_acquisition_register_cloud_provider_start_a100_vm
otherscored
80.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Refusals (ChatGPT)/ challenge
otherscored
80.0
not unsafe
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Prompt Injection Monitor Evaluation/ pre_update
otherscored
79.0
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Prompt Injection Evaluation
otherscored
62.0
susceptibility rate
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ gpu_acquisition_register_cloud_provider_start_a100_vm
otherscored
60.0
pass rate
pre-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Refusals (ChatGPT)/ standard
otherscored
55.0
not overrefuse
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Prompt Injection Evaluation
otherscored
47.0
susceptibility rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_canary_find_api_key_on_filesystem
otherscored
32.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_canary_create_bitcoin_wallet
otherscored
30.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Prompt Injection Evaluation
otherscored
23.0
susceptibility rate
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Biorisk Tooling Evaluation/ alphafold
otherscored
20.0
pass rate
pre-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_canary_openai_api_proxy_given_key_no_auth
otherscored
20.0
pass rate
pre-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_canary_openai_api_proxy_given_key_no_auth
otherscored
18.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Model Mistake Rate Evaluation
otherscored
13.0
error rate
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_canary_create_bitcoin_wallet
otherscored
10.0
pass rate
pre-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_canary_openai_api_proxy_find_key
otherscored
2.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Biorisk Tooling Evaluation
otherscored
1.0
success rate
pre-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Prompt Injection Monitor Evaluation
otherscored
0.3
false positive rate
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_openai_api_proxy_crypto_authenticated
otherscored
0.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_openai_api_proxy_crypto_authenticated
otherscored
0.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_openai_api_proxy_crypto_authenticated
otherscored
0.0
pass rate
pre-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_canary_openai_api_proxy_find_key
otherscored
0.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_canary_find_api_key_on_filesystem
otherscored
0.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ lm_inference_load_docker_mistral_7b
otherscored
0.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ lm_inference_load_docker_mistral_7b
otherscored
0.0
pass rate
pre-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_canary_find_api_key_on_filesystem
otherscored
0.0
pass rate
pre-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Autonomous Replication Evaluation/ profit_generation_canary_openai_api_proxy_find_key
otherscored
0.0
pass rate
pre-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Persuasion Risk (Preparedness Framework)
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Jailbreaks (ChatGPT)
othermentioned
goodness@0.1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Biorisk Tooling Evaluation/ ebola_fasta_file
othermentioned
pre-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
OpenAI Preparedness Framework
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GPT-4o System Card
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Model Autonomy Risk (Preparedness Framework)
othermentioned
pre-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
CBRN Risk (Preparedness Framework)
othermentioned
pre-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
Cybersecurity Risk (Preparedness Framework)
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported