Model Cards / Anthropic

Claude Sonnet 4.6 System Card

model card28,358 words·123 min read·Mar 31, 2026·Source
Summary

Claude Sonnet 4.6 System Card

A 742-word brief of a 28,358-word document. Published by Anthropic. Version dated Mar 31, 2026.
01

What this is

Claude Sonnet 4.6 is a large language model from Anthropic, released February 17, 2026, succeeding Claude Sonnet 4.5. It is designed as a capable mid-tier model covering coding, agentic tasks, reasoning, multimodal, computer use, and mathematical abilities. On several evaluations it approaches or matches Claude Opus 4.6, Anthropic's frontier model. The card was completed and published under Anthropic's Responsible Scaling Policy prior to public deployment.

02

Capabilities

Claude Sonnet 4.6 achieves 79.6% on SWE-bench Verified, 72.5% on OSWorld-Verified (within 0.2% of Opus 4.6's state-of-the-art 72.7%), 89.9% on GPQA Diamond, 60.42% on ARC-AGI-2 at high effort, and 95.6% on AIME 2025. On BrowseComp it scores 74.72% single-agent and 82.62% in a multi-agent configuration. The model processes text and vision inputs, supports computer use via mouse and keyboard interaction, and accepts context windows up to 1M tokens. Two thinking modes are offered: extended thinking and adaptive thinking, the latter allowing context-dependent reasoning depth via an "effort" parameter controllable by developers.

03

Evaluation methodology

All evaluations were conducted on the final deployed model snapshot unless otherwise noted, with results averaged over 10 trials (25 for SWE-bench) using adaptive thinking and max effort. Multiple intermediate training snapshots—including a helpful-only model with safeguards removed—were tested; the highest score across any snapshot was used for dangerous capability assessments. The card notes that many benchmarks may be contaminated by training data and references decontamination methods described in the Claude Opus 4.5 System Card. Some evaluations were conducted by named external third parties.

04

Safety testing

Anthropic evaluated the model against its Responsible Scaling Policy preliminary assessment protocol, testing CBRN, autonomy (AI R&D), and cyber risk domains across multiple training snapshots. On biological risk, Sonnet 4.6 did not cross the ASL-4 rule-out threshold on short-horizon computational biology tasks. On autonomy, the model "crossed most of the rule-out thresholds we use as early proxies for AI R&D-4 capability," though Anthropic states "we still do not believe that our models fully qualify for AI R&D-4." On cyber risk, the model is close to saturating current evaluations, and the card repeats that "the saturation of our evaluation infrastructure means we can no longer use current benchmarks to track capability progression." Single-turn violative request evaluations across seven languages returned a 99.38% harmless response rate, and alignment audits found "no signs of major concerns around high-stakes forms of misalignment."

05

Mitigations

Sonnet 4.6 is deployed under the ASL-3 Standard and ASL-3 Security Standard for model weights, the same tier as Claude Opus 4.6. Anthropic proactively implemented AI R&D-4 safety measures—publishing a risk case and applying ASL-3 security protections—despite concluding the threshold has not been crossed. System prompt mitigations for claude.ai address suicide and self-harm interactions, directing the model to offer crisis resources without delay and avoid language that validates reluctance to seek professional help. Localized crisis resource banners are surfaced when suicide or self-harm is detected on claude.ai, and developers are encouraged to adopt recommended system prompt language for API deployments serving vulnerable populations.

06

Deployment and access

Claude Sonnet 4.6 is available via the Anthropic API and as part of the claude.ai consumer product, which is restricted to users aged 18 or above. Anthropic Ireland, Limited is the designated provider in the European Economic Area. Enterprise customers deploying the model to minors must comply with additional safeguards under Anthropic's Usage Policy, which governs prohibited uses and requirements for high-risk scenarios.

07

Limitations

The card states that "confidently ruling out" the AI R&D-4 and CBRN-4 thresholds "is becoming increasingly difficult" due to model performance approaching rule-out proxies and fundamental epistemic uncertainty in measurement. Current cyber benchmarks are near-saturated, providing no meaningful capability-progression signal for future models. The internal Real-World Finance evaluation lacks independent third-party validation and does not cover all finance domains; AIME 2025 scores may be inflated by training data contamination. GraphWalks and some long-context MRCR results are not reproducible via the public API because problems exceed its 1M token limit. Performance on low-resource African languages degrades by up to 16.2 percentage points from the model's English baseline.

08

What's new

Relative to Claude Sonnet 4.5, this card introduces the adaptive thinking mode (effort parameter), previously documented only in the Opus 4.6 system card. For the first time in a Sonnet system card, multilingual performance evaluations covering 42 languages (GMMLU) and 10 Indic languages (MILU) are included. New alignment-focused evaluations include external testing with Andon Labs via Vending-Bench 2 and a cross-developer safety comparison using the Petri framework against Gemini 3 Pro, GPT-5.2, Grok 4.1 Fast, and Kimi K2.5. Expanded finance and life sciences capability sections are also new to this Sonnet card.

Generated by Claude sonnet from the cleaned source on Apr 23, 2026. Passages in double quotes are verbatim from the source; other text is neutral paraphrase. For citation, use the original: original document · source SHA 41cc9a90beac.

Extracted Evaluations(147 results)

Sort by:2 conflicting reports0/147 rows fully reproducible (0%)
BenchmarkCategoryStateScoreSetupSource
/ verified
agentscored
72.7
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
agentscored
72.5
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
agentscored
66.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
agentscored
61.4
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
agentmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
agentmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
agentmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
agentmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
agentmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
codingscored
100.0
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
/ verified_hard
codingscored
100.0%
pass at 30
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
codingscored
100.0
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
codingscored
100.0
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
codingscored
99.3
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
codingscored
98.7
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
/ verified
codingscored
80.9%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
80.8%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
80.0%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
79.6%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
77.2%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
76.2%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified_hard
codingscored
0.9%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified_hard
codingscored
0.9%
pass at 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ multilingual
codingmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2025
mathmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
multilingualscored
91.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
multilingualscored
91.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
multilingualscored
90.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
multilingualscored
89.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
multilingualscored
89.5
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
multilingualscored
89.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ aa
otherscored
1633.0
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ aa
otherscored
1606.0
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ aa
otherscored
1462.0
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ aa
otherscored
1416.0
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ aa
otherscored
1276.0
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ aa
otherscored
1201.0
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ malicious
otherscored
99.6
accuracy
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ malicious
otherscored
99.4
accuracy
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
malicious_computer_use
otherscored
99.4
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
/ telecom
otherscored
99.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ telecom
otherscored
98.7
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ benign
otherscored
98.2
accuracy
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
/ telecom
otherscored
98.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ telecom
otherscored
98.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ telecom
otherscored
98.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ telecom
otherscored
97.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ malicious
otherscored
97.3
accuracy
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ malicious
otherscored
96.7
accuracy
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ benign
otherscored
96.6
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ benign
otherscored
96.5
accuracy
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ benign
otherscored
95.6
accuracy
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ malicious
otherscored
95.1
accuracy
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ benign
otherscored
93.1
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
/ retail
otherscored
91.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ benign
otherscored
91.8
accuracy
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ benign
otherscored
91.8
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
/ retail
otherscored
91.7
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ retail
otherscored
88.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ benign
otherscored
88.5
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
malicious_computer_use
otherscored
88.4
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
malicious_computer_use
otherscored
88.3
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
/ retail
otherscored
86.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
malicious_computer_use
otherscored
86.1
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ benign
otherscored
86.1
accuracy
post-mitigationmissing: shot countmissing: languagemissing: training state
self-reported
/ retail
otherscored
85.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ benign
otherscored
84.9
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ malicious
otherscored
83.2
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
/ retail
otherscored
82.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ malicious
otherscored
79.3
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ malicious
otherscored
77.8
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
malicious_computer_use
otherscored
77.7
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ malicious
otherscored
69.4
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
Terminal-Bench/ 2.0
otherscored
65.4
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Terminal-Bench/ 2.0
otherscored
64.7
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
malicious_use_of_claude_code/ malicious
otherscored
63.1
accuracy
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
62.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
61.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
60.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Terminal-Bench/ 2.0
otherscored
59.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
59.5
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Terminal-Bench/ 2.0
otherscored
59.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Terminal-Bench/ 2.0
otherscored
56.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
54.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
53.0
accuracy
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
Terminal-Bench/ 2.0
otherscored
51.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
50.0
accuracy
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
49.0
accuracy
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
45.8
accuracy
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
43.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
43.4
accuracy
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
40.0
accuracy
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
37.5
accuracy
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
36.6
accuracy
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
33.6
accuracy
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
33.2
accuracy
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
30.8
accuracy
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
17.7
accuracy
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
Vending-Bench/ 2
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Internal AI Research Evaluation Suite 1/ novel_compiler
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Internal AI Research Evaluation Suite 1/ quadruped_rl
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Internal AI Research Evaluation Suite 1/ llm_training
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Internal AI Research Evaluation Suite 1/ text_based_rl
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Internal AI Research Evaluation Suite 1/ time_series_forecasting
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Internal AI Research Evaluation Suite 1/ kernels
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Internal AI Research Evaluation Suite 1
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
short_horizon_computational_biology
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
creative_biology_automated_evaluations
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
CharXiv/ reasoning
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Lab-Bench/ figqa
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
multimodal_virology
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Long-form virology tasks
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
External Agent Red Teaming/ tool_use
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MedCalc-Bench/ verified
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MILU
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GMMLU
othermentioned
Averagemissing: shot countmissing: methodmissing: training state
self-reported
/ diamond
reasoningscored
93.2%
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
91.9%
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
91.3%
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
89.9%
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
87.0%
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
83.4%
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2_verified
reasoningscored
68.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2_verified
reasoningscored
58.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2_verified
reasoningscored
54.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2_verified
reasoningscored
37.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2_verified
reasoningscored
31.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 2_verified
reasoningscored
13.6
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
safetymentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ pro
visionscored
81.0%
accuracy
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ pro
visionscored
80.4%
accuracy
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ pro
visionscored
79.5%
accuracy
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ pro2 others disagree
visionscored
77.3%
accuracy
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ pro
visionscored
75.6%
accuracy
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ pro
visionscored
74.5%
accuracy
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ pro
visionscored
73.9%
accuracy
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ pro2 others disagree
visionscored
73.9%
accuracy
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ pro
visionscored
70.6%
accuracy
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ pro
visionscored
68.9%
accuracy
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ pro
visionscored
63.4%
accuracy
no-toolsmissing: shot countmissing: languagemissing: training state
self-reported