Model Cards / Anthropic

Claude 3.5 Model Card Addendum

model card2,964 words·13 min read·Aug 20, 2026·Source
Version History
Chaptered summary is still being generated for this document. Showing a heuristic brief in the meantime.
Summary
2,964-word document condensed to 77 words. Anthropic · Aug 20, 2026
TL;DR

This addendum to our Claude 3 Model Card describes Claude 3.5 Sonnet, a new model which outperforms our previous most capable model, Claude 3 Opus, while operating faster and at a lower cost. Claude 3.5 Sonnet offers improved capabilities, including better coding and visual processing.

Top benchmarks
BenchmarkVariantScore
Needle In A Haystack200k_context_length, recall99.7%
Needle In A Haystackall_context_lengths, recall99.7%
Needle In A Haystackall_context_lengths, recall99.4%
Needle In A Haystack200k_context_length, recall98.3%
GSM8K0-shot, cot, accuracy96.4%
Wildchattoxic, correct_refusal_rate96.4%
Needle In A Haystackall_context_lengths, recall95.9%
Needle In A Haystackall_context_lengths, recall95.4%

Showing top 8 of 131. See full list below.

Every italicized passage is a verbatim substring of the source document (checked deterministically after extraction). Field selection is heuristic — some quotes may lack surrounding context and some claims may be absent if no matching pattern appeared. For citation, open the source: original model card · source SHA 33c11beb6320 · version dated Aug 20, 2026.

Extracted Evaluations(131 results)

Sort by:5 conflicting reports0/131 rows fully reproducible (0%)
BenchmarkCategoryStateScoreSetupSource
codingscored
92.0%
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
codingscored
90.2%
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
codingscored
87.1%
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
codingscored
84.9%
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
codingscored
84.1%
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
codingscored
84.1%
accuracy
0-shotinstruction-tunedmissing: methodmissing: language
self-reported
codingscored
73.0%
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
knowledgescored
90.4%
accuracy
5-shotcotmissing: languagemissing: training state
self-reported
16 others disagree
knowledgescored
88.7%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
88.7%
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
knowledgescored
88.3%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
88.2%
accuracy
5-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
86.8%
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
knowledgescored
86.5%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
86.1%
accuracy
5-shotinstruction-tunedmissing: methodmissing: language
self-reported
knowledgescored
85.9%
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
knowledgescored
85.7%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
81.5%
accuracy
5-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
78.3%
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
knowledgescored
77.1%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
96.4%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
95.0%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
94.1%
accuracy
8-shotcotinstruction-tunedmissing: language
self-reported
mathscored
92.3%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
90.8%
accuracy
11-shotmissing: methodmissing: languagemissing: training state
self-reported
mathscored
76.6%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
72.6%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
71.1%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
3 others disagree
mathscored
67.7%
accuracy
4-shotmissing: methodmissing: languagemissing: training state
self-reported
3 others disagree
mathscored
60.1%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
57.8%
accuracy
4-shotcotinstruction-tunedmissing: language
self-reported
mathscored
43.1%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
multilingualscored
91.6%
accuracy
0-shotcotAveragemissing: training state
self-reported
multilingualscored
90.7%
accuracy
0-shotcotAveragemissing: training state
self-reported
multilingualscored
90.5%
accuracy
0-shotcotAveragemissing: training state
self-reported
multilingualscored
88.5%
accuracy
0-shotcotAveragemissing: training state
self-reported
multilingualscored
87.5%
accuracy
8-shotAveragemissing: methodmissing: training state
self-reported
multilingualscored
83.5%
accuracy
0-shotcotAveragemissing: training state
self-reported
/ test
multimodalscored
95.2
anls
0-shotmissing: methodmissing: languagemissing: training state
self-reported
/ test
multimodalscored
93.1
anls
0-shotmissing: methodmissing: languagemissing: training state
self-reported
/ test
multimodalscored
92.8
anls
0-shotmissing: methodmissing: languagemissing: training state
self-reported
/ test
multimodalscored
90.8
relaxed accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ test
multimodalscored
89.5
anls
0-shotmissing: methodmissing: languagemissing: training state
self-reported
/ test
multimodalscored
89.3
anls
0-shotmissing: methodmissing: languagemissing: training state
self-reported
/ test
multimodalscored
87.2
anls
0-shotmissing: methodmissing: languagemissing: training state
self-reported
/ test
multimodalscored
87.2
relaxed accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ test
multimodalscored
85.7
relaxed accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ test
multimodalscored
81.1
relaxed accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ test
multimodalscored
80.8
relaxed accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ test
multimodalscored
78.1
relaxed accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ testmini
multimodalscored
67.7
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ testmini
multimodalscored
63.9
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ testmini
multimodalscored
63.8
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ testmini
multimodalscored
58.1
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ testmini
multimodalscored
50.5
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ testmini
multimodalscored
47.9
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ 200k_context_length
otherscored
99.7
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ all_context_lengths
otherscored
99.7
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ all_context_lengths
otherscored
99.4
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 200k_context_length
otherscored
98.3
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Wildchat/ toxic
otherscored
96.4
correct refusal rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ all_context_lengths
otherscored
95.9
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ all_context_lengths
otherscored
95.4
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ test
otherscored
94.7
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
/ all_context_lengths
otherscored
94.5
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ test
otherscored
94.4
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
/ test
otherscored
94.2
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
Wildchat/ toxic
otherscored
93.6
correct refusal rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 200k_context_length
otherscored
92.7
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Wildchat/ toxic
otherscored
92.0
correct refusal rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 200k_context_length
otherscored
91.9
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ 200k_context_length
otherscored
91.4
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Wildchat/ toxic
otherscored
90.0
correct refusal rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ test
otherscored
89.4
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
/ test
otherscored
88.7
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
/ test
otherscored
88.1
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Win Rate/ law
otherscored
82.0
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Win Rate/ finance
otherscored
73.0
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Win Rate/ philosophy
otherscored
73.0
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
64.0
pass rate
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
Human Preference Win Rate/ coding
otherscored
60.0
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Win Rate/ coding
otherscored
50.0
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Win Rate/ coding
otherscored
45.0
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Win Rate/ coding
otherscored
41.0
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
38.0
pass rate
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
Human Preference Win Rate/ coding
otherscored
33.0
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
21.0
pass rate
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
otherscored
17.0
pass rate
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
Wildchat/ non_toxic
otherscored
11.9
incorrect refusal rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Wildchat/ non_toxic
otherscored
11.0
incorrect refusal rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Wildchat/ non_toxic
otherscored
8.8
incorrect refusal rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Wildchat/ non_toxic
otherscored
6.6
incorrect refusal rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Win Rate/ harmlessness
othermentioned
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Win Rate/ documents
othermentioned
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
simple-evals
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
RSP Evaluation Protocol
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
UK AISI Pre-Deployment Evaluation
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
METR Autonomy Evaluation
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Autonomous Capabilities Evaluation
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Cybersecurity CTF Challenges
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
CBRN Knowledge and Uplift Evaluations
othermentioned
without-mitigationsmissing: shot countmissing: languagemissing: training state
self-reported
reasoningscored
93.1
accuracy
3-shotcotmissing: languagemissing: training state
self-reported
reasoningscored
89.2
accuracy
3-shotcotmissing: languagemissing: training state
self-reported
reasoningscored
87.1%
f1
3-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
86.8
accuracy
3-shotcotmissing: languagemissing: training state
self-reported
reasoningscored
86.0%
f1
3-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
85.3
accuracy
3-shotcotpretrainedmissing: language
self-reported
reasoningscored
83.5%
f1
3-shotpretrainedmissing: methodmissing: language
self-reported
reasoningscored
83.4%
f1
3-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
83.1%
f1
3-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
82.9
accuracy
3-shotcotmissing: languagemissing: training state
self-reported
reasoningscored
78.9%
f1
3-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
74.9%
f1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
67.2%
accuracy
5-shotmajority-votingmissing: languagemissing: training state
self-reported
/ diamond9 others disagree
reasoningscored
59.5%
accuracy
5-shotmajority-votingmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
59.4%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
53.6%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ diamond9 others disagree
reasoningscored
50.4%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
48.0%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
46.3%
accuracy
5-shotmajority-votingmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
40.4%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
safetyscored
36.6
incorrect refusal rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
safetyscored
33.1
incorrect refusal rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
safetyscored
8.3
incorrect refusal rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
safetyscored
1.7
incorrect refusal rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ validation
visionscored
69.1%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ validation
visionscored
68.3%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ validation
visionscored
63.1%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ validation
visionscored
62.2%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ validation
visionscored
59.4%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
/ validation
visionscored
53.1%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported