Model Cards / Anthropic

Claude 3.5 Haiku Addendum

model card5,458 words·24 min read·Aug 20, 2026·Source
Version History
Chaptered summary is still being generated for this document. Showing a heuristic brief in the meantime.
Summary
5,458-word document condensed to 76 words. Anthropic · Aug 20, 2026
TL;DR

human evaluations. This section presents our evaluation results 1covering areas such as reasoning, coding, visual understanding, and the new computer use capability.

Top benchmarks
BenchmarkVariantScore
Wildchattoxic, correct_refusal_rate96.4%
Wildchattoxic, correct_refusal_rate93.6%
BIG-Bench Hard3-shot, cot, cot_correct93.2%
BIG-Bench Hard3-shot, cot, cot_correct93.1%
Wildchattoxic, correct_refusal_rate92.0%
MMLU5-shot, cot, cot_correct90.5%
MMLU5-shot, cot, cot_correct90.4%
IFEvalaccuracy90.2%

Showing top 8 of 155. See full list below.

Capability claim
  • We present some examples of the upgraded Claude 3.5 Sonnet performing computer use.
Limitations the lab flags
  • further research into changing threat models and eval- uations.

Every italicized passage is a verbatim substring of the source document (checked deterministically after extraction). Field selection is heuristic — some quotes may lack surrounding context and some claims may be absent if no matching pattern appeared. For citation, open the source: original model card · source SHA 946c36f7a458 · version dated Aug 20, 2026.

Extracted Evaluations(155 results)

Sort by:3 conflicting reports0/155 rows fully reproducible (0%)
BenchmarkCategoryStateScoreSetupSource
/ os
agentscored
75.0
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ professional
agentscored
73.5
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ workflow
agentscored
73.3
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ overall
agentscored
72.4
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ office
agentscored
71.8
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ daily
agentscored
70.5
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ retail
agentscored
69.2
pass hat 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ retail
agentscored
62.6
pass hat 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ os
agentscored
54.2
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ retail
agentscored
51.0
pass hat 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ airline
agentscored
46.0
pass hat 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ retail
agentscored
45.1
pass hat 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ os
agentscored
41.7
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ professional
agentscored
40.8
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ airline
agentscored
36.0
pass hat 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ airline
agentscored
34.5
pass hat 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ professional
agentscored
24.5
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ daily
agentscored
24.4
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ airline
agentscored
22.8
pass hat 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ overall
agentscored
22.0
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ retail
agentscored
18.2
pass hat 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ office
agentscored
17.9
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ daily
agentscored
16.7
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ airline
agentscored
16.0
pass hat 1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ overall
agentscored
14.9
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ workflow
agentscored
10.9
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ workflow
agentscored
7.9
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ office
agentscored
7.7
success rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ retail
agentmentioned
pass hat k
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ retail
agentmentioned
pass hat k
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
codingscored
88.1%
pass at 1
0-shotmissing: methodmissing: languagemissing: training state
self-reported
codingscored
87.2%
pass at 1
0-shotmissing: methodmissing: languagemissing: training state
self-reported
codingscored
75.9%
pass at 1
0-shotmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
49.0%
pass at 1
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ verified
codingscored
45.2%
resolve rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ verified
codingscored
40.6%
pass at 1
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ verified
codingscored
33.4%
pass at 1
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ verified
codingscored
22.2%
pass at 1
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ verified
codingscored
7.2%
pass at 1
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
instruction_followingscored
90.2%
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
instruction_followingscored
88.6%
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
instruction_followingscored
87.8%
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
instruction_followingscored
86.7%
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
instruction_followingscored
85.9%
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
instruction_followingscored
81.1%
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
instruction_followingscored
77.2%
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
knowledgescored
90.5%
cot correct
5-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
90.4%
cot correct
5-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
89.3%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
88.7%
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
knowledgescored
88.7%
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
16 others disagree
knowledgescored
88.7%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
88.6%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
88.3%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
88.2%
cot correct
5-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
87.3%
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
knowledgescored
86.8%
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
knowledgescored
85.7%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
82.0%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
81.5%
cot correct
5-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
80.9%
cot correct
5-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
80.3%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
78.3%
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
/ pro
knowledgescored
78.0%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
77.6%
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
knowledgescored
77.1%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
76.7%
cot correct
5-shotcotmissing: languagemissing: training state
self-reported
/ pro
knowledgescored
75.8%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
75.2%
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
/ pro
knowledgescored
75.1%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
74.0%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ pro
knowledgescored
73.3%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ pro
knowledgescored
67.9%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ pro
knowledgescored
67.3%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ pro
knowledgescored
65.0%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ pro
knowledgescored
54.9%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ pro
knowledgescored
49.0%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
78.3%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
77.9%
cot correct
4-shotcotmissing: languagemissing: training state
self-reported
mathscored
71.1%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
70.2%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
69.2%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
3 others disagree
mathscored
60.1%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
43.1%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
38.9%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ 2024
mathscored
27.6%
maj at 64
0-shotmajority-votingmissing: languagemissing: training state
self-reported
/ 2024
mathscored
16.7%
maj at 64
0-shotmajority-votingmissing: languagemissing: training state
self-reported
/ 2024
mathscored
16.0%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ 2024
mathscored
13.4%
maj at 64
0-shotmajority-votingmissing: languagemissing: training state
self-reported
/ 2024
mathscored
12.1%
maj at 64
0-shotmajority-votingmissing: languagemissing: training state
self-reported
/ 2024
mathscored
10.1%
maj at 64
0-shotmajority-votingmissing: languagemissing: training state
self-reported
/ 2024
mathscored
9.6%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ 2024
mathscored
9.3%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ 2024
mathscored
7.9%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ 2024
mathscored
5.3%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ 2024
mathscored
1.8%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ 2024
mathscored
0.8%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ 2024
mathscored
0.6%
maj at 64
0-shotmajority-votingmissing: languagemissing: training state
self-reported
/ 2024
mathscored
0.4%
maj at 64
0-shotmajority-votingmissing: languagemissing: training state
self-reported
multilingualscored
87.0%
cot correct
0-shotcotAveragemissing: training state
self-reported
multilingualscored
85.6%
cot correct
0-shotcotAveragemissing: training state
self-reported
multilingualscored
75.1%
cot correct
0-shotcotAveragemissing: training state
self-reported
Wildchat/ toxic
otherscored
96.4
correct refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
Wildchat/ toxic
otherscored
93.6
correct refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
Wildchat/ toxic
otherscored
92.0
correct refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
Wildchat/ toxic
otherscored
90.0
correct refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
Wildchat/ toxic
otherscored
89.2
correct refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
Wildchat/ toxic
otherscored
88.0
correct refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
Agentic Coding Evaluation
otherscored
78.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Agentic Coding Evaluation
otherscored
74.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Agentic Coding Evaluation
otherscored
64.0
pass rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Feedback Win Rate/ document_analysis
otherscored
61.0
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Feedback Win Rate/ creative_writing
otherscored
58.0
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Feedback Win Rate/ visual_understanding
otherscored
57.0
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Feedback Win Rate/ coding
otherscored
52.0
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Feedback Win Rate/ instruction_following
otherscored
51.0
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Wildchat/ non_toxic
otherscored
11.9
incorrect refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
Wildchat/ non_toxic
otherscored
11.0
incorrect refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
Wildchat/ non_toxic
otherscored
8.8
incorrect refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
Wildchat/ non_toxic
otherscored
6.6
incorrect refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
Wildchat/ non_toxic
otherscored
5.3
incorrect refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
Wildchat/ non_toxic
otherscored
4.8
incorrect refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
Human Feedback Win Rate/ coding
othermentioned
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Feedback Win Rate/ document_analysis
othermentioned
win rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
93.2
cot correct
3-shotcotmissing: languagemissing: training state
self-reported
reasoningscored
93.1
cot correct
3-shotcotmissing: languagemissing: training state
self-reported
reasoningscored
88.3%
f1
3-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
87.1%
f1
3-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
86.8
cot correct
3-shotcotmissing: languagemissing: training state
self-reported
reasoningscored
86.6
cot correct
3-shotcotmissing: languagemissing: training state
self-reported
reasoningscored
83.4%
f1
3-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
83.1%
f1
3-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
83.1%
f1
3-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
82.9
cot correct
3-shotcotmissing: languagemissing: training state
self-reported
reasoningscored
79.7%
f1
3-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
78.9%
f1
3-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
78.4%
f1
3-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
73.7
cot correct
3-shotcotmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
65.0%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
59.4%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
59.1%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
53.6%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
51.1%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
51.0%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ diamond9 others disagree
reasoningscored
50.4%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
41.6%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
40.4%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
40.2%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
/ diamond
reasoningscored
33.3%
cot correct
0-shotcotmissing: languagemissing: training state
self-reported
safetyscored
36.6
incorrect refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
safetyscored
33.1
incorrect refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
safetyscored
8.3
incorrect refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
safetyscored
4.3
incorrect refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
safetyscored
2.0
incorrect refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
safetyscored
1.7
incorrect refusal rate
ENmissing: shot countmissing: methodmissing: training state
self-reported