Model Cards / Anthropic

Claude 2 Model Card

model card5,761 words·25 min read·Aug 20, 2026·Source
Version History
Chaptered summary is still being generated for this document. Showing a heuristic brief in the meantime.
Summary
5,761-word document condensed to 96 words. Anthropic · Aug 20, 2026
TL;DR

This report includes the model card [1] for Claude models, focusing on Claude 2, along with the results of a range of safety, alignment, and capabilities evaluations. We have been iterating on the training and evaluation of Claude-type models since our first work on Reinforcement Learning from Human Feedback (RLHF) [2]; the newest Claude 2 model represents a continuous evolution from those early a

Top benchmarks
BenchmarkVariantScore
GRE5-shot, cot, verbal_reasoning, score165.00
GRE5-shot, cot, quantitative_reasoning, score154.00
ARC-Challenge5-shot, accuracy91.0%
ARC-Challenge5-shot, accuracy90.0%
RACE-H5-shot, accuracy88.8%
RACE-H5-shot, accuracy88.3%
GSM8K0-shot, cot, accuracy88.0%
TriviaQA5-shot, accuracy87.5%

Showing top 8 of 53. See full list below.

Every italicized passage is a verbatim substring of the source document (checked deterministically after extraction). Field selection is heuristic — some quotes may lack surrounding context and some claims may be absent if no matching pattern appeared. For citation, open the source: original model card · source SHA 37ba0c80ecea · version dated Aug 20, 2026.

Extracted Evaluations(53 results)

Sort by:0/53 rows fully reproducible (0%)
BenchmarkCategoryStateScoreSetupSource
codingscored
71.2%
pass at 1
0-shotmissing: methodmissing: languagemissing: training state
self-reported
codingscored
56.0%
pass at 1
0-shotmissing: methodmissing: languagemissing: training state
self-reported
codingscored
52.8%
pass at 1
0-shotmissing: methodmissing: languagemissing: training state
self-reported
general_knowledgescored
87.5
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
general_knowledgescored
86.7
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
general_knowledgescored
78.9
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
knowledgescored
78.5%
cot correct
5-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
77.0%
cot correct
5-shotcotmissing: languagemissing: training state
self-reported
knowledgescored
73.4%
cot correct
5-shotcotmissing: languagemissing: training state
self-reported
long_contextscored
84.1
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
long_contextscored
83.2
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
long_contextscored
80.5
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
mathscored
88.0%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
85.2%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
mathscored
80.9%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
GRE/ verbal_reasoning
otherscored
165.0
score
5-shotcotmissing: languagemissing: training state
self-reported
GRE/ quantitative_reasoning
otherscored
154.0
score
5-shotcotmissing: languagemissing: training state
self-reported
otherscored
88.8
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
otherscored
88.3
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
otherscored
85.5
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
Held-Out Harmfulness Prompts
otherscored
4.0
count
ENmissing: shot countmissing: methodmissing: training state
self-reported
HHH/ combined
otherscored
0.9
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
HHH/ combined
otherscored
0.8
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
HHH/ combined
otherscored
0.8
accuracy
0-shotmissing: methodmissing: languagemissing: training state
self-reported
Multilingual Translation Evaluation
othermentioned
Averagemissing: shot countmissing: methodmissing: training state
self-reported
GRE/ analytical_writing
othermentioned
2-shotmissing: methodmissing: languagemissing: training state
self-reported
HHH/ combined
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
HHH/ combined
othermentioned
5-shotpretrainedmissing: methodmissing: language
self-reported
Human Preference Elo Evaluation/ helpfulness
othermentioned
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Elo Evaluation/ helpfulness
othermentioned
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Elo Evaluation/ honesty
othermentioned
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Elo Evaluation/ honesty
othermentioned
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Elo Evaluation/ honesty
othermentioned
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Elo Evaluation/ harmlessness
othermentioned
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Elo Evaluation/ harmlessness
othermentioned
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Human Preference Elo Evaluation/ harmlessness
othermentioned
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Chatbot Arena
othercited
elo
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
ARC Autonomous Replication Evaluations
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
91.0%
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
90.0%
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
85.7%
accuracy
5-shotmissing: methodmissing: languagemissing: training state
self-reported
/ ambiguous
safetymentioned
bias score
ENmissing: shot countmissing: methodmissing: training state
self-reported
/ ambiguous
safetymentioned
bias score
ENmissing: shot countmissing: methodmissing: training state
self-reported
/ ambiguous
safetymentioned
bias score
ENmissing: shot countmissing: methodmissing: training state
self-reported
/ ambiguous
safetymentioned
bias score
ENmissing: shot countmissing: methodmissing: training state
self-reported
/ disambiguated
safetymentioned
accuracy
ENmissing: shot countmissing: methodmissing: training state
self-reported
/ disambiguated
safetymentioned
accuracy
ENmissing: shot countmissing: methodmissing: training state
self-reported
/ disambiguated
safetymentioned
accuracy
ENmissing: shot countmissing: methodmissing: training state
self-reported
/ disambiguated
safetymentioned
accuracy
ENmissing: shot countmissing: methodmissing: training state
self-reported
safetymentioned
0-shotENbasemissing: method
self-reported
safetymentioned
0-shotENmissing: methodmissing: training state
self-reported
safetymentioned
0-shotENmissing: methodmissing: training state
self-reported
safetymentioned
0-shotENmissing: methodmissing: training state
self-reported