Model Cards / Anthropic

Claude 3 Model Card

model card14,161 words·62 min read·Aug 20, 2026·Source
Version History
Chaptered summary is still being generated for this document. Showing a heuristic brief in the meantime.
Summary
14,161-word document condensed to 159 words. Anthropic · Aug 20, 2026
TL;DR

We introduce Claude 3, a new family of large multimodal models – Claude 3 Opus , our most capable offering, Claude 3 Sonnet, which provides a combination of skills and speed, and Claude 3 Haiku , our fastest and least expensive model. All new models have vision capabilities that enable them to process and analyze image data.

Top benchmarks
BenchmarkVariantScore
MGSM8-shot, Average, accuracy90.5%
MGSM8-shot, Average, accuracy88.7%
MGSM8-shot, Average, accuracy83.7%
MGSM8-shot, Average, accuracy79.0%
MGSM8-shot, Average, accuracy76.5%
MGSM8-shot, Average, accuracy74.5%
MATHmajority-voting, accuracy73.7%
MGSM8-shot, Average, accuracy63.5%

Showing top 8 of 37. See full list below.

Capability claim
  • We introduce Claude 3, a new family of large multimodal models – Claude 3 Opus , our most capable offering, Claude 3 Sonnet, which provides a combination of skills and speed, and Claude 3 Haiku , our fastest and least expensive model.
Deployment scope
  • accessible to individuals with disabilities, resulting in lower model stereotype bias.
Limitations the lab flags
  • further research, we plan to incorporate lessons learned into future iterations of the RSP and model launches.

Every italicized passage is a verbatim substring of the source document (checked deterministically after extraction). Field selection is heuristic — some quotes may lack surrounding context and some claims may be absent if no matching pattern appeared. For citation, open the source: original model card · source SHA e8edb8fefac8 · version dated Aug 20, 2026.

Extracted Evaluations(37 results)

Sort by:6 conflicting reports0/37 rows fully reproducible (0%)
BenchmarkCategoryStateScoreSetupSource
codingmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
codingmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
knowledgementioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
knowledgementioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ multilingual
knowledgementioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
long_contextmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
3 others disagree
mathscored
73.7%
accuracy
majority-votingENmissing: shot countmissing: training state
self-reported
mathmentioned
ENmissing: shot countmissing: methodmissing: training state
self-reported
mathmentioned
ENmissing: shot countmissing: methodmissing: training state
self-reported
medicalmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
multilingualscored
90.5%
accuracy
8-shotAveragemissing: methodmissing: training state
self-reported
multilingualscored
88.7%
accuracy
8-shotAveragemissing: methodmissing: training state
self-reported
multilingualscored
83.7%
accuracy
8-shotAveragemissing: methodmissing: training state
self-reported
multilingualscored
79.0%
accuracy
8-shotAveragemissing: methodmissing: training state
self-reported
multilingualscored
76.5%
accuracy
8-shotAveragemissing: methodmissing: training state
self-reported
2 others disagree
multilingualscored
74.5%
accuracy
8-shotAveragemissing: methodmissing: training state
self-reported
multilingualscored
63.5%
accuracy
8-shotAveragemissing: methodmissing: training state
self-reported
multilingualmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
multilingualmentioned
0-shotAveragemissing: methodmissing: training state
self-reported
cyber capabilities evaluation
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ high
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
BIG-Bench/ hard
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Autonomous Replication and Adaption
othermentioned
without-safeguardsmissing: shot countmissing: languagemissing: training state
self-reported
biological capabilities evaluation
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ diamond9 others disagree
reasoningscored
59.5%
accuracy
majority-votingmissing: shot countmissing: languagemissing: training state
self-reported
/ diamond9 others disagree
reasoningscored
53.3%
accuracy
5-shotcotmissing: languagemissing: training state
self-reported
/ diamond9 others disagree
reasoningscored
50.4%
accuracy
0-shotcotmissing: languagemissing: training state
self-reported
reasoningmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ challenge
reasoningmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
reasoningmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
reasoningmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
reasoningmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
9 others disagree
reasoningmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ disambiguated
safetymentioned
accuracy
ENmissing: shot countmissing: methodmissing: training state
self-reported
/ ambiguous
safetymentioned
bias score
ENmissing: shot countmissing: methodmissing: training state
self-reported
visionmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported