Model Cards / Meta AI

Llama 3.1 Technical Paper

model card52,669 words·229 min read·Aug 20, 2026·Source
Version History
Chaptered summary is still being generated for this document. Showing a heuristic brief in the meantime.
Summary
52,669-word document condensed to 103 words. Meta AI · Aug 20, 2026
TL;DR

Llama Team, AI @ Meta1 1A detailed contributor list can be found in the appendix of this paper. Modern artificial intelligence (AI) systems are powered by foundation models.

Top benchmarks
BenchmarkVariantScore
GREverbal, scaled_score167.00
GREverbal, scaled_score167.00
GREverbal, scaled_score166.00
GREverbal, scaled_score166.00
GREquantitative, scaled_score166.00
GREquantitative, scaled_score164.00
GREverbal, scaled_score162.00
GREquantitative, scaled_score162.00

Showing top 8 of 164. See full list below.

Capability claim
  • we present a new set of foundation models for language, calledLlama 3.
Safety findings
  • not released or because the API does not provide access to log-probabilities.
Deployment scope
  • available at the time for reward modeling, while only using the latest batches from various capabilities for DPO training.

Every italicized passage is a verbatim substring of the source document (checked deterministically after extraction). Field selection is heuristic — some quotes may lack surrounding context and some claims may be absent if no matching pattern appeared. For citation, open the source: original model card · source SHA 578dc31aa9a4 · version dated Aug 20, 2026.

Extracted Evaluations(164 results)

Sort by:2 conflicting reports3/164 rows fully reproducible (2%)
BenchmarkCategoryStateScoreSetupSource
agentmentioned
0-shotinstruction-tunedmissing: methodmissing: language
self-reported
codingmentioned
pretrainedmissing: shot countmissing: methodmissing: language
self-reported
codingmentioned
pass at 1
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
codingmentioned
pass at 1
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
/ plus
codingmentioned
pass at 1
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
/ evalplus_base
codingmentioned
pass at 1
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
codingmentioned
0-shotinstruction-tunedmissing: methodmissing: language
self-reported
codingmentioned
pretrainedmissing: shot countmissing: methodmissing: language
self-reported
instruction_followingmentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
/ multilingual16 others disagree
knowledgescored
85.5%
accuracy
5-shotAveragemissing: methodmissing: training state
self-reported
/ multilingual
knowledgescored
83.2%
accuracy
5-shotAverageinstruction-tunedmissing: method
self-reported
/ multilingual
knowledgescored
80.2%
accuracy
5-shotAveragemissing: methodmissing: training state
self-reported
/ multilingual
knowledgescored
78.2%
accuracy
5-shotAverageinstruction-tunedmissing: method
self-reported
/ multilingual
knowledgescored
64.3%
accuracy
5-shotAveragemissing: methodmissing: training state
self-reported
/ multilingual
knowledgescored
58.8%
accuracy
5-shotAveragemissing: methodmissing: training state
self-reported
/ multilingual
knowledgescored
58.6%
accuracy
5-shotAverageinstruction-tunedmissing: method
self-reported
/ multilingual
knowledgescored
46.8%
accuracy
5-shotAveragemissing: methodmissing: training state
self-reported
knowledgementioned
pretrainedmissing: shot countmissing: methodmissing: language
self-reported
/ pro
knowledgementioned
pretrainedmissing: shot countmissing: methodmissing: language
self-reported
knowledgementioned
5-shotinstruction-tunedmissing: methodmissing: language
self-reported
/ pro
knowledgementioned
5-shotcotinstruction-tunedmissing: language
self-reported
knowledgementioned
5-shotinstruction-tunedmissing: methodmissing: language
self-reported
knowledgementioned
5-shotinstruction-tunedmissing: methodmissing: language
self-reported
knowledgementioned
5-shotinstruction-tunedmissing: methodmissing: language
self-reported
knowledgementioned
5-shotmissing: methodmissing: languagemissing: training state
self-reported
knowledgementioned
5-shotmissing: methodmissing: languagemissing: training state
self-reported
knowledgementioned
5-shotmissing: methodmissing: languagemissing: training state
self-reported
/ pro
knowledgementioned
5-shotcotinstruction-tunedmissing: language
self-reported
/ pro
knowledgecited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ en_mc
long_contextmentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
/ en_qa
long_contextmentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
mathmentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
mathmentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
mathmentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
mathmentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
mathmentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
mathmentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
multilingualscored
91.6%
accuracy
0-shotcotAverageinstruction-tuned
self-reported
multilingualscored
91.6%
accuracy
0-shotcotAveragemissing: training state
self-reported
multilingualscored
90.5%
accuracy
0-shotcotAveragemissing: training state
self-reported
multilingualscored
86.9%
accuracy
0-shotcotAverageinstruction-tuned
self-reported
2 others disagree
multilingualscored
85.9%
accuracy
0-shotcotAveragemissing: training state
self-reported
multilingualscored
71.1%
accuracy
0-shotcotAveragemissing: training state
self-reported
multilingualscored
68.9%
accuracy
0-shotcotAverageinstruction-tuned
self-reported
multilingualscored
53.2%
accuracy
0-shotcotAveragemissing: training state
self-reported
multilingualscored
51.4%
accuracy
0-shotcotAveragemissing: training state
self-reported
multilingualscored
29.9%
accuracy
0-shotcotAveragemissing: training state
self-reported
/ test
multimodalscored
95.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ test
multimodalscored
93.1
accuracy
with-toolsmissing: shot countmissing: languagemissing: training state
self-reported
/ test
multimodalscored
92.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ test
multimodalscored
92.6
accuracy
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
/ test
multimodalscored
92.2
accuracy
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
/ test
multimodalscored
90.8
accuracy
cotmissing: shot countmissing: languagemissing: training state
self-reported
/ test
multimodalscored
88.4
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ test
multimodalscored
87.2
accuracy
cotmissing: shot countmissing: languagemissing: training state
self-reported
/ test
multimodalscored
85.8
accuracy
cotinstruction-tunedmissing: shot countmissing: language
self-reported
/ test
multimodalscored
85.7
accuracy
cotmissing: shot countmissing: languagemissing: training state
self-reported
/ test
multimodalscored
84.4
accuracy
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
/ test
multimodalscored
83.2
accuracy
cotinstruction-tunedmissing: shot countmissing: language
self-reported
/ test
multimodalscored
78.7
accuracy
cotinstruction-tunedmissing: shot countmissing: language
self-reported
/ test
multimodalscored
78.4
accuracy
cotmissing: shot countmissing: languagemissing: training state
self-reported
GRE/ verbal
otherscored
167.0
scaled score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GRE/ verbal
otherscored
167.0
scaled score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GRE/ verbal
otherscored
166.0
scaled score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GRE/ verbal
otherscored
166.0
scaled score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GRE/ quantitative
otherscored
166.0
scaled score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GRE/ quantitative
otherscored
164.0
scaled score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GRE/ verbal
otherscored
162.0
scaled score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GRE/ quantitative
otherscored
162.0
scaled score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GRE/ quantitative
otherscored
161.0
scaled score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GRE/ quantitative
otherscored
158.0
scaled score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GRE/ quantitative
otherscored
155.0
scaled score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GRE/ verbal
otherscored
154.0
scaled score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GRE/ quantitative
otherscored
152.0
scaled score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
GRE/ verbal
otherscored
149.0
scaled score
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
100.0
retrieval accuracy
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
Jailbreaks
otherscored
99.9
true positive rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Injections
otherscored
99.5
true positive rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Out-of-Distribution Jailbreaks
otherscored
97.5
true positive rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
AI2 Diagram/ test
otherscored
94.7
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
AI2 Diagram/ test
otherscored
94.4
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
AI2 Diagram/ test
otherscored
94.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
AI2 Diagram/ test
otherscored
94.1
accuracy
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
AP
otherscored
93.5
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
AI2 Diagram/ test
otherscored
93.0
accuracy
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
AP
otherscored
93.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
AP
otherscored
92.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Multilingual Jailbreaks
otherscored
91.5
true positive rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
AP
otherscored
87.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
TextVQA/ val
otherscored
84.8
accuracy
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
AI2 Diagram/ test
otherscored
84.4
accuracy
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
TextVQA/ val
otherscored
83.4
accuracy
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
AP
otherscored
81.3
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
VQAv2/ test-dev
otherscored
80.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
VQAv2/ test-dev
otherscored
80.2
accuracy
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
VQAv2/ test-dev
otherscored
79.1
accuracy
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
TextVQA/ val
otherscored
78.7
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
TextVQA/ val
otherscored
78.2
accuracy
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
AI2 Diagram/ test
otherscored
78.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
VQAv2/ test-dev
otherscored
78.0
accuracy
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
TextVQA/ val
otherscored
78.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
VQAv2/ test-dev
otherscored
77.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
AP
otherscored
74.1
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Indirect Injections
otherscored
71.4
true positive rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
AP
otherscored
70.2
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ english
otherscored
0.9
precision
ENmissing: shot countmissing: methodmissing: training state
self-reported
Llama Guard/ english
otherscored
0.9
precision
ENmissing: shot countmissing: methodmissing: training state
self-reported
Llama Guard/ english
otherscored
0.9
f1
ENmissing: shot countmissing: methodmissing: training state
self-reported
Llama Guard/ english
otherscored
0.9
f1
ENmissing: shot countmissing: methodmissing: training state
self-reported
Llama Guard/ multilingual
otherscored
0.9
precision
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ english
otherscored
0.9
recall
ENmissing: shot countmissing: methodmissing: training state
self-reported
Llama Guard/ multilingual
otherscored
0.9
precision
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ english
otherscored
0.9
recall
ENmissing: shot countmissing: methodmissing: training state
self-reported
Llama Guard/ tool_use
otherscored
0.9
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ tool_use
otherscored
0.9
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ multilingual
otherscored
0.9
f1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ multilingual
otherscored
0.9
f1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ tool_use
otherscored
0.8
f1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ tool_use
otherscored
0.8
f1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ multilingual
otherscored
0.8
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ tool_use
otherscored
0.8
precision
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ multilingual
otherscored
0.8
recall
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ tool_use
otherscored
0.8
precision
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ tool_use
otherscored
0.2
false positive rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ tool_use
otherscored
0.2
false positive rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ english
otherscored
0.0
false positive rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
Llama Guard/ english
otherscored
0.0
false positive rate
ENmissing: shot countmissing: methodmissing: training state
self-reported
Llama Guard/ multilingual
otherscored
0.0
false positive rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Llama Guard/ multilingual
otherscored
0.0
false positive rate
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Safety Violation Rate/ indiscriminate_weapons
otherscored
0.0
violation rate reduction
ENinstruction-tunedmissing: shot countmissing: method
self-reported
Safety Violation Rate/ privacy
otherscored
-40.0
violation rate reduction
ENinstruction-tunedmissing: shot countmissing: method
self-reported
Safety Violation Rate/ suicide_self_harm
otherscored
-62.0
violation rate reduction
ENinstruction-tunedmissing: shot countmissing: method
self-reported
Safety Violation Rate/ violent_crimes
otherscored
-67.0
violation rate reduction
ENinstruction-tunedmissing: shot countmissing: method
self-reported
Safety Violation Rate/ specialized_advice
otherscored
-70.0
violation rate reduction
ENinstruction-tunedmissing: shot countmissing: method
self-reported
Safety Violation Rate/ sex_related_crimes
otherscored
-75.0
violation rate reduction
ENinstruction-tunedmissing: shot countmissing: method
self-reported
Safety Violation Rate/ non_violent_crimes
otherscored
-80.0
violation rate reduction
ENinstruction-tunedmissing: shot countmissing: method
self-reported
Safety Violation Rate/ intellectual_property
otherscored
-88.0
violation rate reduction
ENinstruction-tunedmissing: shot countmissing: method
self-reported
Safety Violation Rate/ sexual_content
otherscored
-100.0
violation rate reduction
ENinstruction-tunedmissing: shot countmissing: method
self-reported
othermentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
API-Bank
othermentioned
0-shotinstruction-tunedmissing: methodmissing: language
self-reported
API-Bench
othermentioned
0-shotinstruction-tunedmissing: methodmissing: language
self-reported
/ multi_needle
othermentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
ZeroSCROLLS
othermentioned
0-shotinstruction-tunedmissing: methodmissing: language
self-reported
ZeroSCROLLS
othermentioned
0-shotinstruction-tunedmissing: methodmissing: language
self-reported
Conic10k
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
VQAv2
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
ICL Consistency Test
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
CoVoST/ 2
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Super-NaturalInstructions
othercited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
reasoningmentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
reasoningmentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
reasoningmentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
reasoningmentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
reasoningmentioned
instruction-tunedmissing: shot countmissing: methodmissing: language
self-reported
reasoningmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
reasoningmentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ val
visionscored
69.1%
accuracy
cotmissing: shot countmissing: languagemissing: training state
self-reported
/ val
visionscored
68.3%
accuracy
cotmissing: shot countmissing: languagemissing: training state
self-reported
/ val
visionscored
64.5%
accuracy
cotinstruction-tunedmissing: shot countmissing: language
self-reported
/ val
visionscored
62.2%
accuracy
cotmissing: shot countmissing: languagemissing: training state
self-reported
/ val
visionscored
60.6%
accuracy
cotinstruction-tunedmissing: shot countmissing: language
self-reported
/ val
visionscored
56.4%
accuracy
cotmissing: shot countmissing: languagemissing: training state
self-reported
/ val
visionscored
49.6%
accuracy
cotinstruction-tunedmissing: shot countmissing: language
self-reported
visioncited
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported