Multiple Choice

On translated versions of the MMLU benchmark, which models' English-language benchmark scores does GPT-4 outperform across the vast majority of evaluated languages?

0

1

Updated 2026-09-11

Tags

Prep Sessions

Frontier Foundation Models, Capability Evaluation, and Just-In-Time Agent Harnesses @ University of Michigan - Ann Arbor

Ch.1 Foundation Model Capabilities and Benchmarking - Frontier Foundation Models, Capability Evaluation, and Just-In-Time Agent Harnesses @ University of Michigan - Ann Arbor

Multilingual Generalization on MMLU - Frontier Foundation Models, Capability Evaluation, and Just-In-Time Agent Harnesses @ University of Michigan - Ann Arbor