Concept icon
Concept

Origin of GPT-4 Exam Capabilities in Pre-training

Empirical evaluation demonstrates that GPT-4's performance across standardized exam benchmarks originates primarily in the pre-training stage rather than post-training alignment. When tested on multiple-choice exam sections, the base pre-trained GPT-4 model achieves an average score of $73.7%while the post-RLHF model scores \74.0%$, indicating that reinforcement learning from human feedback does not substantially alter the fundamental capabilities acquired during pre-training.

0

1

Concept icon
Updated 2026-09-11

Tags

Prep Sessions

Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor

Ch.2 Model Scaling and Capability Evaluation - Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor

Academic and Professional Exam Benchmarks - Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor

Ch.3 Model Alignment and Safety - Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor

Impact of RLHF on Model Capability - Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor

Frontier Foundation Models, Capability Evaluation, and Just-In-Time Agent Harnesses @ University of Michigan - Ann Arbor

Ch.2 Post-Training Alignment and Calibration - Frontier Foundation Models, Capability Evaluation, and Just-In-Time Agent Harnesses @ University of Michigan - Ann Arbor

RLHF Effects on Capability and Calibration - Frontier Foundation Models, Capability Evaluation, and Just-In-Time Agent Harnesses @ University of Michigan - Ann Arbor