Concept icon
Concept

Contamination as a Non-Substantive Confounder in GPT-4 Exam Evaluation

Across comprehensive evaluations on standardized academic and professional exams, pre-training data contamination did not act as a substantive confounding factor for GPT-4's performance. The calculated degradation between non-contaminated and contaminated questions was generally minor and occurred approximately as often with a positive sign as with a negative sign, demonstrating that prior exposure to exam questions in the training corpus did not artificially drive the model's high test scores.

0

1

Concept icon
Updated 2026-09-07

Tags

Prep Sessions

Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor

Ch.2 Model Scaling and Capability Evaluation - Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor

Test Set Contamination Analysis - Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor