Activity (Process)

Measuring Test Set Contamination via Substring Matching

Cross-contamination between evaluation benchmarks and large language model pre-training data can be measured using substring matching. Prior to searching for matching substrings between the evaluation questions and the training corpus, both datasets are preprocessed by stripping out all whitespace and symbols to prevent trivial formatting variations from masking overlapping text.

0

1

Updated 2026-09-07

Tags

Prep Sessions

Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor

Ch.2 Model Scaling and Capability Evaluation - Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor

Test Set Contamination Analysis - Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor