Comparison

Transformer Positional Encoding: Sinusoidal versus Learned Embeddings

The Transformer can use either fixed sinusoidal positional encodings or learned positional embeddings. On the newstest2013 English-to-German development set, the learned variant nearly matched the base sinusoidal model: both had a perplexity of 4.92, while BLEU was 25.7 for learned embeddings and 25.8 for the base model. The sinusoidal variant was retained because its fixed functions may extrapolate to sequence lengths beyond those encountered during training.

0

1

Updated 2026-09-12

Tags

Prep Sessions

Foundational Deep Learning Architectures: Transformers and Residual Networks @ University of Michigan - Ann Arbor

Ch.1 Transformer Architecture and Components - Foundational Deep Learning Architectures: Transformers and Residual Networks @ University of Michigan - Ann Arbor

Sinusoidal and Learned Positional Encodings - Foundational Deep Learning Architectures: Transformers and Residual Networks @ University of Michigan - Ann Arbor

Related