Model-Assisted Safety Pipeline
The model-assisted safety pipeline is an alignment framework that uses the language models themselves as tools to steer model behavior toward safe and nuanced responses. Designed to address failure modes in standard RLHF—such as generating unsafe advice or becoming overly cautious by hedging and refusing benign queries—the framework consists of two primary components: an expanded set of safety-relevant training prompts and rule-based reward models (RBRMs) that supply targeted feedback during reinforcement learning fine-tuning.
0
1
Tags
Prep Sessions
Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor
Ch.3 Model Alignment and Safety - Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor
Model-Assisted Safety and Rule-Based Reward Models - Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor
Learn After
Which set of failure modes in standard reinforcement learning from human feedback (RLHF) is the model-assisted safety pipeline designed to address?
Within the model-assisted safety pipeline, what specific role do rule-based reward models (RBRMs) perform during reinforcement learning fine-tuning?
Rule-Based Reward Models (RBRMs)