PromptHub

Reward Modeling

Quick Definition

Training models to predict human preferences for RLHF

Full Definition

Training a model to predict human preferences and provide reward signals for reinforcement learning from human feedback.

Examples

RLHF training pipeline, preference learning, alignment

Related Terms

rlhf ai-alignment reinforcement-learning

More Artificial Intelligence Terms