RLHF trains AI using human ratings
RLHF trains AI using human ratings. First, AI pre-trains on text to learn language. Then humans rank multiple AI answers for quality. Finally, AI gets "rewards" for answers humans prefer. This teaches it to be helpful, safe, and admit uncertainty instead of just predicting words. Humans' biases transfer to the AI too.