AI Data Specialist (RLHF Contributor) — Freelance/Remote AI Projects (Scale AI, Remotasks, Appen & similar)
Contributed to Reinforcement Learning from Human Feedback (RLHF) pipelines by ranking and rating model responses. Evaluated response quality to support alignment with desired behavior. Helped improve model outputs by enabling preference-based training signals. • Ranked competing model responses by quality • Rated responses for alignment and usefulness • Supported RLHF preference data generation • Provided judgments used in training and iteration