Gen AI Model Trainer and AI Evaluation Specialist — Surge AI (Remote)
Evaluated and ranked LLM responses for helpfulness, factuality, safety, instruction-following, reasoning quality, and tone to support model alignment. Performed comparative preference ranking and identified hallucinations, logical inconsistencies, edge-case failures, and bias risks using nuanced evaluation rubrics. Produced actionable evaluator feedback to guide future training and optimization priorities for reasoning- and safety-sensitive outputs. • Ranked and scored model responses against multi-dimensional rubrics • Conducted preference ranking and comparative response analysis for RLHF workflows • Documented failure patterns and bias concerns for downstream model improvement • Assessed adherence to multi-step instructions and safety constraints