AI / LLM Trainer (Chemistry & Mathematics) - Scale AI (Outlier), Remote
Trained large language models by creating and evaluating chemistry and mathematics prompts, rubrics, and reasoning-tree structures to measure output quality. Produced structured human feedback used to score and iteratively improve model responses for accuracy and reasoning quality. Crafted adversarial prompts to induce failure modes and assess how model reasoning changes under challenging inputs. • Prompt and rubric design for chemistry/math tasks • Evaluation and rating of model outputs • Structured human feedback for RLHF-style improvement • Red-teaming via adversarial prompting