AI Training Contractor | Handshake AI
Designed and evaluated training tasks for LLM fine-tuning and RLHF pipelines using structured QA methods to judge outputs against defined quality rubrics. Authored complex prompts and detailed scoring rubrics with 20+ criteria to benchmark model performance on technical, domain-specific tasks. Ensured consistency across task batches by flagging systematic errors and iterating on rubric design to improve training signal quality. • Produced annotated training inputs/outputs for an AI data operations pipeline feeding model improvement cycles • Benchmarked performance across workflows using QGIS and ParaView domain task contexts • Iterated on rubric and task definitions based on observed error patterns and quality checks • Applied QA assessment standards to maintain batch-level reliability for training data