AI Training & Model Evaluation Specialist (Freelance/Independent)
Designed and refined complex prompts to evaluate large language model behavior across coding, logic, and creative-writing domains. Performed high-fidelity ranking of model responses using strict rubrics focused on truthfulness, helpfulness, and harmlessness. Conducted red-teaming sessions to identify vulnerabilities and edge-case failures and documented findings for iteration. • Built prompt sets and test scenarios to probe LLM capabilities • Evaluated outputs against rubric criteria for safety and quality • Identified failure modes through adversarial testing and edge cases • Automated data cleaning and formatting for training datasets using Python scripts