AI Evaluation Specialist / Freelance AI Evaluation & Prompt Engineering
Evaluated large language model outputs using structured rubric-based assessment frameworks to measure reasoning accuracy, factual consistency, and instruction adherence. Conducted prompt engineering, failure-mode analysis, and performed structured annotation on multilingual text and conversational AI outputs. Produced analytical evaluation reports and collaborated on ethical, human-centered AI evaluation initiatives. • Used rubric-driven assessments to analyze LLM outputs • Labeled and validated data in JSON, CSV, and multilingual text formats • Focused on hallucination detection, ambiguity, and escalation logic • Emphasized privacy, ethical AI assessment, and human-centered workflow