AI Model Evaluator - Coding Focus
Worked as a coding‑focused AI trainer for a private AI evaluation platform. My primary task was to test and evaluate responses from large language models (LLMs) on complex coding and logic problems. I assessed model outputs for factual correctness, code accuracy, clarity, safety, and adherence to given instructions. This involved writing my own test prompts, reviewing generated code for bugs or inefficiencies, and providing detailed reasoning for each rating. I also compared multiple model responses side‑by‑side to determine which was superior, helping improve model alignment and performance.