AI Trainer & Response Evaluator (Independent Project) — Remote
Provided structured evaluation of Large Language Model outputs across 100+ complex prompts spanning business, science, and general knowledge. Assessed responses for factual accuracy, structural coherence, relevance, and safety compliance using objective analytical criteria. Iterated prompt engineering strategies and documented improvements to increase response utility and clarity for downstream use. • Compared multiple LLM responses per prompt to identify strengths and gaps. • Produced detailed written feedback suitable for dataset curation or training support. • Optimized prompt structures to improve output quality and clarity. • Maintained consistent evaluation standards across diverse prompt categories.