Independent AI Tools User & Evaluator
Actively engages with leading large language models to evaluate output quality, test prompt responses, and develop a practical understanding of AI behavior across diverse tasks and use cases. Regularly uses ChatGPT, Gemini, and Claude for a range of tasks including text generation, summarization, question answering, and creative writing — developing a nuanced understanding of model strengths, weaknesses, and output patterns. Evaluates AI-generated responses for accuracy, coherence, tone, instruction-following, and potential biases — core skills required in RLHF (Reinforcement Learning from Human Feedback) workflows. Tests prompt variations to observe how changes in phrasing, specificity, and structure affect model outputs — building practical prompt engineering judgment. Identifies hallucinations, factual errors, and quality issues in AI responses, developing the critical eye needed for data quality assurance roles. Compares outputs across multiple AI platforms to assess relative performance, relevance, and reliability for specific task types.