AI Systems Builder & LLM Evaluator | OFFSITE IT (AI data evaluation and labeling-adjacent output rating)
Evaluated and rated LLM responses for quality, accuracy, and instruction-following behavior across multiple local model variants. Assessed AI assistant outputs for tone, factual grounding, and adherence to task instructions in real-world business and professional services contexts. Built and tested RAG document ingestion workflows to support retrieval-augmented performance evaluation. • Compared response quality and accuracy across Ollama-hosted models (qwen2.5:14b, Mistral, Llama variants) • Validated model behavior on multi-turn tool-use and conversation pipelines via agent frameworks • Assessed Telegram-integrated assistant output quality and provided refinement feedback • Defined evaluation criteria for HIPAA-compliant private medical record analysis (CMV Law) document comprehension and extraction accuracy