Machine Learning (Eval) Engineer (Shipd.ai) — March 2026 to Present
Evaluates LLM outputs using structured benchmarking frameworks to ensure model quality and reliability. Designs evaluation pipelines to measure performance metrics such as accuracy, latency, and reliability. Analyzes large-scale datasets to identify edge-case behaviors and improve model robustness. • LLM output benchmarking • Performance metric evaluation pipeline design • Edge-case dataset analysis • Model quality and reliability improvement