Bilingual AI Data Specialist — AI Annotation, Evaluation & Prompt Engineering (Independent)
Provided multilingual annotations and classified text for sentiment, intent, topic, and categories. Evaluated and ranked LLM outputs (ChatGPT, Claude, Gemini) for factual accuracy, helpfulness, tone, and safety using guideline-driven QA. Performed pairwise preference comparison and quality scoring to support model fine-tuning workflows. • Annotated English/Mandarin samples with structured labels • Performed pairwise comparisons and numeric quality scoring • Flagged inconsistencies and ambiguous edge cases • Transformed unstructured text into schema-compliant datasets