LLM Post-Training Intern (Remote) — Ethara AI
Performed LLM post-training evaluation by reviewing prompts for reasoning, summarization, and code-generation quality. Applied RLHF-based annotation techniques to improve model response behavior. Supported dataset validation and AI safety evaluation while identifying edge cases for fine-tuning decisions. • Labeled/improved prompt-response pairs using RLHF methodology • Performed structured reasoning and summarization quality checks • Identified edge cases to guide model fine-tuning • Collaborated on dataset validation and AI safety evaluation