AI Training Data Engineer (Software Engineering)
• Converted real-world GitHub pull requests into structured, verifiable evaluation instances for benchmarking coding agents, isolating solution diffs from test suites and metadata. • Defined success criteria by separating fail-to-pass and pass-to-pass test cases, ensuring each instance was unambiguously gradable and guarded against regressions. • Authored prompts and metadata to elicit correct solution code, producing reproducible input/output pairs for model training and evaluation.