AI Output Evaluation (Finance Domain)
Performed an independent Finance-domain AI output evaluation assessment using rubric application and structured task analysis. The assessment included complex prompt drafting and identification of LLM failure modes across acquisition and profitability scenarios. Deliverables emphasized standardized yes/no rubric criteria for checking whether AI-generated reasoning meets analytical standards. • Drafted yes/no rubric criteria in a standardized “Did the response…” format for evaluating business reasoning. • Identified analytical errors such as unreconciled market sizing, framework name-dropping without application, and hidden assumption stacking. • Analyzed sample tasks to determine appropriate evaluation coverage for finance reasoning. • Focused on separating correct framework application from superficial or ungrounded references.