RLHF Preference Ranking - Accounting and Finance Domain
Performed RLHF-style preference ranking on large language model (LLM) responses in accounting, audit, tax, journal-entry, and financial-analysis tasks. Compared competing model outputs and selected stronger responses based on factual accuracy, reasoning quality, completeness, and alignment with accounting and finance domain standards, including US GAAP concepts such as ASC 606, ASC 842, ASC 740, consolidations, and journal entry logic. Created expert prompts and gold-standard reference responses to support ranking and training workflows, and documented recurring model failure patterns such as unsupported conclusions, factual inaccuracies, weak calculations, and domain-specific accounting errors. This work helped improve model quality for high-stakes finance and accounting use cases.