AGI Research Intern (iCog Labs) — automated evaluation framework development
Developed automated evaluation frameworks to measure model factuality across 50+ configurations. Standardized model-selection processes by using systematic evaluation outputs to guide downstream choices. Performed assessment and calibration work consistent with AI training and iteration workflows. • Designed evaluation pipelines for factuality measurement across multiple settings • Standardized selection criteria based on evaluation results • Supported iterative improvement of agentic systems through measurable outcomes • Coordinated evaluation outputs with decentralized multi-agent integration work