Подготовка датасетов (профильный опыт для OpenTrain): разметка текстовых данных и формирование instruction-response пар
В рамках подготовки датасетов выполнял разметку сложных текстовых массивов для последующего обучения и дообучения ИИ-моделей. Осуществлял фильтрацию шума и приведение гетерогенных данных к единому стандарту с последующей проверкой фактов. Формировал экспертные эталонные ответы на сложные финансовые и экономические запросы, учитывая контекст и требования к точности вычислений. • Очистка и нормализация текстовых данных • Fact-checking и контроль качества знаний • Форматирование данных в стиле instruction-response • Создание эталонных ответов для SFT