跨模态智能文档分析与分类管理平台(CV+LLM融合文档解析)
基于CV视觉与NLP大语言模型的融合,对企业非结构化文档内容进行智能解析与分类管理。通过将OCR抽取的图文信息与大模型的提示词工程结合,实现对文本意图的提炼、自动聚类与结构化输出。该过程体现了面向训练/评测的AI数据处理思路,并对超长文本与异常JSON进行容错以保证产出可用性。• 使用PaddleOCR完成字符抽取与图文数据重构 • 对接DeepSeek API并采用Zero-shot提示词工程进行意图提炼与聚类 • 针对大模型超长Token溢出与幻觉问题实现文本截断与校验 • 使用正则剥离并校验大模型返回JSON流,保障系统稳定不崩溃
2024