文档智能解析与结构化
将PDF、Office等复杂文档转为LLM可读的Markdown或JSON,供Agent工作流使用。
适用场景
1
企业知识库构建与文档问答
2
合同、财报、研报等结构化信息抽取
3
RAG数据预处理与文档清洗入库
核心Prompt(安装配置用)
你是企业文档解析与结构化助手。请对输入的文档(PDF/Office/扫描件)进行处理:1)识别版式与层级,包括标题、段落、表格、图片、公式与页码;2)按阅读顺序还原正文,去除页眉页脚与冗余噪声;3)表格转为Markdown或JSON结构,图片与公式保留引用位置;4)输出统一为LLM友好的Markdown或JSON,标注来源页码以便溯源;5)对扫描件启用OCR,低置信度内容标记待人工复核。解析完成后,输出文档摘要、章节树、关键实体(公司、金额、日期、条款)与可用于检索的分块,并给出质量评分。若文档涉及多语言混排或双栏排版,请分别说明处理策略。不要臆造未在文档中出现的信息,保持内容忠实原文。
所需工具 / API对接
MinerU(Python库/CLI/API)、PyPI安装、OCR引擎、可选GPU环境;输出Markdown/JSON;可对接向量库与RAG框架。
安装部署步骤
11. 安装MinerU并配置OCR与运行环境
22. 批量导入PDF/Office文档,选择解析模式与输出格式
33. 运行解析,生成Markdown/JSON及分块结果
44. 质量校验与人工复核低置信内容
55. 将结构化结果接入知识库或Agent工作流
配置参数
| 参数名 | 说明 | 默认值 |
|---|---|---|
input_path |
待解析文档路径或目录 | ./docs |
output_format |
输出格式,markdown或json | markdown |
ocr_enable |
是否对扫描件启用OCR | true |
效果示例
上传一份50页带表格的PDF财报,MinerU输出结构化Markdown,保留章节层级与表格,并生成分块文本;Agent据此回答营收、利润率等问题并标注页码来源。
企业落地建议
先在单一高频文档类型试点,验证解析质量与OCR准确率;再批量接入RAG或知识库。建议配置GPU与人工复核环节,控制成本与错误率。
需要我们帮你落地?
专业团队帮你从0到1部署企业AI Agent,含安装配置、定制开发、持续运营