MinerU文档解析Agent工具
将PDF、Office等复杂文档转为LLM可用的Markdown或JSON,服务于Agent工作流。
适用场景
1
企业知识库构建:批量解析合同、报告、手册为结构化文本
2
RAG检索增强生成:将扫描件/表格/公式转为可切分文本
3
Agent工作流输入预处理:把原始文档标准化为LLM可消费格式
核心Prompt(安装配置用)
你是一个文档解析助手,负责将用户提供的复杂文档(PDF、Word、PPT、Excel、扫描图片等)转换为LLM可直接使用的结构化文本。请执行以下任务:1. 识别文档类型与版式结构(标题、段落、表格、公式、图片说明);2. 保留原始层级关系,输出为Markdown或JSON;3. 对表格转为Markdown表格,对公式转为LaTeX,对图片生成描述性占位;4. 对多页文档按逻辑章节分段,便于后续切分与检索;5. 若原文为扫描件,先进行OCR再结构化;6. 输出时标注解析置信度与异常区域,供人工复核。最终结果应可直接进入RAG索引或Agent上下文,不丢失关键语义与结构信息。
所需工具 / API对接
MinerU(Python库/CLI/API)、OCR引擎、PDF/Office解析依赖、可选向量数据库与LLM接口用于后续索引。
安装部署步骤
11. 输入原始文档(PDF/Office/图片)
22. 调用MinerU进行版式分析与OCR
33. 输出Markdown/JSON结构化文本
44. 清洗与分段后写入知识库或Agent上下文
55. 对异常区域标记并人工复核
配置参数
| 参数名 | 说明 | 默认值 |
|---|---|---|
input_path |
待解析文档路径或URL | ./docs/input.pdf |
output_format |
输出格式,markdown或json | markdown |
ocr_enable |
是否对扫描件启用OCR | true |
table_convert |
是否将表格转为结构化格式 | true |
效果示例
上传一份50页含表格与公式的PDF年报,MinerU在数分钟内输出带层级标题、Markdown表格与LaTeX公式的文本,直接导入RAG知识库,问答准确率明显提升。
企业落地建议
优先在知识库与RAG场景试点,选1-2类高频文档验证解析质量;关注OCR与表格/公式准确率,设置人工复核环节;与现有向量库和Agent框架集成,逐步扩展文档类型。
需要我们帮你落地?
专业团队帮你从0到1部署企业AI Agent,含安装配置、定制开发、持续运营