企业Agent技能库 / 内容运营 / 文档解析转LLM数据

文档解析转LLM数据

内容运营 8 浏览 ⭐ 79771

将PDF与Office文档解析为Markdown/JSON,为大模型及Agent提供结构化输入。

适用场景

1 企业知识库建设中将合同、标书、说明书等异构文档批量转成可检索的Markdown
2 Agent工作流中为RAG检索提供高质量结构化文本预处理
3 财务、法务、研发等部门将PDF报表/规范文档转入内部大模型问答系统

核心Prompt(安装配置用)

你是一名文档处理工程师,负责将企业内部的复杂文档(PDF、Word、PPT、Excel、扫描件)转换为大模型可直接使用的结构化数据。请按以下要求执行:1. 读取指定目录或URL中的原始文档,识别版式(单栏/双栏/表格/图片/公式);2. 使用MinerU进行解析,输出Markdown与JSON两种格式,保留标题层级、表格结构与阅读顺序;3. 对扫描件启用OCR,对公式保留LaTeX,对图片生成占位或提取说明;4. 清洗页眉页脚、页码、水印等噪声;5. 校验解析结果,对失败文档记录日志并给出重试建议;6. 将结果写入向量库或文件系统,供下游Agent调用。注意:不要丢失表格与公式信息,不要臆造文档内容,解析置信度低的段落需标注待人工复核。

所需工具 / API对接

MinerU(Python包/CLI)、PyMuPDF或pdfplumber辅助校验、OCR引擎(PaddleOCR/Tesseract)、向量库(Milvus/Chroma)、对象存储(S3/MinIO)

安装部署步骤

1采集待解析文档清单与格式分类
2调用MinerU批量解析为Markdown/JSON
3清洗噪声并校验表格、公式、图片
4写入向量库或文档存储供Agent检索
5记录失败样本并人工复核低置信内容

配置参数

参数名说明默认值
input_path 待解析文档目录或文件URL ./docs
output_format 输出格式,markdown/json/both both
enable_ocr 是否对扫描件启用OCR true
output_dir 解析结果输出目录 ./output

效果示例

输入一份80页含表格与公式的PDF技术白皮书,MinerU输出结构化Markdown,标题层级与表格完整,公式转为LaTeX,直接导入企业知识库供Agent问答。

企业落地建议

建议先小批量试点,重点验证表格、公式、扫描件识别效果;解析结果需加入人工抽检与清洗环节,再接入RAG或Agent工作流,避免脏数据污染知识库。

需要我们帮你落地?

专业团队帮你从0到1部署企业AI Agent,含安装配置、定制开发、持续运营

×

登录后免费使用全部功能

注册即享所有功能免费使用,无次数限制,无任何门槛。

无限 AI 对话
Agent 源码免费下载
Skill/Prompt 免费复制
免费AI诊断 + 需求发布