Scholarcy
把论文与长文档自动拆解为摘要卡片,提取核心论点、方法与参考文献,帮助快速筛选文献。
开源文档解析工具,可将 PDF 与扫描件转换为结构化 Markdown 供模型使用。
MinerU 是面向 AI 数据准备场景的开源文档解析工具,核心能力是将 PDF(含扫描件、图片型 PDF)转换为结构化的 Markdown 文本,供大模型训练、RAG(检索增强生成)或知识库构建直接使用。其官网提供在线解析服务,代码仓库开放,适合开发者与数据工程团队集成。
| 功能模块 | 具体说明 |
| --- | --- |
| 版面分析 | 自动识别标题、正文、页眉页脚、图表区域,剔除冗余信息 |
| 表格还原 | 将复杂表格(含跨行跨列、合并单元格)转换为 Markdown 表格语法 |
| 公式识别 | 支持 LaTeX 公式提取,适用于学术论文、理工类文档 |
| OCR 引擎 | 内置扫描件文字识别,支持多语言(含中文),无需预先额外安装 OCR 组件 |
| 输出格式 | 标准 Markdown 文件,兼容主流 LLM 上下文格式与向量化工具 |
MinerU 适合作为 PDF 转 Markdown 的首选开源工具,尤其适合需要批量处理、且对输出结构完整性有要求的 AI 工程场景。建议先使用在线服务验证你的典型文档类型,再决定是否引入本地流水线。
开源文档解析工具,可将 PDF 与扫描件转换为结构化 Markdown 供模型使用。
MinerU 的官方网站是 https://mineru.net,可直接在浏览器中打开使用。