Marker 完整指南:PDF 转 Markdown 开源工具,十分钟跑通批量转换实操 Marker 完整指南PDF 转 Markdown 开源工具十分钟跑通批量转换实操【免费下载链接】markerConvert PDF to markdown JSON quickly with high accuracy项目地址: https://gitcode.com/GitHub_Trending/ma/marker把 300 页的 PDF 论文转成能直接进笔记软件的 Markdown多数工具给出来的是错位表格和丢失的公式。Marker 是一个开源文档转换工具能把 PDF、图片、PPTX、DOCX、XLSX、HTML、EPUB 文件高质量转成 Markdown、JSON、HTML 和 Chunks自动处理表格、公式、代码块、脚注和图片提取。项目速览Marker包名marker-pdf当前版本 2.0.0Apache 2.0 协议代码可商用走的是文本层优先、VLM 兜底的管线先用 pdftext 按阅读顺序抽取内嵌文本只对扫描页、损坏文本块和公式调用视觉大模型surya VLM本地推理服务器托管因此又快又准。它是什么命令行 Python API 的文档转换管线核心目录为 marker/含 providers读源文件、builders建块、processors精修、renderers输出四层解决什么问题PDF 转 Markdown 时表格错位、公式变乱码、多栏阅读顺序错乱、页眉页脚混进正文适合谁用学生教材转笔记、研究人员批量论文、数据/平台工程师RAG 语料、结构化数据提取边界嵌套表格加表单的极端复杂版面仍可能翻车官方建议加--use_llm兜底输出格式目前只有 Markdown、JSON、HTML、Chunks 四种不能反向生成 PDF为什么值得用第三方基准上分数与速度兼得Marker 在 olmocr-bench1403 个 PDF、约 8400 个测试用例覆盖数学、表格、多栏、旧扫描件上的结果来自仓库 benchmarks/ 目录的公开跑分可自行复现。balanced 模式总分 76.0纯数字 PDF 子集 83.5均高于 MinerU72.7和 docling50.3。系统总分纯数字 PDF持续吞吐Marker — balancedGPU76.083.52.9 页/秒Marker — fastGPU66.671.67.4 页/秒MinerUGPU72.783.30.54 页/秒doclingGPU50.364.02.1 页/秒按需调用 VLMCPU 也能跑传统全页 VLM 方案每页都要过一遍大模型Marker 只在页面确实需要时才调用fast 模式用轻量布局检测器加文本层抽取干净的数字文档甚至不启动 VLM 服务器。纯 CPU 的fast --disable_ocr在单卡 B200 主机上实测 23.7 页/秒每页 42ms不需要 GPU。管线可插拔输出面向 RAG每个环节都能替换换 marker/processors/ 里的处理器改精修逻辑换 marker/renderers/ 里的渲染器加输出格式。--output_format chunks直接产出拍平的、带完整 HTML 的块级切片是为 RAG 场景准备的格式省去自己切树的工作。十分钟从零到跑通第 1 步安装。需要 Python 3.10 和 PyTorch两条命令任选其一pip install marker-pdf # 只处理 PDF/图片最小安装 pip install marker-pdf[full] # 额外支持 PPTX/DOCX/XLSX/EPUB预期结果终端出现Successfully installed marker-pdf-2.0.0且marker_single --help能列出全部参数。第 2 步转换第一个文件建议先用短 PDF比如 10 页以内的论文marker_single paper.pdf --output_dir ./out预期结果./out/paper/下生成paper.md和paper_meta.json图片默认存进同目录首次运行会自动下载模型权重并拉起本地推理服务器比后续运行慢不少属正常现象。第 3 步验证质量。打开生成的 Markdown 检查三处标题是否变成#层级表格是否保留行列公式是否包在$$里。仓库自带成品示例可直接对照如 data/examples/markdown/switch_transformers/switch_trans.md 和 data/examples/markdown/thinkpython/thinkpython.md。到这里一个单文件闭环已经跑通耗时通常在分钟级取决于页数和设备。三个真实场景场景一学生把教材转成可编辑笔记目标把 200 页教材转成带目录的 Markdown放进 Obsidian 或 Typora 管理。marker_single textbook.pdf --output_dir ./notes --page_range 0-99 # 先转前 100 页试水预期结果./notes/textbook/textbook.md里章节标题带层级教材里的插图被提取为独立图片文件并在文中以相对路径引用Obsidian 中打开即可折叠章节。确认质量后再用--page_range 100-199补齐后半本避免一次转换占满内存。场景二研究人员批量转换论文目录目标一次处理文件夹里十几篇 arXiv 论文含多栏排版和公式。marker ./papers --output_dir ./md --mode balanced预期结果每篇论文生成同名 md 文件多栏阅读顺序正确行间公式转成 LaTeXbalanced 模式在 GPU 上持续约 2.9 页/秒10 篇 10 页论文大约 3-5 分钟。CPU 环境把--mode balanced改成--mode fast即可速度约 3 倍。场景三工程师只提取表格或生产 RAG 语料目标从一堆 PDF 报表里把表格抽成 JSON不关心正文。marker_single report.pdf --converter_cls marker.converters.table.TableConverter \ --output_format json预期结果输出只含表格块及其所在页的坐标信息JSON 里的叶子节点是单元格结构可直接喂给 pandas。若要整文档语料入库改用--output_format chunks得到拍平的块列表每块自带完整 HTML。常见坑与解决坑 1转换出来出现乱码或随机字母现象正文里混着无意义的字符片段但版面对得上。原因这个 PDF 是扫描后嵌入了质量很差的 OCR 文本层pdftext 抽出来的就是坏的。解法marker_single file.pdf --force_ocr强制整页重做 OCR若文档里同时有数字文本和残留坏 OCR用--strip_existing_ocr清掉旧层再转。坑 2长 PDF 转换时内存爆掉现象几百页文件跑到一半进程被杀或 OOM 报错。原因marker批量命令默认按 CPU 核数起多个 worker每个都持有模型。解法调小--workers如--workers 2或先用--page_range把文件拆段转单机多卡时也可用VLLM_GPUS0,1让推理服务器跨卡分摊。坑 3CPU 上跑公式识别率偏低现象fast 模式转出的数学论文里大量公式缺失或只剩符号。原因fast 模式为省算力直接从文本层读公式olmocr-bench 上 arXiv 数学项只有 23.4 分balanced 为 83.9。解法公式密集的文档用--mode balanced需 GPU坚持 CPU 就加--force_ocr或--ocr_inline_math用速度换公式质量。进阶用法LLM 混合增强marker_single paper.pdf --use_llm让 LLM 参与合并跨页表格、修复杂表格、抽取表单值。默认走 Gemini也可通过--llm_service切到 Claude、OpenAI 兼容端点、Azure、Vertex、OpenRouter 或本地 Ollama如marker.services.ollama.OllamaService完全离线。并发与多机扩容吞吐来自并发而非单页速度——多个轻量 CPU worker 共享一个推理服务器父进程自动按服务器容量分配 VLM 并发。多 GPU 机器加VLLM_GPUS0,1,2,3多台机器按--num_chunks 4 --chunk_idx 0..3分片各节点独立起服务。交互式界面与 APIpip install -U streamlit streamlit-ace marker_gui启动 Streamlit 界面点点选选marker_server --port 8001起 FastAPI 服务localhost:8001/docs可直接浏览接口适合小规模集成。自定义处理器链--processors marker.processors.table,marker.processors.equation覆盖默认处理器顺序config --help可列出全部可配置的 builder、processor、converter配成 JSON 用--config_json传入。压测自己的机器跑 benchmarks/inference.py 可在本地测出真实并发下的持续页数/秒方法见 benchmarks/README.md。延伸学习完整参数与输出格式说明README.md含 LLM 服务配置、JSON 结构字段、限制清单转换成品对照data/examples/教材、arXiv 论文各一份 Markdown 和 JSON复现全部基准数据benchmarks/README.md 与竞对运行脚本 benchmarks/competitors/GPU 云端部署示例examples/marker_modal_deployment.pyModal 上暴露 HTTP 转换端点Marker 把PDF 转 Markdown从碰运气变成了可复现的管线基准数据、跑分脚本和示例输出全部开源可查。先用一个 10 页 PDF 跑一遍上面的三步再决定要不要接入你的工作流觉得有用就去 Star 仓库遇到问题提 issue。【免费下载链接】markerConvert PDF to markdown JSON quickly with high accuracy项目地址: https://gitcode.com/GitHub_Trending/ma/marker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考