<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>文档解析 on Text Matrix</title><link>https://txtmix.com/tags/%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90/</link><description>Recent content in 文档解析 on Text Matrix</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Tue, 21 Jul 2026 20:06:14 +0800</lastBuildDate><atom:link href="https://txtmix.com/tags/%E6%96%87%E6%A1%A3%E8%A7%A3%E6%9E%90/index.xml" rel="self" type="application/rss+xml"/><item><title>MinerU 架构拆解：高精度文档解析引擎的 pipeline / vlm-engine / hybrid 三路后端与多模态输出</title><link>https://txtmix.com/posts/tech/opendatalab-mineru-document-parsing-engine-guide/</link><pubDate>Thu, 25 Jun 2026 21:05:13 +0800</pubDate><guid>https://txtmix.com/posts/tech/opendatalab-mineru-document-parsing-engine-guide/</guid><description>&lt;h1 id="mineru-架构拆解高精度文档解析引擎的-pipeline--vlm-engine--hybrid-三路后端与多模态输出">MinerU 架构拆解：高精度文档解析引擎的 pipeline / vlm-engine / hybrid 三路后端与多模态输出&lt;/h1>
&lt;p>&lt;code>opendatalab/MinerU&lt;/code> 想做的事情并不只是一份 PDF 转 Markdown 工具——它要替代的是 PDF-Extract-Kit、marker、unstructured 这类在 InternLM 预训练数据生产线上被反复重写的&amp;quot;半成品&amp;quot;工作流。截至 2026-06-25，这个 69,156 Stars、5,843 Forks、MinerU Open Source License（基于 Apache 2.0 加附加条款）的项目（创建于 2024-02-29）已经把&amp;quot;PDF / DOCX / PPTX / XLSX / 图片&amp;quot;五大输入格式、109 种语言 OCR、scan / handwriting / multi-column / 跨页表格合并等复杂版面都跑通了，并在 OmniDocBench v1.6 上做到 pipeline 86.47、hybrid 95.39 (high) / 95.26 (medium) 的端到端精度。本文是一篇架构分析，文章会拆 MinerU 的三路后端（pipeline / vlm-engine / hybrid-engine / *-http-client）、MCP Server 与 LangChain/Dify/FastGPT 的多端集成、以及从 CPU 到 10+ 国产 AI 芯片的部署策略，并讨论为什么 LLM 训练数据生产线上需要一个&amp;quot;全格式原生 + 严格保序&amp;quot;的解析层。&lt;/p></description></item></channel></rss>