文档到Markdown转换器,带有MCP服务器和双向导出
all2md,由Thomas Villani开发,将复杂的文档格式转换为结构化的Markdown,以便于LLM摄取和自动化文档工作流。该工具在40多种格式之间进行双向转换,运行内置的模型上下文协议服务器,并提供RAG原生分块以及基于AST的转换,以实现高保真解析。它包括高级PDF表格恢复、可选的OCR支持和CLI批处理工具。目标用户是LLM和RAG构建者、Python开发者以及处理程序化文档准备的高级用户。
将复杂文件转换为适合 RAG 吞吐的 LLM 准备 Markdown
该工具将超过 40 种文件类型(包括 PDF、DOCX、PPTX、HTML、电子邮件和电子表格)转换为干净的 GitHub 风格 Markdown,旨在用于模型上下文的摄取。该管道使用抽象语法树来保留文档结构并允许程序化转换,并且可以将 Markdown 写回丰富格式,如 DOCX 和 PDF,从而实现模型生成内容的往返编辑。
为复杂布局生成具有可测量保真度的结构化输出
PDF 处理专注于表格恢复、多列布局分析和页眉/页脚移除,这减少了与简单解析器相比的虚假或“发明”文本的数量。该项目报告了与 Docling 和 pymupdf4llm 的基准测试,并强调了低发明文本率。RAG 原生分块提供了包括语义、标题和标记拆分在内的十一种策略,同时保留了检索工作流的部分和页面来源。
需要开发人员熟悉,但提供可扩展的特定格式安装
该工具作为 Python 库和适用于 PC、macOS 和 Linux 的 CLI 提供,目标是 Python 3.x 环境。安装程序使用模块化依赖系统,因此仅安装特定格式所需的编解码器,OCR 附加功能(如 Tesseract 或 EasyOCR)是可选的,适用于扫描的 PDF。插件 API 和 AST 转换允许开发人员以编程方式添加自定义格式或调整解析行为。
通过 MCP 和批处理工具适应 AI 助手管道
内置的模型上下文协议服务器将转换管道直接连接到 AI 助手,该项目为客户端(如 Claude Desktop)提供了一键 MCPB 包。命令行工具支持目录监视、批量转换、语义搜索和文档差异,以自动化摄取。这些集成有助于将结构化 Markdown 输入检索系统,并允许开发人员将转换后的内容纳入下游模型提示或 RAG 存储。
为构建模型摄取管道的开发人员提供实用选择
对于构建检索和上下文层的团队,该工具提供了对源保真度和来源的可测量控制;其模块化、以代码为先的设计适合脚本管道和批处理操作。非技术用户可能会遇到陡峭的设置曲线。实用建议:输出 GitHub Flavored Markdown,并优先使用语义或基于标题的分块,以在将文档导入模型上下文存储时保持来源完整。在批处理运行之前,为基于图像的 PDF 启用 OCR 附加功能。