文件转 Markdown 实用教程:5 分钟把 PDF、Excel 变成大模型能直接读的结构化文本
发布时间:2026/9/12 5:11:10 锦皓数字建站

文件转 Markdown 实用教程5 分钟把 PDF、Excel 变成大模型能直接读的结构化文本【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdownMarkItDown 是一个 Python 写的文件转 Markdown 工具把 PDF、Word、Excel、PPT、HTML、图片、音频统一转成带标题、表格结构的 Markdown输出直接喂给大模型或检索管线。新手在终端敲一条命令就能跑通。 三行命令确认跑通环境Python 3.10 及以上python --version确认建议放进虚拟环境避免依赖冲突。下面这条命令安装主包加全量可选依赖引号别省部分 shell 会把方括号当通配符展开pip install markitdown[all]再转任意一份你手头的 PDF验证链路markitdown 示例.pdf -o 示例.md成功信号终端或示例.md里能看到 Markdown 正文——#开头的标题层级、|开头的表格行都在若只生成空文件说明该格式的可选依赖没装齐回上面补[all]。路径带空格时整体加引号如markitdown 我的 文件.pdf。转换范围一张表输入类型转换后的输出形态备注PDF.pdf标题、正文、表格的 Markdown需[pdf]extras无文字层的扫描页出不了内容Word / PPT.docx / .pptx标题层级、列表、表格、注释分别需[docx]、[pptx]extrasExcel.xlsx / .xls每个工作表转成 Markdown 表格需[xlsx]/[xls]extrasHTML / EPUB / 文本类.html、.epub、.txt、.csv、.json、.xml、.ipynb原结构压平成 Markdown表格保留文本类无需额外 extrasOutlook 邮件.msg邮件正文需[outlook]extras图片.jpg / .jpeg / .pngEXIF 元数据可选用视觉模型生成描述描述功能需传入 OpenAI 兼容的llm_client音频.wav / .mp3 / .m4a元数据 语音转写文本转写需[audio-transcription]extrasZIP.zip逐个解开内部文件各自转换无YouTube 链接视频字幕文本需[youtube-transcription]extras要联网它不做什么一次说死不做版式高保真——多栏布局、页眉页脚的相对位置不还原没有内置视频转换通道输出是给机器读的文本不是给印刷级排版用的。扫描版 PDF 想提取文字得启用仓库自带的 markitdown-ocr 插件或接云端端点。按任务挑配方场景一给大模型备语料。论文、产品文档转完重点看结构我一般先抽查一两页标题和表格都在再整批跑markitdown 论文.pdf -o 语料.md标题变成#/##、表格变成管道符表格大模型按结构理解比纯文本省 token检索定位也更准。场景二批量归档同目录的 Excel。输出名直接沿用原文件名Windows 上把循环换成 PowerShell 的Get-ChildItem *.xlsx | % { markitdown $_.Name -o $($_.BaseName).md }for f in *.xlsx; do markitdown $f -o ${f%.*}.md done跑完同目录多一份同名 .md表头和单元格内容都以表格语法保留。场景三嵌进文件同步脚本。资料落盘时顺手转一份 .md 丢进知识库目录索引工具只扫 Markdownfrom markitdown import MarkItDown md MarkItDown() print(md.convert(test.xlsx).markdown)三行 API 调用convert返回的对象里.markdown就是转换结果。排障清单现象原因解法转 PDF/Excel 报缺依赖基础包只带少量格式的转换器对应 extras 没装pip install markitdown[all]后重试扫描版 PDF 出来几乎是空的图片型页面没有文字层离线转换器提取不到启用 markitdown-ocr 插件并传入视觉模型客户端或走--use-cu云端端点文件明明在却报找不到shell 按空格把路径拆成了多段路径整体加引号复杂表格列错位、合并单元格丢失工具定位是给机器读不保真合并单元格等版式版式要求高的文档交给排版工具或接 Document Intelligence 端点-d参数管道输入cat file \| markitdown后识别不出格式从标准输入读时丢了扩展名信息加-x pdf之类的扩展名提示参数见 CLI--help该绕道走的人印刷级复刻版式输出面向机器阅读多栏、页眉位置不还原——用 Word、InDesign 这类排版工具或专用 PDF 重排服务。服务端解析来路不明的文件工具以当前进程权限读写资源不可信输入必须自己先校验官方 README 的 Security Considerations 一节讲得很细也可只调更窄的convert_local()。视频转文字内置通道没有视频仓库内只有 Azure Content Understanding 覆盖视频或直接用专门的语音识别服务。装好、转换、验证闭环就完成了格式参数与插件机制的完整说明看 主包 README各格式转换器的实现都在 converters 目录遇到怪问题按文件类型进去读源码最快。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。