BabelDOC 教程:把英文 PDF 论文一键变成中英双语版的完整指南
发布时间:2026/9/18 22:10:29 锦皓数字建站

BabelDOC 教程把英文 PDF 论文一键变成中英双语版的完整指南【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC你手里有一份英文 PDF 论文想保留公式、图表和原始排版同时读一份中文译文BabelDOC 就是干这个的它把 PDF 解析成中间表示翻译后重新排版直接输出中英双语对照 PDF 和纯译文 PDF两种结果。核心关键词——PDF 双语转换、论文翻译、保留排版——它一个命令全搞定而且开源免费AGPL-3.0。30 秒认识 BabelDOCPDF 双语转换的核心能力一句话定位BabelDOC 是一个命令行 PDF 翻译工具主打翻译后排版不塌。双份输出默认同时给你一份双语对照版原文页 译文页并排或交替和一份纯译文版公式和图表不丢公式、图片位置在译文里照样在原位参考这张概念图接任意 OpenAI 兼容模型gpt-4o-mini、deepseek-chat、glm-4-flash甚至本地 Ollama 都能用语言支持广50 语言可选其中英文→中文是最成熟的路线详见 docs/supported_languages.md最短路径跑起来 BabelDOC3 步上手推荐用 uv 安装Windows、macOS、Linux 命令相同装完直接跑uv tool install --python 3.12 BabelDOC babeldoc --version # 验证能打印版本号即安装成功然后执行翻译注意要提供 OpenAI 兼容服务的三个参数babeldoc --openai --openai-model gpt-4o-mini \ --openai-base-url https://api.openai.com/v1 --openai-api-key 你的KEY \ --files paper.pdf跑完后paper.pdf同目录下会多出双语版和纯译文版两个 PDF。如果要用源码方式git clone https://gitcode.com/GitHub_Trending/ba/BabelDOC后cd BabelDOC uv run babeldoc --help用法完全一样只是命令前缀换成uv run babeldoc。核心能力拆解4 个你真正会用的点1. 只翻指定页--pages 1,2,1-这样的写法只处理你需要的页翻第 1 页试效果不用等全书。2. 术语表锁定用词--glossary-files指向一个 CSV三列source,target,tgt_lng示例见 docs/example/demo_glossary.csv。翻译时命中词表的段落会自动带上必须照此翻译的指令neural network 不会再一会儿神经网络一会儿神经网。3. 大文档自动切段--max-pages-per-part 50让工具按 50 页一段拆分翻译、翻完自动合并长论文不怕撑爆内存。4. 控制水印和版式译文默认带水印--watermark-output-mode no_watermark可关掉--use-alternating-pages-dual切换原文页、译文页交替排的版式适合手机竖着读。场景实战把一篇英文论文变成中英对照输入eeg_paper.pdf32 页英文 EEG 论文含公式、图表和参考文献。操作一条命令只加术语表babeldoc --openai --openai-model deepseek-chat --openai-base-url 服务地址/v1 \ --openai-api-key KEY --glossary-files terms.csv --files eeg_paper.pdf输出两份 PDF——对照版里每页左侧英文原文、右侧中文译文公式f(x)3x1这种元素原文原样保留纯译文版则是干净的中文版适合直接打印。这个场景最典型的使用者读外文文献的科研同学对照版精读、纯译文版泛读、备考的语言学习者双语对照当教材、需要做技术文档本地化的企业同事术语表 大文档切段。下图是真实的论文翻译效果可以看到标题、摘要、图表编号的位置都没乱避坑与调优速查表问题原因解法扫描版 PDF 翻出来是空白图片里没有文字层白底黑字文档加--ocr-workaround不确定是否扫描件就加--auto-enable-ocr-workaround让它自动判断译文在部分阅读器里显示异常富文本/清洗步骤兼容性问题加--enhance-compatibility一条开关顶三个兼容选项几百页的文档跑得慢、吃内存整本一次性处理--max-pages-per-part 50分段翻译自动合并已知不是扫描件再加--skip-scanned-detection提速译文中带着水印默认watermarked模式--watermark-output-mode no_watermark想两份都要就选both专业名词翻译忽变模型自由发挥建 CSV 术语表 --glossary-files自动抽词可用--no-auto-extract-glossary关掉换目标语言后效果差目前只有英文→中文最成熟查 docs/supported_languages.md优先保证en→zh内网/无网机器跑不了首次运行要下模型和字体联网机--generate-offline-assets 目录离线机--restore-offline-assets 包.zip安装与环境清单环境要求Python 3.10 ~ 3.13推荐 3.12系统不限。系统安装命令验证命令Linux / macOSuv tool install --python 3.12 BabelDOCbabeldoc --versionWindowsPowerShelluv tool install --python 3.12 BabelDOCbabeldoc --versionuv 没装的话先按 uv 官方说明装好并把PATH配好。不想装全局工具就 clone 仓库后用uv run babeldoc在虚拟环境里跑效果相同。进阶玩法配置文件与批量处理TOML 配置文件参数太多可以存成.toml文件用--config my.toml加载命令行参数优先级更高适合把 API key、模型、QPS 这些固定项沉淀下来。批量处理--files可以重复传--files a.pdf --files b.pdf一次翻多个文件。自定义提示词--custom-system-prompt可以追加翻译风格要求比如给 Qwen3 加/no_think指令。深入原理好奇它怎么翻译后排版不塌的可以看 docs/ImplementationDetails/README.md从 PDF 解析 到 段落识别、排版 的完整链路都写清楚了。BabelDOC 把PDF 翻成双语从手动抠排版变成了一条命令的事。下一步挑你手边最短的一篇 PDF 论文装好后跑一遍上面的命令——第一次看到双语对照 PDF 生成的那一刻你就懂它了。【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。