
BabelDOC3 步翻译 PDF 还保留原排版【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC拿到一份带行内公式的英文论文 PDF丢给普通翻译软件后公式被打散、双栏错位、脚注混进正文。BabelDOC 是一款开源的 PDF 翻译工具它按原排版把英文文档逐段翻成中文公式、图表和栏位都留在原位并额外输出一份双语对照 PDF。BabelDOC 能帮你完成哪些翻译任务翻译带公式的英文论文行内公式以占位符方式跳过翻译、原位还原不会被模型改写。适合读论文的研究者。生成双语对照 PDF默认同时输出单语译本和左右对照的双语版本方便逐句对照阅读。适合做文献笔记的人。批量处理多个 PDF--files参数可重复传入多个文件一次跑完。适合需要翻译整批文档的团队。扫描版 PDF 兜底白底黑字的扫描件可开启 OCR 回退处理。适合手上有扫描件又不敢动版式的读者。BabelDOC 安装与第一次 PDF 翻译安装只需一行官方推荐用 uv 安装 PyPI 上的包uv tool install --python 3.12 BabelDOC然后接一个 OpenAI 兼容的 LLM 接口本项目目前只支持这类翻译服务翻译第一份 PDFbabeldoc --openai --openai-model gpt-4o-mini --openai-base-url https://api.openai.com/v1 --openai-api-key sk-xxx --files paper.pdf --lang-in en --lang-out zh--lang-in/--lang-out指定源语言和目标语言默认就是 en→zh译文写在当前目录可用--output指定输出目录。跑完后你会得到一份中文 PDF 和一份双语对照 PDF。BabelDOC 怎么把 PDF 翻成中文还保留排版整套流程的关键是中间层IL表示输入原始 PDF 逐页解析按字符级别提取文字、字体、颜色和坐标得到一份带完整样式信息的结构化中间表示。中间过程先用布局检测模型区分正文、标题、公式、图片区域把段落里的公式和特殊样式文本替换成占位符只把纯文本送进 LLM 翻译同时自动抽取文档术语。输出翻译结果按占位符回填公式和样式原样恢复再按原字体重新排版生成新的 PDF。其余环节——样式与公式处理、字体映射、PDF 重建——都围绕这套中间层展开细节见实现文档。术语库、大文档与扫描版三个进阶场景术语一致性CSV 三列source,target,tgt_lng命中的术语会被注入翻译提示词仓库自带示例格式babeldoc --files paper.pdf --openai --openai-model gpt-4o-mini --openai-api-key sk-xxx --glossary-files ./terms.csv --save-auto-extracted-glossary ./terms_auto.csv适用条件产品文档、标准类文本等对固定译名敏感的场景--save-auto-extracted-glossary会把本次自动抽取的术语存下来供人工复核。大文档分片加--max-pages-per-part 30把长文档按 30 页切分翻译、再自动合并回一份文件--pool-max-workers 8提高内部并发。适用于页数多、单次运行时间很长的文件。扫描版 PDF加--ocr-workaround。它的前提是白底黑字——工具会在原文下方垫白色块遮住原文并把译文强制为黑色。背景不是纯白的扫描件不要使用这个参数。BabelDOC 用不了的情况和工具选型语言对目前只有英文→中文经过充分测试英文作为目标语言属于基础支持其他语言对未充分验证。翻译后端只接 OpenAI 兼容接口不支持 Bing/Google 这类传统翻译 API需要多种翻译服务或 WebUI 自部署时看上游项目 PDFMathTranslate-next。已知短板不支持线条和首字下沉作者与参考文献区可能合并成一段超大页面会被跳过表格文本翻译仍是实验功能。选型只要快速机翻、不关心版式任何网页翻译都够要保留原排版 LLM 翻译BabelDOC 是开源方案中比较完整的一条流水线。手边有带公式的英文论文时先挑一份 10 页以内的短文档跑一遍第一条命令效果对了再批量处理。更多参数说明见官方文档。【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考