PDFMathTranslate 保版式 PDF 翻译:一条命令,公式图表原位保留

发布时间:2026/9/12 15:32:21
PDFMathTranslate 保版式 PDF 翻译:一条命令,公式图表原位保留 PDFMathTranslate 保版式 PDF 翻译一条命令公式图表原位保留【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate用 PDFMathTranslate 翻译英文论文能拿到纯中文和中英双语两份 PDF公式、图表、目录、注释完整保留在原位。你只需一条命令不用配 key10 分钟内出第一份译文。它适合什么 / 不适合什么✅ 适合公式密集的英文论文版面模型会区分正文和公式译文回写原位公式不变成乱码需要中英对照的场景一次产出dual双语文件逐句对照阅读整文件夹 PDF 批量翻译--dir直接处理一个目录不用逐个拖文件不想装 PythonWindows 可直接用发布包的pdf2zh.exe或 Docker 镜像。⚠️ 不适合扫描版、图片型 PDF工具解析的是文本层没有文字层就读不到内容纯离线环境默认翻译服务要联网想离线得换本地模型服务见进阶只想要一段文字翻译它产出的是完整 PDF不导出文本片段。跑起来安装 PDFMathTranslate 并翻译第一篇论文环境要求 Python 3.11 或 3.12见 pyproject.toml。先安装pip install pdf2zh把要翻译的文件放在当前目录执行翻译pdf2zh paper.pdf✅ 你会在当前目录得到两个文件paper-mono.pdf纯中文版和paper-dual.pdf中英双语对照版。默认用 Google 翻译服务不用配任何 API key源语言和目标语言默认是en转zh可用-li、-lo显式指定。首次运行会自动下载版面分析模型wybxc/DocLayout-YOLO-DocStructBench-onnxREADME 有写。国内网络下载卡住时先设镜像环境变量再运行Windows 用set HF_ENDPOINThttps://hf-mirror.comPowerShell 用$env:HF_ENDPOINThttps://hf-mirror.com。想只试读前几页时加-p传页码范围比如pdf2zh paper.pdf -p 1-5。工具带翻译缓存重复内容不会重复调 API所以先翻几页、满意再全量跑没有额外成本。进阶路径路径 1切换翻译服务不依赖 Google 或走本地模型-s参数切换服务pdf2zh paper.pdf -s bing免 key、-s deepl、-s openai、-s ollama本地模型翻译环节不依赖外网。除google、bing外其他服务都需要先设环境变量各服务对应的变量名有一张完整对照表见 docs/ADVANCED.md。路径 2自定义提示词固定术语统一译法有固定术语比如希望 mutant 一律译成突变体时写一个提示词文件用--prompt传入pdf2zh paper.pdf --prompt prompt.txt模板支持${lang_in}、${lang_out}、${text}三个变量格式示例见 docs/ADVANCED.md 的 Custom prompt 一节。改完提示词后记得加--ignore-cache否则缓存会跳过重翻。路径 3批量处理一个目录一次翻完pdf2zh --dir /path/to/papers/ -o output/ -t 3--dir传目录-o指定输出目录-t控制翻译线程数默认 4。产物是目录下每篇文件各一份mono和dual。路径 4图形界面与 Docker 部署团队共用不用碰命令行pdf2zh -i浏览器没自动弹出就访问http://localhost:7860/在页面上选文件、选服务、下译文详见 docs/README_GUI.md。要部署给团队共用用官方镜像docker pull byaidu/pdf2zh docker run -d -p 7860:7860 byaidu/pdf2zh 团队访问同一个http://localhost:7860/服务器上对应服务器 IP即可不需要各自装 Python。验证效果翻译前后对比与项目背景下面两张截图来自官方文档 docs/README_GUI.md左边是英文原文右边是翻译后的效果——正文变中文双栏版式、正文公式、网络图和图注都还在原来的位置。可以核实的三件事论文被 EMNLP 2025 System Demonstrations 接收摘要写明 PyPI 累计下载量超 22 万次引用信息见 README.md核心代码都在 pdf2zh/ 包里版面解析在pdf2zh/pdfinterp.py翻译调度在pdf2zh/translator.py篇幅不长可以顺读Python 3.11 和 3.12 是硬性版本范围requires-python 3.11,3.13见 pyproject.toml。避坑清单现象 → 对策⚠️ 现象翻出来的文件是空白或乱码 → 你给的是扫描版没有文本层先 OCR 成可复制文字的 PDF 再翻译。⚠️ 现象首次运行卡在模型下载 → 设HF_ENDPOINThttps://hf-mirror.com环境变量后重试仍有其他网络问题查 docs/PROXY_CONFIGURATION.md。⚠️ 现象换了服务或提示词译文却和上次一样 → 翻译缓存生效加--ignore-cache强制重翻。⚠️ 现象输出 PDF 打开有字体兼容问题 → 加--skip-subset-fonts跳过字体子集化。⚠️ 现象配自定义 OpenAI 兼容接口报 404 → 检查BASE_URL是否以/v1结尾这是文档标注的高频错误。写在最后今天就可以跑pip install pdf2zh再执行pdf2zh paper.pdf十分钟拿到第一份dual对照文件。PDFMathTranslate 做的事很具体把公式当公式、把图当图只让文字部分变得能读。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考