PDFMathTranslate 完整指南:用 pdf2zh 翻公式密集的英文论文,版式原样保留

发布时间:2026/9/12 5:32:02
PDFMathTranslate 完整指南:用 pdf2zh 翻公式密集的英文论文,版式原样保留 PDFMathTranslate 完整指南用 pdf2zh 翻公式密集的英文论文版式原样保留【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate读满是公式的英文论文最怕译本把公式翻成一串乱码还得逐页翻回去对图。PDFMathTranslate 是保版式的 PDF 翻译工具命令行 pdf2zh 只翻文字部分公式、图表、目录留在原位置一次产出纯中文版和中英双语对照版。据 EMNLP 2025 论文摘要其 PyPI 累计下载量已超过 22.2 万次。能力边界能翻什么、翻不了什么能做的事翻译带文本层的 PDF也接受 doc/docx 输入产出-mono.pdf纯中文和-dual.pdf双语对照各一份公式、图表、目录、注释原位保留不重排版面内置 24 种翻译服务语言方向可配CLI、图形界面、Docker 三个入口翻不了的⚠️ 纯扫描、图片型 PDF解析对象是文本层实验性 OCR 只覆盖白底扫描手写与行间公式可能识别错Python API 目前弃用计划 2.0 重新提供二次开发先等官方说明最短安装步骤从 pip 到第一份译文要求 Python 3.11 或 3.12装包pip install pdf2zh把 PDF 放进当前目录执行pdf2zh paper.pdf首次运行会下载版面模型 wybxc/DocLayout-YOLO-DocStructBench-onnx这一步最慢之后走本地缓存。✅ 当前目录多出paper-mono.pdf纯中文和paper-dual.pdf中英对照。Windows 上没有 Python 时下载官方发布页的pdf2zh-version-win64.zip解压后双击pdf2zh.exe即可打不开就先装官方提示的 VC 运行库再试。参数由浅入深页码、服务、批量指定页码试读与切换语言方向长文档先翻前 5 页看质量pdf2zh paper.pdf -p 1-5-p接页码或范围逗号分隔可拼多段。默认方向是英译中其他方向用-li en -lo ja这类语言代码指定。翻译结果有本地缓存试读过的段落全量跑时不重复请求 API先试后跑零成本。什么时候用到文档很长或想先确认术语译得对不对时。切换翻译服务与自定义提示词默认走 Google 服务免 keybing 同样免 keydeepl、openai 等需要先设环境变量ollama 直接用本地模型、翻译环节不依赖外网。全部服务要设哪些变量对照 docs/ADVANCED.md 的表格查pdf2zh paper.pdf -s ollamaollama 默认连 http://127.0.0.1:11434、模型 gemma2可用 OLLAMA_HOST、OLLAMA_MODEL 改。有固定术语比如 mutant 一律译突变体时写一个提示词文件用--prompt传入模板里 ${lang_in}、${lang_out}、${text} 三个变量会被替换。换完服务或提示词发现输出没变加--ignore-cache强制重翻。什么时候用到对术语一致性有要求或机器要离线跑翻译时。整目录批量与图形界面部署一篇篇敲太慢时--dir递归处理整个目录PDF 和 docx 都收-o指定输出目录-t调线程数默认 4pdf2zh --dir papers/ -o output/ -t 3不想碰命令行就起图形界面pdf2zh -i后浏览器访问 http://localhost:7860/页面上选文件、选服务、选页数细节见 docs/README_GUI.md。团队共用直接 Docker 部署拉取 byaidu/pdf2zh 镜像、映射 7860 端口同事从浏览器进不用各自装环境。什么时候用到一次处理多篇论文或要给多人提供同一套翻译入口时。翻译前后对比与可核实的证据官方文档用一篇 2006 年的 Nature 双栏论文带公式与节点网络图做过完整演示。翻译前是英文原版翻译后标题变为图谱和社交网络合作演化的简单规则正文公式、网络图、图注都还在原位置可以自己核实的几点项目被 EMNLP 2025 System Demonstrations 接收页码 918–924摘要写明 PyPI 累计下载超 22.2 万次当前版本 1.9.12核心链路在 pdf2zh/ 包内版面解析看 pdfinterp.py翻译调度看 translator.py篇幅不长需要程序化调用Python API 弃用中先读 docs/APIS.md 的说明常见报错处置与已知限制症状首次运行卡在模型下载 → 处置设镜像后再跑Windows 执行set HF_ENDPOINThttps://hf-mirror.comPowerShell 用$env:HF_ENDPOINThttps://hf-mirror.com症状换了服务或提示词译文却和上次一样 → 处置加--ignore-cache强制重翻症状输出 PDF 字体显示异常 → 处置加--skip-subset-fonts跳过字体子集化代价是文件变大限制扫描版、图片型 PDF 需先转成可复制文本的版本再翻限制Python API 弃用中二次开发方案要等 2.0如果你在读论文今天就装好 pdf2zh先用-p 1-5试读满意后全量跑把 dual 对照版留在手边。如果你在维护团队工具起一个 7860 端口的 Docker 实例让所有人从浏览器进。如果你想研究它怎么实现从 pdfinterp.py 读起版面识别到译文回写的主链路比想象中直白。它做的事很具体公式还是公式、图还是图只把文字翻成能读的样子——文献整理里最费时的后处理就省在这一步。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考