PDF翻译工具技术对比:格式保留是怎么做到的 很多 PDF 翻译工具翻完字对字但表格飞了、图片乱了。本文从技术角度对比几类方案搞清楚格式保留到底难在哪、各家怎么解。一、PDF 不是纯文本PDF 本质是带坐标的绘制指令文字、线条、图片都有 (x, y) 位置和字体信息。普通翻译器只抽取文本流丢掉坐标于是还原时只能顺序排布——这就是排版崩坏的根源。二、三类技术路线对比路线做法格式保留代表抽取-重排抽文本→翻译→重新排版差Google 粘贴、通用翻译 API文本层替换保留原坐标只替换文字层好PDFTranslator、部分商业方案OCR重排扫描件识别后再排版中各类 OCR 工具文本层替换是保留排版的关键不改图片、不改表格框线只把每个文本块的内容换成译文位置原样保留。三、文本层替换的核心步骤解析 PDF用 PDF 解析库如pdfminer/pymupdf提取每个文本块的 bbox 与字体翻译文本把文本块送翻译引擎Gemini / ChatGPT 等保留段落边界回写图层在相同 bbox 写入译文字号/行高自适应避免溢出保留非文本元素图片、矢量图、表格线框原样不动。示意伪代码forblockinextract_text_blocks(pdf):translatedtranslate(block.text,src,tgt)draw_text(page,translated,atblock.bbox,fontblock.font)# 图片与线框不做任何改动四、难点在哪长单词换行英文译中文后变短、译小语种可能变长需要重算行高表格内文字单元格坐标固定译文过长会溢出需缩放字号双栏/多栏必须按栏读取顺序否则译文顺序错乱公式与特殊符号通常作为图片保留不参与翻译。五、选型建议要原样保留排版、免费、免注册优先文本层替换路线的在线工具如 PDFTranslator扫描件为主先做 OCR再走翻译接受部分重排仅要读懂意思通用翻译器足够不必追求版式。一句话格式保留的本质是保坐标、换文字选工具时认准这一点能少踩大量坑。在线文本层替换方案https://pdftranslator.org