转PDF成TXT的时候,最容易踩坑的环节基本都在上传、参数设置和结果核对这几步。动手之前先给原PDF拷个备份,确认你要处理的是正确版本,再往下走流程。

PDF转TXT前先把文件情况看清楚
要是这份转好的资料要发给客户、同事或者老师,最好先确认手里的源PDF是最终定稿。转完别看到下载按钮就完事,一定要打开生成的TXT,挨个检查段落顺不顺、有没有乱码缺字、页眉页脚有没有多余内容、扫描页的识别准不准,确认没问题再往外发。
方法一:从极轻PDF入口完成提取
平时处理办公资料选这个方法就行:打开PDF.cn在线平台(https://www.pdf.cn/),不用装软件,浏览器里就能搞定PDF、Office常见的格式处理。找到PDF转TXT功能后上传你要提取文字的PDF文件,生成转换后的TXT文件之后立刻预览,重点核对段落顺序、乱码、缺字、页眉页脚和扫描件识别情况。
第1步:进入工具入口
点开工具列表,找到PDF转TXT的入口,仔细看功能名称,别误点成旁边的PDF压缩、拆分或者其他转换工具。

第2步:上传文件
点上传区域,选中要提取文字的PDF文件。如果文件很大,耐心等上传进度走完,别反复点击提交,不然容易卡。

第3步:确认上传状态
上传完核对下文件名、文件数量和页面提示,别把旧版本或者不相干的文件传上来,转了半天白忙活。

第4步:开始处理
确认所有设置都没问题,点开始提取就行。处理的时候别关当前页面,等页面提示转换完成再操作下一步。

第5步:下载结果
转好的TXT下载下来之后马上打开检查,别光看到文件生成了,连看都不看就直接发人或者存进文件夹归档。

方法二:用本地转换工具导出TXT
要是你的PDF文件特别大,或者内容涉密不方便上传到在线平台,就用本地转换工具导出TXT。操作前先确认你选的是PDF转TXT功能,再核对下输出路径和文本编码的设置。
下面几张截图分别对应工具入口选择、文件导入、输出设置的操作,导出完成后同样要打开TXT检查有没有乱码、断行错位、多余的页眉页脚内容。

进入文件导入这一步时,先核对文件名、文件数量和上传状态,确认没有选到旧版本或无关文件,再继续往下处理。

下一张图主要看参数和输出位置,重点检查输出格式、页面范围、保存目录这些选项,确认无误后再开始处理。

方法三:扫描件先做OCR再整理文本
要是你手里的PDF是扫描件,直接转TXT大概率出来的是空文件或者全是乱码。得先做OCR文字识别,把图片里的文字先识别出来,再导出成TXT,这种方法尤其适合转电子书、摘录纸质扫描的资料。
下面这张图标注了OCR识别的入口位置,识别完记得核对下段落顺序、有没有缺字、特殊符号识别准不准。

结果文件别急着发,先这样看
转好的TXT先别急着发,打开先过一遍:别光看文件下完了就完事,重点查段落顺序、乱码缺字、多余页眉页脚、扫描内容识别准确度这几项。要是发现明显问题,回到源文件调整下设置重新转一次就行。
遇到失败提示先这样排查
要是碰到上传失败、处理超时、下载出错这类问题,先刷新页面试一次。还是解决不了的话,把文件大小、失败截图、你用的浏览器型号、具体操作步骤整理清楚,发邮件到market@pdf.cn处理就行。

