碰到图里的文字没法直接复制,再也不用逐字手动敲了。下面整理了3种完整的图片文字识别方法:第一种用极轻PDF先把图片转成PDF再做OCR识别,另外两款工具可以直接处理已经整理好的PDF扫描件,每种方法都从找入口、上传操作,一直讲到识别、下载和结果核验。

方法一:用极轻PDF先转PDF再做OCR
极轻PDF(pdf.cn)的OCR PDF工具只支持上传PDF文件,要是你手里的原始资料是JPG、PNG这类图片,得先走「图片转PDF」功能生成PDF文件,再进OCR PDF工具做识别,两步都走完,就能把图片里的文字完整提出来。
步骤一:进入图片转PDF工具
打开极轻PDF首页,在常用工具区找到「图片转PDF」,先看清楚入口名字,别误点成「PDF转图片」白忙活半天。

步骤二:上传需要识别的图片
进到工具页之后点「选择多个图片」,把要提取文字的JPG、PNG文件传上去,多张图可以一起批量加,不过上传前最好先检查下图片方向正不正、清不清晰。

步骤三:确认图片上传成功
等文件列表里显示出图片名称,状态标了「上传成功」再往下走,要是状态一直没刷新,就先重新上传,别直接点转换,很容易出问题。

步骤四:开始转换为PDF
确认所有文件都没问题就点「开始转换」,多张图片的排列顺序直接决定生成PDF的页序,转换前一定要先把顺序核对好。

步骤五:下载转换后的PDF
等转换记录显示完成,点「下载」把PDF存到本地,后面我们还要把这个生成好的文件传到OCR PDF工具里处理。

步骤六:进入OCR PDF工具
回到极轻PDF首页,从「文件优化」分类里找到「OCR PDF」点进去,先确认页面标题确实是OCR PDF,再开始上传文件。

步骤七:上传刚生成的PDF
点「选择PDF文件」,上传刚才下载好的PDF就行,注意这里不能直接传JPG或者PNG,要是文件格式不对,得返回前一步重新转。

步骤八:核对上传状态
等文件列表里显示出名称、大小,还有「上传成功」的提示,就说明文件已经准备妥当了,要是页面还显示上传中,就等状态更新完再操作,不用急。

步骤九:开始OCR识别
点「开始转换」就能启动OCR识别,提醒下大家:原始扫描图越清晰、方向越正,最后出来的文字结果越准,后面核对也越省事儿。

步骤十:下载OCR结果
转换完成后点「下载」拿到结果,打开之后重点检查数字、标点、表格边界和生僻字,有错字及时改过来。

方法二:使用iLovePDF处理PDF扫描件
要是你手里本来就是PDF扫描件,直接进iLovePDF的OCR PDF工具就行,能省掉图片转PDF的步骤,不过上传前还是要确认下PDF页面方向正确、文字没有被裁切。
步骤一:找到OCR PDF入口
在工具列表里找到「OCR PDF」点进去,页面上的「扫描为PDF」是另一个功能,别选错了。

步骤二:上传PDF并识别
点「选择一个PDF文件」上传扫描件,跟着页面提示启动OCR就行,处理完下载文件,抽查下标题、页码和数字有没有识别对。

方法三:使用PDF24提取PDF文字
PDF24对应的文字提取工具叫「PDF转换为文本」,适合已经整理成PDF的图片资料,操作前同样要保证原文件足够清晰。
步骤一:进入PDF文本识别工具
在它的工具列表里找到「PDF文本识别」入口,他家功能列表挺长的,先看清楚名称再点,别进错页面。

步骤二:选择PDF并下载文本
点「选择文件」上传PDF,等处理完成直接下载文本结果就好。拿到结果之后记得跟原图逐段对照,尤其留意表格、金额和编号这类容易出错的内容。

识别结果怎么检查
可以先抽查每页的开头结尾,还有数字密集的区域,再核对模糊字、标点和换行对不对。要是原图本身就倾斜、反光或者分辨率太低,优先把原图调整好再重新转换,别对着满是错漏的结果反复改,费时间还容易出问题。多页的资料还要核对页序,避免漏页。


