永发信息网

怎样提取pdf里的文字出来?

答案:5  悬赏:0  手机版
解决时间 2021-01-28 20:54
怎样提取pdf里的文字出来?
最佳答案
1、实现工具:Office 2003中自带的Microsoft Office Document Imaging
应用情景:目前国外很多软件的支持信息都使用PDF方式进行发布,如果没有Adobe Reader,无法查看其内容,如果没有相关的编辑软件又无法编辑PDF文件。转换为DOC格式则可以实现编辑功能。尽管有些软件也可以完成PDF转换为DOC的工作,但很多都不支持中文,我们利用Office 2003中的Microsoft Office Document Imaging组件来实现这一要求最为方便。
使用方法:
第一步:首先使用Adobe Reader打开待转换的PDF文件,接下来选择“文件→打印”菜单,在打开的“打印”设置窗口中将“打印机”栏中的“名称”设置为“Microsoft Office Document Image Writer”,确认后将该PDF文件输出为MDI格式的虚拟打印文件。
编辑提示:如果你在“名称”设置的下拉列表中没有找到“Microsoft Office Document Image Writer”项,那证明你在安装Office 2003的时候没有安装该组件,请使用Office 2003安装光盘中的“添加/删除组件”更新安装该组件。
第二步:运行Microsoft Office Document Imaging,并利用它来打开刚才保存的MDI文件,选择“工具→将文本发送到Word”菜单,并在弹出的窗口中勾选“在输出时保持图片版式不变”,确认后系统提示“必须在执行此操作前重新运行OCR。这可能需要一些时间”,不管它,确认即可。
编辑提示:目前,包括此工具在内的所有软件对PDF转DOC的识别率都不是特别完美,而且转换后会丢失原来的排版格式,所以大家在转换后还需要手工对其进行后期排版和校对工作。
2、实现工具:Solid Converter PDF
应用情景:利用Office 2003中的Microsoft Office Document Imaging组件来实现PDF转Word文档在一定程度上的确可以实现PDF文档到Word文档的转换,但是对于很多“不规则”的PDF文档来说,利用上面的方法转换出来的Word文档中常常是乱码一片。为了恢复PDF的原貌,推荐的这种软件可以很好地实现版式的完全保留,无需调整,而且可以调整成需要的样板形式。
使用方法:
1、下载安装文件Solid Converter PDF,点击安装。
编辑提示:安装前有个下载安装插件的过程,因此需要保证网络连接通畅。
2、运行软件,按工具栏要求选择需要转换的PDF文档,点击右下的“转换”(Convert)按扭,选择自己需要的版式,根据提示完成转换。 说白了就是不能直接提取 需要下载第三方软件 !
全部回答
目前没有办法
下一个可以阅读这样格式的软件就可以了,好像是 PDF READER
如果你不想转,就用软件自带的选择方式提取
用文字识别软件,尚书6号、汉王ocr都可以。扫描出来把错别字一改就行了。
我要举报
如以上问答信息为低俗、色情、不良、暴力、侵权、涉及违法等信息,可以点下面链接进行举报!
大家都在看
力帆汽车恩施洪林专卖店地址有知道的么?有点
写出6种不同意思的“轻”组成的词语,
写一段对话要有动作、心理描写
我和男友都一米五五那我们结婚后孩子会不会更
关于身边的海伦凯勒。为他/她写一篇传记。要
屑越的意思是什么啊?知道的请说下!
护理专业学生学习营养学有什么作用
庆铃汽车恩施专营服务店怎么去啊,我要去那办
在一次战役中,美军对被包围的英军散发传单说
干栋的意思是什么啊?知道的请说下!
【生产资料私有制】我国实现了把生产资料私有
绵山的资料
上海大众恩施麟达汽车销售服务有限公司地址在
脸部放淤血真的能祛痘么?
青岛东李大集搬哪里去了
推荐资讯
确定单独柱基础高度时,用净土反力由
下图为大肠杆菌DNA分子(片段)的结构示意图
任意浓度范围内的标准曲线都是直线吗?请简单
订制一双NIKEID一般要多长时间?
我在小河边抓了一个野老鳖,我放到桶里了,这
壮辞的意思是什么啊?知道的请说下!
WOW源生空气是怎么得到的
口袋妖怪漆黑的魅影EX中文版和口袋妖怪漆黑的
多个原告法院判决后执行还有先后顺序吗?
完美国际中巡海夜叉是什么啊
鑫龙源数码产品店地址有知道的么?有点事想过
西京和唐都哪个神经外科看得好
正方形一边上任一点到这个正方形两条对角线的
阴历怎么看 ?