PDF格式文件怎样转化成DOC格式文件
法一:
直接采用软件,比较好的有solidconverpdfverter.v1.0。用verter时,当采用以word文档打开的方式时,verter会自动弹出询问是否转化。校园网ftp也有相关的软件,并且是破解版。
不过经过试验,发现这些软件对只有是源文件是pdf的文件的转化效果较好,如果源文件是其他格式,而转化为pdf的,则无法正常转化,只能将文件以内嵌图片的方式转化,也就是说在word文件中是图片的形式。
法二:
1、先将PDF转为图片:
可用:“Galcott PDF Converter”软件将PDF转为图片格式
www.jfdown/SoftView/SoftView_17738.html
2、再用OCR软件识别、校对:
推荐使用“汉王摄影七种光OCR2.5
ftp://software@211.147.168.80/pic/hwdoc.rar
虽然汉王巳出了530058006800,但真正完全破解的只有汉王OCR2.5,用它的批文件处理模式可进行自动识别,然后再校对。
3、输出到文本:
完成识别校对后,可用我先前发的“OCR助手”软件
/personal/wyx/
删除多余的换行符并合并导出为单个文本文件。
4、在手机网页h5什么意思WORD中作最后的修饰。
注:此法引述段老师课堂段老师的说法,本人由于没到相关软件没有成功
ascii编码表规律如果是原文件非pdf格式,可用此法,首先确定你是否安装了Office 2003中的Microsoft Office Document Imaging组件,如果没有,使用Office 2003安装光盘中的“添加/删除组件”更新安装该组件,选中“Office 工具 Microsoft DRAW转换器”
第二步,打开转化好的pdf文件,点打印按钮,此时office的虚拟打印机会自动弹出对话框,如果有多个虚拟打印机,则选择Microsoft Office Document Image writer.然后会成生一个MDI文件,并且自动打开,选择“工具→将文本发送到Word”菜单,在弹出的窗口中选中“在输出时保持图片版式不变”,确认后系统会提示“必须在执行此操作前重新运行OCR。这可能需要一些时间”,不管它,确认即可。如果配置较低却是比较费时,大概会有十分钟左右,2M的文件。这一步完成后会自动弹出word对话框,并且询问以何种方式打开,不理它,按默认的方式打开即可,因为识别率较低,所以接下来就是在word中手工操作了。
pdg格式转doc格式然超星本身带有OCR识别功能,但是太垃圾,只能识别简单的字。
所以这个比较复杂,没有直接的软件,至少我还没到,思路是先转为pdf格式,然后转为doc格式:
其中第一步:pdgpdf格式,建议用pfdFactory,这是个虚拟打印机,首先在超星中将文件打开,点击图书打印,输入页数,然后确定,接下来就会出现一个选择虚拟打印机的对话框,当然选pfdFactory,完成后文件会自动打开,这里只是预览,记得要保存。需要注意的一点是,当pdg文件中有空白页时,pfdFactory会停止不动,我也没搞清是怎么回事。
第二步,当然是由pdf转换为doc了,可以采用上边已经叙述的方法。我是用我个人实践的方法的,主要的缺陷是有不少乱码,第二是超星文本中有些文字扫描的不是很清晰,所以容易出错,不过整体上来说文本的转化没有丢太多东西。
现在网上的许多资料都是以CAJsecurity形容词性PDF等文件格式提供的,其中的文本不能被直接编辑。网上提供了许多处理这种情况的软件,但是它们不是效率低,就是只能提取其中部分文本。本文所述利用微软提供的OCR识别技术从CAJPDF等文件中提取全部文本的方法,简便快捷,效率很高。
从不同格式的文件中提取文本前需要做好以下准备工作,安装CAJViewer5.5文件格式转换app浏览器软件acrobat 5 专业版浏览器软件安装Office2003,并完全安装Of?fice工具Microsoft Office D
ocument Imaging,然后在打印机里面会增加Microsoft Office Document Image Writer打印机。 Microsoft Office Document Image可以非常准确的全文件识别转化中文、英文、表格。
一、CAJ文件的识别
(一)首先,从网上下载CAJ格式的资料文件保存到本地硬盘上。
(二)然后,启动CAJViewer浏览器程序,并在该程序中打开刚才保存的CAJ格式的文件。浏览文件到最后一页后,不要关闭CAJ浏览器程序。
(三)在CAJ浏览器程序窗口中,选择“文件”→“打印”,并选择打印机为Microsoft Office Document Image Writer打印机,勾选打印到文件选项和确定打印页数。
(四)保存打印文件(*.prn)到适当位置。等待打印完成后,Microsoft Office Document Image 自动打开刚才保存的打印文件。
(五)在Microsoft Office Document Image窗口中,选择“页面”菜单中的“选择所有页面”菜单项,然后选择“工具”菜单中的“使用OCR识别文本”提取文本。
(六)选择“工具”下的 “将文本发送到word”,最后将把整个CAJ文件识别输出到word文件中。
二、PDF文件的识别
乘法函数在excel里怎么输入
(一)以文本形式保存的PDF文件,用acrobat 5 专业版,识别整个文件。直接打开从网上下载的PDF格式文件另存为RTF文件,或者选择工具栏上的文字选择按钮,然后选择文字区域,然后复制到Word中即可。
(二)以图片形式保存的PDF文件,将PDF文件打印到Microsoft Office Document Image Writer打印机,选择打印形成的文件的保存位置,然后会自动形成一个MDI文件,并且自动用Microsoft Office Document Image打开此文件,然后在Microsoft Office Document Im?age中选择“工具”菜单中的“使用OCR识别文本”,识别完成后,在选择“工具”下的,“将文本发送到word”,最后将把整个PDF文件识别输出到word文件中。
(三)加密的PDF文件先下载解密软件,解密后在参照上述步骤1),2) 进行。
(四)繁体PDF文件用上述步骤2)的方法识别到word后,用word中的“工具”→“语言”→“中
文繁简转换”
三、超星文件的识别
(一)全文件识别打印到Microsoft Office Document Image Writer打印机,然后按上述PDF文件的识别步骤中第二点操作,要注意的是,超星打印功能有点区别,因为超星是目录和全文分开的,所以打印时,需要分别把目录和正文识别到Word中,再合并到一起。打印时要填入打印页码从1到最后一页,不要选择打印全部。在打印选项中,要将页面比例设成真实大小,而不是整宽。注意识别速度比其他格式要慢很多,请保持耐心。一般一本200多页的书,识别需要几分钟的时间。
(二)超星文件识别相对比较麻烦一些,如果还有问题,可以先把超星打印成完整的PDF文件,然后再用上述识别PDF文件的方法转成Word
四、后记
经过试验,发现Microsoft Office Document Image 存在一些不稳定的问题,如在用CAJ打印到Microsoft Office Document Image Writer时,发现用CAJ5.5版本比较快,而CAJ5.0
时出现假死机。页面显示大时,转化的识别率较高。如果页数多的文件,包括超星,可以分多次转化。
由于虚拟打印到Microsoft Office Document Image Writer 比较慢,并且形成的虚拟文件很大,1200多页的书大约是60M,因此会严重影响机器的运行速度、C盘和内存空间。建议配置好的机器一次转化不要超过200页,配置差的不要超过100页,同时打印时在任务栏中会出现打印机图标,可以双击,看到打印任务的进度,避免误以为死机。转化完成后请删除c:\windows\temp目录下的虚拟打印文件,否则C盘很快会被用光。
如果是Office 2003,可以利用Microsoft Office 文档 Imaging组件的ocr功能.
    第一步:首先使用CAJ浏览器打开文档,接下来选择打印,在打开的“打印”设置窗口中将“打印机”栏中的“名称”设置为“Microsoft Office 文档 Image Writer”,确认后将该NH文件输出为MDI格式的虚拟打印文件。
提示:如果你在“名称”设置的下拉列表中没有到“Microsoft Office 文档 Image Writer”项,那证明你在安装Office 2003的时候没有安装该组件,请使用Office 2003安装光盘中的“添加/删除组件”更新安装该组件。
第二步:运行Microsoft Office 文档 Imaging,并利用它来打开刚才保存的MDI文件,选择“工具→将文本发送到Word”菜单,并在弹出的窗口中勾选“在输出时保持图片版式不变”,确认后系统提示“必须在执行此操作前重新运行OCR。这可能需要一些时间”,确认即可。
好象CAJ5.0以上版本可以转换为WORD文档,只过不可以转换图象,公式,图表,但是您可以用“复制图位”按钮,以图象方式复制到WORD文档. 第二种方法: CAJ支持另存为TXT,操作在“文件”选项里,但TXT为文本文件,不能保存图片,公式,图表等,可由TXT转为DOC,通过“复制图位”按钮,以图象方式复制到WORD文档中去。
也可以用Acorbat7.0打印成PDF后直接另存为DOC

版权声明:本站内容均来自互联网,仅供演示用,请勿用于商业和其他非法用途。如果侵犯了您的权益请与我们联系QQ:729038198,我们将在24小时内删除。