首页   中变网通传奇私服   新开1.80传奇私服   1.98传奇   北方网通传奇私服
以图片形式保存的PDF文件
文章作者:admin 文章来源: 浏览次数:
网上的学术资料多数是以CAJ、PDF等文件格式提供的,减肥药,其中的文本不能被直接编辑。网上提供了许多处理这种情况的软件,但是它们不是效率低,就是只能提取其中部分文本。本文所述利用微软提供的OCR识别技术从CAJ、PDF等文件中提取全部文本的方法,简便快捷,效率很高。
从不同格式的文件中提取文本前需要做好以下准备工作,安装CAJViewer5.5浏览器软件和acrobat 5 专业版浏览器软件安装Office2003,并完全安装Office工具Microsoft Office Document Imaging,然后在打印机里面会增加Microsoft Office Document Image Writer打印机。 Microsoft Office Document Image可以非常准确的全文件识别转化中文、英文、表格。
下面是具体步骤:
一、CAJ文件的识别
(一)首先,从网上下载CAJ格式的资料文件保存到本地硬盘上。
(二)然后,启动CAJViewer浏览器程序,并在该程序中打开刚才保存的CAJ格式的文件。浏览文件到最后一页后,不要关闭CAJ浏览器程序。
(三)在CAJ浏览器程序窗口中,选择“文件”→“打印”,并选择打印机为Microsoft Office Document Image Writer打印机,勾选打印到文件选项和确定打印页数。
(四)保存打印文件(*.prn)到适当位置。等待打印完成后,Microsoft Office Document Image 自动打开刚才保存的打印文件。
(五)在Microsoft Office Document Image窗口中,选择“页面”菜单中的“选择所有页面”菜单项,然后选择“工具”菜单中的“使用OCR识别文本”提取文本。
(六)选择“工具”下的 “将文本发送到word”,最后将把整个CAJ文件识别输出到word文件中。
二、PDF文件的识别
(一)以文本形式保存的PDF文件,用acrobat 5 专业版,识别整个文件。直接打开从网上下载的PDF格式文件另存为RTF文件,变态私服发布,或者选择工具栏上的文字选择按钮,然后选择文字区域,然后复制到Word中即可。
(二)以图片形式保存的PDF文件,将PDF文件打印到Microsoft Office Document Image Writer打印机,选择打印形成的文件的保存位置,然后会自动形成一个MDI文件,并且自动用Microsoft Office Document Image打开此文件,然后在Microsoft Office Document Im?鄄age中选择“工具”菜单中的“使用OCR识别文本”,识别完成后,在选择“工具”下的,“将文本发送到word”,最后将把整个PDF文件识别输出到word文件中,地摊网
(三)加密的PDF文件先下载解密软件,解密后在参照上述步骤1),传奇sf发布网站,2) 进行。
(四)繁体PDF文件用上述步骤2)的方法识别到word后,用word中的“工具”→“语言”→“中文繁简转换”
推荐文章
热门文章
  • 另准备1大匙炸花生去皮压成碎
  • 摩西在某一个夜晚
  • 「何如斯可谓之『士』矣
  • 到底在追求什么样的生活
  • 曾经有人为了我的病
  • 也可以活出自己的精彩
  • 枪栓动力是橡皮?
  • 这里的男人有工作而且热爱小孩
  • 240平米 350万 精装修 南北通透 带40平
  • 2008-01-10 08
  • 即便有人好不容易跳出三界外
  • 这四个条件缺一不可
  • 240平米 350万 精装修 南北通透 带40平
  • 600010 600029 600003 601398 600015
  • 一汽大众和奥迪对Q5在中国市场的前景也
  • 青春是手牵手的坐上了永不回头的火车
  • 抗性皮肤 武器
  • 其实过节没什么太大的感觉
  • 爱这个东西
  • 再说你自己跟他俩在一起像电灯泡似的
  • 本站所有1.80战神复古内容均为用户上传,如果侵犯到您的版权,我们会立刻删除!本站非盈利性网站,广告请勿联系!