如何把PDF文档的文字、图片及其排列方式等信息提取出来?

如何把PDF文档的文字、图片及其排列方式等信息提取出来?,第1张

有下面两种方法: 1、实现工具:Office 2003中自带的Microsoft Office Document Imaging 应用情景:目前国外很多软件的支持信息都使用PDF方式进行发布,如果没有Adobe Reader,无法查看其内容,如果没有相关的编辑软件又无法编辑PDF文件。转换为DOC格式则可以实现编辑功能。尽管有些软件也可以完成PDF转换为DOC的工作,但很多都不支持中文,我们利用Office 2003中的Microsoft Office Document Imaging组件来实现这一要求最为方便。 使用方法: 第一步:首先使用Adobe Reader打开待转换的PDF文件,接下来选择“文件→打印”菜单,在打开的“打印”设置窗口中将“打印机”栏中的“名称”设置为“Microsoft Office Document Image Writer”,确认后将该PDF文件输出为MDI格式的虚拟打印文件。 编辑提示:如果你在“名称”设置的下拉列表中没有找到“Microsoft Office Document Image Writer”项,那证明你在安装Office 2003的时候没有安装该组件,请使用Office 2003安装光盘中的“添加/删除组件”更新安装该组件。 第二步:运行Microsoft Office Document Imaging,并利用它来打开刚才保存的MDI文件,选择“工具→将文本发送到Word”菜单,并在d出的窗口中勾选“在输出时保持图片版式不变”,确认后系统提示“必须在执行此 *** 作前重新运行OCR。这可能需要一些时间”,不管它,确认即可。 编辑提示:目前,包括此工具在内的所有软件对PDF转DOC的识别率都不是特别完美,而且转换后会丢失原来的排版格式,所以大家在转换后还需要手工对其进行后期排版和校对工作。 2、实现工具:Solid Converter PDF 应用情景:利用Office 2003中的Microsoft Office Document Imaging组件来实现PDF转Word文档在一定程度上的确可以实现PDF文档到Word文档的转换,但是对于很多“不规则”的PDF文档来说,利用上面的方法转换出来的Word文档中常常是乱码一片。为了恢复PDF的原貌,推荐的这种软件可以很好地实现版式的完全保留,无需调整,而且可以调整成需要的样板形式。 使用方法: 1、下载安装文件Solid Converter PDF,点击安装。 编辑提示:安装前有个下载安装插件的过程,因此需要保证网络连接通畅。 2、运行软件,按工具栏要求选择需要转换的PDF文档,点击右下的“转换”(Convert)按扭,选择自己需要的版式,根据提示完成转换。

于设备和分辨率的图形图像等封装在一个文件中。

而你的意思是将PDF文件以数据库形式存放,需要时以数据库来调用么。计算机多以二进制保存传输数据,PDF文件本身是一组二进制流,在封装的文件中将不同的信息分开归类,数据库则与之等同的设定一系列的项目来存放这些数据。SQL数据库是三级模式的数据库,分为关系模式,储存模式和子模式。

你用百度搜一下SQL,其中有一段SQL语言组成,可能对问题有帮助。

实际上,PDF转换到数据库,应该说很难,我也只了解很少的一部分,可以多查些资料,更为准确些。


欢迎分享,转载请注明来源:内存溢出

原文地址: http://outofmemory.cn/sjk/6699677.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2023-03-27
下一篇 2023-03-27

发表评论

登录后才能评论

评论列表(0条)

保存