知网汉语词库(即HowNet)怎样使用

知网汉语词库(即HowNet)怎样使用,第1张

一、理论基础 首先,二者都以一种“模式假设”(patterning hypothesis)为前提和理论基础。其次,“理解性假设”(comprehensiveness hypothesis)也是二者的理论基础。但二者的理论基础不同之处也很多。Wordnet的一个较主要的理论基础是“可分离性假设”(separability hypothesis)即语言的词汇成分可以被离析出来并专门针对它加以研究。 Hownet的最重要的理论基础是它的哲学。其根本点是:世界上一切事物(搭核悉物质的和精神的)都在特定的时间和空间内不停地运动和变化。部件和属性这两个单位在Hownet的哲学体系中占有着重要的地位,一个事物被视为是整体还是部件,可以因系统的不同而不同对待;而关于对属性的认识是:任何一个事物都一定包含着多种属性,事物之间的异同是由属性决定的,没有了属性就没有了事物。二、设计原理与方法 二者的建设方法最明显的相同之处就是自上而下的方法。具体来说,Wordnet是以同义词集合作为基本构建单位进行组织的。Hownet则是先提取义原,以它为基本构建单位进行组织的。虽然细节不同,但总的指导性建氏兆设方法还是相同的。具体的设计原理与建设方法上,两者的不同点就凸现出来了。 1、Wordnet 的基本设计原理是它的“词汇矩阵模型” 一个词汇矩阵从理论上可以用单词与其同义词集合之间的映射来表示。当某个词有多个同义词时,通常同义词集合足以满足差异性的要求。当然,同义词是词形之间的一种词汇关系,但由于这种关系在Wordnet中被赋予了中心角色。因此,同义关系的词被放在中,与其他被放进[]中的词汇关系的词区别开来。Wordnet是按语义关系组织,由于语义关系是多个词义之间的关系,而词义用同义词集合来表示,因此很自然地把语义关系看作为同义词集合之间的一些指针。 2、Hownet的基本设计原理是把概念与概念之间的关系以及概念的属性与属性之间的关系形成一个网状的知识系统。这是它与Wordnet的本质不同。Hownet的建设方法的一个重要特点是自上而下的归纳的方法。通过对全部的基本义原进行观察分析并形成义原的标注集,然后再用更多的概念对标注集进行考核,据此建立完善的标注集。无论是义原的提取还是义原的考核与确定,在Hownet的建设中都是至关重要的并具有决定意义。三、描述关系的比较 1、上下位关系 这是二者都有的。Wordnet是词义之间的语义关系。Hownet的上下位关系由概念的主要特征体现,也具有继承关系。 2、同义关系 同义关系是二者都有的。Wordnet最重要的关系是同义关系。Hownet对于同义的定义与Wordnet相似,都采取了较宽泛的定义,只是Wordnet的同义关系是显性的,而Hownet的同义关系是隐性的。 3、反义关系 Wordnet对于反义关系采取了直接反义和间接反义两种关系都包括的方法。Hownet中的反义关系比Wordnet定义的还要宽泛,只要属性值一样就知乎可以形成反义关系。四、目的与应用 1、目的 Wordnet一开始要建立一个词典浏览器,后来又发展成自足的词汇数据库和语义或义类的机读词典。而Hownet是要建立一个面向计算机的知识库,揭示多重语义关系网络,为自然语言处理系统的建立提供最终需要的知识库。 2、应用 由于二者都是为自然语言信息处理服务的系统,那么二者的应用有交叉。例如,二者都在进行意义排歧,语义分析,语料库语义标注,信息过滤和分类,机器翻译等方面有着十分广泛的应用。 两者又有自己独特的应用领域。例如,Wordnet由于许多国家都在它的基础上建立了词汇数据库,那么Wordnet就可以进行多国语处理的词汇转换。由于它的内部结构是以层次为主,所以可进行信息语义层次检索,还可以进行主题名义识别和图像检索等;而Hownet也有它自己的应用领域,如:基于Hownet的内部语义关系建立,语料库句法关系标注,信息检索系统自然语言接口。还有它关于汉语方面研究与应用的独特之处,如:它的信息过滤和分析系统都是双语的,可以进行事件角色语义特征的提取。把Wordnet和Hownet结合起来的典型应用要算基于两者建设的双语语义词典。五、小结 经过对Wordnet和Hownet的一番比较,可以看出二者虽然是两种系统,但把二者结合起来研究,找出各自的不足之处,对自然语言处理研究还是有一点帮助作用的。Wordnet的词语概念是够用,但关系方面不足以支持推理。Hownet恰恰就是这样一种推理的知识库。Wordnet可向Hownet吸取这一点。Wordnet几乎没有关于句法方法方面的标注。而Hownet作为一个面向计算机并借助于计算机建立的常识知识库,它在语义知识构建方面明显优于Wordnet,而且许多现在Wordnet正致力解决的问题,在Hownet中都不是问题。所以在面向自然语言的信息处理方面,Hownet要优于Wordnet。当然Wordnet的研究人员也从来觉得这是一个“完工”的项目,Wordnet仍在继续发展中。

  针对“知网查重和PaperPass对比有什么区别”这个话题,只有将两者对比后,才能得出比较清晰的结论,有选择性的利用两系统。

         一、数据库对比    

知网:中国学术期刊网络出版总库,中国博士学位论文全文数据库/中国优秀硕士学位论文全文数据库,中国重要会议论文全文数据库,中国重要报纸全文数据库,中国专利全文数据库,互联网资源,英文数据库等,部分书籍不在镇裤知网库,检测不出抄袭,主要来源于知网本地收录的文献;

PaperPass:PaperPass的比对指纹数据库由超过9000万的学术期刊和学位论文,以及一个超过10亿数量的互联网网页数据库组成。

          二、检测语种对比     

PaperPass是全球首个中文文献相似度比对哗衡系统,只检测中文。

中国知网可以检测中文和英文。

        三、算法查重原理规则对比     

知网是用语义级别检测技术,没有“最小级别检测”的概念,系统在识别重复和引用时,会结合上下文内容,进行判断。

PaperPass是以句子为最小单位检测的,报告详细;

    四、识别能力对比     

知网能够识别标题,不会把标题算为重复相似;根据目录系统自动识别分章节;标注和参考文献,能检测到引用。

由于存在引注格式不统一、参考文献格式不规范、虚假引用等问题,PaperPass为给用户提供严格、负责的检测结果,将不再区分“相似”和“引用”。PaperPass检测系统是在论文修改环节为用户提供修改依据的工具,系统所显示的相似部分(红字)是否属于正常引用将保留给用户自行审定。

       五、准确权威程度对比     

中国知网是中国知识基础设施工程(China National Knowledge Infrastructure)。以实现全社会知识资源传播共享与增值利用为目标的信息化建设项目,由清华大学、清华同方发起,始建于1999年6月,是公认的权威的学术不端检测系统。

PaperPass网站诞生于2007年,是全球首个中文文献相似度比对系统,运营十一年来,已经发展成为权威、可信赖的中文原创性检查和预防剽窃的在线网站。系统自主研发的动态指纹越级扫描检测技术,已经领先于国内外其它检测系统所用技术,成为了论文抄袭检测技术的领导者。

          六、格式要求对比      

知网学位论文检测为整篇上传,格式对检测结果可能会造成影响,需要将最终交稿格式提交检测,将影响降到最小,此影响为几十字的小小段可能检乱旅做测不出。但都不会影响通过。系统的算法比较复杂,每次修改论文后再测可可能会有第一次没测出的小段抄袭。

PaperPass检测对格式没有太大的要求,因为检测过程中有复制粘贴这一过程。检测基本都是文本格式的。

通过上面六方面的对比,可得出如下大致结论:知网数据库大部分来源于本地收录的文献,paperpass大部分来源于9000个学术期刊和学位论文和互联网数据,两者的数据库还是有一定区别的,而且paperpass的算法没有那么精准,有时会把您的文章跟一篇完全不挨边的文章对比在一起,所以paperpass结果才会普遍较高,但这并不意味着在知网检测就百分之百会比paperpass低,也没有paperpass算法更严格的说法,PaperPass检测系统多适合在论文修改环节使用。


欢迎分享,转载请注明来源:内存溢出

原文地址: http://outofmemory.cn/yw/12406511.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2023-05-25
下一篇 2023-05-25

发表评论

登录后才能评论

评论列表(0条)

保存