基于自然语言处理和机器学习的实体关系抽取方法研究
王思丽; 刘巍; 杨恒; 张伶; 祝忠明
刊名图书馆学研究
2021-09-25
期号18页码:39-48
关键词自然语言处理 机器学习 特征提取 远程监督 规则映射 实体关系识别
ISSN号1001-0424
DOI10.15941/j.cnki.issn1001-0424.2021.18.005
产权排序1
英文摘要

实现非结构化文本中实体关系的有效抽取,并形成一条简单化、易操作、可重复的实现路径,为图书情报等相关领域分析处理与整合利用网络非结构化数字资源提供方法基础。充分结合自然语言处理与机器学习方法的优势:首先,通过词性标注、句法分析等多种自然语言处理方法实现对非结构化文本数据的语义化处理与特征提取,使其转变为机器学习模型可以接收的输入;其次,采用远程监督和设计决策程序的方式将得到的初始化特征进一步转换为机器学习模型可以使用的一组规则化标签;最后,指定预测变量,训练机器学习模型,使其能够使用预先生成的标签数据进行学习和推理,并推断出实体关系的边际概率。能够使用预先给定的领域知识提高非结构化文本中实体关系抽取的精度和质量,并有效解决一定的统计推断问题。暂未能在一些专业领域进行验证,有待引入和开发可扩展的高性能学习和推理引擎,以支持更多的基础机器学习算法的快速运行。 

学科主题图书馆、情报与文献学 ; 情报学
语种中文
内容类型期刊论文
源URL[http://ir.las.ac.cn/handle/12502/11715]  
专题文献情报中心_中国科学院兰州文献情报中心_信息系统部
作者单位中国科学院西北生态环境资源研究院文献情报中心
推荐引用方式
GB/T 7714
王思丽,刘巍,杨恒,等. 基于自然语言处理和机器学习的实体关系抽取方法研究[J]. 图书馆学研究,2021(18):39-48.
APA 王思丽,刘巍,杨恒,张伶,&祝忠明.(2021).基于自然语言处理和机器学习的实体关系抽取方法研究.图书馆学研究(18),39-48.
MLA 王思丽,et al."基于自然语言处理和机器学习的实体关系抽取方法研究".图书馆学研究 .18(2021):39-48.
个性服务
查看访问统计
相关权益政策
暂无数据
收藏/分享
所有评论 (0)
暂无评论
 

除非特别说明,本系统中所有内容都受版权保护,并保留所有权利。


©版权所有 ©2017 CSpace - Powered by CSpace