随着数据的爆炸式增长,人工从海量的文本中寻找有用的信息无疑是一项费时费力的任务,因此信息抽取研究应运而生。 作为其关键技术之一的命名实体识别(Name Entity Recognition,NER)是知识库问答系统、机器翻译、信息检索、情感分析、知识图谱等多个自然语言处理应用的基础任务。
命名实体(named entity,NE)作为一个明确的概念和研究对象,是在 1995 年 11 月的第六届 MUC会议(MUC-6,the Sixth Message Understanding Conferences)上被提出的。
其目的是:是指从文本中提取专有名词和特定命名实体的识别任务,且识别结果作为实体关系抽取的基础。
命名实体识别从早期基于词典和规则的方法,到传统机器学习的方法, 后来采用基于深度学习的方法, 一直到当下热门的注意力机制、图神经网络等研究方法, 命名实体识别技术路线随着时间在不断发展, 技术发展趋势如下图所示。

命名实体识别是自然语言处理的一项基础任务,从最初的词典和规则的方法,发展到统计机器学习方法,一直到最近应用范围最广的基于深度学习的模型,命名实体识别技术一直是自然语言处理领域中的热点研究方向。
基于规则和字典的方法是最初代的命名实体识别使用的方法, 这些方法多采用由语言学家通过人工方式, 依据数据集特征构建的特定规则模板或者特殊词典。 基于词典的实体识别方法:是指词典中的每个词与被处理文档之间逐一匹配的过程。词典是由特征词构成的词典和外部词典共同组成, 外部词典指已有的常识词典。 基于规则的实体识别方法:是根据文本特点与定制规则特点匹配的方式完成实体识别。规则包括关键词、位置词、方位词、中心词、指示词、统计信息、标点符号等。 制定好规则和词典后, 通常使用匹配的方式对文本进行处理以实现命名实体识别。

基于词典和规则的实体识别方法使用简单,结果准确率较高,可以满足实际应用中对准确率的要求;但是词典和规则库的建立需要花费大量时间和人力;不同的实体类型需要定制相应的规则,可移植性较差。
从给定的、已标注的训练集出发,通过人工构建特征,并根据特定的模型对文本中每个词进行标签标注,实现命名实体识别。与分类问题相比, 序列标注问题中当前的预测标签不仅与当前的输入特征相关,还与之前的预测标签相关, 即预测标签序列之间是有强相互依赖关系的。 序列化标注是目前最为有效,也是最普遍的 NER 方法。
| 项目 | 模型 | 特点 |
|---|---|---|
| 单 | ||
| 一 | ||
| 模 | ||
| 型 | 基于词典和规则的方法 | 准确率高,使用简单;需要人工定制,移植性差 |
| 隐马尔可夫模型 HMM | 训练效率较高;严格的独立观测假设, 不能考虑上下文的特征 | |
| 最大熵马尔可夫模型 MEMM | 特征设计灵活,解决了 HMM 输出独立性的问题;局部归一化,存在标签偏置 | |
| 支持向量机模型 SVM | 可以解决高维问题,适用大型特征空间;对参数和核函数选择要求高 | |
| 条件随机场模型 CRF | 可利用上下文信息,全局归一化求得最优解;收敛速度慢、复杂度高 |
总的来说,该方法的步骤主要可以总结为:预处理语料、抽取特征并制定特征模板、训练模型、优化模型。

基于统计机器学习算法的命名实体识别模型对特征选取的要求较高,并且需要丰富的语料库。 结合词典规则的统计机器学习模型适用于专业性比较强的领域,可在一定程度上提高分词的准确性,但词典和规则的训练语料库构建程序繁琐,需要爬取大量数据库。同时基于统计的机器学习算法依赖于人工定制特征,限制了该方法在仅有少量标注数据集范围中的更深入使用。
与基于统计的机器学习方法不同,深度学习本身包含较强的泛化能力,可以从原始数据中自行获取特征,不依赖于专家知识和人工特征。深度学习主要包括深度神经网络模型、注意力模型和迁移学习模型。 与深度神经网络模型相比,迁移学习适用于标注数据稀缺的情况。注意力模型通过相似度计算,在各神经网络单元引入权重系数,提升模型识别精度。