3.0 随机词性标注
随机词性标注代表着从手动创建规则到数据驱动的概率方法的重大范式转变。该方法利用从预先标注的训练语料库中提取的统计信息——特别是词频和概率。它的出现标志着自然语言处理领域经验数据驱动革命的开始,证明了可以从文本中自动学习到稳健的语言行为。
随机标记可以通过两种不同的方法来实现,这两种方法在复杂性和有效性方面有所不同。
- 词频法 这种简单的方法通过赋予单词在训练语料库中出现频率最高的词性标签来消除歧义。例如,如果单词“book”在训练数据中作为名词出现了100次,作为动词出现了10次,那么这种方法总是将其标记为名词。该方法的主要缺陷在于它没有考虑上下文,这可能导致不合理的标签序列(例如,冠词后跟动词)。
- 标签序列概率(n-gram 方法) 这是一种更先进、更注重上下文的方法,它通过计算单词在包含特定词的序列中出现的概率来确定单词的最佳标签。 n 前导标签。这从根本上对 P(标签|前 n-1 个标签) 进行建模,从而捕捉词频方法忽略的局部上下文依赖关系。二元语法模型(n例如,=2),会根据最近的单个标签计算标签的概率,从而使模型能够更倾向于语法正确的标签序列。
随机标注器的定义特性源于其统计性质。
- 取决于标签单独出现和按顺序出现的概率。
- 需要一个大型的、带注释的训练语料库作为其主要知识来源。
- 根据训练数据中观察到的模式,选择单词最常用或最可能的标签。
- 由于没有语料库中不存在的单词的概率数据,因此存在“未知单词”或“词汇表外 (OOV)”问题。
接下来我们将探讨的方法是基于转换的标记,它提供了一种混合模型,其灵感来源于基于规则的逻辑和随机系统的数据驱动学习。