1.0 Введение в маркировку частей речи
Разметка частей речи (POS-тегирование) — это процесс присвоения каждому слову в тексте грамматической части речи, такой как существительное, глагол, прилагательное или наречие. Эта задача функционирует как форма классификации, где каждому словесному фрагменту присваивается соответствующая POS-тег. Как основополагающий шаг в анализе на уровне слов, POS-тегирование имеет фундаментальное значение для широкого спектра более сложных приложений обработки естественного языка (NLP), включая синтаксический анализ, семантический анализ и извлечение информации.
Основная цель данного документа — проанализировать и сравнить четыре основные методики определения частей речи. Каждый подход представляет собой отдельную стратегию, эволюционировавшую от лингвистических знаний, закодированных вручную, до сложных статистических моделей, основанных на данных.
В данном документе рассматриваются четыре методологии:
- Маркировка POS-терминалов на основе правил
- Стохастическая POS-маркировка
- Тегирование на основе трансформации
- Маркировка POS-терминалов на основе скрытой марковской модели (HMM)
Данный анализ начнётся с рассмотрения старейшего из этих методов — подхода, основанного на правилах, который опирается на непосредственную лингвистическую экспертизу.