重要な用語の用語集
重要な用語の用語集
| 契約期間 | |
| アドホック検索 | ユーザーが自然言語でクエリを入力し、システムが必要な情報に関連するドキュメントを返す IR の問題。 |
| 合意(コンコード) | 単語が、関連する他の単語に応じて形を変えること。異なる単語間で文法カテゴリの値を一致させること。 |
| 曖昧さ | 複数の方法で理解される能力。 |
| アナフォリックな曖昧さ | 談話の中でアナフォラ実体を使用することで生じる曖昧さ。「それ」のような言及は複数の先行詞を指す可能性があります。 |
| 反意語 | 軸に対して意味的構成要素が対称である 2 つの語彙項目間の関係 (例: 金持ち/貧乏人)。 |
| 側面 | 完了形(完了)や不完了形(進行中)など、イベントに対する見方を定義する動詞に関連する文法カテゴリ。 |
| オートマトン | 事前に決められた一連の操作に自動的に従う抽象的な自己推進型コンピューティング デバイス。 |
| ボトムアップ解析 | パーサーが入力シンボルから開始し、開始シンボルまでの解析ツリーを構築しようとする解析戦略。 |
| チャンキング | トークンにラベルを付けて品詞 (POS) と短いフレーズを識別し、文の構造を取得するプロセス。 |
| コヒーレンス | 発話がまとまって意味のある全体を形成するテキストの特性。発話とエンティティ間の関係によって特徴付けられます。 |
| 文脈自由文法(CFG) | 言語を記述するための記法。非終端記号、終端記号、生成規則、および開始記号の集合によって定義されます。正規文法のスーパーセットです。 |
| コーパス | 自然なコミュニケーション環境で作成された、機械で読み取り可能なテキストの大規模かつ構造化されたセット。 |
| 相互参照の解像度 | テキスト内で同じエンティティを参照する参照表現を見つけるタスク。 |
| 依存文法 | 動詞を節構造の中心とし、単語が有向リンク(依存関係)によって繋がれる文法形式。句節点はない。 |
| 導出 | 解析中に入力文字列を生成するために使用される生成規則のセット。 |
| 決定論的有限オートメーション(DFA) | 入力シンボルごとにマシンが移行する状態を決定できる有限オートマトンの一種。 |
| 談話処理 | NLP のサブフィールドは、発話がどのようにまとまり一貫した談話を形成するかに関する理論とモデルの構築に関係します。 |
| 有限状態オートマトン(FSA) | 有限の数の状態を持つオートマトン。 |
| 文法 | 言語学では、言語が機能するために用いられる規則または原則。 |
| 隠れマルコフモデル(HMM) | 基礎となる隠れた確率過程が、一連の観測結果を生成する別の確率過程セットを通じてのみ観測できる、二重に埋め込まれた確率モデル。 |
| 同音異義語 | 綴りや形式は同じだが意味が異なり無関係な単語 (例: bat/bat)。 |
| 催眠術 | 一般的な用語(上位語)とその用語のインスタンス(下位語)との関係。たとえば、「色」(上位語)と「青」(下位語)など。 |
| 情報検索 (IR) | ドキュメント リポジトリの情報 (特にテキスト情報) の整理、保存、取得、評価を処理するソフトウェア プログラム。 |
| 逆索引 | すべての単語について、その単語を含むすべての文書と文書内での出現頻度をリストするデータ構造。 |
| レンマ化 | 語彙と形態素解析を使用して語尾変化を除去し、単語の基本形 (語幹) を抽出するプロセス。 |
| 語彙の曖昧さ | 単一の単語が異なる品詞として扱われたり、異なる意味を持つ可能性がある曖昧さ(例:「silver」は名詞、形容詞、動詞として使用されます)。 |
| 語彙意味論 | 個々の語彙項目(単語、サブワード、接辞、句)の意味の研究。 |
| 機械翻訳(MT) | あるソース言語のテキストを別の言語に翻訳するプロセス。 |
| 意味表現 | 状況を記述し、推論を可能にするために、エンティティ、概念、関係、述語などの構成要素から構築された正式な構造。 |
| 形態素 | 語幹や接辞など、単語の意味を伝える最小単位。 |
| 形態素解析 | 単語が形態素と呼ばれるより小さな意味のある単位に分解されることを認識し、それに基づいて言語構造を生成する問題。 |
| 言語における単語の構造、分類、形成を研究する学問。 | |
| 自然言語処理(NLP) | コンピュータサイエンスと AI のサブフィールドであり、コンピュータが人間の言語を理解して処理できるようにすることを目的としています。 |
| 非決定性有限オートメーション(NDFA) | 入力シンボルに対してマシンが任意の状態の組み合わせに移行できる有限オートマトンの一種。 |
| 品詞 (POS) タグ付け | 文中の特定の単語に品詞の 1 つ (名詞、動詞、形容詞など) を割り当てるプロセス。 |
| 解析ツリー | 導出のグラフィカルな表現。ルートは開始シンボル、内部ノードは非終端、リーフ ノードは終端です。 |
| 解析 | 自然言語の記号の文字列を分析して、正式な文法の規則に準拠しているかどうかを確認し、構造的表現を構築するプロセス。 |
| 句構造文法 | 構成文法とも呼ばれるこの文法は、構成関係に基づいており、文の構造を名詞句 (NP) と動詞句 (VP) の観点から捉えます。 |
| 多義性 | 異なるが関連性のある意味を持つ単語または句 (例: 金融機関としての「銀行」またはその建物)。 |
| 実用的な曖昧さ | 文言が具体的でないため、フレーズの文脈によって複数の解釈が可能になる曖昧さ。 |
| 実践的な分析 | 意味解析中に取得されたオブジェクト参照を使用して、特定のコンテキスト内の実際のオブジェクト/イベントを適合させ、あいまいさを解決する NLP フェーズ。 |
| 実用的な | 言語の機能と文脈におけるその使用法の研究。 |
| プロップバンク | 意味役割のラベル付けに使用される、動詞命題とその議論が注釈付けされたコーパス。 |
| 参照解像度 | テキスト内のどの言語表現がどのエンティティを参照しているかを判断するタスク。 |
| 正規表現 (RE) | パターンに保持された特殊な構文を使用してテキスト検索文字列を指定するための言語。 |
| 関連性フィードバック | クエリの初期出力を使用して関連性に関するユーザー情報を収集し、改善された新しいクエリを実行する IR のプロセス。 |
| 意味の曖昧さ | 単語自体の意味が誤って解釈され、文章の解釈が異なる場合に生じる曖昧さ。 |
| セマンティック分析 | テキストから正確な辞書の意味を抽出し、その意味をチェックする NLP フェーズ。 |
| 意味論 | 言語で意味がどのように伝えられるかを研究する学問。 |
| ステミング | 単語の末尾を切り落とすことで単語の基本形を抽出するヒューリスティックなプロセス。 |
| 確率的POSタグ付け | 頻度または確率を使用して単語の曖昧さを解消するタグ付け手法。多くの場合、単語の頻度またはタグ シーケンスの確率 (n グラム) に基づきます。 |
| 同義語 | 形式は異なるが同じまたは近い意味を表す 2 つの語彙項目の関係 (例: 著者/作家)。 |
| シンセット | WordNet では、名詞、動詞、形容詞、副詞がグループ化された認知同義語のセット。 |
| 構文の曖昧さ | 文をさまざまな方法で解析できる場合に生じる曖昧さ。 |
| 構文 | 単語を節や句などの大きな単位に順序と配置する研究。 |
| 構文解析 | 文が整形式であるかどうかを確認し、単語間の構文関係を示す構造に分解するNLPフェーズ。構文解析とも呼ばれます。 |
| 緊張した | 動作の時間(現在、過去、未来)を示す動詞に関連する文法カテゴリ。 |
| トークン化 | 与えられたテキストをトークンと呼ばれる小さな単位(単語、数字、句読点など)に分割するプロセス。 |
| トップダウン解析 | パーサーが開始シンボルから解析ツリーの構築を開始し、入力に一致するように変換しようとする解析戦略。 |
| 変換ベースのタグ付け | Brill タグ付けとも呼ばれ、データからルールが自動的に誘導され、ある状態を別の状態に変換する、自動 POS タグ付けのルールベースのアルゴリズムです。 |
| ツリーバンク | 文の構文または意味構造を注釈する、言語的に解析されたテキスト コーパス。 |
| ベクトル空間モデル | ドキュメントとクエリが高次元空間内のベクトルとして表現され、それらの間の角度の余弦を使用して類似度が計算されることが多い IR モデル。 |
| VerbNet(ベトナム語) | 意味情報と構文情報の両方を組み込んだ、英語の動詞に関する大規模で階層的、ドメインに依存しない語彙リソースです。 |
| 語義曖昧性解消(WSD) | 特定の文脈で単語を使用することで、その単語のどの意味が活性化されるかを判断する能力。 |
| WordNet | 名詞、動詞、形容詞、副詞が認知同義語 (Synsets) のセットにグループ化されている英語の語彙データベース。 |