Lexical Database the Japanese WordNet is a useful tool in natural language processing. However, it is officially announced that Japanese WordNet contains 5% errors. In this paper, we discuss error detection methods in the Japanese WordNet. キーワード Thesaurus, WordNet, Japanese WordNet, 1. はじめに 日本語 WordNet[1,2]は Princeton 大学が開発した WordNet[3]を用いた言語データベースである。日本語 WordNet は自然言語処理において有用であり、様々な 実験に使用されている [4]。フリーの Web シソーラス サービスにおいて、日本語 WordNet は一般的に使用さ れている。しかしながら、現行の日本語 WordNet は間 違いを 5%ほど含んでいると作成者らが認めており [2]、 それらの間違いが日本語 WordNet の使いやすさに影響 を及ぼしている可能性がある。 本論文では、われわれが検証した日本語 WordNet の 間違い探知手法において議論する。間違い探知は日本 語 WordNet の間違い修正の第一段階である。この手法 は、大規模言語データベースの作成に有用であると考 える。我々は特に日本語 WordNet の似たような間違い 1 Weblio, http://ejje.weblio.jp の発見を主眼にしており、この間違いのことを「類義 語の間違い」と呼んでいる。 英語でない WordNet や WordNet に似た言語データベ ースの作成という点において、複数のプロジェクトが 行 わ れ て い る 。 日 本 語 WordNet や Chinese Open WordNet[5]は、ブートストラップの段階で、Princeton WordNet のマッピング手法を用いて半自動生成されて いる。 また、 Universal WordNet[6]や Babel Net[7]、 Open Multilingual WordNet[8]といった、WordNet の拡張によ る統合、多言語概念字句データベースの生成の試みも なされている。概念と語句、または複数の概念間の関 係は、Wikipedia やタグ付けコーパスのような様々な資 源から自動的に抽出することが可能である。それらに よって得られた統合データベースの品質は、生成者自 身や、ネットワークコミュニティによって評価されて きた。 WordNet は、オントロジーのひとつとしてみなすこ とができる。多言語 WordNet を生成する場合には、言 語数に応じたオントロジー間のマッピングをする必要 がある。そのため、オントロジーの間違いの検出と修 正、オントロジー間のマッピングに関する研究がなさ れてきた。これらの研究において、オントロジー内で 分類が間違っているものや、冗長もしくは不適切であ る、または間違った関係性を生成されている箇所を修 正する試みがなされてきた。 間違い検出の手法として、日本語 WordNet のみを使 用した手法を動詞に適用した場合をベースラインとし て提示する [9]。また、コーパスを用いた単語をベクト ル化し、これらのコサイン類似度によって名詞の間違 い検出の手法として使用できないかを議論する。 本論文では、第 2 節で WordNet と日本語 WordNet の 説明、第 3 節で本論文のコンセプトと WordNet の構造 における「同義語の間違い」の一例を紹介する。第 4 節では間違いの抽出法に関するわれわれの手法の説明、 第 5 節では手法を用いた場合の結果の提示を行う。第 6 節では、本手法の Princeton WordNet における応用例 と、関心を持っている別手法に関しての説明、第 7 節 で word2vec を用いた単語のベクトル化とそれらを用 いた間違い検出の実験、第 8 節に今後の展望と課題を 述べる。 2. WordNet と日本語 WordNet 2.1. Princeton WordNet Princeton WordNet は英語の大規模言語データベース である。名詞、動詞、形容詞、副詞といった品詞ごと に、明確なコンセプトを持った「Synset」という認知同 義語のセットに纏められる。各 Synset は固有の ID に よって管理されており、Gloss と呼ばれる、Synset の簡 単な意味を説明するテキストがリンクされている。 Synset は概念 -意味関係もしくは字句トークン関係で 相互リンクを持っている。単語が持つ意味を Synset に よってグループ化することができるため、WordNet は シソーラスとして使用できる。多義である単語が存在 するため、単語は複数の Synset に属することがある。 2.2. 日本語 WordNet 日本語 WordNet は Princeton WordNet を基にした、日 本語の語彙データベースである。日本語 WordNet のプ 2 Wikipedia, http://ja.wikipedia.org ロジェクトの目的は、誰でも自由に使用可能な大規模 日本語データベースを提供することである。このデー タベースは 2006 年から開発されている。 日本語 WordNet の構造は、Princeton WordNet に準拠 している [1]。しかし、日本語と英語という言語の違い が存在するため、日本語 WordNet は Princeton WordNet に含まれていないオリジナルの Synset を含んでいる。 また、日本語 WordNet は、シソーラスとしての精度よ り多数の概念を包括することに主眼を置いている。 現行の日本語 WordNet の規模は以下のとおりである。 ・57,238 概念(Synset 数) ・93,834 語(日本語) ・158,058 語義(単語 -synset ペア数) 図 1 日本語 WordNet の Synset-同義語間リンク例 日本語とリンクを持つ Synset は日本語の gloss を持 っている。日本語 WordNet のカバー範囲の拡張のため に、SUMO や Wikipedia、GoiTaikei[10]といった他のリ ソースが使用されている。 2.3. 他言語の WordNet と WordNet の拡張 Princeton WordNet を基にした、様々な言語の言語デ ータベース作成プロジェクトが存在する。一部のプロ ジェクトでは WordNet、Wikipedia、Wiktionary及びそ の他の言語資源を用いて、多言語のごくデータベース を作成しようと試みている。 既存の言語資源と新しいデータベース間のマッピ ングの正確さは、それによって出力されるデータベー スの整合性の正しさを証明する指標になるので非常に 重要である。新しい言語の WordNet を作成することは、 他の言語からなる新しいオントロジーで表現されてい る、既存のオントロジーからマッピングで作成すると みなすことができる。 3 Wiktionary, http://ja.wiktionary.org 3. 日本語 WordNet の間違い 間違いの訂正は、新しく作成したオントロジーや、 オントロジー間のマッピングの整合性の確認において 重要である。日本語 WordNet の現行のバージョンでは、 約 5%の間違いが含まれている。また、Chinese Open WordNet も、それに匹敵するエラー率である。本節の 残りでは、同義語における間違いにおける、エラーの 種類に焦点を当てる。 3.1. 同義語の間違い WordNet の構造において、「同義語の間違い」を、語 wmiss が属している synset(S とする)の Gloss と合致 しない語であると定義する。 図 2 では、Synset 02651424-v について図示している。 この Synset は「泊める」、「収容」、「宿る」、「持ち込む」 という 4 つの同義語を持っている。