ワードゲームには、合法な文字列のリストだけでは不十分です。各文字列が何を意味するのかを伝える必要があります means、そして意味こそが保存するのが最も難しいものです。
WordChess plays on a 25×25 board with a 148,941-word English dictionary6、平均8.6文字、最大25文字に及ぶエントリ。これが簡単な部分です。合法な単語のリストは、ゲームが受け入れる文字列の集合に過ぎません。興味深いのは、盤上の文字列が何を意味するのかをプレイヤーに伝えることです means、そしてそれを22言語で同時に実現することです。
辞書編纂者は、a の間に明確な 語根 およびその屈折形。語根とは、あなたが引く run, house, beのような基本形である。その周囲を、表面形の範式が軌道を描く: runs, ran, running。これらは同じ核心的な意味を担い、異なる文法的役割に合わせて装いを変えている。3 辞書は散文を語根に費やし、影には帰還の指針を委ねる。
ある単語がいくつの影を落とすかは、言語によって異なる。英語は 分析型であり、語順や小さな補助語に依存するため、動詞はせいぜい数個の形しか持たない。 フィンランド語 は 膠着型で、語幹に接尾辞を貼り付けて意味を構築する。一つのフィンランド語の名詞 15もの格変化を伴う、単数形と複数形があり、所有の語尾や準接尾辞が重層する。実際に区別できる形の数はいくつもの数千に達する。4 ハンガリー語は 英語のフレーズ全体を, 「私の家の中で」を一つの単語に házamban.5
定義は Wiktionary、誰でも編集できるフリー辞書から来ている。それは 巨大で多言語対応である:このプロジェクトは100以上のアクティブな言語版と数千万ものエントリにまたがり、有給の編集委員会ではなく、ボランティアによって協働的に書かれている。1 22言語で動作するゲームにとって、他のフリー辞書はカバー範囲でこれに匹敵するものはない。
しかし、紙の上でのカバー範囲は、読み上げられるカバー範囲ではない。Wiktionaryは、人間のエディターが同じ注釈を1万回書くことから解放するために、屈折形を保存している。定義を明記する代わりに、非語根エントリは form-of テンプレート、つまり「これはあの語根の特定の文法形である」と実質的に示す小さなポインタを保持している。2 その項目は smoulders は散文ではなく、「smoulderの三人称単数現在形」としてレンダリングされるテンプレートである。1
これらのポインターは誤差ではない。英語版Wiktionaryでは、約127万の定義のうち、約478,000、すなわち3分の1を大きく超える部分が、書き出された意味ではなく「〜の形」の定義である。1 データはそこにある。ただ折りたたまれているだけだ。
したがって、重要だった課題は決して「単語が欠けている」ことではなかった。単語の意味が、素朴なパーサーが捨ててしまうテンプレートの中に収まっていたことだった。WordChessの定義は、 Wiktionaryの生ダンプ を読み取り、 活用テンプレートを展開 することで構築された。言語ごとにパーサーに各ポインターの意味を学習させ、それを素の注釈に書き換えたのである。6
すべての言語は、異なる機構の裏にその形を隠している。スペイン語は動詞の形を {{forma verbo}}の裏にしまい込み、「Xの動詞形」として解決される。ドイツ語は {{Grundformverweis Dekl/Konj}} を屈折形と活用形に用いる。フィンランド語は {{taivutusmuoto}}. ロシア語では、形態テンプレートを一切保存しない場合があり、屈折語形は素の リダイレクト (собаки → собака) であり、「〜の形」の注釈を復元するために追跡する必要がある。6 各規約を処理すれば、カバレッジは飛躍的に向上する。
| 言語 | 展開前 | 展開後 | 増加 |
|---|---|---|---|
| ドイツ語 | 45% | 92% | +47 |
| オランダ語 | 58% | 90% | +32 |
| フィンランド語 | 54% | 74% | +20 |
| ロシア語 | 20% | 70% | +50 |
| ギリシア語 | 15% | 57% | +42 |
本プロジェクトの設計および構築ノートから測定。パーセンテージは、利用可能な定義または解決済みの「〜の形」注釈を備える辞書エントリの割合を示す。
データが欠落していたわけではない。ポインタに折り畳まれていたのだ。機械にその語を意味させるということは、それを展開する方法を学ぶことを意味した。
ゲームが現在保持しているものについて、正直である価値がある。WordChess が собаки が собакаの形であることを示すとき、「犬」の意味で、それは何も理解していない。それは、人間の編集者が残した同じポインタに従って、一つの文字列を別の文字列、すなわち注釈にマッピングしただけに過ぎない。これは lemmatizationであり、自然言語処理の主力である。表面形を基本形に還元することで、機械が追跡すべき個別の項目数を減らす作業だ。7
それは実在し、有用な種類の知識である。辞書学者をスタッフに抱えることなく、アテネでもアムステルダムでも「この単語は何ですか?」という質問に答えることを可能にする。しかし、それは意味としての知識ではなく、参照としての知識である。注釈とは、それを読む人がその単語を認識するという約束である。機械はその約束を保持し、読者が意味を供給する。
一部の言語は、パーサーが取り除くことのできない天井にぶつかる。なぜなら、展開するためのデータがそもそも存在しないからだ。ハンガリー語の項目は、語源と翻訳の表しか持たず、定義テキストが全くないことが頻繁にあるため、完璧な読者であっても空手振って帰ることになる。最も困難なケースは、言語学が最も困難な場所に集まっている。フィンランド語やハンガリー語のような膠着語は巨大な語形変化のパラダイムを生み出し、キリル文字やギリシャ文字の文字体系では、コミュニティのカバレッジが元々薄い。ギリシャ語は15%から57%まで上昇したが、ドイツ語の92%に大きく届かないのは、コードの問題ではなく、ソースの問題である。 6