Qは10点、Eは1点。このひとつの事実の裏には、言語についての小さな理論と、情報をめぐる議論と、そしてこのゲームのタイルセットの中身がスペイン語と英語とで異なる理由が隠れています。
英語で執筆・編集されました。この日本語版は機械翻訳によって作成されたものです。正確さが重要な箇所については、英語の原文が正式なものです。 英語の原文を読む →
最初の手番で出会う採点ルールは、美的な選択ではありません。それは測定なのです。1930年代の初め、失業中の建築家Alfred Mosher Buttsは、純粋な運でも純粋な語彙力でもない単語ゲームを作ろうと思い立ち、各文字に値をつける筋の通った方法を必要としていました。そこで彼は技術者がすることをしました。数えたのです。Buttsは、当時の印刷物に各文字がどれほど頻繁に現れるかを集計しました。その筆頭はThe New York Timesの一面で、ほかにHerald TribuneやThe Saturday Evening Postもありました。1
その集計から、彼は2つの数を同時に読み取りました。個数、つまり各タイルを袋に何枚入れるかは、その文字が実際の文章でどれほどありふれているかに従います。点数はその逆をいきます。文字が珍しいほど、それを使う手は高く報われるべきなのです。ありふれた母音はわずか1点で、外来語や辞書の片隅にしか現れない文字はゲームの最高点を得ます。英語版ではその最高点は10点で、それを持つのはQとZだけです。BBCがかつて述べたように、Buttsは「各文字がNew York Timesの一面にどれほど頻繁に現れるかを測ることで、各タイルの値を算出した」のです。2
文字を並べてみると、設計の姿が見えてきます。現実世界での頻度が下がるにつれ、点数はほぼ単調に上がっていきます。Eはどこにでもあって安く、ZとQはほとんどどこにもなくて高価です。
| 文字 | 袋の中の枚数 | 点数 | 英語での頻度 |
|---|---|---|---|
| E | 12 | 1 | ≈ 12.7% |
| A | 9 | 1 | ≈ 8.2% |
| N | 6 | 1 | ≈ 6.7% |
| D | 4 | 2 | ≈ 4.3% |
| B | 2 | 3 | ≈ 1.5% |
| K | 1 | 5 | ≈ 0.8% |
| X | 1 | 8 | ≈ 0.15% |
| Q | 1 | 10 | ≈ 0.12% |
| Z | 1 | 10 | ≈ 0.07% |
ここで、すっきりした発想が厳しい制約とぶつかります。点数が単に希少性に報いるものなら、理想の袋はQやZでいっぱいになり、莫大な点数が取られるのを待っていることになるでしょう。しかし袋は、実際にそこから手を打たなければならない手札でもあります。高得点の変わり種を7枚引いてしまえば、合法な単語をひとつも作れずに固まってしまいます。そのため個数は点数と引っ張り合います。袋には、言語がそれを使うのとおおよそ同じ比率で文字が入っていなければならず、さもなければゲームは行き詰まるのです。
だからこそQはちょうど1枚しかなく、Qとほとんど切り離せない相棒のUには専用のタイルが4枚与えられているのです。Qが1枚、そしてQがUに出会える見込みを与えるためのUが袋に4枚。ただ1枚のQが貴重なのは、それがほとんど使えないからこそであり、そもそも使えるのは、袋のほかのタイルが現実の言葉そのものの比率で配られているからにほかなりません。希少性が報酬を決め、頻度がゲームを動かし続けるのです。
タイルの値段は、その文字がどれほどまれに現れるかで決まりますが、袋の中身は、それがどれほど頻繁に現れるかで決まります。この2つの力は、同じ事実を前から読むか後ろから読むかの違いにすぎません。
公平なタイルセットがある言語の文字頻度を写した写真だとすれば、言語を変えれば写真も変わるはずです。実際、目に見えて変わります。WordChessは22の言語で動いており、言語ごとにタイルセットが作り直されます。英語に合わせて調整された分布は、ほかの言語ではまったく当てはまらないからです。3
北米以外で売られているスペイン語版のセットは、KとWを完全に外しています。これらの文字はスペイン語では外来語にしか現れないので、忠実な袋はそれらに1枚のタイルも与えないのです。5 イタリア語はさらに進んで、J、K、W、X、Yを省いています。これらはイタリア語本来の綴りに属さず、外来語にしか現れない文字です。5 英語の袋がそれぞれ1、2枚ずつに制限している文字は、別の言語では珍しいのではなく、存在しないのです。希少性は文字の性質ではありません。それはある言語における文字の性質なのです。
Buttsは、それを表す言葉を持たないまま、ある数学者がおよそ15年後に定式化することになるものを測っていました。1948年、クロード・シャノン(Claude Shannon)は、ある明確な主張の上に情報理論を打ち立てました。記号は予測しにくいほど多くの情報を運ぶ、という主張です。推測できたはずの文字はほとんど何も教えてくれませんが、意外な文字は多くを教えてくれます。希少性とは情報そのものであり、情報はビットで測られます。6
1951年の論文Prediction and Entropy of Printed English(印刷された英語の予測とエントロピー)で、シャノンはその量を量ろうとしました。文字を個別に扱えば、英語は1文字あたりおよそ4ビットになります。しかし読み手に文脈を使わせると、つまりqのあとにはほぼ確実にuが来ること、vで終わる単語がほとんどないことなどを使わせると、実際の値は急落します。シャノンの予測実験は、通常の英語のエントロピーを1文字あたり0.6ビットから1.3ビットの間と見積もりました。6 私たちが書くものの大部分は冗長であり、本当の仕事をしているのは意外な文字なのです。
同じ勘定は、それ以前にある符号をすでに形づくっていました。1840年代にSamuel MorseとAlfred Vailが自分たちのアルファベットを作ったとき、Vailは印刷所の活字ケースを調べてどの文字が最もよく使われるかを知り、それらの文字に最も短い信号、つまりEには点ひとつ、Tには線ひとつを割り当てたと言われています。7 頻出する文字には短い符号を。ありふれたタイルには安い点数を。予測できるものには少ないビットを。Morseは電線上の時間を最小にし、Buttsはゲームの均衡をとり、シャノンはその根底にある数に名前を与えましたが、3人とも同じ帳簿を読んでいたのです。文字の価値とは、結局のところ、それがどれだけあなたを驚かせうるかの尺度だったのです。