Q jest warte dziesięć punktów, a E jeden. Ten jeden fakt kryje w sobie małą teorię języka, rozważanie o informacji i powód, dla którego zestaw płytek tej gry wygląda po hiszpańsku inaczej niż po angielsku.
Napisane i zredagowane po angielsku. Ta polska wersja powstała w wyniku tłumaczenia maszynowego; tam, gdzie liczy się precyzja, rozstrzygający jest angielski oryginał. Przeczytaj oryginał po angielsku →
Zasada punktacji, którą poznajesz w pierwszym ruchu, nie jest wyborem estetycznym. Jest pomiarem. Na początku lat 30. XX wieku bezrobotny architekt Alfred Mosher Butts postanowił stworzyć grę słowną, która nie byłaby ani czystym szczęściem, ani czystym słownictwem, i potrzebował zasadnego sposobu, by wycenić każdą literę. Zrobił więc to, co robi inżynier: policzył. Butts zliczał, jak często każda litera pojawia się w drukowanych źródłach swoich czasów, przede wszystkim na pierwszej stronie The New York Times, a także w Herald Tribune i The Saturday Evening Post. 1
Z tych zliczeń odczytał jednocześnie dwie liczby. Liczebność, czyli ile płytek z daną literą trafia do woreczka, odpowiada temu, jak częsta jest litera w prawdziwym piśmie. Wartość działa odwrotnie: im rzadsza litera, tym więcej powinno dawać zagranie z jej użyciem. Pospolite samogłoski dostają jeden punkt; litery, które wypływają tylko w słowach zapożyczonych i w dziwnych zakamarkach słownika, dostają maksimum gry. W angielskiej wersji tym maksimum jest dziesięć punktów i mają je tylko Q i Z; jak ujęło to kiedyś BBC, Butts „obliczył wartość każdej płytki, mierząc, jak często każda litera pojawiała się na pierwszej stronie New York Timesa”. 2
Ustaw litery w rzędzie, a zamysł sam się ujawni. Wartość punktowa rośnie niemal monotonicznie w miarę, jak spada częstość w realnym języku. E jest wszędzie i jest tanie; Z i Q prawie nigdzie nie występują i są drogie.
| Litera | Płytki w woreczku | Wartość punktowa | Częstość w angielskim |
|---|---|---|---|
| E | 12 | 1 | ≈ 12.7% |
| A | 9 | 1 | ≈ 8.2% |
| N | 6 | 1 | ≈ 6.7% |
| D | 4 | 2 | ≈ 4.3% |
| B | 2 | 3 | ≈ 1.5% |
| K | 1 | 5 | ≈ 0.8% |
| X | 1 | 8 | ≈ 0.15% |
| Q | 1 | 10 | ≈ 0.12% |
| Z | 1 | 10 | ≈ 0.07% |
Liczby i wartości to standardowy zestaw angielski; 3 dane o częstości to zwyczajowe szacunki dla zwykłego tekstu angielskiego. 4 WordChess używa płytek z wartościami punktowymi i zestawu płytek ważonego częstością, zgodnie z tą tradycją (w wersji angielskiej 100 płytek: 98 liter i 2 blanki), choć każdy gracz ma pełny komplet zamiast dobierać z woreczka, według dokumentów projektowych gry.
Tu czysta idea zderza się z twardym ograniczeniem. Gdyby wartość po prostu nagradzała rzadkość, idealny woreczek byłby wypchany literami Q i Z, ogromnymi punktami czekającymi na zgarnięcie. Ale woreczek to także ręka, z której trzeba faktycznie grać. Wylosuj siedem wysoko punktowanych dziwolągów, a utkniesz, niezdolny ułożyć dozwolonego słowa. Liczebność ciągnie więc przeciw wartości: woreczek musi zawierać litery mniej więcej w takich proporcjach, w jakich używa ich język, inaczej gra staje.
Dlatego jest dokładnie jedno Q i dlatego jego niemal nierozłączny partner U dostaje aż cztery własne płytki: jedno Q i cztery U w woreczku, by dać mu szansę na znalezienie jednego z nich. Samotne Q jest cenne dlatego, że niemal nie da się go zagrać, a w ogóle da się je zagrać tylko dlatego, że pozostałe płytki woreczka rozdzielono w proporcjach samego życia. Rzadkość ustala nagrodę; częstość utrzymuje grę w ruchu.
Cenę płytki ustala to, jak rzadko pojawia się litera, ale zawartość woreczka ustala to, jak często się pojawia. Obie siły są tym samym faktem, czytanym od przodu i od tyłu.
Jeśli uczciwy zestaw płytek jest fotografią częstości liter danego języka, to zmiana języka musi zmienić fotografię. I zmienia, wyraźnie. WordChess działa w 22 językach, a zestaw płytek jest dla każdego z nich budowany od nowa, bo rozkład dostrojony do angielskiego gdzie indziej jest po prostu błędny. 3
Hiszpańskie zestawy sprzedawane poza Ameryką Północną całkowicie pomijają K i W; te litery pojawiają się w hiszpańskim tylko w słowach zapożyczonych, więc wierny woreczek nie daje im żadnych płytek. 5 Włoski idzie dalej, pomijając J, K, W, X i Y, litery, które nie należą do rodzimej włoskiej pisowni i pojawiają się tylko w zapożyczeniach. 5 Litery, które angielski woreczek wydziela po jednej czy dwie płytki, w innym języku nie są rzadkie, lecz nieobecne. Rzadkość nie jest właściwością litery. Jest właściwością litery w danym języku.
Butts, nie mając na to słów, mierzył coś, co matematyk sformalizuje jakieś piętnaście lat później. W 1948 roku Claude Shannon oparł teorię informacji na precyzyjnym twierdzeniu: im mniej przewidywalny symbol, tym więcej informacji niesie. Litera, którą dało się odgadnąć, mówi niewiele; zaskakująca mówi dużo. Rzadkość jest informacją, a informację mierzy się w bitach. 6
W artykule z 1951 roku, Prediction and Entropy of Printed English („Przewidywanie i entropia drukowanego angielskiego”), Shannon postanowił tę wielkość zważyć. Jeśli traktować litery w oderwaniu od siebie, angielski daje mniej więcej cztery bity na literę; ale gdy pozwolić czytelnikowi korzystać z kontekstu, z tego, że q niemal gwarantuje u, że niewiele słów kończy się na v, prawdziwa wartość gwałtownie spada. Eksperymenty Shannona z przewidywaniem oszacowały entropię zwykłego angielskiego na od 0,6 do 1,3 bitu na literę. 6 Większość tego, co piszemy, jest redundantna; prawdziwą pracę wykonują litery zaskakujące.
Ten sam rachunek ukształtował już wcześniej inny kod. Gdy w latach 40. XIX wieku Samuel Morse i Alfred Vail budowali swój alfabet, Vail miał podobno przestudiować kaszty w drukarni, by ustalić, których liter używa się najczęściej, a potem przydzielić tym literom najkrótsze sygnały: pojedynczą kropkę dla E, pojedynczą kreskę dla T. 7 Krótkie kody dla częstych liter; tanie punkty dla pospolitych płytek; mało bitów dla tego, co przewidywalne. Morse minimalizował czas na drucie, Butts równoważył grę, Shannon nazwał leżącą u podstaw liczbę, ale wszyscy trzej czytali ten sam rachunek. Wartość litery, jak się okazuje, zawsze była miarą tego, jak bardzo może cię zaskoczyć.