Eine Elo-Zahl braucht ihren Gegner
Jede Zahl unten stammt aus dem öffentlichen Datenvertrag: register.json im Abzug vom 05.09.2026, mit der Register-Kennung daneben. Die beiden angenommenen Kandidaten liefen eine zweite Stufe gegen einen anderen Gegner; wo diese Stufe keinen Wert meldet, wird hier keiner erfunden.
Sechs Versuche an einem Tag, zwei davon angenommen. Einer der beiden trägt zwei Elo Stärkeabstand zum Gegner, aus den Partien geschätzt, mit 95-Prozent-Halbbreite, wo das Orakel eine berichtet hat. Nie eine absolute Wertung.-Zahlen, die sich um den Faktor zweihundertfünfzig unterscheiden — und beide sind richtig.
Am 31. August 2026 gingen sechs Kandidaten durch das Testtor. Vier wurden abgelehnt, zwei angenommen. Das ist ein gewöhnlicher Tag und wäre keinen Eintrag wert — nur trägt einer der beiden angenommenen Kandidaten zwei Elo-Zahlen zugleich, und sie unterscheiden sich um etwa den Faktor zweihundertfünfzig.
Beide sind richtig. Sie beantworten verschiedene Fragen, und der Unterschied zwischen diesen Fragen ist das Nützlichste auf dieser Seite.
Dieselbe Änderung, zweimal gemessen
T-0049 änderte, wie die Suche Transpositionsschranken in der Ruhesuche wiederverwendet. Gemessen wurde zweimal, gegen zwei verschiedene Gegner:
| Stufe | Gegner | Bedenkzeit | Partien | Elo |
|---|---|---|---|---|
| kurz | der Vorgängerstand | 8+0,08 | 19.942 | +4,79 ± 3,80 |
| lang | v0, der eingefrorene erste Stand | 40+0,4 | 486 | +1194,89 |
Beide Zeilen beschreiben dieselbe Codeänderung (T-0049, register.json). Die kurze Stufe fragt: Ist dieser Stand besser als der davor? Die lange Stufe fragt: Wie weit ist die Engine seit dem Anfang gekommen? Die zweite Frage hat eine viel größere Antwort, weil sie alles seit v0 zusammenfasst — nicht, weil diese Änderung mehr bewirkt hätte.
Eine Elo-Zahl ohne ihren Gegner ist deshalb keine Aussage. Sie ist eine halbe Aussage, und die fehlende Hälfte entscheidet über die Größenordnung.
Der Gegner ist nicht das Einzige, was sich zwischen den beiden Zeilen unterscheidet: Die lange Stufe läuft zugleich bei einer fünfmal längeren Bedenkzeit. Beide Stufen wechseln gemeinsam, also trennt keine der beiden Zahlen die Wirkung des Gegners für sich heraus. Was das Paar zeigt, ist dies: Eine einzelne Änderung kann zwei berechtigte Elo-Zahlen in verschiedenen Größenordnungen tragen, und die Zahl ist ohne die Angabe, welcher Vergleich sie hervorgebracht hat, bedeutungslos.
Warum sich die große Zahl nicht aufaddiert
Die eingefrorene Referenz v0 ändert sich nie, und genau das macht sie nützlich: Zuwächse gegen einen festen Punkt lassen sich über die Zeit vergleichen. Aber die gegen sie gemessene Zahl gehört der ganzen Reihe, nicht dem Kandidaten, der an jenem Tag lief. Die Langstufenwerte mehrerer angenommener Kandidaten zu addieren hieße, dieselbe Strecke mehrfach zu zählen.
Die Zahl, die einer einzelnen Änderung gehört, ist die kurze — die gegen den Vorgänger. Für T-0049 sind das +4,79 Elo bei einer 95-%-Halbbreite von 3,80 (register.json). Sie ist klein, und sie ist die ehrliche.
Was die sechs Versuche wirklich gemessen haben
Alle sechs liefen dieselbe kurze Stufe gegen ihren eigenen Vorgänger, bei 8+0,08. Sortiert nach Schätzwert (T-0048 bis T-0053, register.json):
| Kandidat | Schätzwert | 95-%-Intervall | Breite | Partien | Urteil |
|---|---|---|---|---|---|
T-0051 | −13,95 | −23,20 bis −4,70 | 18,50 | 3.664 | abgelehnt |
T-0050 | −9,19 | −16,76 bis −1,62 | 15,14 | 5.028 | abgelehnt |
T-0048 | −2,91 | −7,92 bis +2,10 | 10,02 | 11.566 | abgelehnt |
T-0053 | +0,38 | −2,14 bis +2,90 | 5,04 | 36.362 | abgelehnt |
T-0049 | +4,79 | +0,99 bis +8,59 | 7,60 | 19.942 | angenommen |
T-0052 | +17,17 | +8,29 bis +26,05 | 17,76 | 3.828 | angenommen |
Liest man die Spalten Breite und Partien zusammen, wird die Mechanik des Tests sichtbar. Die größte Breite gehört zur kleinsten Stichprobe, die kleinste zur größten. Genauigkeit wird mit Partien bezahlt, und der Preis steigt steil, je näher der Effekt an null liegt.
Die vier abgelehnten Kandidaten sind genauso ein Ergebnis wie die zwei angenommenen. Drei von ihnen schätzen unter null. Der vierte nicht.
Eine Ablehnung, die positiv gemessen hat
T-0053 wurde abgelehnt, mit einem Schätzwert von +0,38 ± 2,52 Elo über 36.362 Partien (register.json) — die größte Stichprobe der sechs, und ein Punktschätzwert auf der positiven Seite von null.
Das ist kein Widerspruch. Der sequentielle Test fragt nicht: Ist der Schätzwert positiv? Er fragt, ob die Belege eine von zwei Schranken überschritten haben. Die Stufe war darauf eingerichtet, „kein Zuwachs“ von „ein Zuwachs von 5 nElo Normiertes Elo: der Elo-Abstand geteilt durch die Streuung der Partieergebnisse, damit die SPRT-Schranken bei verschiedenen Bedenkzeiten dasselbe bedeuten.“ zu trennen (elo0 0,0, elo1 5,0 nElo, α = β = 0,05, Log-Likelihood-Schranken bei ∓2,94; T-0053, register.json), und dieser Lauf hat die untere überschritten. Ein Intervall, das etwa von −2,1 bis +2,9 reicht, enthält die Null deutlich; eine Änderung, die sich nicht von keiner Änderung unterscheiden lässt, wird nicht angenommen — auf welcher Seite der Null ihre Mitte auch immer liegt.
Zwei Folgerungen ergeben sich daraus, und die zweite wiegt schwerer:
- Ein Punktschätzwert aus einem sequentiellen Test ist keine unverzerrte Effektgröße. Der Lauf hielt an, als eine Schranke erreicht war, und diese Stoppregel verzerrt den Schätzwert. Wo solche Zahlen hier vorkommen, sind sie Schätzwert aus einem gestoppten Test, keine Messungen einer Größe.
- Festzustellen, dass etwas nichts bewirkt, ist teuer.
T-0053brauchte etwa das Neunfache der Partien vonT-0052, um zu seinem Urteil zu kommen. Der Kandidat mit dem größten Punktschätzwert (T-0052, +17,17 ± 8,88 Elo, register.json) kam nach 3.828 zu seinem Urteil. Was diese beiden Läufe zeigen, ist dieser Unterschied und nicht mehr: Beides sind früh gestoppte Beobachtungen, und aus einem Paar von ihnen folgt keine allgemeine Regel über Stichprobengrößen.
Die im Register veröffentlichte Hypothese von T-0053 betraf die Meldung erzwungener Matts als vorzeichenbehaftete Zugzahlen, damit Protokollprogramme sie richtig lesen — ausdrücklich ohne Änderung des Suchbaums. Der Lauf wurde abgelehnt, was mit dieser Erwartung vereinbar ist — er hat nicht festgestellt, dass die Wirkung null ist, sondern nur, dass die Belege die untere Schranke erreichten. Deshalb steht der Lauf im Register und nicht in einer Änderungsliste.
Was fehlt, und fehlend bleibt
Die lange Stufe von T-0052 meldet überhaupt keinen Elo-Wert, und die lange Stufe von T-0049 meldet einen Wert ohne Fehlerhalbbreite (register.json). Keine der beiden Lücken wird hier gefüllt. Eine fehlende Fehlerangabe ist keine Unsicherheit von null, und ein fehlender Wert ist keine Null — beides heißt unbekannt, und genau das sagt das Register.
Bei der langen Stufe wiegt die Lücke schwerer, als sie aussieht. In diesem Abstand von v0 liegt die Punktrate dicht an ihrer Obergrenze, und dort entscheidet eine Handvoll Partien darüber, ob überhaupt ein endlicher Elo-Wert existiert — 486 Partien sind für eine Größe mit diesem Verhalten wenig. Die Zahl steht hier, weil das Register sie führt, nicht weil sie genau wäre.
Was das nicht sagt
Es sagt nicht, die Engine habe am 31. August 1194,89 Elo gewonnen (T-0049, register.json). Diese Zahl ist der Abstand von einem am Anfang der Reihe eingefrorenen Stand zu dem an jenem Tag gemessenen, und sie wird je angenommener Langstufe einmal berichtet — nicht je Kandidat einmal verdient.
Es sagt nicht, T-0049 und T-0052 seien dauerhaft +4,79 und +17,17 Elo wert. Beides sind Schätzwert aus gestoppten Tests, beide tragen Intervalle, die breit genug sind, um ins Gewicht zu fallen, und keiner von beiden wurde seither nachgemessen.
Es vergleicht diese Engine mit keiner anderen. Jede Zahl hier stammt aus einem Kandidaten, der gegen einen anderen Stand seiner selbst spielt, und das sagt nichts darüber, wie er gegen jemand anderen abschneiden würde.
Und es sagt nicht, die vier Ablehnungen seien Fehler gewesen. Drei schätzen unter null, einer knapp darüber; alle vier haben die untere Schranke überschritten. Die vier Ablehnungen dieser Reihe sind aussagekräftige Ergebnisse, und deshalb stehen sie hier.