Math Challenge
Mehr

Math Challenge liegt offen: der Code, der Plan und die Forschung

Das Repository, der komplette Plan und alle 47 Studien sind öffentlich — auch die, die dem Produkt widersprechen, und der Lauf, in dem sich unsere eigene Prüfer-Flotte geirrt hat.

Was offen liegt

Zwei Links. Beide heute öffentlich, beide im Browser ohne Konto überprüfbar.

Alle 47 Studien, auch die, die dem Produkt widersprechen

Siebenundvierzig Studien, rund 157.000 Wörter, mit nummerierten Quellen und erklärten Grenzen. Sie werden vollständig veröffentlicht, und dazu gehören die Stellen, an denen die Evidenz gegen das spricht, was wir bauen: Der ursprüngliche Auftrag verlangte etwas Süchtigmachendes, und die Forschung hat wochenlang dagegen argumentiert.

Aussagen, die wir nicht gegen eine Primärquelle bestätigen konnten, tragen im Text die Markierung [unverified] — 18 Markierungen, verteilt auf 14 der Dokumente. Sie bleiben sichtbar, statt still gelöscht zu werden, denn eine Studie, die ihre Schwachstellen versteckt, ist keine Evidenz, sondern Werbung.

Die Prüfer-Flotte, und was sie sagen darf

Heute existieren 31 der 39 geplanten Prüfer. Acht davon sind deterministisch und blockieren jeden Commit; darunter: die sieben vollständigen Locales, Geheimnisse, das Bundle-Gewicht, die Ignia-Palette, kein Freitextfeld in einer Kindertabelle. Die anderen dreiundzwanzig sind adversariale LLM-Prüfer, angewiesen, den Verstoß zu finden statt zuzustimmen, und jeder muss die Entscheidung oder die Studie zitieren, die er durchsetzt. Ein Befund, der eine nicht existierende Kennung zitiert, wird mechanisch verworfen.

Die Befunde werden als SARIF 2.1.0 geschrieben, dem OASIS-Standard, und von Hand zu GitHub code scanning hochgeladen: Dieses Projekt fährt keine CI, und das ist eine Entscheidung, keine Lücke. Jeder Befund landet verankert an einer Datei und einer Zeile, die jede und jeder nachlesen kann.

Was beim ersten Lauf schiefging

Der erste vollständige Lauf der adversarialen Flotte brachte zwei blockierende Urteile hervor. Eines davon war erfunden: Der Prüfer zitierte eine Entscheidung, die es wirklich gibt, und behauptete dann, eine Datei enthalte versión, wo die Datei versão sagt. Echtes Zitat, erfundener Beleg — und der Befund kam als blockierend heraus. Die Hälfte der blockierenden Befunde dieses Laufs war Rauschen.

Die Korrektur war kein besserer Prompt. Es war eine deterministische Schicht, die jede Zeichenfolge herauszieht, die der Prüfer gesehen haben will, und prüft, ob sie wirklich in dem vorkommt, was ihm gezeigt wurde. Kommt keine davon vor, blockiert der Befund nicht mehr.

Was diese Schicht weiterhin nicht kann, gesagt bevor es jemand annimmt: Ein Prüfer, der paraphrasiert statt zu zitieren, hinterlässt nichts zum Nachprüfen. Erkannt wird die wörtliche Erfindung, nicht die falsche Deutung — das war der zweite Fehlschlag desselben Laufs, und dafür gibt es keine deterministische Lösung.

Die Lizenz: AGPL-3.0

Das Repository enthält eine LICENSE-Datei mit der GNU Affero General Public License, Version 3. Das ist starkes Netzwerk-Copyleft: Wer dies als Dienst betreibt, muss seine Änderungen veröffentlichen. Genau darum geht es. Die Aufgabensammlung ist das Produkt — dort steckt der Großteil der eigentlichen Arbeit — und das Versprechen dieses Projekts lautet, dass es die erreicht, die nicht zahlen können. Eine permissive Lizenz würde es jemandem erlauben, Engine und Sammlung zu nehmen, zu schließen und dafür Geld zu verlangen.

Was das kostet, offen gesagt: Die AGPL schreckt Unternehmen ab, die sonst beitragen würden, und viele verbieten sie per interner Richtlinie. Dieser Tausch wurde bewusst gemacht.

Warum sich das lohnt

Die Forschung zu veröffentlichen ist die Strategie, keine Geste der Transparenz. Was wirklich kostet, ist das Veröffentlichen der Fehler: Auf dem Board steht bis heute die Notiz, dass Phase F0 als abgeschlossen markiert wurde, während eines ihrer eigenen Kriterien — 0-RTT — nie überprüft war, und das kam nur heraus, weil jemand noch einmal nachfragte. Ein Board, das den eigenen Fehler zeigt, ist mehr wert als jede Wertetafel.

Prüfen Sie es selbst

Klonen Sie das Repository und lassen Sie die Flotte laufen. Jede Zahl auf dieser Seite stammt aus diesem Befehl oder aus dem öffentlichen Board. Keine wurde aus dem Gedächtnis geschrieben.

git clone https://github.com/kilowatto/math-challenge
node audits/run.mjs