Zum Inhalt springen
Tools & Modelle

KI-Mathematikbeweise: Warum ungelöste Jahrtausendrätsel als Benchmark für KI-Modelle versagen

Mehr als 100 Behauptungen des Herstellers über gelöste Rätsel sind unbestätigt. Mathematiker kritisieren die maschinellen Berechnungen als aufgewärmte menschliche Vorarbeit.

Lukas GörögLukas Görög2 Min. Lesezeit
KI-Mathematikbeweise: OpenAI beruft externe Prüfer
KI-Mathematikbeweise: OpenAI beruft externe Prüfer

Anbieter großer Sprachmodelle verlagern ihren Leistungswettbewerb zunehmend auf offene Fragen der Wissenschaft. OpenAI reagierte am 29. September 2026 auf anhaltende Proteste von Forschern und aktualisierte das Mandat seiner neuen Gutachtergruppe für KI-Mathematikbeweise (Quelle: OpenAI). Neun externe Mathematiker sollen künftig die Behauptungen des Unternehmens prüfen, wenn Modelle angeblich ungelöste Probleme der Disziplin knacken. Zuvor hatte der Entwickler von ChatGPT reklamiert, er habe die sogenannten Navier-Stokes-Gleichungen gelöst, eines der sieben Millennium-ProblemeEine Liste von sieben ungelösten mathematischen Fragestellungen, für deren Lösung jeweils eine Million US-Dollar Preisgeld ausgeschrieben ist. der Mathematik (Quelle: Die Zeit). Daraufhin warfen Forscher dem Unternehmen vor, bestehende menschliche Arbeiten als eigene Modellleistung auszugeben.

Der Streit um KI-Mathematikbeweise eskaliert

Hersteller wie OpenAI und Anthropic nutzen die formale Mathematik als ultimativen BenchmarkEin standardisiertes Verfahren, mit dem die Rechenleistung oder Genauigkeit eines KI-Modells gemessen und mit anderen verglichen wird. (Quelle: Heise). Wer einen fehlerfreien Rechenweg liefert, belegt damit angeblich logisches Denken und Autonomie. Doch die Realität der Entwickler sieht derzeit anders aus. Nach den Plagiatsvorwürfen zog sich OpenAI kurzfristig von einem HackathonEin zeitlich begrenzter Wettbewerb, bei dem Entwickler in kurzer Zeit gemeinsame Lösungen für vorgegebene Probleme erarbeiten. am Caltech zurück (Quelle: Business Insider). Die kalifornische Universität organisierte den Wettbewerb, um maschinelle Fähigkeiten in der Mathematik zu testen.

Die Liste der umstrittenen Resultate wächst. Das Portal Shattered.io dokumentiert mehr als hundert unbestätigte Behauptungen über angeblich gelöste Probleme (Quelle: Shattered.io). In offenen Briefen und Diskussionsforen äußern Forscher grundlegende Bedenken dagegen, die Bearbeitung solcher Rätsel als Nachweis für maschinelle Intelligenz zu werten. Der Streit löste eine Debatte über den Sinn der Forschung aus: Die US-Zeitschrift The Atlantic sprach angesichts des Konflikts von einer existenziellen Krise der Disziplin (Quelle: The Atlantic).

Menschliche Vorarbeit als maschinelle Leistung

Das Kernproblem dieser Leistungstests liegt in der unklaren Trennung von Trainingsdaten und Eigenleistung. Mathematiker werfen OpenAI vor, die Modelle zögen keine eigenständigen Schlüsse, sondern reproduzierten unveröffentlichte oder kaum bekannte Forschungsergebnisse (Quelle: Yellow). Ähnlich wie bei KI-Agenten im Unternehmen, die den Großteil der Steuerung dem Menschen überlassen, kaschiert das glänzende Endresultat den tatsächlichen Beitrag der Maschine. Das Trainingsmaterial diktiert den Ausstoß.

Konkrete Zahlen zur Verifizierungsquote eigener Beweise nennt keiner der Berichte. OpenAI delegiert das Problem nun an die neunköpfige Kommission, die künftige Ankündigungen vorab prüfen soll.

Der Fokus auf theoretische Durchbrüche ist ein Marketinginstrument, das Entscheidern in der Wirtschaft wenig nützt. Ein SprachmodellEin auf großen Textmengen trainiertes KI-System, das Muster in Daten erkennt und neue Inhalte generiert., das auf Basis riesiger Datenmengen eine Jahrhundertgleichung ausspuckt, liefert keinen Beleg dafür, dass es in der Praxis komplexe Geschäftsprozesse nachvollziehbar steuert. Solange Entwickler nicht trennscharf nachweisen, welcher Teil eines Ergebnisses aus dem menschlichen Material stammt und was eigene maschinelle Deduktion ist, bleibt jeder gelöste Benchmark eine Blackbox. Die Industrie braucht transparente Prüfverfahren für den Alltag, keine simulierten Nobelpreise.

Wie aussagekräftig sind gelöste Mathematikprobleme als Beleg für die Leistungsfähigkeit von KI-Modellen?

Ergebnisse sehen Sie nach Ihrer Stimme.

Häufige Fragen

Was ändert die externe Prüfergruppe an OpenAIs Behauptungen?

OpenAI hat das Mandat seiner Gutachtergruppe am 29. September 2026 aktualisiert. Neun externe Mathematiker sollen künftig prüfen, ob ein Modell tatsächlich ein ungelöstes Problem gelöst hat. Die Gruppe soll damit eine zusätzliche Kontrolle schaffen. Ob sie auch Fragen zu Priorität, Originalität und möglicher Übernahme menschlicher Arbeiten klärt, bleibt im Artikel offen.

Warum ist der angebliche Navier-Stokes-Beweis umstritten?

Forscher werfen OpenAI vor, vorhandene menschliche Arbeiten als eigene Modellleistung ausgegeben zu haben. Damit geht es nicht allein darum, ob einzelne Gleichungen stimmen. Entscheidend ist auch, ob das Modell einen neuen Beweis erzeugt, den Lösungsweg nachvollziehbar herleitet und fremde Vorarbeiten korrekt ausweist. Genau diese Punkte haben die Proteste ausgelöst.

Kann ein formaler Beweis die Leistung eines KI-Modells eindeutig belegen?

Ja, ein formales System kann einzelne logische Schritte auf ihre Korrektheit prüfen. Das beantwortet aber nicht automatisch, ob das Modell das Problem eigenständig gelöst hat. Dafür müssten auch die Herkunft der Ideen, verwendete Vorarbeiten und die genaue Leistung des Systems geklärt werden. Der Streit bei OpenAI betrifft deshalb mehr als reine Rechenfehler.

Warum gelten offene Mathematikprobleme als Benchmark für KI?

Formale Mathematik liefert klarere Prüfkriterien als viele offene Aufgaben: Ein Rechenweg kann richtig oder falsch sein. OpenAI und Anthropic nutzen solche Probleme deshalb als Leistungsmaßstab für logisches Denken und Autonomie. Die Kritik lautet jedoch, dass ein Ergebnis allein keine verlässliche Aussage über allgemeine maschinelle Intelligenz erlaubt.

Was kostet die neue Prüfung durch externe Mathematiker?

Zum Preis nennt der Artikel keine Angaben. Offen bleibt damit, wer die neun externen Mathematiker bezahlt, wie viel Zeit die Prüfungen beanspruchen und ob OpenAI dafür ein dauerhaftes Verfahren eingerichtet hat. Das aktualisierte Mandat soll Behauptungen über ungelöste Probleme prüfen, nachdem Forscher die bisherigen Nachweise kritisiert hatten.

Wie geht es nach der Einrichtung der Gutachtergruppe weiter?

Als Nächstes müssen Behauptungen über neue KI-Mathematikbeweise die Prüfung durch die neun externen Mathematiker bestehen. Das gilt besonders für Aussagen zu ungelösten Problemen wie den Navier-Stokes-Gleichungen. Ob die Gruppe frühere Vorwürfe ausräumt, lässt sich noch nicht sagen. Die Debatte über Benchmarks und maschinelle Intelligenz dürfte deshalb weitergehen.

Teilen