Ein Modell bekommt die Literaturliste eines Papers und sonst nichts, und soll daraus sagen, worum es in dem Paper geht.
Ein Test, den kein Modell auswendig kennen kann
Der Aufbau ist schnell erzählt. Das Modell sieht ausschließlich die Literaturliste, und darin nur Quellen, die vor dem Erscheinen des Papers veröffentlicht wurden. Aus diesem Material soll es die Forschungsidee des zurückgehaltenen Papers formulieren. Bewertet wird der Vorschlag von einem unabhängigen Sprachmodell, das ihn mit Titel und Zusammenfassung des zurückgehaltenen Papers vergleicht.
Die Arbeit trägt den Titel Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies und läuft unter arXiv 2608.16645, die Fassung v2 stammt vom 19. August 2026. Hinter ihr stehen Forscher der Stanford University und weiterer Einrichtungen.
Der Zweck dieser Bauform steckt im Wort blind. Ein Modell soll den Text des Papers nie gesehen haben und kann sich deshalb nicht an ihn erinnern. Damit ist der Test gegen verunreinigte Trainingsdaten abgesichert, also gegen den naheliegenden Verdacht, die Lösung habe im Training bereits mitgelesen werden können. Dieser Verdacht entwertet viele Bestenlisten, sobald eine Aufgabensammlung lange genug im Netz steht. Hier ist er von der Konstruktion her ausgeschlossen. Wer Benchmarkzahlen liest, sollte zuerst nach dieser Absicherung suchen. Sie entscheidet darüber, ob eine Zahl überhaupt etwas misst.
Drei bis 15 Prozent
Über sieben Spitzenmodelle hinweg liegen die Trefferquoten bei rund 3 bis 15 Prozent. Das beste Einzelmodell im Test war Claude Opus 4.8 mit 13,3 Prozent, die Schwankungsbreite beträgt 2,3 Prozentpunkte, gemittelt über die Fachgebiete.
Erst kostenlos reinschnuppern, dann entscheiden
Bevor du dich für eine Weiterbildung entscheidest, sieh dir kostenlos an, wie sie läuft, fünf Lektionen plus Live-Demo, ohne Verpflichtung. Passt es, ist der Digitalisierungsmanager bei bewilligtem Bildungsgutschein für dich kostenlos.
Kostenlos reinschnuppernDer Schnupperkurs ist gratis. Ob die Weiterbildung über den Bildungsgutschein gefördert wird, entscheidet die Agentur für Arbeit im Einzelfall.
Angetreten sind Claude Opus 4.8, GPT-5.6 Sol Pro, Kimi K3, GLM 5.2, Gemini 3.1 Pro Preview, DeepSeek-V4-Pro und Qwen3.7-Max. Das ist eine Teilnehmerliste, keine Rangliste. Geprüft wurde eine einzelne Aufgabe in sechs Fachgebieten, daraus folgt nichts über den Alltagsnutzen eines Modells.
Ebenso wenig lässt sich die Quote auf betriebliche Arbeit übertragen. Wer aus 13 Prozent bei Forschungsideen eine Fehlerquote im Büroalltag ableitet, rechnet falsch. Eine Rechnung auslesen, einen Serienbrief formulieren oder ein Besprechungsprotokoll kürzen hat mit dem Erraten einer unveröffentlichten Forschungsidee nichts gemein.
Im Verbund mehr als das Doppelte
Interessanter wird es, wo die Modelle gemeinsam antreten. Eine Kette aus gegenseitiger Prüfung durch mehrere Modelle, kombiniert mit einem Auswahlverfahren nach Schweizer System, erreicht über sechs Fachgebiete rund 23 bis 42 Prozent. Nach Angabe der Autoren entspricht das etwa dem 2,4-Fachen des besten Einzelmodells.
Dieselben Modelle, dieselbe Aufgabe, ein anderes Verfahren. Das ist der Befund, an dem für Betriebe etwas hängt.
Was die Arbeit ausdrücklich nicht prüft
Die Autoren ordnen ihr Ergebnis selbst ein und nennen ihre Arbeit einen kontrollierten Belastungstest für künftige Fähigkeiten. Gemessen wird das Wiederfinden bekannter Ideen unter engen Bedingungen, nicht das freie Erfinden neuer. Aus einer niedrigen Quote folgt damit gerade keine Aussage darüber, ob ein Modell von sich aus auf etwas Neues kommen kann. Wer die 3 bis 15 Prozent als Beleg für fehlende Kreativität zitiert, zitiert etwas, das im Papier nicht steht.
Wie viel eine Benchmarkzahl trägt, entscheidet sich ohnehin am Messaufbau. Um genau diesen Punkt ging es auch im Streit um das Testgerüst von ARC-AGI-3. Jede solche Zahl gehört mit ihrem Verfahren zusammen gelesen.
Unsere Einschätzung
Der Sprung vom Einzelmodell zum Verbund ist die eigentliche Nachricht dieser Arbeit.
In Betrieben wird viel Zeit darauf verwendet, das eine richtige Werkzeug zu finden. Welches Modell schreibt die besseren Texte, welches rechnet zuverlässiger, welches Abo lohnt sich. Die Reconstruction-Zahlen legen einen anderen Hebel nahe: Mehrere Modelle, die einander prüfen, kommen im Test auf mehr als das Doppelte des besten Einzelmodells. Übertragen auf den Alltag heißt das, eine wichtige Sache von einer zweiten KI prüfen zu lassen, mit der ausdrücklichen Aufgabe, Fehler und Widersprüche zu benennen. Bei einem Angebot, einer Kündigungsfrist oder einer Zahl in einer Kalkulation kostet dieser zweite Durchgang zwei bis drei Minuten. Er fängt genau die Fälle, in denen die erste Antwort souverän formuliert ist und trotzdem daneben liegt, denn souverän klingt jede Antwort. Nach unserer Erfahrung aus den Kursen ist das der Handgriff, den Teilnehmer am schnellsten übernehmen und am längsten behalten. Ein zweites Abo braucht dafür niemand, die kostenlosen Zugänge zweier Anbieter reichen für den Anfang.
Die zweite Lehre steht im Kleingedruckten jedes Benchmarks. Eine Zahl aus einem fremden Test sagt nichts darüber, wie gut ein Werkzeug die eigene Aufgabe löst. Das weiß nur, wer die eigene Aufgabe misst, mit drei echten Fällen aus dem eigenen Haus und einem Maßstab, den man vorher festgelegt hat.
Quellen
Die genannten Angaben stützen sich auf folgende öffentlich zugängliche Quellen (Stand der Recherche: 21. August 2026):
- arXiv: Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies
- Tech Times: Blind Benchmark Catches Frontier AI at Just Three Percent on Research Idea Recovery
Häufige Fragen
Was prüft der Blindtest Reconstruction genau?
Ein Modell erhält ausschließlich die Literaturliste eines Papers, und darin nur Quellen, die vor dem Erscheinen dieses Papers veröffentlicht wurden. Daraus soll es die Forschungsidee des zurückgehaltenen Papers formulieren, ein unabhängiges Sprachmodell vergleicht den Vorschlag anschließend mit Titel und Zusammenfassung. Weil das Modell den Text nie gesehen haben soll, ist der Test gegen verunreinigte Trainingsdaten abgesichert. Die Arbeit läuft unter arXiv 2608.16645, Fassung v2 vom 19. August 2026.
Wie hoch sind die Trefferquoten der getesteten Modelle?
Sieben Spitzenmodelle erreichen rund 3 bis 15 Prozent. Das beste Einzelmodell im Test war Claude Opus 4.8 mit 13,3 Prozent bei einer Schwankungsbreite von 2,3 Prozentpunkten, gemittelt über die Fachgebiete. Angetreten sind daneben GPT-5.6 Sol Pro, Kimi K3, GLM 5.2, Gemini 3.1 Pro Preview, DeepSeek-V4-Pro und Qwen3.7-Max. Das ist eine Teilnehmerliste aus einer einzelnen Aufgabe in sechs Fachgebieten und keine allgemeine Rangliste.
Heißt eine Quote von 3 bis 15 Prozent, dass KI keine neuen Ideen hervorbringt?
Nein, das misst der Test nicht, und die Autoren stellen das ausdrücklich klar. Geprüft wird das Wiederfinden bekannter Ideen unter engen Bedingungen, das freie Erfinden neuer Ideen steht gar nicht auf dem Prüfstand. Die Autoren nennen ihre Arbeit einen kontrollierten Belastungstest für künftige Fähigkeiten.
Was sollte ein Betrieb daraus praktisch mitnehmen?
Eine Kette aus gegenseitiger Prüfung mehrerer Modelle erreicht im Test rund 23 bis 42 Prozent, nach Angabe der Autoren etwa das 2,4-Fache des besten Einzelmodells. Für den Alltag heißt das, wichtige KI-Ergebnisse von einer zweiten KI gegenprüfen zu lassen, mit der ausdrücklichen Aufgabe, Fehler und Widersprüche zu benennen. Das dauert wenige Minuten und fängt Antworten ab, die souverän klingen und trotzdem falsch sind. Die Prozentzahlen aus dem Test lassen sich dabei nicht auf betriebliche Aufgaben übertragen, wie gut ein Werkzeug die eigene Arbeit erledigt, zeigt nur ein eigener Test mit echten Fällen aus dem Haus.
Wer prüft im eigenen Betrieb eigentlich nach, ob eine KI-Antwort stimmt?
Im kostenlosen KI-Schnupperkurs zeigen wir in fünf Lektionen, wie kleine und mittlere Firmen KI im Alltag einsetzen. Tiefer und praxisnah geht es im Vollkurs Digitalisierungsmanager, DEKRA-zertifiziert und förderfähig über den Bildungsgutschein.
Zuletzt aktualisiert: 21. August 2026. Stand der Recherche: 21. August 2026.