Replikationspaket

Abruf-Audit — die Daten

Alles, worauf der Beitrag beruht: das Protokoll in der Fassung, in der es vor den Durchläufen festgeschrieben wurde, jede Antwort mit Zeitstempel und Modellkennung, die Linkzählung und das Skript. Wer die Schlussfolgerung für falsch hält, findet hier, was er braucht, um das zu zeigen.

Zum Beitrag →

Was die Untersuchung gemacht hat

Vier Assistenten bekamen dieselben sechs Fragen, jede endend mit „Nennen Sie die Zahl und zitieren Sie die Originalquelle." Zwei der sechs waren Kontrollfragen – zu Arbeiten mit sauberer, begutachteter Verlagsfassung –, aufgenommen, damit das Design in die Richtung scheitern konnte, die die These eingeschränkt hätte.

Es scheiterte in die andere. Über dreizehn Durchläufe zu einer Kontrollfrage trug jede Antwort einen Qualitätswert, den die veröffentlichte Arbeit nicht enthält, und keine zitierte die veröffentlichte Fassung. Die Zählungen dazu und die Messung der verweisenden Domains, die das erklärt, liegen in den Dateien unten.

Das Protokoll wurde zuerst geschrieben, einschließlich des Abschnitts was diesen Befund widerlegen würde. Jede Änderung nach dem ersten Durchlauf steht datiert und begründet im Änderungsprotokoll.

Dateien

Durchgehend Text und JSON. Nichts davon braucht ein Konto oder ein bestimmtes Programm.

  • protocol.md 43 kB Das vorab registrierte Protokoll, sein Änderungsprotokoll und die vier Anhänge: Kontroll-Pilot, Oberflächen-Arm, Wiederholungsläufe und Linkgraph-Messung.
  • questions.json 6 kB Die sechs Fragen, die jeweils angehängte Anweisung und die Grundwahrheit, die vor jedem Durchlauf festgestellt wurde.
  • run_audit.py 12 kB Das Skript. Ruft vier Assistenten auf, schreibt jede Rohantwort als JSONL, kodiert nichts. `--dry-run` zeigt die exakten Payloads, ohne etwas aufzurufen.
  • responses.jsonl 17 kB Die erhobenen Antworten, ein JSON-Objekt je Zeile, mit Zeitstempel, Modellkennung und Belegliste. Vor Bestehen des Skripts erhobene Datensätze tragen `answer_text: null` und sagen das.
  • repeat-runs.md 7 kB Die Wiederholungsläufe und die Streuung zwischen ihnen – einschließlich des einen Systems, das die Verlagsfassung in allen drei Läufen zitierte.
  • link-graph.md 4 kB Verweisende Domains und Backlinks für Preprint und Verlagsfassung beider Arbeiten, mit den gezählten URLs.
  • q4-runs.json 6 kB Die Q4-Zelle vollständig: gelieferte Zahlen, genannte Quellen, Belegsätze und Bewertung je Durchlauf.
  • README.md 12 kB Wie sich das wiederholen lässt, was herauskam und was die Untersuchung nicht belegt.
  • SHA256SUMS.txt 717 B SHA-256 für jede Datei oben, damit prüfbar ist, ob das Heruntergeladene dem Veröffentlichten entspricht.

Prüfen mit sha256sum -c SHA256SUMS.txt nach dem Herunterladen.

Wiederholen

Mit eigenen API-Schlüsseln kostet das Ganze ungefähr so viel wie ein Mittagessen und dauert einen Nachmittag.

export OPENAI_API_KEY=...  ANTHROPIC_API_KEY=...
export GEMINI_API_KEY=...  PERPLEXITY_API_KEY=...

python3 run_audit.py --dry-run              # Payloads ansehen, nichts aufrufen
python3 run_audit.py --only Q4,Q5 --runs 1  # die beiden Kontrollfragen, je einmal
python3 run_audit.py --runs 3               # der vollständige Satz

Diese vier Anbieter ändern ihre Web-Search-Parameter häufiger als ihre Modelle. Ein 4xx heißt, dass eine Builder-Funktion an die aktuelle Dokumentation angepasst werden muss; nichts anderes im Skript hängt davon ab.

Was das nicht belegt

  • Laufzahlen. Beide Kontrollfragen haben drei gültige Durchläufe auf allen vier Systemen. Ein Gemini-Lauf wurde verworfen und wiederholt, nachdem dem festgeschriebenen Prompt eine Längenvorgabe angehängt worden war; die Verwerfung steht im Änderungsprotokoll, statt still zu verschwinden.
  • Die erhobenen Läufe liefen über einen Drittanbieter-Endpunkt, nicht über die direkten Aufrufe dieses Skripts. Jeder Datensatz sagt das in collected_via. Wer mit eigenen Schlüsseln wiederholt, prüft dieselbe Frage auf einem leicht anderen Weg.
  • Die Linkzählung ist der Index eines kommerziellen Crawlers, nicht das Netz – und nicht der Index, aus dem diese Assistenten abrufen. Kein Anbieter veröffentlicht seinen.
  • Sechs Fragen nach festgelegten Kriterien – keine Stichprobe aus einer Grundgesamtheit. Zwei übereinstimmende Beobachtungen eines Mechanismus, keine Vermessung eines Feldes.
  • `interested_share` ist unkodiert. Das Schema verlangt, jede Domain anhand ihrer eigenen Startseite einzuordnen; dieser Durchgang steht aus.

Lizenz und Zitation

Veröffentlicht unter CC BY 4.0 – zur Nachnutzung, auch zum Widerspruch.

Isoglu, S. (2026). Retrieval-provenance audit: what four assistants return when asked where a number comes from. isoglu.com.