Look-ahead-Bias entsteht, wenn ein Merkmal oder eine Kennzahl in der Trainingsreihe zu einem Zeitpunkt steht, an dem sie in der Praxis noch nicht vorliegen konnte. Die Folge ist eine Rückrechnung, die zu gut ausfällt, weil das Modell Antworten sieht, die es zum Vorhersagezeitpunkt nicht hätte haben können.

Wo der Fehler entsteht

Typische Quellen sind überarbeitete Makroreihen, die erst Wochen später finalisiert werden, Analystenschätzungen, deren Erfassungsstichtag nicht korrekt abgebildet ist, und fundamentale Kennzahlen, die mit der jeweils aktuellen – nicht der stichtagsbezogenen – Version in den Bestand fließen. Auch korrigierte Kursreihen, die rückwirkend angepasst wurden, erzeugen einen Bias, wenn die Anpassung vor dem eigentlichen Ereignis liegt.

Was der Fehler im Modell bewirkt

Ein Modell, das mit look-ahead-verseuchten Daten trainiert wurde, lernt Zusammenhänge, die in der Vorwärtsnutzung nicht bestehen. Die gemessene Performance in der Rückrechnung übersteigt die erreichbare Vorwärtsperformance oft deutlich. Im Einsatz fällt das Modell zurück, ohne dass die Ursache im Modell selbst liegt.

Wie der Fehler nachweisbar wird

Die einfachste Prüfung ist eine As-of-Date-Simulation: Für jeden Stichtag wird der Datenstand auf den Stand genau dieses Stichtags zurückgesetzt, und die Merkmale werden aus diesem Stand neu gebildet. Weicht die Kennzahl von der point-in-time-Konsistenz ab, tritt der Fehler offen zutage. Ergänzend hilft eine Erfassungsprotokollierung, die für jeden Wert festhält, wann er in den Bestand aufgenommen wurde.

Leseprobe

Eine Rückrechnung, die ohne As-of-Date-Simulation entsteht, ist keine Prognose – sie ist eine Erklärung mit Wissen, das im Vorhersagezeitpunkt noch nicht existierte.

Möchten Sie zu diesem Thema eine Quelle angeben oder einen inhaltlichen Hinweis geben? Schreiben Sie uns über die Kontaktseite.