Ein Modell ist nur so tragfähig wie die Daten, auf denen es lernt. In der Finanzmarktpraxis gibt es zwei systematische Fehler, die Ergebnisse verzerren, ohne dass der Anwender es bemerkt: survivorship bias und look-ahead bias. Beide sind nicht technisch, sie entstehen durch die Auswahl der Daten.
Survivorship Bias
Wer ein Modell auf einem Aktienuniversum trainiert, das nur heute noch existierende Unternehmen enthält, lernt aus einer überlebenden Menge. Die Unternehmen, die im Beobachtungszeitraum ausgeschieden sind — durch Insolvenz, Übernahme oder Delisting — fehlen. Das Modell sieht eine Welt ohne Ausfälle und überschätzt die Stabilität der Relationen. Die Folge ist eine Rebalancierung, die im Rückblick robuster wirkt, als sie in der Anwendung ist.
Look-ahead Bias
Wer ein Modell mit Informationen trainiert, die zum Zeitpunkt der Vorhersage noch nicht vorlagen, lernt aus der Zukunft. Ein häufiger Fehler ist die Verwendung von Jahresabschlussdaten, die erst Monate nach Bilanzstichtag veröffentlicht wurden, als ob sie am Stichtag verfügbar gewesen wären. Die Folge ist eine Rebalancierung, die im Rückblick rechtzeitig reagiert, in der Anwendung aber zu spät kommt.
Was ein redaktioneller Beitrag benennt
Ein Beitrag, der ein Verfahren beschreibt, benennt die Datenbasis. Er sagt, aus welchem Universum die Daten stammen, ob das Universum überlebende und ausgeschiedene Unternehmen enthält und ob die Daten zum Vorhersagezeitpunkt tatsächlich verfügbar waren. Fehlt diese Angabe, ist das ein redaktioneller Mangel, kein technischer.
Was ein Beitrag nicht behauptet
Ein Beitrag behauptet nicht, dass ein Verfahren mit sauberen Daten funktioniert. Er sagt, dass ein Verfahren mit unsauberen Daten nicht beurteilt werden kann. Saubere Daten sind eine Voraussetzung, kein Beweis.