P-009 · 2026 · Hackathon-Beitrag
Kraftstoffpreisprognosen mit TabPFN-3.5 und LLM-Ereignismerkmalen
Eine Hackathon-Studie, die prüft, ob aus einem wöchentlichen Energiemarktbericht extrahierte Ereignismerkmale TabPFN-3.5-Prognosen für Kraftstoffpreise über Preishistorie und Veröffentlichungszeitpunkt hinaus verbessern.
Studiendesign
Gleiches TabPFN-3.5-Modell, gleiche Zeilen, Kontext, Seed und Fit-Plan
Fragestellung und Kontext
Diese Studie habe ich für den TabPFN-3.5 Hackathon von Prior Labs entwickelt. Sie untersucht, ob strukturierte Ereignismerkmale, die Jev aus dem wöchentlichen Bericht This Week in Petroleum extrahiert, TabPFN-3.5-Prognosen für US-Benzinpreise über Preishistorie und Veröffentlichungszeitpunkt hinaus verbessern. Die Daten umfassen 29 wöchentliche Preisreihen der EIA und 1.146 Berichtsausgaben von 2002 bis 2024. Jedes extrahierte Label, etwa Markttreiber, Preisausblick, Region oder Versorgungsstörung, behält den Satz, aus dem es stammt.
Methode
TabPFN-3.5 prognostiziert Preisänderungen ein bis vier Wochen im Voraus, mit Quantilen. Dasselbe Modell läuft mit Kalender und Preishistorie und ergänzt dann Veröffentlichungszeitpunkt, Jev-Merkmale oder den Rohtext der Ausgaben, jeweils mit denselben Zeilen, demselben Kontext, Seed und Fit-Plan. Ein Placebo behält den Zeitpunkt, vertauscht aber die extrahierten Inhalte zwischen bereits veröffentlichten Ausgaben. Alle Merkmale gelten strikt zum Prognosezeitpunkt. Das Protokoll wurde auf 2005 bis 2015 festgelegt, bevor ein eingefrorener Holdout von 2016 bis Januar 2024 mit gepaartem Moving-Block-Bootstrap bewertet wurde.
Ergebnisse
Der Holdout umfasst 418 wöchentliche Prognosezeitpunkte, 29 Reihen und 48.484 Prognosen je Variante. Jev-Merkmale senkten den MASE gegenüber dem reinen Zeitpunkt um 0,127 (95-%-KI 0,050 bis 0,209) und halfen in allen 29 Reihen. Das Placebo schnitt jedoch genauso gut ab (Differenz +0,013, KI −0,036 bis +0,057), sodass sich der Gewinn nicht auf den Inhalt der Texte zurückführen lässt. Ohne Ereignisspalten war TabPFN-3.5 ungenauer als ein Random Walk, und seine 80-%-Intervalle deckten nur 67 bis 73 % der Ergebnisse ab.
Einordnung
Die Studie ist retrospektiv: Die Merkmale gelten zum jeweiligen Zeitpunkt, vortrainierte Modelle könnten aber Wissen über 2002 bis 2024 mitbringen. Der Bericht wiederholt aktuelle Preise und wurde von der EIA im Januar 2024 eingestellt, daher kann die Anwendung nicht live laufen. Zwei Korrekturen nach dem Holdout-Lauf, an der Intervallbewertung und an HTML-Resten in 104 Ausgaben, sind dokumentiert und ändern das Ergebnis nicht.