P-008 · 2026 · Hackathon-Beitrag
TabPFN-3.5 vs. bayessche Pareto/NBD-Kundenmodelle
Ein Benchmark, wann das Foundation-Modell TabPFN-3.5 spezialisierte bayessche Kundenmodelle bei der Vorhersage schlägt, ob Kunden innerhalb von 90 Tagen wieder kaufen.
Studiendesign
Gemeinsame Eingaben, dann ein vorab festgelegter erweiterter Merkmalssatz
Fragestellung und Kontext
Diesen Benchmark habe ich für den TabPFN-3.5 Hackathon von Prior Labs entwickelt. Er untersucht, wann TabPFN-3.5, das aus gelabelten Beispielen im Kontext lernt, Wiederholungskäufe besser vorhersagt als das Pareto/NBD-Modell und dessen hierarchisch-bayessche Erweiterung nach Abe (2009), die ohne Labels auskommen. Zu monatlichen Prognosezeitpunkten wird für jeden Bestandskunden die Wahrscheinlichkeit vorhergesagt, in den nächsten 90 Tagen nicht zu kaufen, sowie die Anzahl der Kaufanlässe in diesem Zeitraum.
Methode
Der ungetunte TabPFN-3.5-Klassifikator und -Regressor wird mit Basisraten- und Recency-Referenzen, logistischen und Poisson-GLMs, getuntem LightGBM, Pareto/NBD per Maximum Likelihood und Abes Modell per MCMC verglichen, das nur bei Konvergenz bewertet wird. Überwachte Modelle werden nur mit den Pareto/NBD-Eingaben und mit einem vorab festgelegten erweiterten Merkmalssatz verglichen. Das Protokoll wurde auf Entwicklungszeitpunkten eingefroren, bevor drei unberührte Holdout-Zeitpunkte einmalig bewertet wurden, mit kundengeclustertem gepaartem Bootstrap und Lernkurven von 50 bis 2.000 gelabelten Kunden.
Ergebnisse
Auf Online Retail II mit den drei Pareto/NBD-Eingaben schlägt das labelfreie Pareto/NBD TabPFN-3.5 beim Brier-Score (0,169 vs. 0,177) und ist besser kalibriert. Mit erweiterten Merkmalen liegt TabPFN-3.5 beim Brier-Score gleichauf mit GLM, LightGBM und Pareto/NBD, erzielt die beste PR-AUC und den geringsten Fehler bei der Kaufanzahl und ist bei jeder Lernkurvengröße das stärkste überwachte Modell. Auf CDNOW konvergiert das hierarchisch-bayessche Modell und gewinnt mit den gemeinsamen Eingaben, während die bayesschen Modelle die besten Anzahlprognosen behalten. Kurz: TabPFN-3.5 gewinnt, wenn es reichere Merkmale nutzen kann und Labels knapp sind.
Einordnung
Die Daten sind nicht vertraglich, daher ist 90-tägige Inaktivität keine Kündigung, und die Ergebnisse ordnen Risiken, statt die Wirkung einer Kundenansprache zu schätzen. Die Studie umfasst zwei öffentliche Handelsdatensätze und sich überlappende Holdout-Zeitpunkte. Das Repository enthält eine lokale Streamlit-Anwendung, gespeicherte Vorhersagen und einen Befehl, der alle Tabellen neu erzeugt.