ts / Timur Salakhetdinov

P-008 · 2026 · Hackathon-Beitrag

TabPFN-3.5 vs. bayessche Pareto/NBD-Kundenmodelle

Ein Benchmark, wann das Foundation-Modell TabPFN-3.5 spezialisierte bayessche Kundenmodelle bei der Vorhersage schlägt, ob Kunden innerhalb von 90 Tagen wieder kaufen.

TabPFN-3.5Pareto/NBDHierarchische Bayes-ModelleLightGBMStreamlit

Studiendesign

Kaufhistorien der Kunden zu monatlichen Prognosezeitpunkten
Pareto/NBD · Abe (2009) HBOhne Labels; Frequenz, Recency und Kundenalter
TabPFN-3.5Gelabelte Beispiele im Kontext; kein Tuning
GLM · LightGBMÜberwachtes Training; LightGBM-Raster auf Entwicklungsdaten

Gemeinsame Eingaben, dann ein vorab festgelegter erweiterter Merkmalssatz

90-Tage-Inaktivitätsrisiko und Kaufanzahl je Kunde
Das Protokoll wurde auf Entwicklungszeitpunkten eingefroren; danach wurden drei unberührte Holdout-Zeitpunkte einmalig bewertet, mit kundengeclustertem gepaartem Bootstrap.

Fragestellung und Kontext

Diesen Benchmark habe ich für den TabPFN-3.5 Hackathon von Prior Labs entwickelt. Er untersucht, wann TabPFN-3.5, das aus gelabelten Beispielen im Kontext lernt, Wiederholungskäufe besser vorhersagt als das Pareto/NBD-Modell und dessen hierarchisch-bayessche Erweiterung nach Abe (2009), die ohne Labels auskommen. Zu monatlichen Prognosezeitpunkten wird für jeden Bestandskunden die Wahrscheinlichkeit vorhergesagt, in den nächsten 90 Tagen nicht zu kaufen, sowie die Anzahl der Kaufanlässe in diesem Zeitraum.

Methode

Der ungetunte TabPFN-3.5-Klassifikator und -Regressor wird mit Basisraten- und Recency-Referenzen, logistischen und Poisson-GLMs, getuntem LightGBM, Pareto/NBD per Maximum Likelihood und Abes Modell per MCMC verglichen, das nur bei Konvergenz bewertet wird. Überwachte Modelle werden nur mit den Pareto/NBD-Eingaben und mit einem vorab festgelegten erweiterten Merkmalssatz verglichen. Das Protokoll wurde auf Entwicklungszeitpunkten eingefroren, bevor drei unberührte Holdout-Zeitpunkte einmalig bewertet wurden, mit kundengeclustertem gepaartem Bootstrap und Lernkurven von 50 bis 2.000 gelabelten Kunden.

Ergebnisse

Auf Online Retail II mit den drei Pareto/NBD-Eingaben schlägt das labelfreie Pareto/NBD TabPFN-3.5 beim Brier-Score (0,169 vs. 0,177) und ist besser kalibriert. Mit erweiterten Merkmalen liegt TabPFN-3.5 beim Brier-Score gleichauf mit GLM, LightGBM und Pareto/NBD, erzielt die beste PR-AUC und den geringsten Fehler bei der Kaufanzahl und ist bei jeder Lernkurvengröße das stärkste überwachte Modell. Auf CDNOW konvergiert das hierarchisch-bayessche Modell und gewinnt mit den gemeinsamen Eingaben, während die bayesschen Modelle die besten Anzahlprognosen behalten. Kurz: TabPFN-3.5 gewinnt, wenn es reichere Merkmale nutzen kann und Labels knapp sind.

Einordnung

Die Daten sind nicht vertraglich, daher ist 90-tägige Inaktivität keine Kündigung, und die Ergebnisse ordnen Risiken, statt die Wirkung einer Kundenansprache zu schätzen. Die Studie umfasst zwei öffentliche Handelsdatensätze und sich überlappende Holdout-Zeitpunkte. Das Repository enthält eine lokale Streamlit-Anwendung, gespeicherte Vorhersagen und einen Befehl, der alle Tabellen neu erzeugt.

Lernkurve: Wie viele Labels braucht TabPFN-3.5?

TabPFN-3.5GLMLightGBMPareto/NBD (ohne Labels)
0,170,190,210,23501002505001.0002.000Pareto/NBD, ohne Labels: 0,169Gelabelte Trainingskunden (log. Skala)Brier-Score (niedriger ist besser)
Online Retail II, Holdout, erweiterte Merkmale, Mittel über drei Zeitpunkte und drei Seeds. TabPFN-3.5 liegt bei jeder Größe vor allen überwachten Modellen, am deutlichsten bei 50 bis 250 Kunden, und erreicht das labelfreie Pareto/NBD bei etwa 2.000.

Öffentlichen Code und Dokumentation auf GitHub ansehen ↗

Timur Salakhetdinov ·