{"asOf":"2026-09-26","forward":{"generatedAt":"2026-09-26T13:48:02.780977+00:00","capturedTotal":98122,"maturedMarkets":28368,"baseRateYes":0.1255,"design":"Forecasts captured while the market was OPEN (contamination-proof, time is the air-gap), graded as reality resolved them. The living benchmark: it grows and re-grades every time the bus refreshes; a young log grades few until its markets mature.","forecasters":{"crowd":{"n":28368,"nMarkets":28368,"brier":0.054,"brierCI95":[0.0524,0.0556],"baseRateBrier":0.1174,"skillVsBaseRate":0.5404,"logLoss":0.1782,"reliability":[{"bin":"0.0-0.1","n":19402,"meanPredicted":0.0144,"empiricalFrequency":0.0112},{"bin":"0.1-0.2","n":2145,"meanPredicted":0.1437,"empiricalFrequency":0.104},{"bin":"0.2-0.3","n":1522,"meanPredicted":0.2458,"empiricalFrequency":0.1866},{"bin":"0.3-0.4","n":1208,"meanPredicted":0.3466,"empiricalFrequency":0.2922},{"bin":"0.4-0.5","n":1055,"meanPredicted":0.4481,"empiricalFrequency":0.345},{"bin":"0.5-0.6","n":646,"meanPredicted":0.5379,"empiricalFrequency":0.5015},{"bin":"0.6-0.7","n":409,"meanPredicted":0.6459,"empiricalFrequency":0.6333},{"bin":"0.7-0.8","n":325,"meanPredicted":0.7477,"empiricalFrequency":0.6985},{"bin":"0.8-0.9","n":316,"meanPredicted":0.8521,"empiricalFrequency":0.8608},{"bin":"0.9-1.0","n":1340,"meanPredicted":0.9686,"empiricalFrequency":0.9903}]}}},"retrospective":{"generatedAt":"2026-06-23T06:10:56.693233+00:00","windowDays":45,"horizonHours":72,"resolvedMarkets":34325,"trainMarkets":17162,"testMarkets":17163,"design":"Markets split train/test by resolution date. The deterministic engine is FIT on train (OLS residual correction on the crowd) and the leaderboard is the disjoint TEST split (clean OOS); the base-rate null is measured on train, applied to test. Every forecaster sees only snapshots with ts<=as_of (contamination guard). Reproducible, offline, no LLM in any forecaster here.","forecasters":{"base_rate":{"n":17163,"nMarkets":17163,"brier":0.1063,"brierCI95":[0.103,0.1097],"baseRateBrier":0.1063,"skillVsBaseRate":0,"logLoss":0.3699,"reliability":[{"bin":"0.1-0.2","n":17163,"meanPredicted":0.1453,"empiricalFrequency":0.1201}]},"crowd":{"n":4069,"nMarkets":4069,"brier":0.0705,"brierCI95":[0.0658,0.0756],"baseRateBrier":0.1586,"skillVsBaseRate":0.5555,"logLoss":0.2339,"reliability":[{"bin":"0.0-0.1","n":2287,"meanPredicted":0.0206,"empiricalFrequency":0.0131},{"bin":"0.1-0.2","n":325,"meanPredicted":0.1432,"empiricalFrequency":0.12},{"bin":"0.2-0.3","n":272,"meanPredicted":0.2495,"empiricalFrequency":0.1654},{"bin":"0.3-0.4","n":207,"meanPredicted":0.3474,"empiricalFrequency":0.1836},{"bin":"0.4-0.5","n":242,"meanPredicted":0.4501,"empiricalFrequency":0.2025},{"bin":"0.5-0.6","n":107,"meanPredicted":0.5369,"empiricalFrequency":0.4206},{"bin":"0.6-0.7","n":68,"meanPredicted":0.6531,"empiricalFrequency":0.6765},{"bin":"0.7-0.8","n":67,"meanPredicted":0.747,"empiricalFrequency":0.6269},{"bin":"0.8-0.9","n":70,"meanPredicted":0.8475,"empiricalFrequency":0.7857},{"bin":"0.9-1.0","n":424,"meanPredicted":0.9719,"empiricalFrequency":0.9434}]}}},"whatThisCovers":"This dataset grades the market sensor we cite, and only that: `crowd` is the prediction-market price, `base_rate` is the naive null it is scored against. No forecaster of ours is published here, in either slice. We maintain a source-traced record of the entities and events in a customer's domain and sell that maintained state; prediction-market prices are one sensor we cite and grade for accuracy, never a forecast of ours. Each price was logged while its market was open and graded when it matured, so the grade cannot be back-filled. The `design` notes describe the whole internal benchmark, graders we run included; the rows above are what is served."}