{"asOf":"2026-08-27","forward":{"generatedAt":"2026-08-27T17:33:47.952942+00:00","capturedTotal":67204,"maturedMarkets":29309,"baseRateYes":0.1351,"design":"Forecasts captured while the market was OPEN (contamination-proof, time is the air-gap), graded as reality resolved them. The living benchmark: it grows and re-grades every time the bus refreshes; a young log grades few until its markets mature.","forecasters":{"crowd":{"n":29309,"nMarkets":29309,"brier":0.0581,"brierCI95":[0.0564,0.0598],"baseRateBrier":0.116,"skillVsBaseRate":0.4995,"logLoss":0.1881,"reliability":[{"bin":"0.0-0.1","n":19811,"meanPredicted":0.0136,"empiricalFrequency":0.0108},{"bin":"0.1-0.2","n":2252,"meanPredicted":0.1432,"empiricalFrequency":0.1026},{"bin":"0.2-0.3","n":1551,"meanPredicted":0.2483,"empiricalFrequency":0.2134},{"bin":"0.3-0.4","n":1322,"meanPredicted":0.346,"empiricalFrequency":0.2988},{"bin":"0.4-0.5","n":1253,"meanPredicted":0.4488,"empiricalFrequency":0.3296},{"bin":"0.5-0.6","n":821,"meanPredicted":0.5375,"empiricalFrequency":0.4787},{"bin":"0.6-0.7","n":400,"meanPredicted":0.6463,"empiricalFrequency":0.62},{"bin":"0.7-0.8","n":338,"meanPredicted":0.7482,"empiricalFrequency":0.645},{"bin":"0.8-0.9","n":382,"meanPredicted":0.8517,"empiricalFrequency":0.8717},{"bin":"0.9-1.0","n":1179,"meanPredicted":0.9671,"empiricalFrequency":0.9763}]}}},"retrospective":{"generatedAt":"2026-06-23T06:10:56.693233+00:00","windowDays":45,"horizonHours":72,"resolvedMarkets":34325,"trainMarkets":17162,"testMarkets":17163,"design":"Markets split train/test by resolution date. The deterministic engine is FIT on train (OLS residual correction on the crowd) and the leaderboard is the disjoint TEST split (clean OOS); the base-rate null is measured on train, applied to test. Every forecaster sees only snapshots with ts<=as_of (contamination guard). Reproducible, offline, no LLM in any forecaster here.","forecasters":{"base_rate":{"n":17163,"nMarkets":17163,"brier":0.1063,"brierCI95":[0.103,0.1097],"baseRateBrier":0.1063,"skillVsBaseRate":0,"logLoss":0.3699,"reliability":[{"bin":"0.1-0.2","n":17163,"meanPredicted":0.1453,"empiricalFrequency":0.1201}]},"crowd":{"n":4069,"nMarkets":4069,"brier":0.0705,"brierCI95":[0.0658,0.0756],"baseRateBrier":0.1586,"skillVsBaseRate":0.5555,"logLoss":0.2339,"reliability":[{"bin":"0.0-0.1","n":2287,"meanPredicted":0.0206,"empiricalFrequency":0.0131},{"bin":"0.1-0.2","n":325,"meanPredicted":0.1432,"empiricalFrequency":0.12},{"bin":"0.2-0.3","n":272,"meanPredicted":0.2495,"empiricalFrequency":0.1654},{"bin":"0.3-0.4","n":207,"meanPredicted":0.3474,"empiricalFrequency":0.1836},{"bin":"0.4-0.5","n":242,"meanPredicted":0.4501,"empiricalFrequency":0.2025},{"bin":"0.5-0.6","n":107,"meanPredicted":0.5369,"empiricalFrequency":0.4206},{"bin":"0.6-0.7","n":68,"meanPredicted":0.6531,"empiricalFrequency":0.6765},{"bin":"0.7-0.8","n":67,"meanPredicted":0.747,"empiricalFrequency":0.6269},{"bin":"0.8-0.9","n":70,"meanPredicted":0.8475,"empiricalFrequency":0.7857},{"bin":"0.9-1.0","n":424,"meanPredicted":0.9719,"empiricalFrequency":0.9434}]}}},"whatThisCovers":"This dataset grades the market sensor we cite, and only that: `crowd` is the prediction-market price, `base_rate` is the naive null it is scored against. No forecaster of ours is published here, in either slice. We maintain a source-traced record of the entities and events in a customer's domain and sell that maintained state; prediction-market prices are one sensor we cite and grade for accuracy, never a forecast of ours. Each price was logged while its market was open and graded when it matured, so the grade cannot be back-filled. The `design` notes describe the whole internal benchmark, graders we run included; the rows above are what is served."}