预测市场并不是新事物
利用市场来汇聚预测并不是21世纪的创新。早在1860年代,美国就已经出现了政治博彩市场——华尔街场外交易为总统选举设赔。这些市场受到广泛关注,往往比同时期的民意调查更加准确。1988年上线的Iowa Electronic Markets(爱荷华电子市场),提供了现代形态下关于预测市场准确度的第一批学术证据。
学术证据
爱荷华大学的 Berg、Nelson 与 Rietz 针对1988年至2004年的多届总统选举,发表了多篇研究,比较Iowa Electronic Markets预测与民调数据。在相同日期进行比较时,市场预测跑赢民调的比例达到74%。当预测时间早于选举100天以上时,这种优势尤为明显。
2023年,Atanasov及其合作者在《International Journal of Forecasting》上发表了一项元分析,考察了多领域内的预测市场、民意调查与专家预测。研究发现,最好的预测通常是三种来源的结合;在问题定义清晰、结算标准明确、流动性充足时,市场的表现最好。
市场失灵之处
预测市场并非万无一失,它的失败也颇有启发。市场系统性地低估极端事件(黑天鹅)的概率,因为极端事件本身的基础频率极低,大多数市场参与者也从未亲历过。当事件的结果依赖于某个决策者真正私下的思考过程(某位CEO是否会辞职、某位法官会如何判决)时,市场也会显得力不从心。
2024年的美国大选提供了一个充满张力的案例。当民调显示选情胶着时,Polymarket正确地将Trump识别为可能的胜选者;但57%的概率仍然意味着有43%的机会判断错误。市场在这一事件上是正确的,但一个57%的预测最终兑现并不代表预测“完美”,只能说明市场对不确定性评估得当——这是一种不同且更为细腻的判断。
校准才是正确的评价指标
评估预测市场长期准确度的正确方式是校准性:被市场定价为30%的事件,实际是否以30%的频率发生?被定价为70%的事件,是否以70%的频率发生?完美校准意味着市场在任何概率水平上都没有系统性高估或低估。
关于预测市场校准性的研究普遍显示,它在20%至80%区间内表现良好,但在极端概率区间有一定程度的过度自信(被定价为95%的事件,发生频率略低于95%)。这与理论预期相符:极端概率更难被精准定价,因为小幅度的概率变化,需要靠大幅度的仓位变化才能实现修正。
在 Blockcircle 上探索这些工具: 预测市场错误定价引擎