需求统计与预测 DSF · v0.11
discipline/06-evidence.md
📑 本页目录

06 · 证据标准与评估协议

继承 AppTrends harness 纪律,并升级为学科级标准。

1. 文献证据金字塔

等级 含义 示例
S 强实证 多项独立研究一致 + 公开数据可复现 组合优于单模型;proper scoring 的必要性
M 中等 方向一致、样本有限或单一情境 时序基础模型零样本优于统计基线(数据集相关)
W 弱/混合 结论依赖情境 预测市场 vs 专家(选举/疫情结果不一)
X 推测/新兴 机制合理但证据不足 LLM 合成需求数据的普遍可用性

规则:X 级结论必须标注,不得作为学科定论引用;引用时带等级后缀。

2. 预测注册纪律(先注册后计分)

3. 评估协议(默认交付)

预测类型 必须报告
点预测 MASE 或相对误差(vs 基准);禁止只报 MAPE 绝对值
分布预测 CRPS(或特定分位的 pinball)+ PIT/可靠性图
区间预测 Winkler 分数 + 覆盖率
分类/事件概率 Brier 分数 + 校准曲线
排序预测 约束一致率 / tau / hit@k(Case 0 采用)

4. 基准纪律

5. 可复现标准

6. 代理登记表(模板)

字段 内容
代理名 如「App Store 畅销榜名次」
目标构念 某品类消费者需求
偏差方向 高估/低估/未知 + 理由
滞后 领先/同步/滞后
覆盖 人群/地域/时间
操纵风险 刷榜、付费推广、机器人流量
效度证据 与参考量的相关、收敛效度结果
状态 active / deprecated

7. 假设注册(模板)

## H-XX 表述
- 表述:(可证伪的一句话)
- 可证伪方式:(什么数据、什么阈值判否)
- 检验设计:(协议、基准、样本外方式)
- 状态:proposed / in_progress / supported / rejected

8. 案例标准(Case 模板)

每个案例(含 Case 0:ADDO)应记录:对象与范围定义、所用代理及偏差、方法组合、 评估协议与结果、对公理/方法的反馈。案例库是学科「实践层」的证据来源。