两章分册
先选择证据类型,再开始录入
历史回测回答“方法在既定历史区间如何表现”;发布后复盘回答“当时公开的原始预测后来对应什么结果”。两者的时间条件不同,不能混为同一结论。
当前分册
可进入评价的记录
评价任务
和值集合覆盖
回测方法面板
先登记可重现条件,再添加逐期评价记录。参数可以是窗口长度、筛选条件或模型配置;如果旧版本无法恢复,应在缺失处理和局限说明中明确记录,而不是补写一个看似完整的结果。
历史回测设置
这些字段会随新记录一起保存为本地草稿快照。
发布后复盘口径
此分册以发布时留下的内容为证据单位。生成时间必须早于适用期次的结果确认;预测原文应保持原样,不能因实际结果出现而改写候选集合。
已评价
预测与实际和值均已录入,可进入有效分母。
待核对
保留原预测,但暂不计入命中率与基线。
撤回
继续显示撤回状态,不从发布记录中删除。
评价指标与同口径基线
当前任务只判断“实际和值是否落入预先给出的候选集合”。随机覆盖基线按每条记录的候选数量除以 28 计算,再对有效记录取平均;它不是预测结果,也不代表真实方法必然达到该比例。
| 评价项 | 预先定义 | 当前值 | 有效分母 | 同口径基线 |
|---|---|---|---|---|
| 集合覆盖次数 | 实际和值位于该期候选集合内 | 不单列次数基线 | ||
| 集合覆盖率 | 覆盖次数 ÷ 有效记录数 | |||
| 平均候选数量 | 各有效记录候选数的算术平均 | 用于解释覆盖宽度 |
候选集合越宽,覆盖实际和值的机会通常越高。因此,候选数量或和值范围不同的方法不能仅凭“命中几次”直接比较。
发布与结果逐项对照
每条记录都显示录入时的原始预测、适用期次和实际和值。未覆盖项不会隐藏;待核对和撤回项仍留在手册中,以便检查选择性展示。
使用逗号、空格或顿号分隔候选和值。
当前分册尚无记录
从左侧录入第一条记录。页面不会预填虚构的回测成绩,也不会把示例数字计入评价表。
| 适用期次 | 生成时间 / 版本 | 原始预测 | 实际和值 | 评价结论 | 操作 |
|---|---|---|---|---|---|
方法局限注疏
样本量决定评价结果能承受多大波动。少量期次中的覆盖或未覆盖,都可能受到区间选择影响;如果只挑选某段表现较好的历史记录,结论会高估方法的稳定性。评价时应同时查看有效分母、候选集合宽度和缺失记录数量。
方法版本发生变化后,应另起版本记录。扩大候选和值范围通常会提高覆盖机会,但也会同步抬高同口径随机基线;因此不能把更宽的覆盖范围直接解释为方法改善。发布后复盘还应保留未覆盖、待核对和撤回记录,避免只展示成功案例。
历史回测描述的是既定样本和既定规则下的模拟表现。它不能替代未来有效性的证据,也不应被表述为下一期结果保证。需要重现时,应核对原始数据、版本、参数、训练与评估切分以及当时可用信息边界。