docs(research): add the chance baseline the house-lord measurement was missing

Block-layer unique top-1 0.20 sits at or below the 0.35 random expectation for
2.95 candidate ascendants, so H1-H4 had no signal to amplify. Not significant at
n=20; recorded as "no positive signal", not "worse than chance".

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_0193vBv6w5MV2cifdTUu9H5P
This commit is contained in:
Jesse_Chen
2026-09-13 17:24:08 +00:00
co-authored by Claude Opus 5
parent 53565d0da1
commit 007a05fe48
@@ -131,3 +131,27 @@
- 未把研究脚本接到 API,未改 `SCORE_DELTA` / 确认门。
- 未写入任何私人出生资料。
## 复核 · 与随机基线的对照(Claude2026-09-13
> 本节为人工复核,不由 `scripts/research/house_lord_gochara_supply.py` 生成。脚本重跑会覆盖本文件,重跑后需要重新追加。
复核方式:从 `house_lord_gochara_2026_09_13.json` 重算 block 层指标(与上表一致),并用 `--case-id barack_obama_1961_aa_v4_holdout` 单例重跑,baseline / H1 / H3 / H4 的名次与真实上升得分(24.425 / 4.675 / 4.425 / 4.675)与本报告逐位相同,harness 可复现。
窗内候选上升数:2 个的 3 例、3 个的 15 例、4 个的 2 例,平均 2.95。据此算瞎猜的期望值:
| 指标 | 实测基线 | 随机期望 |
| --- | ---: | ---: |
| 唯一头名 | 0.20 | 0.35 |
| 前二 | 0.75 | 0.70 |
| 平均名次 | 2.05 | 1.98 |
**读法:基线这一层在这 20 例上选上升星座与随机不可区分。** 因此「H1~H4 无收益」的含义不是这四条规则不行,而是这一层没有可放大的信号;继续往这一层加规则不应预期回报。
诚实边界:n=200.20 与 0.35 相差约 1.4 个标准差(二项标准差 ≈ 0.107),**未达统计显著**。只能写「看不出正向信号」,不得写成「显著差于随机」。数据集本身是 `invalidated_after_replay`,只作开发集趋势。
补充检查(本报告未做):受控过运规则在 11/20 例里命中,5 条落在真实上升、9 条落在错误上升,比例与随机分布一致 —— 它既不是信号也不是噪声,是无信息。因此不需要先做「关掉 controlled_transit 看是否变好」的减法实验。
生产影响:`scripts/rectification/api_service.py``block_scan()` 直接聚合同一套 `score_candidates`,所以本结论适用于生产的时段阶段。该层的 `blocks[].relative_support` 目前没有被任何前端组件渲染(`frontend/src/lib/rectification-agentic/v9/block-scan.ts` 解析后未进 UI),因此不存在把接近随机的份额当作把握度展示给用户的问题;影响的是流程效率,不是展示诚实性。
下一轮若还要在时段阶段投入,应换指标口径而不是加规则:整段平均分、整段最大分、只用 day/month 精度事件、按事件数归一,同一 harness 一轮可量完。若这些口径都抬不起真实上升,则把时段阶段定性为「靠用户自述收敛、不靠打分」,写进产品口径。