Files
Jyotisha/docs/research/reported_offset_2026_09_20.md
T
jesse-uxandClaude Code 932f2fffba
Independent Staging Quality Gate / validate (push) Successful in 12m7s
Independent Staging Quality Gate / publish (push) Successful in 3m46s
research(rectification): add reported-offset evaluation and frozen rerun integrity
Preserve closed confirmation gates and previously-exposed dataset boundaries. Add auditable 900-trial sensitivity results, current scorer freshness checks, and the v5 collection protocol.

Co-Authored-By: Claude Code <noreply@anthropic.com>
2026-09-20 12:03:52 +08:00

5.9 KiB
Raw Blame History

申报偏差敏感性评测(2026-09-20)

结论与边界

默认半径 ±15 分钟时,申报误差绝对值超过 15 分钟,记录真值就不在候选窗内;按整数分钟,第 16 分钟开始出窗。 这是搜索窗几何边界,不需要知道真实用户偏差分布。

本轮完整评测预先固定 15 个偏移 × 3 档半径 × 20 例,共 900 组合。修正版全部运行完成,validator 排除 0 例;实测结果以下列最终 JSON 为准,不能用中途旧版本初扫代替。

区间覆盖不等于分钟命中,模拟偏差敏感性不等于真实用户准确率。 不运行六题真值方向回放,不以用户认可作真值,不调参、不改生产打分、不打开确认门。

口径

项目 口径
数据集 references/real_case_calibration/minute_rectification_holdout_v3.json,20 例公开 AA,每例 3 件事件,已曝光
ayanamsa / node mode raman / mean
申报偏移 0、±3、±5、±8、±10、±15、±20、±30 分钟
搜索半径 ±15 / ±30 / ±60 分钟;±120 仅说明几何边界,未评分
候选步长 1 分钟,含两端;不是生产 2 分钟抽样
12 文件历史身份 b15d9ea15227cd58(完整值见 JSON
实际评分路径 原生 event contribution matrix;不是 T2 的 shadow fact ranker
额外身份 JSON 的 production_scoring_sha256research_implementation_sha256 分别绑定扩展评分文件和研究适配文件;显式文件清单不是完整传递依赖锁
头名与排名 分数降序,再用既有 _opaque_winner 同源 SHA-256 规则排同分;不选择最接近真值的候选
交付区间 初始未答题:signature clusters 中落后头名不足 8 分的仍有效簇外包范围;无新回答、无淘汰,不是完整问答链交付效果
跨午夜 候选、误差及区间使用完整日期;离线矩阵按候选日期分组,合并后全窗排序/聚类
独立性 is_blind_evaluation=false,已曝光集;评分/区间定稿后才揭示标签,仅证明程序标签隔离

实测表

每格依次为 真值在窗比例 / 哈希头名命中 / 初始交付区间覆盖,分母均为 20 例。列为申报偏移分钟,行为搜索半径。统一口径:v3、raman/mean、1 分钟步长;历史打分身份 b15d9ea15227cd58,扩展原生评分身份 115c3fbcffdaff49,研究适配身份 8d0c613dc0900adb

半径 -30 -20 -15 -10 -8 -5 -3 0 +3 +5 +8 +10 +15 +20 +30
±15 0/0/0 0/0/0 100/10/95 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/95 100/15/95 0/0/0 0/0/0
±30 100/10/95 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/95 100/15/95
±60 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100 100/5/100

表内全部数字单位为 %。这只是 20 例公开已曝光案例的条件敏感性,不附会总体置信度。即使真值在候选窗中,±15 的 -15/+10/+15 档及 ±30 的 -30/+20/+30 档仍各有一例未被初始交付范围覆盖;窗口包含与交付覆盖必须分开。±60 的所有采样偏移虽保持覆盖,但真正选中的头名只有 5%,不能用宽区间覆盖声称分钟准确。

修正版与错误初版的汇总比例恰好相同,不表示初版评分正确;身份、逐候选计算与跨日回归以修正版为准。

放宽能救回什么

  • 真值在候选窗的条件始终是 abs(offset) <= radius。本次偏移最大绝对值 30,因此半径 30 / 60 / 120 在几何上都能包含本次所有偏移标签。
  • 对 ±15 已出窗的 ±20 / ±30 两组偏移,放宽到 ±30 可把候选窗包含率从 0 恢复到 100%;±60 / ±120 对这些特定偏移不再增加几何包含率。
  • 半径 ±30 自第 31 个整数分钟偏移出窗,±60 自第 61 个、±120 自第 121 个。放宽不是无条件保证,更不代表排名命中或交付覆盖同样恢复。
  • ±120 未跑评分,不报告其头名命中率或交付覆盖率。真实用户申报偏差分布未知,不估算现实用户中有多少人能被放宽救回。

初扫作废与独立复核

首版正确枚举了跨日候选,但矩阵内 transition proximity 仍共用窗口起日,独立审查发现跨日候选得分偏移。因此旧初扫作废,修正版标记 replay_revision=candidate_date_grouped_v2,并登记 supersedes=initial_sweep_invalidated_cross_midnight_transition_anchor

修复仅在本次新脚本 score_window() 做按日期分组适配,未改冻结打分文件。实引擎回归验证跨日窗口的分组计算与逐候选独立重算相同;聚类和交付范围在合并后全窗运行。生产日期处理未在本单修复,不能称为生产端到端回放。

可复算产物与验收

python scripts/research/reported_offset_sweep.py --json
python -m pytest tests/test_reported_offset_research.py tests/test_rectification_validation_integrity_gate.py -q

reported_offset_2026_09_20.json 保留逐例四项必要输出:真值是否在窗、真值排名、头名分钟误差、交付区间覆盖,以及每个格子的分母、全部参数和实现哈希。仅保存公开集序号,不保存出生分钟、坐标或事件正文。

排名不能与 T2 的竞争排名 top-1/top-3 混比:T2 按旧协议允许并列多个分钟同时算第一;本表把同分完全按哈希打破。最终测试数字与已知基线失败见 进度。真实分布采集与新未曝光样本见 v5 协议