# TASK · 生时校正三项离线研究(2026-09-26) ## 基线 - `origin/staging` 当前 head。分支 `codex/rectification-offline-research-20260926`。**不改线上代码**(只加研究脚本、结果 JSON、报告文档;若研究脚本需要读引擎内部函数,只读不改)。 - 数据:只用仓库已有的公开 AA 名人开放集(v4,`docs/research/holdout_v4_build_2026_09_14.md`)与明确虚构数据。 ## 背景(09-26 盘点) 1. 所有回放都按"每题理想作答",数字全是上限;**是 / 否答错的容错从未测过**。 2. 分盘敏感度配权 V1/V2 的结论在 09-15 勘误为"未测"(权重没真正生效,BUG-692),**一直没重跑**,是打分侧唯一没真正测过的方向。 3. 文档写"1 分钟 ≈ 1.1 天大运边界位移"(`TASK-rectification-precision-adaptive-boundary-research-20260914.md` 及 BUG-689 邀请语依据)有误:Vimshottari 120 年覆盖 9 个星宿(120°),平均 1° ≈ 1 年;09-26 用 swisseph 在 2000 个虚构时刻实测每分钟位移中位 **3.8 天**(p10 1.6、p90 5.0、范围 1.3–5.9),仓库 `_vim_start_dates` 复核两例 2.3 / 4.9 天。45 天闸门对应约 9–34 分钟而非 40 分钟。推断"出不来题"的真实原因更可能是 `event_probes.py` `_representative_pairs` 只比相邻代表分钟 + 首尾一对。 ## 任务 - R1 **答错容错**:在 v4 开放集上,六题回放里随机把 1 题、2 题的是 / 否答反(固定种子,多次重复),统计真值仍在交付区间的比例、头名簇命中、区间宽度;分 ±10 / ±30 / ±60 窗。 - R2 **V1/V2 分盘敏感度配权重跑**:先证明权重确实生效(打分差异非零),再按 closure 文档口径报告头名命中、宽度、真值在区间比例;与基线对照。 - R3 **改正算术**:复现 3.8 天 / 分钟的测量(脚本 + 分布表),重新推导"不同精度的证据能区分多近的候选",核实 `_representative_pairs` 推断;改正相关任务书 / 研究文档中的错误数字(加勘误段,不删原文),并给出引导邀请语的修改建议(不直接改线上文案)。 ## 硬红线 1. 不改线上代码、打分、阈值、Skill;研究脚本放 `scripts/research/`,结果放 `docs/research/`,每个结论附可复跑命令。 2. 不把开放集结果写成盲测或"准确率";不得出现真实用户数据。 3. Python 同机 A/B,不写死跨机浮点哈希(BUG-985)。 ## 交付 `docs/research/rectification_offline_research_2026_09_26.md`(三节 + 结论一句话 + 是否建议立实现单)、结果 JSON、PROGRESS;README 状态板一行。