Co-Authored-By: Claude Opus 5.5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_017eEAG8HD3mm8gsKXgk8uU8
2.6 KiB
2.6 KiB
TASK · 生时校正三项离线研究(2026-09-26)
基线
origin/staging当前 head。分支codex/rectification-offline-research-20260926。不改线上代码(只加研究脚本、结果 JSON、报告文档;若研究脚本需要读引擎内部函数,只读不改)。- 数据:只用仓库已有的公开 AA 名人开放集(v4,
docs/research/holdout_v4_build_2026_09_14.md)与明确虚构数据。
背景(09-26 盘点)
- 所有回放都按"每题理想作答",数字全是上限;是 / 否答错的容错从未测过。
- 分盘敏感度配权 V1/V2 的结论在 09-15 勘误为"未测"(权重没真正生效,BUG-692),一直没重跑,是打分侧唯一没真正测过的方向。
- 文档写"1 分钟 ≈ 1.1 天大运边界位移"(
TASK-rectification-precision-adaptive-boundary-research-20260914.md及 BUG-689 邀请语依据)有误:Vimshottari 120 年覆盖 9 个星宿(120°),平均 1° ≈ 1 年;09-26 用 swisseph 在 2000 个虚构时刻实测每分钟位移中位 3.8 天(p10 1.6、p90 5.0、范围 1.3–5.9),仓库_vim_start_dates复核两例 2.3 / 4.9 天。45 天闸门对应约 9–34 分钟而非 40 分钟。推断"出不来题"的真实原因更可能是event_probes.py_representative_pairs只比相邻代表分钟 + 首尾一对。
任务
- R1 答错容错:在 v4 开放集上,六题回放里随机把 1 题、2 题的是 / 否答反(固定种子,多次重复),统计真值仍在交付区间的比例、头名簇命中、区间宽度;分 ±10 / ±30 / ±60 窗。
- R2 V1/V2 分盘敏感度配权重跑:先证明权重确实生效(打分差异非零),再按 closure 文档口径报告头名命中、宽度、真值在区间比例;与基线对照。
- R3 改正算术:复现 3.8 天 / 分钟的测量(脚本 + 分布表),重新推导"不同精度的证据能区分多近的候选",核实
_representative_pairs推断;改正相关任务书 / 研究文档中的错误数字(加勘误段,不删原文),并给出引导邀请语的修改建议(不直接改线上文案)。
硬红线
- 不改线上代码、打分、阈值、Skill;研究脚本放
scripts/research/,结果放docs/research/,每个结论附可复跑命令。 - 不把开放集结果写成盲测或"准确率";不得出现真实用户数据。
- Python 同机 A/B,不写死跨机浮点哈希(BUG-985)。
交付
docs/research/rectification_offline_research_2026_09_26.md(三节 + 结论一句话 + 是否建议立实现单)、结果 JSON、PROGRESS;README 状态板一行。