research(rectification): v5 verdict for scoring-method research — LR weights, absence and precision follow-up all fail hard line 1 (BUG-1091 closed_by_design)
Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_017eEAG8HD3mm8gsKXgk8uU8
This commit is contained in:
co-authored by
Claude Fable 5.1
parent
a29fbe0333
commit
fa2e7d17f5
+7
-6
@@ -14705,18 +14705,19 @@
|
||||
|
||||
## BUG-1091 | 生时校正打分只奖不罚、权重未校准、高分辨率信号未计分
|
||||
|
||||
- 状态:investigating(2026-09-29 研究单 `TASK-rectification-scoring-research-20260929` 脚手架已落地;判定按任务书须在 v5(≥60 例)上做,v4 上只跑通流水线、所有判定字段写 `pending_v5`)
|
||||
- 首次发现 / 最近更新:2026-09-29 / 2026-09-29
|
||||
- 状态:closed_by_design(2026-09-30 在 v5 77 例上判定:R-A 似然比校准权重与 R-B 缺席证据在三档半径 × truth/opposite 六格全部未过硬红线 1,打分层不立实现单;R-C 精度追问与同子集基线比无一致收益,同样不立实现单)
|
||||
- 首次发现 / 最近更新:2026-09-29 / 2026-09-30
|
||||
- 影响面:`scripts/active_rectification_event_engine.py::_score_event`(11 条加分规则,权重手拍)、`OBSERVATION_ONLY_LAYERS`(KP 宫头子主每分钟在算但不计分)、`_fine_minute_indices`(Pranapada / Hora / Ghati / Bhava lagna 已算未计分)、计分分盘无 D60。
|
||||
- 用户现象:开场说 12 件带年份经历、答约 10 张卡后范围整窗不动;引擎原始分头名簇命中在 v4 上只有 0.35 / 0.15 / 0.10(±10 / ±30 / ±60),约为随机水平的 4–5 倍。
|
||||
- 触发条件:任何一次校正。打分对候选「能解释事件」加分,对「预测了没发生的事」不扣分;一条规则对真分钟和错分钟同样常命中时照样 +2。
|
||||
- 根因(已确认):(1) 只奖不罚——负证据只来自选择题答「没有」(`core/build-state.ts::applyProbeOutcome`,±2);(2) 权重是人拍的,R1–R5 / V1 / V2 / V1n 都是「再拍一个权重看结果」,没有按数据校准;(3) KP / Pranapada / D60 这些分钟级信号没进计分,09-14 KP@默认权重更差是「权重没校准」的另一个症状。
|
||||
- 修复:未修。本轮只做离线脚手架:`scripts/research/scoring_research_lib.py`(特征记录 provider 与线上 `score_candidates` 逐分对账、似然比权重、leave-one-case-out、加权 provider、缺席 / 精度追问辅助)、`scripts/research/scoring_research.py`(R-A / R-B / R-C 流水线)、`tests/test_scoring_research.py`。生产代码与冻结文件零改动。
|
||||
- 验证:`tests/test_scoring_research.py`(含 v4 公开案例对账 0 差);v4 全集流水线跑通、`PYTHONHASHSEED=0` 两次复跑 JSON 逐字节一致(见 `docs/tasks/PROGRESS-rectification-scoring-research-20260929.md`)。
|
||||
- 防复发:任何计分改动必须先在 v5 上过任务书硬红线(六格真值在区间不降、留一法数字、稳健性三项),再按 ERR-110 重冻结;不得在 v4 上下结论(BUG-1090)。
|
||||
- 修复:不修(研究不过门)。离线脚手架与判定:`scripts/research/scoring_research_lib.py`(特征记录 provider 与线上 `score_candidates` 逐分对账、似然比权重、leave-one-case-out、加权 provider、缺席 / 精度追问辅助)、`scripts/research/scoring_research.py`(R-A / R-B / R-C 流水线)、`tests/test_scoring_research.py`。生产代码与冻结文件零改动。
|
||||
- 验证:`tests/test_scoring_research.py`(含 v4 公开案例对账 0 差);v4 与 v5 全集两次复跑 JSON 逐字节一致(`PYTHONHASHSEED=0`);v5 对账 231/231 case-radius 差 0。
|
||||
- 判定数字(v5,`raw` 口径,留一法按案例;基线真值在区间 / 头名 = 76 / 0.675、76 / 0.494、75 / 0.325):R-A A1 76 / 0.571、77 / 0.455、72 / 0.247;A2 75 / 0.545、76 / 0.416、72 / 0.247;A3 77 / 0.597、77 / 0.468、75 / 0.221——头名三档全降,六格不过。42 个特征里 36 / 38 / 39 个 bootstrap 区间跨 0,剩余 |log LR| ≤ 0.15,v4 与 v5 都稳定同号的特征 0 个。R-B @0.5 / 1.0 / 2.0 分:真值在区间 77 / 73 / 55、75 / 71 / 33、75 / 70 / 19,头名全降,六格不过。按方案矩阵重出六题与共用题目逐格相同(出题器不读矩阵分数)。全文 `docs/research/rectification_scoring_research_2026_09_29.md`。
|
||||
- 防复发:定论页 §9 记录「线上规则 + KP / Pranapada / D60 对分钟几乎无区分力、缺席年扣分伤真值」;再有人想从加权重 / 换尺度 / 缺席证据入手,先读 §9 与本条数字。任何计分改动仍须先在 v5 上过任务书硬红线,再按 ERR-110 重冻结。
|
||||
- 相关记录:BUG-560、BUG-1048、BUG-1089、BUG-1090
|
||||
- 复发自:无
|
||||
- 修复版本:未修(研究分支 `codex/rectification-scoring-research-20260929`)
|
||||
- 修复版本:未修(研究分支 `codex/rectification-scoring-research-20260929`;脚手架已合入 staging `84aaeadf`)
|
||||
|
||||
## BUG-1092 | 报告技术页标题出现「字段」,行星主星表头是看不懂的 RL / NL / SL / SS / SB
|
||||
|
||||
|
||||
Reference in New Issue
Block a user