docs(tasks): 跨午夜单产品拍板放行 + 更正决策 C 的挂载点

产品 2026-09-20 就三点拍板:A 修;B 修完重新冻结并重跑 T1/T2;C 让修复
前后的结果可区分。任务书 §3 三个待决点改为已决,状态转待领取。

更正 C 的做法。原提案是改 calculation_spec 并 bump INPUT_CONTRACT_VERSION,
但查证发现 calculation_spec_hash 的消费方全在 V4 链路,生产跑的 V9 对它零
引用,改了对真实用户历史无效。改为随修复 bump engine_version:它取自
v9EngineVersion(),全仓只写不比、无任何相等性门控。明令不得动 skill_version,
BUG-621 就是 open RPC 的 Skill 版本绑定让历史校正打不开。

§1.6 同步重写为 V9 的真实身份字段表;T4 改为 engine_version bump,验收加
一条历史会话仍能打开的定向回归。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_0199rbQDTsUbCVw84wc8BTFe
This commit is contained in:
Jesse_Chen
2026-09-20 12:28:44 +08:00
co-authored by Claude Opus 5
parent dacd404480
commit 03cba4780a
2 changed files with 33 additions and 19 deletions
+1 -1
View File
@@ -291,7 +291,7 @@
| `TASK-owner-case-purge-20260919.md` | `PROGRESS-owner-case-purge-20260919.md` | **上游库主案例与本机路径残留清除(只含本仓)**:镜像同步带进库主本人案例(敏感案例标识与本机路径)并被 `origin/staging` 命中,涉及无引用的 `versions/` 三快照、前端 fixture、Python 测试、整机扫描台账、会话转录及上游 SKILL 快照。运行时无特判不用动。产品拍板整体删除不留匿名版;fixture 统一虚构常量;`import_yinduzhanxing.py` 加隐私排除项 + 新增仓库级隐私守卫测试;上游 SKILL 快照等库主清完再重导入(BLOCKED 记录)。上游仓的清理指令另见 `UPSTREAM-INSTRUCTION-owner-case-purge-20260919.md`(交给库主,不在本仓执行)。BUG-972/973 | **已验收通过(2026-09-20`497798ac`);未合入 staging,等产品放行** | 两轮:首轮未通过(1 个隐私守卫冲突:新增路径规则与答案键守卫冲突,该守卫在快速门 glob 内,合入会让门禁红)→ 修复单 `TASK-owner-case-purge-fix2-20260919.md` → `497798ac` 通过。Claude 在 Linux 全依赖环境独立复验:快速门 Python 步 859 passed / 0 failed(上一轮就是这步红),Python 全量 63 红与基线逐条相同、0 新红,收集数与删除清单已记录;tsc 0 / lint 0 error、120 warning 同基线 / `npm test` 失败清单为基线子集(少 1 条工作流 YAML,非回归)/ `○ /` Static、首屏 gzip 与基线字节相同(前端自首轮提交起零改动)。上游指令文件已逐字节还原为基线原文;12 个已删测试名与计数已落进度记录;BLOCKED 两条已划掉。校正 Skill 哈希包、注册表、上游快照、`frontend/src`、主 API 全程 0 改动;库主本机用户名 0 命中。遗留 P3:进度记录和 BUG 状态文字待后续对账修正 |
| `TASK-consult-smalltalk-fastpath-20260920.md` | — | **普通对话寒暄轮快速通道**:真机一句「你好」触发完整窗口排盘(活动面板「已完成 4 步」)+ `## 先回答你的问题` + 400 字判词 + 扣 1 点。三层叠加:`index.ts` 两处「every turn 必调排盘」(BUG-922)与 `contractReady()` 的 `requireTool` 把排盘变成硬合同;`product-voice.ts` OPENER SHAPE 标「三种模式共用」;唯一的 chit-chat 豁免句只在 `natalSpokenReportContract` 里、只拼进本命 Agent(BUG-977)。计费侧「写回复」与「扣点」绑在 `complete_consultation_response` 同一次调用,`cancel` 只退款不写消息,所以今天没有「不扣点但保留对话」的通道。**产品拍板 a:不扣点、不排盘、回一句白话**;**分流不得用正则/关键词/长度阈值**,改为进 Agent 之前一次极短的结构化模型调用(复用本轮已选模型),fail-open 一律落回完整路径;BUG-922/923 的三处合同一个字不改;新增 `complete_consultation_free` 迁移。BUG-976/977 | 待领取 | — |
| `TASK-rectification-validation-integrity-20260920.md` | `PROGRESS-rectification-validation-20260920.md` | **生时校正验证体系补缺(纯离线评测,不改打分不改产品)**:会议要求把「推断真实出生时间」与「用户认可的参考盘」分开证明。核对结论——**产品口径侧四条已落地**(`accepted`≠`confirmed` 两条写入路径、确认门 fail-closed 且 `holdout` 为 `not_ready` 使 `confirmation_allowed` 不可能为真、采用不写 `reported_birth_time`、无任何把采用率当准确率的指标;运行时也无按生日走捷径的分支);**缺口全在评测本身**。三条:① 封存契约 `rectification_sealed_holdout.v1.json` 的三个打分哈希互不相同(封存 `f41c298d` / 契约记录 `99730c84` / 基线实测 `b15d9ea1`),`official_eval_trial_count: 0`——当前实现**从未产出过一次有效官方盲测**,唯一跑过那次已被资料审计作废(top-1 `0.15`,发布门要 `0.60`),可见的 `0.45` 自带「不得当发布指标」标记(BUG-978);② 全部离线评测的候选窗**以真值为圆心**(`_candidate_moments()`、`request_from_case()` 的 `true_time`),生产以申报时间为圆心(`ENGINE_SEARCH_RADIUS_MINUTES = 15`)——「真值掉出窗外」这一失败模式从不可见(BUG-979);③ v3 封存但每例仅 3 事件、v4 有 7+ 事件却已被看过并用于调参,**无口径干净又贴近真实会话的封存集**;六题回放的 `0.80/0.55/0.35` 是「真值方向最优答」的上帝视角上界,±30/±60 仍低于发布门(BUG-980)。T1 申报偏差敏感性 sweep、T2 有效重跑 + 契约对齐 + **防复发新测试**、T3 只出 v5 采集协议、T4 记录。**硬红线:不得改 12 个打分文件、不得用封存集调参、不得把 `status` 改 `ready`。** 家庭信息(父母职业/兄弟姐妹)在拿到基线数字前不开工——现有七领域全是带日期事件,静态属性没有输入口。前置:owner-case-purge 三提交仍未合入 staging。BUG-978980 | **已验收通过(2026-09-20Claude 独立复算)**;独立盲测仍 blocked;门禁/部署待核验 | `932f2fff`。Claude 独立复核:T1 完整重跑 900 组合**逐例 8 字段 0 差异**、summary/specification 全等,另从 900 条逐例重算 45 格表与发布表逐位相同;T2 独立复跑 0.45/0.50/6.45/0/1.0/0.0 与哈希全序 0.05/0.10 全部一致;12 个打分文件字节未动、`status=not_ready`、`confirmation_coverage_rate=0`、实跑 `holdout_passed()`=False;新增/触及 Python 测试本机 38 条全绿;freshness 测试比对时排除 `frozen_at_utc`BUG-693/694 教训已用上)。**执行方正确推翻任务书 T2.3**:「首次口径干净的官方盲测」与 BUG-428 防复发(已看过结果的案例不得再计入盲测)冲突,已核 BUG-428 原文,是任务书写错。环境缺口:本机 frontend 无 node_modulestsc/lint/npm test/build 未能复核,采信执行方自报。遗留 → `TASK-rectification-cross-midnight-dasha-20260920.md`BUG-981 |
| `TASK-rectification-cross-midnight-dasha-20260920.md` | — | **跨午夜候选的 Dasha 边界错一天(生产打分)**:`scoring_service.py` 调 `merge_transition_proximity()` 只传**一个** `birth_date`,该函数用它算全部候选的 Vimshottari / Narayana 起始日期,候选之间只靠 `_context_time()` 的 `HH:MM` 区分、**日期被丢掉**。窗口跨午夜时午夜后候选的 dasha 边界整体错一天。Claude 验收时在生产调用链独立复现:窗口 `23:50→00:10`、21 个候选,**恰好那 11 个跨日候选分数错、10 个同日候选逐位相同**(幅度 +0.0267 / −0.0133,本例头名未变)。算术上界 = `cap/kernel_width`day 精度 0.067 分/件,18 件可累计约 1.2 分,而随分钟变化项总量仅约 2.1 分 —— **上界是推的不是实测,真实幅度本单必须实测**。踩中路径:`late_night` 时段 `23:0003:59`、`unknown` `00:0023:59`、23:45 后或 00:15 前申报的 ±15 窗。连带发现:`calculation_spec()` 不含打分实现身份,修复后同一 spec hash 对应不同分数,历史 Case 静默失去可复现性(同 BUG-427 类型)。**本单会改生产打分,与验证补缺单的红线相反,§3 三个待决点(修不修 / 要不要重新冻结重跑 / 历史 Case 怎么办)未由产品填答不得开工。**硬红线:只改「按候选日期取 dasha 起始」,不得动 kernel/cap/share 任一常数;确认门不变。BUG-981 | **待产品拍板** | — |
| `TASK-rectification-cross-midnight-dasha-20260920.md` | — | **跨午夜候选的 Dasha 边界错一天(生产打分)**:`scoring_service.py` 调 `merge_transition_proximity()` 只传**一个** `birth_date`,该函数用它算全部候选的 Vimshottari / Narayana 起始日期,候选之间只靠 `_context_time()` 的 `HH:MM` 区分、**日期被丢掉**。窗口跨午夜时午夜后候选的 dasha 边界整体错一天。Claude 验收时在生产调用链独立复现:窗口 `23:50→00:10`、21 个候选,**恰好那 11 个跨日候选分数错、10 个同日候选逐位相同**(幅度 +0.0267 / −0.0133,本例头名未变)。算术上界 = `cap/kernel_width`day 精度 0.067 分/件,18 件可累计约 1.2 分,而随分钟变化项总量仅约 2.1 分 —— **上界是推的不是实测,真实幅度本单必须实测**。踩中路径:`late_night` 时段 `23:0003:59`、`unknown` `00:0023:59`、23:45 后或 00:15 前申报的 ±15 窗。连带发现:`calculation_spec()` 不含打分实现身份,修复后同一 spec hash 对应不同分数,历史 Case 静默失去可复现性(同 BUG-427 类型)。**产品 2026-09-20 已就三点拍板:A 修、B 修完重新冻结重跑 T1/T2、C 让新旧结果可区分。** C 的做法经查证已修正:`calculation_spec_hash` 全在 **V4** 链路、**V9 零引用**,原提案 bump `INPUT_CONTRACT_VERSION` 对真实历史无效已作废;改为随修复 bump `engine_version``v9EngineVersion()` 缺省串,全仓只写不比、无相等性门控),**不得动 `skill_version`**BUG-621open RPC 要求绑定 Skill 等于当前版本,bump 会让历史校正打不开)。硬红线:只改「按候选日期取 dasha 起始」,不得动 kernel/cap/share 任一常数;确认门不变。BUG-981 | **待领取**(产品已放行) | — |
## 命名与归档
@@ -1,6 +1,6 @@
# TASK · 跨午夜候选的 Dasha 边界错一天(生产打分,2026-09-20)
> 状态:**待产品拍板后才可开工**。本单会**改动生产打分结果**,与 `TASK-rectification-validation-integrity-20260920` 的「不改打分」红线相反,必须由产品显式放行(§3 有三个待决点)
> 状态:**待领取**。本单会**改动生产打分结果**,与 `TASK-rectification-validation-integrity-20260920` 的「不改打分」红线相反;产品已于 2026-09-20 就三点全部拍板放行,见 §3
> 起因:执行 BUG-979 偏差评测时,独立审查在离线适配层发现该问题;Claude 2026-09-20 验收时在**生产调用链上独立复现**。
## 0. 基线与交付
@@ -62,11 +62,19 @@ merge_transition_proximity(matrix_payload, scoring_request["events"],
该事实目前**只写在 `BUG-979` 的「独立审查追加」一行**与 `BLOCKED.md` 里,没有独立编号、没有 `investigating` 状态。`BUG-979` 自身是 `resolved`,其正文已声明「resolved 仅指离线缺少偏差维度的缺口……不代表生产跨日问题已修」。按 `AGENTS.md` §5.4,已确认事实必须有自己的记录与状态。
### 1.6 历史结果不可复现(连带发现
### 1.6 生产结果没有打分实现身份(连带发现,2026-09-20 修正
`scripts/rectification/scoring_service.py``calculation_spec()` 写入 `version` / `birthDate` / `candidateRange` / 经纬度 / 时区 / ayanamsa / nodeMode / minuteStep**不含打分实现身份**。`api_service.py` 用它算 `calculation_spec_hash` 并随结果落库
**先更正一条**`scripts/rectification/scoring_service.py``calculation_spec()` 与随结果落库的 `calculation_spec_hash`,其消费方全部在 **V4** 链路(`frontend/supabase/migrations/20260726020000_birth_time_rectification_v4.sql``frontend/src/mastra/rectification-tools.ts`)。**生产跑的是 V9V9 对 `calculation_spec_hash` 零引用**(已全仓检索确认)。因此「bump `INPUT_CONTRACT_VERSION` 以区分新旧结果」对真实用户历史无效,不要做
因此修复打分后,**同一个 `calculation_spec_hash` 会对应不同的分数**,历史 Case 静默失去可复现性。这与 `BUG-427` 的防复发条(「评测指标必须与产生它的 `implementation_sha256` 绑定记录」)是同一类问题,只是发生在生产结果侧而非评测侧。
V9 的真实情况:
| 字段 | 来源 | 是否被相等性门控 |
| --- | --- | --- |
| `skill_version` | Skill 包版本 | **是**`BUG-621`open RPC 要求绑定 Skill 等于当前版本,bump 会让历史校正打不开 |
| `engine_version` | `frontend/src/lib/rectification-agentic/v9/engine-client.ts``v9EngineVersion()`=环境变量 `RECTIFICATION_ENGINE_VERSION`,缺省 `"rectification-v5"` | **否**。全仓只写不比,无任何 `===` / SQL 相等判断 |
| 打分实现身份(如 12 文件的 `implementation_sha256` | **不存在** | — |
所以修复打分后,V9 历史结果与新结果在回执里**没有任何可区分的标记**。这与 `BUG-427` 的防复发条(「评测指标必须与产生它的 `implementation_sha256` 绑定记录」)是同一类问题,只是发生在生产结果侧而非评测侧。
## 2. 根因
@@ -74,16 +82,17 @@ merge_transition_proximity(matrix_payload, scoring_request["events"],
2. 全仓没有一条跨午夜窗口的**打分层**回归。`BUG-098` 记录里「跨午夜兼容」指的是**逐分钟枚举**transition proximity 是后加的层,没有被那条覆盖。`tests/` 下无任何 transition / proximity 命名的测试文件。
3. 生产结果的可复现性只绑定输入规格,不绑定打分实现身份,所以打分变更不会触发任何告警。
## 3. 决策记录**三个待决点,未拍板不得开工**
## 3. 决策记录
- **A. 修不修?** 修复会改变跨午夜窗口下所有候选的分数,可能改变头名、并列关系与交付区间。不修则该缺陷继续存在于 `late_night``unknown` 与深夜申报路径。
- Claude 建议:**修**。它是确定性错误,不是精度取舍。
- **B. 修完要不要重新冻结并重跑 T1/T2?** `932f2fff` 的 900 组合与 v3 重跑成绩是用**当前(有缺陷的)**实现算的。修复后那些数字与实现不再对应。
- Claude 建议:**要**。否则刚刚建立的「成绩必须可归属到实现哈希」这条纪律当场破功。重跑成本已实测:T2 约 10 秒,T1 全量 900 组合约 4 分钟。
- **C. 历史已交付 Case 怎么处理?** 见 §1.6。三条路:(c1) 在 `calculation_spec` 里加打分实现身份并 bump `INPUT_CONTRACT_VERSION`,让新旧结果显式可区分;(c2) 只加身份字段不 bump,老结果标为「按旧实现产出」;(c3) 不动,接受静默分歧。
- Claude 建议:**c1**。但它会让所有历史 Case 的 spec hash 变化,需确认不会影响历史会话打开(参照 `BUG-621` 的教训:版本绑定改动曾让历史校正打不开)。
**2026-09-20 产品负责人已就三点拍板,本单可以开工。**
以上三点由产品负责人在领取前填答;未填答的项,执行方**不得**自行假设
- **A. 修不修?→ 修。** 修复会改变跨午夜窗口下所有候选的分数,可能改变头名、并列关系与交付区间。产品接受这一影响:它是确定性错误,不是精度取舍
- **B. 修完要不要重新冻结并重跑 T1/T2?→ 要。** `932f2fff` 的 900 组合与 v3 重跑成绩是用有缺陷的实现算的,修复后不再对应。重跑成本已实测:T2 约 10 秒,T1 全量 900 组合约 4 分钟。旧数字保留并标注作废原因,不删除历史。
- **C. 历史已交付 Case 怎么处理?→ 让新旧结果可区分,但挂在 `engine_version` 上。**
- 原始提案(改 `calculation_spec` 并 bump `INPUT_CONTRACT_VERSION`)**已作废**:§1.6 查证表明那条链路属 V4,生产 V9 零引用,改了对真实历史无效。
- 采纳做法:随修复 bump `engine_version``v9EngineVersion()` 的缺省串,或部署侧 `RECTIFICATION_ENGINE_VERSION`),使修复前后的 V9 回执可区分。该字段全仓只写不比,bump 不影响历史会话打开。
- **不得 bump `skill_version`**`BUG-621`open RPC 要求绑定 Skill 等于当前版本,bump 会让历史校正打不开)。
- 是否把 12 文件的 `implementation_sha256` 也写进 V9 回执,作为可选增强;若做,必须是新增字段,不得改动既有字段的含义或类型。
## 4. 硬红线
@@ -118,7 +127,7 @@ merge_transition_proximity(matrix_payload, scoring_request["events"],
### T3 · 按决策 B 重新冻结与重跑
仅在产品对 §3-B 答「要」时执行:
产品已答「要」,本项必做。
- 重新计算 12 个 `frozen_scoring.files` 的实现哈希(修复若落在这 12 个文件内,哈希会变;若落在之外,需在报告里说明为何成绩仍变)。
- 重跑 `scripts/research/sealed_holdout_rerun.py``scripts/research/reported_offset_sweep.py`,更新两份研究文档与 JSON,**旧数字保留并标注作废原因**,不删除历史。
@@ -126,11 +135,16 @@ merge_transition_proximity(matrix_payload, scoring_request["events"],
验收标准:`tests/test_sealed_holdout_contract_freshness.py` 绿(它会因哈希漂移而红,这正是它存在的意义);两份研究文档的口径块含新哈希;`official_valid_independent_blind``false`
### T4 · 按决策 C 处理历史可复现性
### T4 · 按决策 C 给结果加可区分标记
仅在产品对 §3-C 答 c1 或 c2 时执行。c1 需额外验证:历史校正会话仍能打开(参照 `BUG-621`)。
- bump `engine_version`:改 `frontend/src/lib/rectification-agentic/v9/engine-client.ts``v9EngineVersion()` 缺省串(或与部署侧 `RECTIFICATION_ENGINE_VERSION` 协同,二选一并在进度记录写明选了哪个及原因)。
- **不得**改 `skill_version`**不得** bump `INPUT_CONTRACT_VERSION`(见 §1.6,那是 V4 死链路)。
- 可选增强:在 V9 回执新增打分实现身份字段。做则必须是新增字段,不得改既有字段含义或类型。
验收标准:按所选方案给出对应证据;c1 必须有「历史 Case 可打开」的定向测试。
验收标准:
- 修复后新建 Case 的回执 `engine_version` 为新值,历史 Case 回执保留旧值。
- **历史校正会话仍能打开**`BUG-621` 的定向回归必须跑,结果贴进度记录)。
- 全仓确认 `engine_version` 仍无相等性门控——若本单引入了任何按它比较的逻辑,视为越界。
### T5 · 记录
@@ -144,8 +158,8 @@ merge_transition_proximity(matrix_payload, scoring_request["events"],
## 6. 让步顺序
1. **最先保 T1 + T2**:失败测试与修复本身。没有 T1 就没有证据证明修对了。
2. 其次 T3(重跑)。若产品对 B 答「暂不重跑」,则必须在两份研究文档顶部加一行「本文数字产出自已修复前的实现」,不得留着不说。
3. T4 可以独立成单往后排,但 §1.6 必须`BUG-981` 正文,不得因为不做就不记
2. 其次 T3(重跑,产品已拍板必做)。确实跑不完时,必须在两份研究文档顶部加一行「本文数字产出自已修复前的实现」,不得留着不说。
3. T4 `engine_version` bump 不可砍(产品已拍板 C);可选的「回执加打分实现身份」可砍,砍了要在 §1.6 的事实`BUG-981` 正文。
4. **不得砍掉 T2 的「非跨午夜窗口分数逐位不变」回归。** 砍了它,这次修复就无法与打分权重变更区分开。
## 7. 开工前置命令