docs(tasks): rectification grounding acceptance
Co-Authored-By: Claude Opus 5.5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_017eEAG8HD3mm8gsKXgk8uU8
This commit is contained in:
co-authored by
Claude Opus 5.5
parent
2efe225863
commit
261d7b2e04
@@ -132,3 +132,9 @@ BUG-588 原测试(`rectification-probe-replay-loss-20260908`)、BUG-593 原
|
||||
|
||||
- 无 Docker:24 条 DB / 部署套件失败,与基线逐条一致(见上)。
|
||||
- 无真实模型凭据:真实模型下的旁白质量、`delivers_range_this_turn` 时的三句写法,需部署后按 `docs/testing/rectification-grounding-20260927.md` 走真机。
|
||||
|
||||
## 验收(Claude,2026-09-27)
|
||||
|
||||
基于 `19376089` 独立复跑(Node 22.14):tsc 0;lint 0 error;`npm test` 4152 / 24 fail / 28 skip,失败名单与 `cd4dde9d` 基线逐条一致;消失的 11 个测试名 = 随重试功能删除的 `rectification-v9-regenerate.test.ts` 8 条 + 3 条改名(有三栏说明);Python 门禁集退出 0;`/`、`/chart`、`/ephemeris`、`/people` ○ Static;rootMainFiles gzip(level 9)130933 B。未碰 `.gitea/`、`vendor/`、`deploy/`、迁移、任何 Python;删除的 3 个文件均为校正重试功能本身,源码里已无校正重试引用,普通对话重试按钮由 `onRegenerate` 控制仍在。数据库函数 `regenerate_agentic_rectification_turn` 保留,待另开单退役。
|
||||
|
||||
观察(不阻塞):数字白名单会把模型复述用户经历里自带的钟点(如「10:30 手术」)那一整句丢掉、由服务端 recap 顶上,措辞会略生硬;真机若常见再调。
|
||||
|
||||
@@ -36,7 +36,7 @@
|
||||
| 任务书 | 进度 | 主题 | 状态 | 落点 |
|
||||
| --- | --- | --- | --- | --- |
|
||||
| `TASK-rectification-fewer-probes-card-20260926.md` | [PROGRESS](PROGRESS-rectification-fewer-probes-card-20260926.md) | **减少无效追问 + 卡片区间为主**:引导补件离线新增达标 0 → 上限 6→2、定向题问完门槛未达直接出卡;卡片区间为主标题、代表分钟副标题,第一二名差距 ≥5 个百分点才显示百分比,否则写「目前区分不开」。不放宽任何置信度。先做 | 已验收(真机清单欠) | `4e6e8d87` + 验收补改 `7203d94e`(区分不开时隐藏「最可能」),deploy-staging run 2933 已部署;回放真值 ±30/±60 19→20、宽度中位 ±1 分钟、提问 11.4→7.8;Skill 10.0.30;真机清单 `docs/testing/rectification-fewer-probes-card-20260926.md` 未走 |
|
||||
| `TASK-rectification-grounding-20260927.md` | `PROGRESS-rectification-grounding-20260927.md` | **生时校正旁白事实有据 + 去重试 + 资料瘦身**:服务端范围句被裁句裁掉(BUG-1055,复发自 588);重试按钮盲写不校验→校正里下线(1056);read-case 超限先删对话记忆(1057);点选题带经历时范围变化无人说(1058);offer/compare 剥离推断前数据、报告去重;Skill 按轮次切片、关 skills 注入 | 待验收 | `codex/rectification-grounding-20260927` 本地提交 T1–T7(未推送);BUG-1055~1058;Skill 不 bump;见 PROGRESS |
|
||||
| `TASK-rectification-grounding-20260927.md` | `PROGRESS-rectification-grounding-20260927.md` | **生时校正旁白事实有据 + 去重试 + 资料瘦身**:服务端范围句被裁句裁掉(BUG-1055,复发自 588);重试按钮盲写不校验→校正里下线(1056);read-case 超限先删对话记忆(1057);点选题带经历时范围变化无人说(1058);offer/compare 剥离推断前数据、报告去重;Skill 按轮次切片、关 skills 注入 | 已验收(真机欠) | `0e0baaa7`…`2efe2258`;BUG-1055~1058;固定开销 12.0K→6.5K token、offer 100K→28.8K 字节;Skill 未 bump |
|
||||
| `TASK-rectification-telemetry-20260926.md` | [PROGRESS](PROGRESS-rectification-telemetry-20260926.md) | **匿名聚合统计**:每会话一行只存数字 / 枚举(题数分类、宽度、差距、停止原因、门槛达标、耗时、版本),管理后台只看汇总、保留 180 天;动表须 test:db。排在 fewer-probes 后 | 已验收(后台登录走查欠) | `d0bfc1fc`,门禁 run 2938 含真实 PG 测试通过、migrate 2940、deploy 2941(`e801fcf5`);只存数字/枚举、不存用户 id;后台「校正统计」页 |
|
||||
| `TASK-rectification-offline-research-20260926.md` | `PROGRESS-rectification-offline-research-20260926.md` | **三项离线研究**:答错 1–2 题的容错、V1/V2 分盘配权正确重跑、改正「1 分钟≈1.1 天」(实测中位 3.8 天)并核实 `_representative_pairs` 推断。不改线上。结论(`docs/research/rectification_offline_research_2026_09_26.md`):R1 答错 1 题真值在区间 98–100%、头名降三到四成,答错 2 题 ±30/±60 挤出 7–10%(两道反答=8 分=淘汰线);R2 权重生效,V1/V2 在 ±30/±60 按定义恒等、±10 六题后指标不变 → `no_benefit`(已实测);R3 3.8 天/分钟复现,45 天闸≈8–34 分钟,`_representative_pairs` 推断被推翻(全配对题数不变,卡在逐月评估),另记 BUG-1048 `investigating`(闸门跨年豁免 + zip 错位)。三项均不建议立实现单 | 已验收 | `0f5442ce`(纯研究,不改线上);三项均不立实现单:答错 2 题 ±30 真值入区间 0.93、V1/V2 no_benefit、每分钟边界位移中位 3.82 天(勘误 5 份文档);新发现 BUG-1048 出题闸门两处漏洞待产品决定 |
|
||||
| `TASK-rectification-code-split-20260926.md` | `PROGRESS-rectification-code-split-20260926.md` | **代码拆分(只搬不改)**:聊天组件 2043 行 / 35 useState、`POST` 926 行、`runV9AgentTurn` 1047 行,269 处切源码测试;拆分 + 增长合同 + 切片测试改调用函数。排在 fewer-probes、telemetry 之后 | 已验收 | `3a66c39f` 组件 / `eb773f12` 路由 / `a00c40d4` agent-run;组件本体 1625→630、useState 35→12、POST 927→114、runV9AgentTurn 1046→25;增长合同 8 条 |
|
||||
|
||||
Reference in New Issue
Block a user