docs(tasks): briefs for holdout v5 expansion and scoring-method research (BUG-1090/1091 reserved)
Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_017eEAG8HD3mm8gsKXgk8uU8
This commit is contained in:
co-authored by
Claude Fable 5.1
parent
b9133154da
commit
5febb11159
@@ -254,6 +254,8 @@
|
||||
| `TASK-self-edit-avatar-menu-20260928.md` | `PROGRESS-self-edit-avatar-menu-20260928.md` | **本人可编辑 + 各页头像菜单 + 报告页去说明**:`/people` 本人可编辑出生资料(BUG-1081,`ab6c55f8` 漏掉);次级页头像弹同一账户菜单、弹窗项跳 `/?account=`;我的报告删顶部说明与统计 | 已实现待验收(分支 `codex/self-edit-avatar-menu-20260928`,未推送) | BUG-1081 |
|
||||
| `TASK-mobile-chart-and-confirmed-edit-20260929.md` | `PROGRESS-mobile-chart-confirmed-edit-20260929.md` | **手机星盘 + 确认时间可改 + 天空定格**:iPhone 星盘被宽表撑出屏幕(BUG-1083);confirmed 状态改声明字段也重置排盘时间(推翻 BUG-264 约定);「那一刻的天空」改为重放汇聚→定格→右上角分享;去掉报告星图封面 | 已验收(Claude 2026-09-29),已推 staging | BUG-1083 |
|
||||
| `TASK-rectification-futile-collect-stop-20260929.md` | `PROGRESS-rectification-futile-collect-stop-20260929.md` | **生时校正停掉无效补经历循环(止血)**:打字经历不收窄(BUG-560 后果),流程却一路索要,真机 22 件整窗不动;采集只为开闸、门开后只问点选卡问完即出卡;交付正文去吻合率;多段时旁白误报「范围没变」;交付轮带采集题 | 已验收(Claude 2026-09-29 合并验收:全量前端 4302/24 与基线同 24 条环境失败、tsc 0、lint 0 error、`/` Static、gzip +0.16%、快速门 pytest 1001 passed、两份回放复跑一致),待部署核对 | BUG-1084~1087 |
|
||||
| `TASK-rectification-holdout-expansion-20260929.md` | — | **开放评价集扩到 ≥60 例(v5)**:所有打分判定都在 20 例上做,1 例 = 5pp,KP / 精度闸 / V1n 的 no_benefit 都只差 1–3 例。只用 Rodden AA 公开名人,事件人工核对出处,分层(年代 / 纬度 / 南半球 / 跨午夜 / UTC+8),v4 不动;基线成绩单 v4 子集须与已发布数字逐格一致。研究单的判定以 v5 为准 | 待领取 | — |
|
||||
| `TASK-rectification-scoring-research-20260929.md` | — | **打分方法研究(离线)**:R-A 似然比校准权重(leave-one-case-out,KP / Pranapada / D60 作为特征由数据定权重、允许负权重)、R-B 缺席证据(口述时间线覆盖时段内的空白年扣分,必测漏说稳健性)、R-C 精度追问可行性(对已说事件追问月份,算在定向追问 2 条额度内)。判定必须在 v5 上做;有收益才立实现单并按 ERR-110 重冻结 | 待领取(脚手架可先在 v4 上开发) | — |
|
||||
| `TASK-rectification-typed-event-scoring-research-20260929.md` | `PROGRESS-rectification-typed-event-research-20260929.md` | **打字经历按选择题规则计分(离线研究,不上线)**:计分通道不对称 + 已入账年份挡题;R0 学业质量题措辞 / 年精度显示成 1 月(冻结文件,需重新冻结) | 已验收(Claude 2026-09-29 合并验收:全量前端 4302/24 与基线同 24 条环境失败、tsc 0、lint 0 error、`/` Static、gzip +0.16%、快速门 pytest 1001 passed、两份回放复跑一致),待部署核对 | BUG-1088、1089 |
|
||||
| `TASK-serif-headings-20260928.md` | `PROGRESS-serif-headings-20260928.md` | **全站标题改用自托管宋体、正文保持黑体**:产品推翻 BUG-737「CJK 不用衬线」结论(保留「声明的字体必须可加载」「不落系统宋体」两条);Noto Serif SC SemiBold 按通用规范汉字表 6500 字 unicode-range 切片自托管(改名 Jyotisha Serif SC),swap 不 preload;首页宋体流量 ≤300 KB;先于天空封面单 | 已实现待验收(分支 `codex/serif-headings-20260928`,未推送) | 不开新 BUG;BUG-737 追加说明 |
|
||||
| `TASK-cend-ui-claude-alignment-20260916.md` | `PROGRESS-cend-ui-r1/r2/r3-20260916.md` | **C 端界面向 claude.ai 产品界面对齐(三轮串行 R1→R2→R3,都动 `globals.css`,不得并行)**:根因是 `frontend/CLAUDE_DESIGN.md` 扒的是 **claude.com 营销官网**,它自己在 Known Gaps 里写明 claude.ai 产品界面不在范围内,而 `DESIGN.md:3` 把它当成了产品界面的实现契约。**R1**:`--font-display` 里 Tiempos Headline / StyreneB **从未加载**(无 `@font-face`、`public/` 无字体、`layout.tsx` 只 vendor 了 Inter),中文标题全站落到 **宋体 / SimSun**,波及 20 处含助手回答的 h2/h3(BUG-737);亮色强调色 `#85432f` 与暗色 `#d78064` 不同源,产品拍板亮色换 **Claude coral `#cc785c`**,**易漏点**是 `globals.css:16` 的 `--color-ring` 硬编码在 `@theme inline` 里不跟随 `:root`,另有第四个 `:root` 亮色块(`:4358`)必须同步(BUG-738);`.composer-footer` 常驻 44px + 顶栏 68px + `--composer-reserve` 148px,每屏固定吃掉 216px,模型选择器移进输入框内部、删掉底栏、顶栏收到 46px 并删「分析对象」副标题。**R2**:空状态是营销落地页(hero 卡 + 两张 132px 入口大卡 + 3 列 156px 主题卡),输入框被压在 **800px 以上**内容之下,重排成「问候 + 居中输入框 + 两枚入口 pill + 一排 chip」。**R3**:侧栏两个 `<details>` 拍平成一条「最近」、星盘的两个入口(侧栏分组 + 账户菜单)收敛到一处、删掉逐条助手头像。**决策记录 D3 推翻 DESIGN.md「报告强调色与应用同源」一句**(报告刻意保留深棕)。原型图 https://claude.ai/code/artifact/da275da6-2954-4f50-99aa-32bb8694d38b(三套画面 + 明暗,页面标题就是建议字体栈的实际渲染)。环境缺口:无登录态无 Chrome,四项真机观感留 `docs/testing/`。BUG 段 737–738 | 待领取 | — |
|
||||
|
||||
@@ -0,0 +1,83 @@
|
||||
# TASK · 生时校正:把开放评价集从 20 例扩到 ≥60 例(v5,2026-09-29)
|
||||
|
||||
## 基线
|
||||
|
||||
- `origin/staging` @ `b9133154`(写作时 head;开工时以最新 `origin/staging` 为准)。
|
||||
- 分支 `codex/rectification-holdout-expansion-20260929`,工作树 `.worktrees/rectification-holdout-expansion-20260929`。
|
||||
- **串行关系**:本单是 `TASK-rectification-scoring-research-20260929.md` 的前置。研究单的脚手架可以在 v4 上并行开发,但它的任何"过门 / 不过门"判定必须在本单交付的 v5 上做。
|
||||
- 本单**不改任何生产代码**,不动 `scripts/research/sealed_holdout_rerun.py::PRODUCTION_FILES` 的 10 个冻结文件与 `frozen_scoring.files`(ERR-110)。
|
||||
|
||||
## 事故实证
|
||||
|
||||
生时校正打分方法的每一次"过门 / 不过门"都是在 20 例上判的(`references/real_case_calibration/minute_rectification_holdout_v4.json`,20 例公开 Rodden-AA,84 件年精度 + 59 件日精度事件)。20 例上 1 例 = 5 个百分点:
|
||||
|
||||
| 判定 | 数字 | 实际差几例 |
|
||||
| --- | --- | --- |
|
||||
| KP 宫头子主计分(R3,09-14)判 no_benefit | ±10 头名 0.35 → 0.20 | 3 例 |
|
||||
| 精度分档闸门(09-15)判 no_benefit | ±10 头名 0.80 → 0.75 | 1 例 |
|
||||
| V1n 分盘配权(09-26)判 no_benefit | ±10 头名 0.80 → 0.85,±60 宽度 56 → 73 | 1 例 / 若干例 |
|
||||
| W3 分位区间(09-14)按红线不放行 | ±30 一例真值被挤出 | 1 例 |
|
||||
|
||||
这些判定都可能是对的,但都在噪声线上。定论页 `docs/research/rectification_minute_resolution_closure_2026_09_14.md` 的"已证伪"结论,其证据强度同样只有 20 例。
|
||||
|
||||
## 根因
|
||||
|
||||
v4 继承 v3 的 20 例名单(`docs/research/holdout_v4_build_2026_09_14.md`),只补了事件数与领域数,没有扩例数。没有一份 ≥60 例、事件与出处经人工核对、口径与本仓一致(ayanamsa `raman`、node mode `mean`)的公开评价集。
|
||||
|
||||
## 决策记录(产品 2026-09-29)
|
||||
|
||||
- **批准**扩建到 **≥60 例**(目标 80 例),新建 v5,v4 原文件不动(旧研究复跑仍要逐字节一致)。
|
||||
- v5 是**开放评价集**(`truth_hidden_from_ranker=false`),用来量尺度、做留一法校准;不是封存盲测。封存盲测(`sealed_holdout_rerun.py`)与 reported-offset 记录不因本单改变。
|
||||
- **只用公开名人**:Astro-Databank Rodden **AA** 级(出生证 / 医院记录)。不得选入本仓任何真实用户、库主、协作者或其亲友;不得用 A/B/C/DD 级。
|
||||
- 事件抽取允许用模型起草,但**每条事件必须人工核对**来源页并记录 URL;模型草稿不得直接进数据集。
|
||||
- 本单不改打分、不改闸门、不改任何常数;不得因 v5 上的基线成绩单而顺手调参。
|
||||
|
||||
## 硬红线
|
||||
|
||||
1. 隐私:只用公开名人;`tests/test_repo_privacy_markers.py` 全绿;数据集不得含任何真实用户资料。
|
||||
2. 出生资料:出生时间、地点、时区逐例回到 Astro-Databank 页核对,记录 AA 等级与页面 URL;时区/夏令时按当地历史规则换算,写明依据(v3 曾有两处日期错,见 `holdout_v4_build_2026_09_14.md`)。
|
||||
3. 事件:每例 ≥7 件带年月事件、≥4 个领域,字段与 v4 schema 一致(`domain` / `precision` / `date` / `source_url` / `independent_of_birth_source=true`);事件出处必须独立于出生资料来源。
|
||||
4. 分层:名单要覆盖 —— 出生年代 ≥3 个年代段;纬度带 ≥3 档(|φ| <25° / 25–45° / >45°);南半球 ≥8 例;出生时间落在 22:00–02:00 的 ≥6 例(跨午夜路径,BUG-981~985);北京时区(UTC+8)≥6 例(本产品主要用户)。不满足分层要求写进 PROGRESS,不得静默。
|
||||
5. 基线成绩单必须能复现旧数字:v5 的 v4 子集在 `minute_resolution_sweep.py` / `cluster_width_probe.py` 上跑出的三档头名、覆盖、宽度、并列率必须与 09-14 / 09-26 已发布的数字逐格一致;不一致先查口径,不得改旧文档。
|
||||
6. 生产代码零改动;`run_quality_gate.py --profile quick` 与开工基线逐条一致。
|
||||
7. `PYTHONHASHSEED=0`(ERR-111)。
|
||||
|
||||
## 任务分解
|
||||
|
||||
- **T1 选例协议与名单(BUG-1090)**
|
||||
- 写 `docs/research/holdout_v5_protocol_2026_09_29.md`:入选标准、分层配额、排除规则(同一家族多人只取一人;出生时间"rectified"或"from memory"一律排除)、来源记录格式。
|
||||
- 名单 ≥60(含 v4 的 20 例),每例:姓名、Astro-Databank URL、AA 等级、出生日期/时间/地点/时区依据。
|
||||
- 验收:名单文件 `references/real_case_calibration/holdout_v5_roster.json`;分层统计表进 PROGRESS;隐私守卫全绿。
|
||||
- **T2 事件抽取与核对**
|
||||
- 每例 ≥7 件、≥4 领域;领域用 `scripts/active_rectification_event_engine.py::DOMAIN_CONFIG` 的键;精度诚实标注(year / month / day),不得把"某年"写成"某年 1 月"。
|
||||
- 每条事件记录 `source_url` 与核对人;模型草稿另存 `_draft`,不进数据集。
|
||||
- 验收:schema 校验测试 `tests/test_holdout_v5_schema.py`(字段、精度、领域、每例计数、URL 非空、`independent_of_birth_source` 全真);抽样 10% 由 Claude 验收时二次核对来源页。
|
||||
- **T3 构建脚本**
|
||||
- `scripts/research/holdout_v5_build.py`:从 roster + 事件文件生成 `references/real_case_calibration/minute_rectification_holdout_v5.json`,三档半径写在数据集上,口径字段(ayanamsa / node mode / 步长)显式写入。
|
||||
- 验收:两次构建逐字节一致;v4 的 20 例在 v5 中的出生资料与事件与 v4 逐字段一致(新增事件除外)。
|
||||
- **T4 基线成绩单**
|
||||
- 线上算法在 v5 上跑 `minute_resolution_sweep.py`(五指标)与 `cluster_width_probe.py`(含淘汰的六题回放:头名、真值在区间、宽度中位、并列率、熵降),三档半径。
|
||||
- 另按 `futile_collect_stop_replay.py` 口径跑 truth / opposite 六格。
|
||||
- 验收:JSON 进 `docs/research/holdout_v5_baseline_2026_09_29.json`;v4 子集数字与已发布数字逐格一致(硬红线 5);全集数字进 PROGRESS 表。
|
||||
- **T5 文档**
|
||||
- `docs/research/holdout_v5_build_2026_09_29.md`(协议、分层统计、与 v4 差异、基线成绩单、复跑命令);`docs/research/ACTIVE_FRONTS.md` 加索引;定论页 §7 之后追加"§8 v5 已建,后续判定以 v5 为准"。
|
||||
- 验收:文档齐;`docs/tasks/README.md` 状态板更新。
|
||||
|
||||
## 让步顺序
|
||||
|
||||
T1 > T2 > T3 > T4 > T5。**例数 < 40 不算完成**,40–59 例可先交付一版并在 PROGRESS 写明缺口与下一批计划;研究单的判定等到 ≥60 例。
|
||||
|
||||
## 开工前置命令
|
||||
|
||||
```bash
|
||||
git fetch origin --prune
|
||||
git worktree add -b codex/rectification-holdout-expansion-20260929 .worktrees/rectification-holdout-expansion-20260929 origin/staging
|
||||
cd .worktrees/rectification-holdout-expansion-20260929
|
||||
export PYTHONHASHSEED=0
|
||||
.venv/bin/python -m pytest tests/test_repo_privacy_markers.py tests/test_minute_resolution_research.py tests/test_cluster_width_research.py -q # 基线
|
||||
.venv/bin/python scripts/research/minute_resolution_sweep.py --help
|
||||
```
|
||||
|
||||
## BUG 编号
|
||||
|
||||
开工时核对 `docs/BUG_HISTORY.md` 最大号(写作时 `BUG-1089`)。本单:**BUG-1090**(评价集 20 例欠力,所有打分判定在噪声线上)。由执行方以 `investigating` 登记,v5 交付后改 `resolved`,证据是 T4 成绩单与 T2 schema 测试。关联 BUG-560、BUG-1089。
|
||||
@@ -0,0 +1,99 @@
|
||||
# TASK · 生时校正打分方法研究:似然比权重 / 缺席证据 / 精度追问(研究单,2026-09-29)
|
||||
|
||||
## 基线
|
||||
|
||||
- `origin/staging` @ `b9133154`(写作时 head;开工时以最新 `origin/staging` 为准)。
|
||||
- 分支 `codex/rectification-scoring-research-20260929`,工作树 `.worktrees/rectification-scoring-research-20260929`。
|
||||
- **串行关系**:脚手架(研究计分器、特征抽取、留一法框架)可以先在 v4 上开发调试;**R-A / R-B / R-C 的任何"有收益 / 无收益"判定必须在 `TASK-rectification-holdout-expansion-20260929.md` 交付的 v5(≥60 例)上做**。v5 未交付时只能写 `pending_v5`,不得在 v4 上下结论。
|
||||
- 本单是**离线研究**:不改任何生产代码,不动 `sealed_holdout_rerun.py::PRODUCTION_FILES` 的 10 个冻结文件。研究计分器按 09-26 做法独立实现,并与线上 `score_candidates` 在 v4 上**逐分对账**后才算可信。
|
||||
|
||||
## 先读
|
||||
|
||||
- `docs/research/rectification_minute_resolution_closure_2026_09_14.md`(定论页,含 §7 勘误)
|
||||
- `docs/research/rectification_offline_research_2026_09_26.md`
|
||||
- `docs/research/rectification_typed_event_scoring_2026_09_29.md`
|
||||
- `docs/research/pre_work_error_ledger.md` ERR-110 / ERR-111
|
||||
|
||||
## 事故实证
|
||||
|
||||
产品 2026-09-29 staging 真机:31 分钟窗,开场 12 件带年份经历,答约 10 张卡,范围整窗不动(止血单 BUG-1084~1087 已处理流程层)。离线事实:
|
||||
|
||||
| 事实 | 数字 | 出处 |
|
||||
| --- | --- | --- |
|
||||
| 引擎原始分头名簇命中(v4,±10/±30/±60) | 0.35 / 0.15 / 0.10;随机水平约 0.09 / 0.03 / 0.02 | 定论页 §1.4 |
|
||||
| 按真值方向答六张卡后 | 0.80 / 0.55 / 0.35 | 同上 |
|
||||
| 六题后交付宽度中位 | 15 / 33 / 56 分钟 | 定论页 §1.1 |
|
||||
| 打字经历按选择题规则计分(R1,09-29) | 57 件日精度经历只有 4 / 9 / 14 件能把候选分到两边 | BUG-1089 |
|
||||
| 出生时间每差 1 分钟,大运边界平移 | 中位 3.8 天(1.3–5.9) | 09-26 R3a |
|
||||
|
||||
## 根因(打分层)
|
||||
|
||||
`scripts/active_rectification_event_engine.py::_score_event`(`:192`)对每件事、每个候选分钟按 11 条规则**加分**(大运主星落领域宫 +2.0、分运 +1.5、次分运 +0.75、分盘命中 `+weight/(2·len(varga_charts))`、Narayana +2.0/+1.0、Arudha +0.35、功能吉凶 ±0.2/0.1、受控过运、Ashtakavarga 辅助),再乘精度权重。三个结构性问题:
|
||||
|
||||
1. **只奖不罚**。候选"能解释"事件加分;候选"预测了没发生的事"不扣分。选择题能动分,正因为它允许答"没有"(`core/build-state.ts::applyProbeOutcome`,±2)。口述时间线里的空白(例如事业线 2019-10 到 2025-02 之间没有变动)目前不是证据。
|
||||
2. **权重是人拍的,没有校准**。一条规则若对真分钟和错分钟同样常常命中,它只是噪声,但照样 +2。R1–R5 / V1 / V2 / V1n 都是"再拍一个权重看结果",不是让数据定权重。
|
||||
3. **高分辨率信号没进计分**。KP 宫头子主每分钟在算(`scripts/rectification/kp_cusp_observation.py`),被 `OBSERVATION_ONLY_LAYERS`(`:71`)挡住;Pranapada 已算(`:449`)未计分;D60 未入 11 张计分分盘。09-14 KP@默认权重更差,是"权重没校准"的另一个症状,不能证明信号无用。
|
||||
|
||||
## 决策记录(产品 2026-09-29)
|
||||
|
||||
- **批准**三项离线研究:**R-A 似然比校准权重**、**R-B 缺席证据**、**R-C 精度追问可行性**。有收益才立实现单;实现单必须按 ERR-110 重冻结 sealed holdout / reported offset 记录。
|
||||
- **保留**:2026-09-14"KP 宫头子主参与评分"的方向有效——KP 作为 R-A 的一个特征进入,权重由数据定,不再手工试。
|
||||
- **保留**:BUG-560 维持 `blocked`,直到某个方案在 v5 上过门。
|
||||
- **保留**:09-26"定向追问最多 2 条问完出卡"。R-C 若进入实现,精度追问算在这 2 条额度内,不另加轮次。
|
||||
- **不做**:不改 `MIN_SEPARATION_LEAD`、淘汰次数、采用 / 确认门、45 天闸门、领域门槛;不改冻结文件;不接上游 `PL9_BAV_CELL_OVERRIDES`。
|
||||
- **预期口径**(写进文档,不得夸大):月精度经历最多分开相差 ≥8 分钟的候选;31 分钟窗做到极致约 8–10 分钟,不承诺 1–2 分钟。
|
||||
|
||||
## 硬红线
|
||||
|
||||
1. **真值在区间不降**(v5 三档半径 × truth / opposite 六格,每格都不低于基线)。头名命中不降。任何一格变差即该方案不过门,把数字写进 PROGRESS,不得调参数凑。
|
||||
2. **留一法**:R-A 权重估计必须 leave-one-**case**-out(不是 leave-one-event-out);报告里必须同时给"全集拟合"与"留一法"两组数字,只有留一法数字可用于判定。
|
||||
3. 稳健性三项必测:事件日期偏移 ±7 天 / ±1–3 月;答错 1–2 题(09-26 R1 口径);R-B 另加"用户漏说 1–2 件真实事件"。任何一项把真值挤出区间的比例 > 基线,方案不过门。
|
||||
4. 研究计分器与线上 `score_candidates` 在 v4 上逐分对账(09-26 做法),差异 0 才能开始实验。
|
||||
5. `PYTHONHASHSEED=0`(ERR-111);所有 JSON 结果两次复跑逐字节一致。
|
||||
6. 生产代码零改动;`run_quality_gate.py --profile quick` 与开工基线逐条一致;新增研究测试全绿。
|
||||
7. 隐私:只用 v4 / v5 公开名人数据;文档不写真机会话的事件内容。
|
||||
8. 负结果必须完整写出;不得只报有利档位。
|
||||
|
||||
## 任务分解
|
||||
|
||||
- **R-0 脚手架(可在 v4 上做)**
|
||||
- `scripts/research/scoring_research_lib.py`:特征抽取——对每个 (case, candidate, event) 输出各规则是否命中(现有 11 条规则拆成独立特征;再加 KP 宫头子主是否与真值簇同、Pranapada 宫位是否为领域宫、D60 上升星座是否含领域主、Narayana 层;特征名与 `rule_ids` 对齐),以及候选是否属真值簇(步长 2 分钟,簇口径同 `cluster_width_probe.py`)。
|
||||
- 研究计分器复算线上分数并逐分对账。
|
||||
- 验收:`tests/test_scoring_research.py` 覆盖对账 0 差、特征表形状、留一法拆分不泄漏案例。
|
||||
- **R-A 似然比校准权重(BUG-1091)**
|
||||
- 每个特征 f 估 `LR_f = P(f 命中 | 真值簇) / P(f 命中 | 非真值簇)`(加拉普拉斯平滑,平滑量写明),候选分 = Σ log LR_f × 精度权重;淘汰与区间沿用线上 `unionStillValidRange` 口径。
|
||||
- 变体:A1 只用现有 11 特征;A2 加 KP / Pranapada / D60 / Narayana;A3 在 A2 上加只奖不罚 → 允许负 log LR(命中反而降分)。
|
||||
- 指标:头名命中、真值在区间、宽度中位、并列率、每轮熵降;六题回放前后各一组;留一法与全集各一组;稳健性三项。
|
||||
- 判定沿用 `precision_gate_lib.gate_verdict`(头名不降**且**宽度下降,覆盖不降)。另报"校准曲线":预测概率分桶 vs 真值命中率。
|
||||
- 验收:结果 JSON `docs/research/scoring_research_lr_2026_09_29.json`;每个特征的 LR 与置信区间列表;哪些特征 LR≈1(即噪声)单独列出。
|
||||
- **R-B 缺席证据(BUG-1091)**
|
||||
- 定义"覆盖时段":每个领域内,该例第一件与最后一件带年月事件之间的年份;覆盖时段内没有该领域事件的年份 = 缺席年。
|
||||
- 对每个候选,用 `event_probes.py` 的激活判定(`_has_domain_activation` / `_boundary_windows` 逻辑,研究侧复制不改原文件)算它在缺席年是否预测该领域强激活;预测了就扣分,幅度三档 0.5 / 1.0 / 2.0(卡片答"没有"是 2)。
|
||||
- 必测"用户漏说":随机删掉每例 1–2 件真实事件后重跑,看真值被挤出区间的比例。
|
||||
- 验收:三档幅度 × 三档半径的表;漏说稳健性表;判定。
|
||||
- **R-C 精度追问可行性(产品层,不改计分)**
|
||||
- 对每例每件年精度事件,算"若精确到月,是否恰好落在候选之间的大运边界(±4 个月内)";统计每例可追问事件数。
|
||||
- 模拟:把 v5 日精度事件降为年精度作为"口述",再按真月"追问"一件,与六题基线比头名 / 宽度。
|
||||
- 验收:每例可追问数分布;追问 1 件 / 2 件的增益表;判定是否值得进产品(额度按决策记录,算在定向追问 2 条内)。
|
||||
- **R-D 文档**
|
||||
- `docs/research/rectification_scoring_research_2026_09_29.md`:三项结论表(一句话 + 是否立实现单)、全部复跑命令;`docs/research/ACTIVE_FRONTS.md` 索引;定论页追加 §9;若某项过门,写实现单草案要点(含 ERR-110 重冻结步骤)。
|
||||
|
||||
## 让步顺序
|
||||
|
||||
R-0 > R-A > R-C > R-B > R-D 之外的图表。R-0 与 R-A 缺一不可合入;R-B / R-C 未做要在 PROGRESS 写 `not_started`,不得写成"无收益"。
|
||||
|
||||
## 开工前置命令
|
||||
|
||||
```bash
|
||||
git fetch origin --prune
|
||||
git worktree add -b codex/rectification-scoring-research-20260929 .worktrees/rectification-scoring-research-20260929 origin/staging
|
||||
cd .worktrees/rectification-scoring-research-20260929
|
||||
export PYTHONHASHSEED=0
|
||||
.venv/bin/python -m pytest tests/test_minute_resolution_research.py tests/test_cluster_width_research.py tests/test_rectification_validation_integrity_gate.py -q # 基线
|
||||
.venv/bin/python scripts/research/minute_resolution_sweep.py --help
|
||||
.venv/bin/python scripts/research/cluster_width_probe.py --help
|
||||
```
|
||||
|
||||
## BUG 编号
|
||||
|
||||
开工时核对 `docs/BUG_HISTORY.md` 最大号(写作时 `BUG-1089`;`BUG-1090` 由扩集单预留)。本单:**BUG-1091**(打分只奖不罚、权重未校准、高分辨率信号未计分)。由执行方以 `investigating` 登记;研究结束按结果改 `resolved`(有实现单)或 `closed_by_design`(无收益,附数字)。关联 BUG-560、BUG-1048、BUG-1089、BUG-1090。
|
||||
Reference in New Issue
Block a user