research(rectification): archive partial varga-resolution study (BUG-1105)
Archive research scripts, regression tests, M1 results and safe M0 smoke. Keep the incomplete study and failing quick gate explicit. Exclude full M0 JSON, raw logs and unrelated oracle newline changes. Co-Authored-By: Claude Code <noreply@anthropic.com>
This commit is contained in:
@@ -116,6 +116,12 @@ Do not open new product surfaces before at least one of these four lanes is clos
|
||||
- Vimsopaka semantic mapping for `NEECHA_BHANGA / GREAT_FRIEND / GREAT_ENEMY`
|
||||
- functional role now enters strict evidence; follow-up is Technique Audit Table rendering.
|
||||
|
||||
## 生时校正:分盘上升段研究(2026-09-30,BUG-1105)
|
||||
|
||||
- [任务书](../tasks/TASK-rectification-varga-resolution-research-20260930.md)、[进度](../tasks/PROGRESS-rectification-varga-resolution-research-20260930.md)、[阶段性报告](rectification_varga_resolution_2026_09_30.md)。仅离线研究,无生产实现授权。
|
||||
- M0 首轮与 M1 全量各 308 个 case-radius 已在本地落盘;本次 staging 归档仅含研究代码/测试、M1 JSON、测试必需的 M0 smoke 和文档,M0 全量原始 JSON 与运行日志因交付检查缺口不提交。M0 起点表逐格一致性、两次字节复跑尚未闭环,不能称整单验收通过。
|
||||
- M2/M3 `not_started`,M4 仅阶段性建议;±60 D9/D10 真值段保留各 74/77,低于既有区间基线 75/77,不通过研究红线。筛选子集的高准确率不能冒充全集或唯一段准确率。
|
||||
|
||||
## 生时校正:候选分不开(2026-09-14 收口)
|
||||
|
||||
- 定论页(先读这个):`<repo>/docs/research/rectification_minute_resolution_closure_2026_09_14.md`
|
||||
|
||||
@@ -2,6 +2,18 @@
|
||||
|
||||
Purpose: read this file before substantial project work. It exists to stop repeat mistakes caused by multiple Codex windows, WorkBuddy mirrors, local drafts, backup folders, and partial cloud-git visibility.
|
||||
|
||||
## 2026-09-30 · BUG-1105 获准阶段性归档后的推送准备
|
||||
|
||||
- 用户获知未验收、quick 和产物隐私缺口后要求 push staging。fetch 到 `5208f19b7`,研究基线之后 4 个提交不改 Python 研究依赖。仅提交隐私守卫覆盖并通过的 13 个精确路径;M0 全量 JSON、原始日志和 5 个 oracle 换行副作用留在原工作树,不编码规避、不改守卫。
|
||||
- pre-work 再次 exit 1:remote verified,focused 两项失败为历史镜像缺失以及 candidate_count=6 小于 workspace_residue_count=29;后者与已有同类机器目录数量假设一致。不得以允许推送冒充预检/研究通过。加入 index 后研究与隐私合跑 140 passed,完整 quick 的新增失败仍未解除。
|
||||
|
||||
## 2026-09-30 · BUG-1105 离线研究收尾验证
|
||||
|
||||
- 研究工作树 `codex/rectification-varga-resolution-research-20260930` 使用本机 Python 3.11.7。开工 quick 的 Python 子段通过后因 npm 缺 tsx 失败;pre-work 的历史 WorkBuddy 镜像断言是另一项失败,不混写。
|
||||
- 最终 `artifacts/varga-resolution/closure-quick.log` 为 exit 1:1000 passed、1 failed、1 skipped、3 subtests passed。新增失败是 `test_the_new_layer_leaves_every_existing_output_unchanged` 原输出不变性断言;日志仅给出被截断的请求清单差异,根因未确定,不得套用开工失败豁免,也不为消红修改生产代码。
|
||||
- quick 经 external oracle sanity → master dashboard → annual closure status → annual oracle queue 重写 5 个 tracked pending packet JSON;独立核查 JSON 全等、换行归一后的字节与 HEAD 相同,仅 LF→CRLF。Windows 文本模式写入造成工作树副作用,未证明与上述断言失败有关;保留现场、不暂存、不顺带提交。后续验证应将生成型检查隔离到临时输出,不默认门禁只读。
|
||||
- tracked 隐私 63 passed 不覆盖新研究产物;显式补扫有 3 处时刻字段 R003 命中及旧日志严格解码失败。保持未通过,不删除证据、不改例外;详见本轮 PROGRESS / BLOCKED。未提交、未推送、未部署。
|
||||
|
||||
## 2026-09-29 · 星盘展示获准推送后的预检
|
||||
|
||||
- 产品在获知本轮全量 29 项既有失败后明确授权推送 staging。重新 fetch,远端仍为已验基线 `78b9c5b65cda44650e8c7ca019931ce33a85a95d`;19 个业务/测试变动文件与 final-r2 快照哈希一致,隐私检查 63/63 通过。
|
||||
|
||||
@@ -0,0 +1,99 @@
|
||||
# 生时校正「分盘上升段」研究结论(BUG-1105,2026-09-30)
|
||||
|
||||
## 1. 范围与诚实边界
|
||||
|
||||
这是基于公开 Rodden-AA v5 开放集的离线研究,不是盲测,也不是生产准确率承诺。评价集为 77 例公开资料;所有数字均保留分母、空 coverage、并列和 LMT(1900 年前)分层。参数固定为 Raman ayanamsa、mean node、2 分钟评分候选网格、1 分钟分盘扫描,既有探针 `refresh_probes=false`。生产代码、权重、门槛和前端均未修改。
|
||||
|
||||
M0 的首轮完整结果为 308 个 case-radius、逐案计分对账 changed=0;第二次 M0 字节复跑因耗时中止,不能声称逐字节复现。M1 全量 308 个 case-radius、0 errors 已完成。M2、M3 尚未执行,M4 只有本页的研究边界与阶段性结论,不构成实现授权。
|
||||
|
||||
## 2. 一句话结论表
|
||||
|
||||
| 阶段 | 结论 | 是否建议实现 |
|
||||
|---|---|---|
|
||||
| M0 窗内分盘段 | D1 在 ±10/±15 几乎稳定;D9/D10 在 ±10 可较常收到 ≤2 段;±30 起分盘候选明显增多,±60 更不稳定。真值段首轮真实保留集合仍为 D1 76/77、D9 76/77、D10 76/77(±10);±60 为 D1 76/77、D9 74/77、D10 74/77。 | 仅支持继续研究,不直接实现 |
|
||||
| M1 段级汇总 | LOO 选择阈值后,D9/D10 的高 accuracy 只覆盖少量高占比案例;±60 D9 仅 17/77、D10 9/77 eligible,且 D9 accuracy 0.588。uniform 并列更多。 | 不建议单独以阈值交付分盘结论 |
|
||||
| M2 按段选题 | 未执行;没有证据证明按段信息增益优于线上选题。 | 不建议实现 |
|
||||
| M3 按问题域取盘 | 未执行;事业/婚恋/综合三策略没有实测比较。 | 不建议实现 |
|
||||
|
||||
## 3. M0 结果:盘型比分钟更有信息,但存在窗口边界
|
||||
|
||||
| 半径 | D1 窗内单一上升 | D9 平均段数 | D10 平均段数 | D1×D9×D10 平均组合 |
|
||||
|---|---:|---:|---:|---:|
|
||||
| ±10 | 64/77 | 2.43 | 2.51 | 3.84 |
|
||||
| ±15 | 51/77 | 3.22 | 3.26 | 5.27 |
|
||||
| ±30 | 37/77 | 5.34 | 5.60 | 9.62 |
|
||||
| ±60 | 10/77 | 9.64 | 10.29 | 18.36 |
|
||||
|
||||
六题后真实保留集合中的真值段保留:
|
||||
|
||||
| 半径 | D1 | D9 | D10 |
|
||||
|---|---:|---:|---:|
|
||||
| ±10 | 76/77 | 76/77 | 76/77 |
|
||||
| ±15 | 75/77 | 75/77 | 76/77 |
|
||||
| ±30 | 76/77 | 76/77 | 76/77 |
|
||||
| ±60 | 76/77 | 74/77 | 74/77 |
|
||||
|
||||
这些数字只能说明“真值段通常没有被排除”,不能说明系统已经正确选中唯一分盘。特别是 ±30/±60 的 D9/D10,段数和并列快速增加。**按任务书硬红线 1,±60 的 D9/D10 各 74/77,低于既有区间基线 75/77,当前口径不过门**;不能用阈值筛掉失败案例后重报通过。±15 未在原三档区间基线中给出参考数,不能自行套用另一半径。M0 首轮运行完成不等于 M0 已验收:任务书起点表与新表仍有种数/连续段、区间包络/真实集合差异需要逐格解释,第二次字节复跑也未完成。
|
||||
|
||||
## 4. M1 结果:阈值可以筛出高置信子集,但不能冒充全集能力
|
||||
|
||||
下面是 `raw` 模式全量 top 段正确 / 真值段保留 / 有效候选 ≤2 段,以及逐案例 LOO 选择阈值后的 eligible、accuracy、truth-retained。`top_segment_correct` 是**真值段属于最高质量段集合**(并列也算命中),不是唯一段选对率;并列另报,不能据此宣称唯一盘型已确定。
|
||||
|
||||
“六题后”表示最多六题预算,并非每例实际答足六题:308 个 case-radius 中 36 个无探针、38 个零回答,实际回答 0/1/2/3/4/5/6 题分别为 38/6/5/9/11/16/223 个;全部保留在分母中。
|
||||
|
||||
| 半径 | 盘 | 全量 top 正确 | 真值保留 | ≤2 段 | LOO eligible / accuracy / retained |
|
||||
|---|---|---:|---:|---:|---:|
|
||||
| ±10 | D1 | 76/77 | 76/77 | 77/77 | 77 / 0.987 / 0.987 |
|
||||
| ±10 | D9 | 71/77 | 76/77 | 68/77 | 23 / 0.913 / 0.957 |
|
||||
| ±10 | D10 | 69/77 | 76/77 | 63/77 | 29 / 0.931 / 0.966 |
|
||||
| ±15 | D1 | 74/77 | 75/77 | 77/77 | 77 / 0.961 / 0.974 |
|
||||
| ±15 | D9 | 61/77 | 75/77 | 50/77 | 14 / 0.929 / 0.929 |
|
||||
| ±15 | D10 | 59/77 | 76/77 | 52/77 | 8 / 0.875 / 0.875 |
|
||||
| ±30 | D1 | 75/77 | 76/77 | 77/77 | 75 / 0.973 / 0.987 |
|
||||
| ±30 | D9 | 50/77 | 76/77 | 25/77 | 11 / 1.000 / 1.000 |
|
||||
| ±30 | D10 | 52/77 | 76/77 | 25/77 | 16 / 1.000 / 1.000 |
|
||||
| ±60 | D1 | 68/77 | 76/77 | 76/77 | 54 / 0.944 / 0.981 |
|
||||
| ±60 | D9 | 41/77 | 74/77 | 11/77 | 17 / 0.588 / 0.941 |
|
||||
| ±60 | D10 | 34/77 | 74/77 | 10/77 | 9 / 0.778 / 1.000 |
|
||||
|
||||
±30 的 D9/D10 “1.000”只是在 11/77 和 16/77 的筛选子集上成立;不能用于对所有用户交付“盘型已确定”。±60 的 D9 结果直接显示阈值筛选也不稳定。
|
||||
|
||||
三种段质量均已计算:`raw`、`percent`、`uniform`。先将代表候选的后验分复制到其 `cluster_times` 中的评分网格候选,再只对真实保留候选求段内和;不是给独立扫描网格的每分钟插值。`percent` 在当前实现中只做非负总量比例化,非负分数下与 raw 的 top-share 数学等价,不是另一种概率校准或线上百分比先验回放;`uniform` 不使用分数,依赖段内保留候选数量,且产生更多并列。
|
||||
|
||||
LOO 每次只以另外 76 例选择阈值,优先顺序为训练准确率、真值保留率、eligible 数、较低阈值;训练 eligible 至少 5 例。固定阈值表不拟合参数,其汇总可与逐例留出评估相同,但不能当作已择阈值的无偏验证。当前名为 `full_fit` 的字段只是全集固定阈值对照,不代表另一轮学习器拟合。M1 JSON 尚缺独立完整的运行参数 metadata,复现还须结合本页与 M0 metadata;`deterministic_json=true` 只声明确定性序列化意图,不证明两次全量已逐字节一致。完整逐案数组、固定阈值表、LOO 选择阈值表、空 coverage、并列及 LMT 分层见:
|
||||
|
||||
- `artifacts/varga-resolution/varga_resolution_m1.json`
|
||||
|
||||
## 5. 可信度口径(研究建议,不是生产实现)
|
||||
|
||||
- **可直接说“无需校正”**:只有目标盘在当前窗口扫描中只有一个连续段,且该盘的输入窗口与资料精度满足产品既有门槛;不能由高 top-share 单独推出。
|
||||
- **较可信**:目标盘剩余不超过两段、真值保留门没有被触发、且不是 ±30/±60 的高并列情况;仍只能说“目前更像/可按该盘继续看”,不能写 confirmed。
|
||||
- **倾向**:存在多个段但 top-share 达到训练折选择的阈值;必须显示仍有多少段、是否并列和覆盖分母。
|
||||
- **不可判**:±30 以上 D9/D10 剩余段多、并列或 LOO eligible 很低;诚实出口应只交付 D1 或明确“分盘暂时分不开”,不要继续给伪精确分钟。
|
||||
|
||||
以上档位是研究报告用语,不是批准生产阈值;M2/M3 尚未提供足够证据支持交互或停题策略。
|
||||
|
||||
## 6. 产物与复跑
|
||||
|
||||
**归档范围说明**:用户要求将阶段性研究推到 staging;本次仅纳入隐私扫描通过的研究代码、测试、M1 JSON、测试必需的 M0 smoke JSON 和文档。下面的 M0 baseline JSON 及所有原始日志仍只在本地研究树,未提交;不将路径列出冒充远端证据已齐。完整提交/排除清单及 M0、M1 哈希见 PROGRESS 顶部。研究验收、完整 quick 和未提交产物的隐私缺口保持未通过。
|
||||
|
||||
- `scripts/research/varga_resolution_lib.py`
|
||||
- `scripts/research/varga_resolution_probe.py`
|
||||
- `scripts/research/varga_resolution_m1.py`
|
||||
- `docs/research/varga_resolution_baseline_2026_09_30.json`
|
||||
- `artifacts/varga-resolution/varga_resolution_m1.json`
|
||||
- `tests/test_varga_resolution_research.py`
|
||||
|
||||
既有验证:M0 定向测试 4 passed;M1 烟测、M1 全量均 exit 0;M1 全量为 308 条、0 errors。开工快速门 `baseline-quick.log` 的 Python 子段为 1001 passed、1 skipped、3 subtests passed,但随后 `npm test` 因 `tsx` 不可用失败,整体 exit 1。另一个独立命令的 `pre-work.log` 为 fail:focused preflight fragment-scan 测试要求本机不存在的 `.workbuddy/skills/jyotish-vedic-astrology` 镜像路径。两项不能混为一谈,均不能写成通过;本轮补验见 PROGRESS。
|
||||
|
||||
本轮补充的研究测试独立复验 **77 passed(exit 0)**,包括上述表格与机器结果一致性、36 组 M1 汇总及 LOO 重算;这不是全引擎复跑。tracked 隐私测试 63 passed,但显式补扫未跟踪产物未通过:M0 JSON 有 3 处 R003 时刻字段命中、旧 quick 日志严格解码失败,详见 PROGRESS / BLOCKED。没有修改隐私例外,当前不可声明隐私全绿或可交付。
|
||||
|
||||
最终完整 quick 补验 **exit 1**:Python 子段为 **1000 passed、1 failed、1 skipped、3 subtests passed**。失败是 `test_the_new_layer_leaves_every_existing_output_unchanged` 的原输出不变性断言,不是开工 quick 的 tsx 缺失;根因尚未确定,不能宣称失败清单与基线一致。快速门另产生 5 个 oracle JSON 的 LF→CRLF 副作用,独立比对确认无语义变化;保留现场且不纳入本研究候选交付。证据与范围见 PROGRESS / BLOCKED。
|
||||
|
||||
## 7. 后续实现单必须先补的内容
|
||||
|
||||
若产品仍要推进实现,另立实现单并明确串行依赖:
|
||||
|
||||
1. 先补齐 M0/M1 的验收缺口;按任务书让步顺序优先 M3:事业 D1+D10、婚恋 D1+D9、综合 D1+D9+D10 的取盘策略和“不用校正”比例。
|
||||
2. 再完成 M2:同一题池、同样六题预算下,按段信息增益与线上按分钟选题逐格比较;必须包含 wrong1/wrong2、事件日期 ±7 天、LMT 分层。
|
||||
3. 只有两者通过真值段保留红线,才能讨论 UI 交付卡、段扫描时机、段级停止和阈值文案;不得先把本研究脚本接入生产。
|
||||
Reference in New Issue
Block a user