# 生时校正「分盘上升段」研究结论(BUG-1105,2026-09-30) ## 1. 范围与诚实边界 这是基于公开 Rodden-AA v5 开放集的离线研究,不是盲测,也不是生产准确率承诺。评价集为 77 例公开资料;所有数字均保留分母、空 coverage、并列和 LMT(1900 年前)分层。参数固定为 Raman ayanamsa、mean node、2 分钟评分候选网格、1 分钟分盘扫描,既有探针 `refresh_probes=false`。生产代码、权重、门槛和前端均未修改。 M0 的首轮完整结果为 308 个 case-radius、逐案计分对账 changed=0;第二次 M0 字节复跑因耗时中止,不能声称逐字节复现。M1 全量 308 个 case-radius、0 errors 已完成。M2、M3 尚未执行,M4 只有本页的研究边界与阶段性结论,不构成实现授权。 ## 2. 一句话结论表 | 阶段 | 结论 | 是否建议实现 | |---|---|---| | M0 窗内分盘段 | D1 在 ±10/±15 几乎稳定;D9/D10 在 ±10 可较常收到 ≤2 段;±30 起分盘候选明显增多,±60 更不稳定。真值段首轮真实保留集合仍为 D1 76/77、D9 76/77、D10 76/77(±10);±60 为 D1 76/77、D9 74/77、D10 74/77。 | 仅支持继续研究,不直接实现 | | M1 段级汇总 | LOO 选择阈值后,D9/D10 的高 accuracy 只覆盖少量高占比案例;±60 D9 仅 17/77、D10 9/77 eligible,且 D9 accuracy 0.588。uniform 并列更多。 | 不建议单独以阈值交付分盘结论 | | M2 按段选题 | 未执行;没有证据证明按段信息增益优于线上选题。 | 不建议实现 | | M3 按问题域取盘 | 未执行;事业/婚恋/综合三策略没有实测比较。 | 不建议实现 | ## 3. M0 结果:盘型比分钟更有信息,但存在窗口边界 | 半径 | D1 窗内单一上升 | D9 平均段数 | D10 平均段数 | D1×D9×D10 平均组合 | |---|---:|---:|---:|---:| | ±10 | 64/77 | 2.43 | 2.51 | 3.84 | | ±15 | 51/77 | 3.22 | 3.26 | 5.27 | | ±30 | 37/77 | 5.34 | 5.60 | 9.62 | | ±60 | 10/77 | 9.64 | 10.29 | 18.36 | 六题后真实保留集合中的真值段保留: | 半径 | D1 | D9 | D10 | |---|---:|---:|---:| | ±10 | 76/77 | 76/77 | 76/77 | | ±15 | 75/77 | 75/77 | 76/77 | | ±30 | 76/77 | 76/77 | 76/77 | | ±60 | 76/77 | 74/77 | 74/77 | 这些数字只能说明“真值段通常没有被排除”,不能说明系统已经正确选中唯一分盘。特别是 ±30/±60 的 D9/D10,段数和并列快速增加。**按任务书硬红线 1,±60 的 D9/D10 各 74/77,低于既有区间基线 75/77,当前口径不过门**;不能用阈值筛掉失败案例后重报通过。±15 未在原三档区间基线中给出参考数,不能自行套用另一半径。M0 首轮运行完成不等于 M0 已验收:任务书起点表与新表仍有种数/连续段、区间包络/真实集合差异需要逐格解释,第二次字节复跑也未完成。 ## 4. M1 结果:阈值可以筛出高置信子集,但不能冒充全集能力 下面是 `raw` 模式全量 top 段正确 / 真值段保留 / 有效候选 ≤2 段,以及逐案例 LOO 选择阈值后的 eligible、accuracy、truth-retained。`top_segment_correct` 是**真值段属于最高质量段集合**(并列也算命中),不是唯一段选对率;并列另报,不能据此宣称唯一盘型已确定。 “六题后”表示最多六题预算,并非每例实际答足六题:308 个 case-radius 中 36 个无探针、38 个零回答,实际回答 0/1/2/3/4/5/6 题分别为 38/6/5/9/11/16/223 个;全部保留在分母中。 | 半径 | 盘 | 全量 top 正确 | 真值保留 | ≤2 段 | LOO eligible / accuracy / retained | |---|---|---:|---:|---:|---:| | ±10 | D1 | 76/77 | 76/77 | 77/77 | 77 / 0.987 / 0.987 | | ±10 | D9 | 71/77 | 76/77 | 68/77 | 23 / 0.913 / 0.957 | | ±10 | D10 | 69/77 | 76/77 | 63/77 | 29 / 0.931 / 0.966 | | ±15 | D1 | 74/77 | 75/77 | 77/77 | 77 / 0.961 / 0.974 | | ±15 | D9 | 61/77 | 75/77 | 50/77 | 14 / 0.929 / 0.929 | | ±15 | D10 | 59/77 | 76/77 | 52/77 | 8 / 0.875 / 0.875 | | ±30 | D1 | 75/77 | 76/77 | 77/77 | 75 / 0.973 / 0.987 | | ±30 | D9 | 50/77 | 76/77 | 25/77 | 11 / 1.000 / 1.000 | | ±30 | D10 | 52/77 | 76/77 | 25/77 | 16 / 1.000 / 1.000 | | ±60 | D1 | 68/77 | 76/77 | 76/77 | 54 / 0.944 / 0.981 | | ±60 | D9 | 41/77 | 74/77 | 11/77 | 17 / 0.588 / 0.941 | | ±60 | D10 | 34/77 | 74/77 | 10/77 | 9 / 0.778 / 1.000 | ±30 的 D9/D10 “1.000”只是在 11/77 和 16/77 的筛选子集上成立;不能用于对所有用户交付“盘型已确定”。±60 的 D9 结果直接显示阈值筛选也不稳定。 三种段质量均已计算:`raw`、`percent`、`uniform`。先将代表候选的后验分复制到其 `cluster_times` 中的评分网格候选,再只对真实保留候选求段内和;不是给独立扫描网格的每分钟插值。`percent` 在当前实现中只做非负总量比例化,非负分数下与 raw 的 top-share 数学等价,不是另一种概率校准或线上百分比先验回放;`uniform` 不使用分数,依赖段内保留候选数量,且产生更多并列。 LOO 每次只以另外 76 例选择阈值,优先顺序为训练准确率、真值保留率、eligible 数、较低阈值;训练 eligible 至少 5 例。固定阈值表不拟合参数,其汇总可与逐例留出评估相同,但不能当作已择阈值的无偏验证。当前名为 `full_fit` 的字段只是全集固定阈值对照,不代表另一轮学习器拟合。M1 JSON 尚缺独立完整的运行参数 metadata,复现还须结合本页与 M0 metadata;`deterministic_json=true` 只声明确定性序列化意图,不证明两次全量已逐字节一致。完整逐案数组、固定阈值表、LOO 选择阈值表、空 coverage、并列及 LMT 分层见: - `artifacts/varga-resolution/varga_resolution_m1.json` ## 5. 可信度口径(研究建议,不是生产实现) - **可直接说“无需校正”**:只有目标盘在当前窗口扫描中只有一个连续段,且该盘的输入窗口与资料精度满足产品既有门槛;不能由高 top-share 单独推出。 - **较可信**:目标盘剩余不超过两段、真值保留门没有被触发、且不是 ±30/±60 的高并列情况;仍只能说“目前更像/可按该盘继续看”,不能写 confirmed。 - **倾向**:存在多个段但 top-share 达到训练折选择的阈值;必须显示仍有多少段、是否并列和覆盖分母。 - **不可判**:±30 以上 D9/D10 剩余段多、并列或 LOO eligible 很低;诚实出口应只交付 D1 或明确“分盘暂时分不开”,不要继续给伪精确分钟。 以上档位是研究报告用语,不是批准生产阈值;M2/M3 尚未提供足够证据支持交互或停题策略。 ## 6. 产物与复跑 **归档范围说明**:用户要求将阶段性研究推到 staging;本次仅纳入隐私扫描通过的研究代码、测试、M1 JSON、测试必需的 M0 smoke JSON 和文档。下面的 M0 baseline JSON 及所有原始日志仍只在本地研究树,未提交;不将路径列出冒充远端证据已齐。完整提交/排除清单及 M0、M1 哈希见 PROGRESS 顶部。研究验收、完整 quick 和未提交产物的隐私缺口保持未通过。 - `scripts/research/varga_resolution_lib.py` - `scripts/research/varga_resolution_probe.py` - `scripts/research/varga_resolution_m1.py` - `docs/research/varga_resolution_baseline_2026_09_30.json` - `artifacts/varga-resolution/varga_resolution_m1.json` - `tests/test_varga_resolution_research.py` 既有验证:M0 定向测试 4 passed;M1 烟测、M1 全量均 exit 0;M1 全量为 308 条、0 errors。开工快速门 `baseline-quick.log` 的 Python 子段为 1001 passed、1 skipped、3 subtests passed,但随后 `npm test` 因 `tsx` 不可用失败,整体 exit 1。另一个独立命令的 `pre-work.log` 为 fail:focused preflight fragment-scan 测试要求本机不存在的 `.workbuddy/skills/jyotish-vedic-astrology` 镜像路径。两项不能混为一谈,均不能写成通过;本轮补验见 PROGRESS。 本轮补充的研究测试独立复验 **77 passed(exit 0)**,包括上述表格与机器结果一致性、36 组 M1 汇总及 LOO 重算;这不是全引擎复跑。tracked 隐私测试 63 passed,但显式补扫未跟踪产物未通过:M0 JSON 有 3 处 R003 时刻字段命中、旧 quick 日志严格解码失败,详见 PROGRESS / BLOCKED。没有修改隐私例外,当前不可声明隐私全绿或可交付。 最终完整 quick 补验 **exit 1**:Python 子段为 **1000 passed、1 failed、1 skipped、3 subtests passed**。失败是 `test_the_new_layer_leaves_every_existing_output_unchanged` 的原输出不变性断言,不是开工 quick 的 tsx 缺失;根因尚未确定,不能宣称失败清单与基线一致。快速门另产生 5 个 oracle JSON 的 LF→CRLF 副作用,独立比对确认无语义变化;保留现场且不纳入本研究候选交付。证据与范围见 PROGRESS / BLOCKED。 ## 7. 后续实现单必须先补的内容 若产品仍要推进实现,另立实现单并明确串行依赖: 1. 先补齐 M0/M1 的验收缺口;按任务书让步顺序优先 M3:事业 D1+D10、婚恋 D1+D9、综合 D1+D9+D10 的取盘策略和“不用校正”比例。 2. 再完成 M2:同一题池、同样六题预算下,按段信息增益与线上按分钟选题逐格比较;必须包含 wrong1/wrong2、事件日期 ±7 天、LMT 分层。 3. 只有两者通过真值段保留红线,才能讨论 UI 交付卡、段扫描时机、段级停止和阈值文案;不得先把本研究脚本接入生产。