feat(consult): add free model-classified smalltalk fast path
Keep full consultation tool contracts unchanged. Persist short replies and refund the original reservation atomically while recording actual model usage. Verify Linux frontend 3566/3566, database 40/40, Static home and gzip +0.0493%. Co-Authored-By: Claude Code <noreply@anthropic.com>
This commit is contained in:
@@ -0,0 +1,98 @@
|
||||
# PROGRESS · 普通对话寒暄快速通道 · 2026-09-20
|
||||
|
||||
## 状态与边界
|
||||
|
||||
本地实现和主会话独立审查完成;审查发现的 SDK 原文日志与无效输出 usage 丢失两项已修复并复验。**Linux 前端全量、标准 DB、tsc/lint、完整构建与 Static/gzip 均通过**;真人模型/余额/刷新验收仍缺受控登录态,不宣称已交付线上。分支 `codex/consult-smalltalk-fastpath-20260920`,实际基线 **fcad06372**,不是任务书成文时的 09b41009。用户授权补验后提交并推 staging;当前记录写于提交前,门禁/部署待核验。未 stash,未改 workflow/main/DNS,未读凭据、未打真实模型;所有改动只在授权工作树。
|
||||
|
||||
## 实现清单
|
||||
|
||||
| 范围 | 实现 |
|
||||
| --- | --- |
|
||||
| 分类 | consultation-smalltalk.ts:同一 selectedModel,裸 Agent 无 Skill/tools/memory,maxSteps=1、maxRetries=0、96 输出 token、thinking disabled;本轮可见问题 + 最后完整相邻问答 role/text + 称呼;strict union,≤20 字回复形状;3 秒 Promise.race + abort,任何不确定/错误回 consult |
|
||||
| 路由 | resolveConsultationQuestion 与预留/问题落盘之后、主 Agent/标题/摘要之前分流;仅 entrypoint undefined;三个特殊入口保持原链(旧校正入口仍拒绝);寒暄不启动标题/摘要模型 |
|
||||
| 流 | 沿用实际 application/x-ndjson,不另造 SSE 协议;先成功持久化/退款再 answer.delta + run.completed(responseKind=smalltalk),无 activity/receipt;失败只 run.failed,不能声称成功;断连不打断服务端结算 |
|
||||
| SQL | 仅新增 complete_consultation_free 函数,无表变更;沿用 advisory lock/owner/session/status 校验;complete_usage 写真实成本;按 reservation.credit_amount 退款并记交易;request completed、reservation released,释放订阅 quota;同回复重试成功不退款,不同回复冲突、取消拒绝、收费完成不可退 |
|
||||
| 权限 | 仅 service_role grant,无 admin_runtime 新 grant,撤销 PUBLIC/anon/authenticated;服务端 createAdminSupabaseClient 使用 service role,客户端 RPC 是 authenticated,responseKind 自报不产生免费权力 |
|
||||
| UI | responseKind 从流/header→hook→StreamingReply/ChatMessage→transcript/row→cloud read 贯穿,刷新不重建虚构步骤;寒暄隐藏思考/活动/技法;未有真实活动时不造分类思考;Home 只新增一行 prop,0 新 useState/useRef |
|
||||
| 语气 | 豁免移到共享 productConversationVoice,三模式均含;领域咨询原开场骨架不改,Skill 版本不变 |
|
||||
| 观测 | classifier 独立封闭机器码、耗时/tokens/按模型价格估算 cost;成功咨询账本合并分类 usage,寒暄记其真实 usage;缓存 normalized usage 合并不丢失;无问题/姓名/出生资料/输出原文日志 |
|
||||
|
||||
## 保持的安全合同与产品边界
|
||||
|
||||
- BUG-922/923/937/938 及相关历史已检索阅读;最大号 975,本轮新增 976/977。没有修改 index.ts every turn 两句、consultationNatalPrepareStep/WindowPrepareStep、contractReady 或原 stream-agent-response;两处 requireTool:true 保持。
|
||||
- **预留仍在分类前**。零余额无有效订阅用户仍受前端守卫/服务端 402 限制;没有擅自改计费入口为匿名无限免费模型代理。profile/mode/session 校验也保持。
|
||||
- 历史可见正文可能含此前解读,任务允许这一对历史;只作为用户语义数据,不是工具/系统星盘证据,提示词禁止复述盘上主张。未声称能力剥夺可数学保证模型零幻觉。
|
||||
- 订阅无 credit debit 时不加点;reservation released 不再计入 reserved/completed quota,ledger 仍有实际成本。定向覆盖无点数来源分支;真实订阅授权链见真人清单。
|
||||
- 供应商忽略 abort 时最多等待约 3 秒;晚 usage 用 late_usage 观测,不追写已完成/释放 reservation,避免改变状态和重复账务。供应商错误/超时未返回 usage 为 unknown,不伪报真实零成本;价格字段计算是既有模型价格估算,不是供应商账单对账。
|
||||
- 误判成本按任务书:咨询误判成寒暄会收到一句短回应,需要再问一次;产品接受它比整轮合同失败轻。漏判仍按原咨询处理,宁可多算一次,不用关键词/正则/长度补分类。假模型测试只证明传输/路由/严格解析,不证明真实语义准确率或延迟 P50。
|
||||
|
||||
## 验收
|
||||
|
||||
日志保存在本树 `artifacts/smalltalk/`,都是本地执行产物,不应整目录提交(含临时迁移副本与虚构 DB fixture 日志)。
|
||||
|
||||
| 检查 | 未改基线 | 最终候选 | 结论 |
|
||||
| --- | --- | --- | --- |
|
||||
| tsc --noEmit | 0 error | 0 error | 通过 |
|
||||
| npm run lint | 0 error / 120 warning | 0 error / 120 warning | 无新增 warning,不顺修旧 warning |
|
||||
| npm test | 3486 tests,3409 pass / 77 fail | 3522 tests,3444 pass / 78 fail(最终 `npm test -- --test-concurrency=2`) | 既有 77 个失败名称逐项相同;新增 1 个新 DB 测试被同一迁移镜像问题阻塞,不称全绿 |
|
||||
| 标准 npm run test:db | 39 tests,11 pass / 28 fail | 40 tests,11 pass / 29 fail | 原 28 个失败名称逐项相同,新增 RPC 测试在迁移阶段被同一 duplicate filename 阻塞 |
|
||||
| 新功能/适配合同定向 | 无新增用例 | 主会话独立 59/59 | 真实 SDK + 假模型合法/非法/供应商错误、隐私和成本、UI SSR、voice、billing/title/audit 合同 |
|
||||
| 旧边界相关联合定向 | 基线同类 EPERM | 65 tests,64 pass / 1 fail | 唯一 general runtime Skill symlink EPERM;BUG-922/923 静态合同通过 |
|
||||
| 新 RPC 隔离 PostgreSQL 17 | 无新增 RPC | 执行方 1/1,主会话独立复跑 1/1 | 主会话逐文件确认临时迁移集 154 个 SQL 与仓库原文一致,真实 SQL、真实并发连接 |
|
||||
| Next build | 编译成功后页面收集因 Skill alias EPERM 失败 | 主会话最终编译成功(7.6s),收集 `/api/birth-time-guide` 时同类 symlink EPERM | 未通过,不改 loader 绕过 |
|
||||
| `/` Static / 首屏 gzip | 无完整产物 | 无完整产物 | **blocked;没有 ±2% 证据** |
|
||||
| pre_work_check | remote verified;focused 23 pass / 1 fail | 未变更 Python | 缺 .workbuddy 镜像断言;不造目录 |
|
||||
|
||||
### 定向数据库证据
|
||||
|
||||
标准命令扫描两迁移目录时遇到 Windows 检出的 Git symlink 普通文本,报 `duplicate migration filename: 20260814025000_personal_report_document_v2.sql`。未改 runner/旧迁移/既有断言。将两目录真正 SQL 文件逐字节复制到本树 artifacts 临时目录,跳过仅含相对路径的镜像占位文本,重复真实文件必须内容一致,共 154 个 SQL;用已有 MIGRATIONS_DIRECTORY 参数运行同一新 DB 测试。
|
||||
|
||||
覆盖:service_role 可调用,anon/authenticated/app_runtime 不可;精确退 3 点不是写死 1;同请求重试仅一次退款/一条回复;不同回复冲突;他人 user/session 拒绝;取消后拒绝;普通已完成收费咨询拒退;23 input / 7 output / 91 microusd 实际入账;负 token 触发事务回滚后重试成功;无点数来源不加点且释放计数;两个 PostgreSQL 连接并发 free/cancel,余额守恒且只有一个 refund。并发测试不是生产订阅链或 staging 验收替代。
|
||||
|
||||
### 断言调整三栏
|
||||
|
||||
| 原值 | 新值 | 原因 |
|
||||
| --- | --- | --- |
|
||||
| usagePayload await usage | await mergeUsage([usage, classificationUsage]) | 必须等待并计入分类成本,不弱化完成时机 |
|
||||
| 标题测试切片截止 usageStartedAt | 截止 usagePayload | 计时前移到分类前;原 expectedTitle/所有权/CAS 断言保留 |
|
||||
| auditRows 直接 receipt.techniqueAuditTable(两测试) | smalltalk ? undefined : 原字段 | 寒暄不得显示技法;咨询字段不变 |
|
||||
| completed.receipt 隐式必有 | assert.ok(receipt) 后相同 domains 深比较 | 新协议允许寒暄无 receipt,旧咨询仍显式必须有 |
|
||||
|
||||
一次编辑脚本在 Windows 写入 CRLF 导致源码逐字合同额外失败,已恢复被改文件原 LF,不修改业务或放松相关断言来掩盖。新 SQL 测试在标准命令中也被同一个既有 duplicate migration 阻断,会比基线多一个环境失败,不能宣称失败总数完全不变。
|
||||
|
||||
## 主会话独立审查与最终证据
|
||||
|
||||
- SQL、RPC 角色、迁移打包/加载静态复核未发现确认缺陷;真实数据库独立回归通过,不等于标准整套 DB 通过。
|
||||
- 修复审查发现:Mastra 默认 strict 校验会把非法模型输出附入 SDK 日志,同时在读取 usage 前抛错。现对独立分类 Agent 与结构化输出处理器使用 `noopLogger`,结构化生成采用保留结果的 `errorStrategy: warn`;外层原有 strict schema 仍是唯一接纳门。真实 SDK 内存假模型覆盖合法输出、非法 schema、坏 JSON、供应商异常;验证一次调用、无工具、96 token cap、原文不进 console/stdout/stderr、非法输出仍保留 23/7 tokens。
|
||||
- 最终证据:`review-final-targeted.log`(59/59)、`review-final-full-concurrency2.log`(3522/3444/78)、`review-final-failure-comparison.json`(全量与 DB 逐项名单)、`review-final-tsc.log`(0)、`review-final-lint.log`(0 error/120 warnings)、`review-final-db-targeted.log`(1/1)、`review-final-build.log`(EPERM)。
|
||||
- 原默认并发多次出现内存分配失败,导致部分测试未完整收集;这些失败日志保留,不用作最终测试总数。中途构建还出现 `.next` rmdir UNKNOWN;最终单独复跑重新到达编译成功后 Skill symlink EPERM。未改业务、断言或依赖去迎合环境。
|
||||
- 执行与审查子代理最后因服务端 API 403 insufficient balance 中断;主会话接手完成上述复验与记录,未将中断代理的待完成工作冒充结果。
|
||||
- 本轮执行期间远端引用前进至 `5049e784`,相对基线仅新增另一份任务书及索引。未在脏工作树拉取;未来提交/推送前必须重新 fetch、核对 BUG 编号和整合任务索引,不能直接覆盖他人文档。
|
||||
|
||||
## Linux 隔离补验(用户授权继续,2026-09-20)
|
||||
|
||||
- 主机 Docker Desktop:4 CPU / 8 GB;使用本轮专属 runner、DinD 和 named volume,不挂宿主 Docker socket,不访问其他会话容器或凭据。Node `22-bookworm`(拉取 digest `sha256:dd5847a04b0deee391fa145f1f4c6d214196668b6bcc7988ebed67249f226844`),容器内按未修改的 package-lock 执行 `npm ci`;两侧依赖副本相同,不复用 Windows node_modules。
|
||||
- 基线从根目录 `git archive fcad06372`;候选为相同 archive + 33 个本轮变更文件。8 个 Git symlink 均保真,overlay 全部逐字节匹配工作树,输入哈希清单 `artifacts/smalltalk/linux-input-manifest.json`。为 Git 文件跟踪合同建立仅容器内使用的临时 Git 快照,非发布提交。
|
||||
- runner 与专属 DinD 共享网络命名空间和 `/work` volume;`DOCKER_HOST` 仅 loopback,无发布端口,`TMPDIR=/work/tmp`,fixture 上限 1;真实 PostgreSQL 17、标准双迁移目录,无 MIGRATIONS_DIRECTORY 绕行。
|
||||
|
||||
| 检查 | Linux 基线 | Linux 候选 | 结论 |
|
||||
| --- | --- | --- | --- |
|
||||
| tsc | 0 error | 0 error | 通过 |
|
||||
| lint | 0 error / 120 warnings | 0 error / 120 warnings | 无新增 |
|
||||
| 首轮全量 | 3530 / 3527 pass / 3 fail | 3566 / 3563 pass / 3 fail | 失败名称逐项相同:缺 python3-yaml 一项、rsync 两项;原日志保留 |
|
||||
| 补齐系统依赖后最终全量 | **3530/3530,0 fail/skip** | **3566/3566,0 fail/skip** | 新增 36 项,0 新红;`npm test -- --test-concurrency=2` |
|
||||
| 标准 test:db | 39/39 | 40/40 | 通过,新增免费结算真实库回归包含在内 |
|
||||
| npm run build | 退出 0,`○ /` | 退出 0,`○ /` | 首页 Static 不变 |
|
||||
| 首页 JS gzip | 621,299 B / 25 文件 | 621,605 B / 25 文件 | +306 B / +0.0493%,在 ±2% 内 |
|
||||
|
||||
- gzip 口径:各自全新 `.next` 的 `.next/server/app/index.html` 中去重 `/_next/static/**.js` 引用,每文件 gzip level 9 后求和;不混入其他路由、旧 hash chunk 或 CSS。复算脚本与逐文件清单在本地 artifacts,不整目录提交。
|
||||
- 日志:`artifacts/smalltalk/linux-logs/{base,proposed}-{tsc,lint,test,db,build}.log` 与 `*-gzip.json`。脚本末尾退出 0 不能代表全部测试成功,逐项结果按表中原始日志记录。
|
||||
- Gitea REST Actions API 未认证为 401;公开 `/root/Jyotisha/actions` 网页可读,可在不读取凭据的前提下核对门禁。推送前 staging health 为 `12fdaed90b81014378fe5eaa9231e50d2b838a37`,不是本轮部署证据。
|
||||
- 远端期间另有校正研究提交 `932f2fff`(BUG-978~980),本轮编号无冲突。提交后只整合本分支,保留双方共享文档;不操作他人工作树、不 stash、不提升 main。
|
||||
|
||||
## 剩余未做 / 交接
|
||||
|
||||
1. 独立代码审查与 Linux 平台验收已完成;最终日志 `linux-logs/{base,proposed}-test-final.log`,机器对照 `final-test-comparison.json`。隐私扫描 `commercial_privacy_artifact_scan.py --json` 为 pass、0 finding(3188 文件)。
|
||||
2. 提交后整合最新 `origin/staging`、快进推送、核对远端 SHA 与 Gitea 门禁/自动迁移/部署。远端至 `03cba478` 额外两提交仅跨午夜任务书与索引,需保留并行工作。
|
||||
3. 受控 staging 账号三模式真实模型语义、延迟、零点/订阅、取消/断线/刷新与余额走查,清单 `docs/testing/consult-smalltalk-fastpath-20260920.md`。
|
||||
4. BUG-976/977 不提前标 resolved。没有获得真实模型 P50,不按猜测降低 3 秒上限。
|
||||
@@ -289,7 +289,7 @@
|
||||
| — (产品口头拍板,无任务书) | `PROGRESS-agent-voice-20260917.md` | **对话口气改形状(纯提示词与文案,无 BUG 号)**:产品判定现有人设出来的是顾问报告。人设改成「把人当一个人认真对待 / 行动力很强、嘴有点毒但靠谱的同事」;开场从「一句结论 + 2–3 条短要点 + 一句下一步」换成固定形状——**反差**(表面 A 底下 B,命名成一个格局)→ **谁在推谁在修**(大运主星推、行运修体面)→ **别去应 X 的象,去扮演 Y 的象** → **最多三条短行动**(各 ≤ 20 字),仍无标题、≤ 400 字。新增希望纪律:有转机且允许精确应期就说到月份,没有就说这段时间拿来干什么、能扮演哪个象,禁「一切都会好 / 相信自己 / 加油 / 你值得更好的 / 宇宙自有安排」。申报时段与无出生分钟两条降级路线形状照给、不编月份。改 `product-voice.ts` / `consult/route.ts` 用户回合文案 / 三处复述旧形状的系统指令 / `VOICE.md`(五条原则→七条)/ `CHANGELOG.md`。零业务逻辑改动,Skill 版本不变 | 已实现,待验收 | `codex/agent-voice-20260917`:tsc 0 / lint 0 error(118 warning 不变)/ npm test 3468→3471 条、36 红与基线 `ff0427cf` 逐条相同、0 新红 / `○ /` Static / 首屏 gzip 1,416,965 两侧**字节相同**(改动全在服务端模块,客户端 chunk 无该文本)。真机口气走查欠 |
|
||||
| — (产品口头拍板,无任务书) | `PROGRESS-settings-ui-20260919.md` | **设置面板布局与资料入口整理**:基线 `4f4cd684`;四分区继续共用固定 `.settings-modal`,桌面导航 176px→200px 并加分隔,内容区增加内边距,表单 cap 440px→560px,导航移除误导性右箭头;账户头像 48px→56px;“添加其他人”移到分组标题操作区。已同步 `frontend/DESIGN.md` 与合同测试;tsc 0、lint 0 error、定向测试 21/21;build 被 Windows Skill runtime symlink 权限阻塞,浏览器走查待受控环境;BUG-970 保持 `investigating` | 待验收 | `codex/settings-ui-20260919` |
|
||||
| `TASK-owner-case-purge-20260919.md` | `PROGRESS-owner-case-purge-20260919.md` | **上游库主案例与本机路径残留清除(只含本仓)**:镜像同步带进库主本人案例(敏感案例标识与本机路径)并被 `origin/staging` 命中,涉及无引用的 `versions/` 三快照、前端 fixture、Python 测试、整机扫描台账、会话转录及上游 SKILL 快照。运行时无特判不用动。产品拍板整体删除不留匿名版;fixture 统一虚构常量;`import_yinduzhanxing.py` 加隐私排除项 + 新增仓库级隐私守卫测试;上游 SKILL 快照等库主清完再重导入(BLOCKED 记录)。上游仓的清理指令另见 `UPSTREAM-INSTRUCTION-owner-case-purge-20260919.md`(交给库主,不在本仓执行)。BUG-972/973 | **已验收通过(2026-09-20,`497798ac`);未合入 staging,等产品放行** | 两轮:首轮未通过(1 个隐私守卫冲突:新增路径规则与答案键守卫冲突,该守卫在快速门 glob 内,合入会让门禁红)→ 修复单 `TASK-owner-case-purge-fix2-20260919.md` → `497798ac` 通过。Claude 在 Linux 全依赖环境独立复验:快速门 Python 步 859 passed / 0 failed(上一轮就是这步红),Python 全量 63 红与基线逐条相同、0 新红,收集数与删除清单已记录;tsc 0 / lint 0 error、120 warning 同基线 / `npm test` 失败清单为基线子集(少 1 条工作流 YAML,非回归)/ `○ /` Static、首屏 gzip 与基线字节相同(前端自首轮提交起零改动)。上游指令文件已逐字节还原为基线原文;12 个已删测试名与计数已落进度记录;BLOCKED 两条已划掉。校正 Skill 哈希包、注册表、上游快照、`frontend/src`、主 API 全程 0 改动;库主本机用户名 0 命中。遗留 P3:进度记录和 BUG 状态文字待后续对账修正 |
|
||||
| `TASK-consult-smalltalk-fastpath-20260920.md` | — | **普通对话寒暄轮快速通道**:真机一句「你好」触发完整窗口排盘(活动面板「已完成 4 步」)+ `## 先回答你的问题` + 400 字判词 + 扣 1 点。三层叠加:`index.ts` 两处「every turn 必调排盘」(BUG-922)与 `contractReady()` 的 `requireTool` 把排盘变成硬合同;`product-voice.ts` OPENER SHAPE 标「三种模式共用」;唯一的 chit-chat 豁免句只在 `natalSpokenReportContract` 里、只拼进本命 Agent(BUG-977)。计费侧「写回复」与「扣点」绑在 `complete_consultation_response` 同一次调用,`cancel` 只退款不写消息,所以今天没有「不扣点但保留对话」的通道。**产品拍板 a:不扣点、不排盘、回一句白话**;**分流不得用正则/关键词/长度阈值**,改为进 Agent 之前一次极短的结构化模型调用(复用本轮已选模型),fail-open 一律落回完整路径;BUG-922/923 的三处合同一个字不改;新增 `complete_consultation_free` 迁移。BUG-976/977 | 待领取 | — |
|
||||
| `TASK-consult-smalltalk-fastpath-20260920.md` | `PROGRESS-consult-smalltalk-fastpath-20260920.md` | **普通对话寒暄轮快速通道**:真机一句「你好」触发完整窗口排盘(活动面板「已完成 4 步」)+ `## 先回答你的问题` + 400 字判词 + 扣 1 点。三层叠加:`index.ts` 两处「every turn 必调排盘」(BUG-922)与 `contractReady()` 的 `requireTool` 把排盘变成硬合同;`product-voice.ts` OPENER SHAPE 标「三种模式共用」;唯一的 chit-chat 豁免句只在 `natalSpokenReportContract` 里、只拼进本命 Agent(BUG-977)。计费侧「写回复」与「扣点」绑在 `complete_consultation_response` 同一次调用,`cancel` 只退款不写消息,所以今天没有「不扣点但保留对话」的通道。**产品拍板 a:不扣点、不排盘、回一句白话**;**分流不得用正则/关键词/长度阈值**,改为进 Agent 之前一次极短的结构化模型调用(复用本轮已选模型),fail-open 一律落回完整路径;BUG-922/923 的三处合同一个字不改;新增 `complete_consultation_free` 迁移。BUG-976/977 | 本地实现及独立审查完成,两项 SDK 隐私/成本问题已修复;Linux 最终全量 3530/3530 → 3566/3566、标准 DB 39/39 → 40/40、tsc 0、lint 0 error/120 既有 warning;两侧首页 Static,首屏 gzip +0.0493%;用户授权推 staging,门禁/部署待核验,真人模型/余额/刷新待受控账号 | `codex/consult-smalltalk-fastpath-20260920`;实际基线 `fcad06372`;逐项测试对照见 PROGRESS,真人清单见 `docs/testing/consult-smalltalk-fastpath-20260920.md` |
|
||||
| `TASK-rectification-validation-integrity-20260920.md` | `PROGRESS-rectification-validation-20260920.md` | **生时校正验证体系补缺(纯离线评测,不改打分不改产品)**:会议要求把「推断真实出生时间」与「用户认可的参考盘」分开证明。核对结论——**产品口径侧四条已落地**(`accepted`≠`confirmed` 两条写入路径、确认门 fail-closed 且 `holdout` 为 `not_ready` 使 `confirmation_allowed` 不可能为真、采用不写 `reported_birth_time`、无任何把采用率当准确率的指标;运行时也无按生日走捷径的分支);**缺口全在评测本身**。三条:① 封存契约 `rectification_sealed_holdout.v1.json` 的三个打分哈希互不相同(封存 `f41c298d` / 契约记录 `99730c84` / 基线实测 `b15d9ea1`),`official_eval_trial_count: 0`——当前实现**从未产出过一次有效官方盲测**,唯一跑过那次已被资料审计作废(top-1 `0.15`,发布门要 `0.60`),可见的 `0.45` 自带「不得当发布指标」标记(BUG-978);② 全部离线评测的候选窗**以真值为圆心**(`_candidate_moments()`、`request_from_case()` 的 `true_time`),生产以申报时间为圆心(`ENGINE_SEARCH_RADIUS_MINUTES = 15`)——「真值掉出窗外」这一失败模式从不可见(BUG-979);③ v3 封存但每例仅 3 事件、v4 有 7+ 事件却已被看过并用于调参,**无口径干净又贴近真实会话的封存集**;六题回放的 `0.80/0.55/0.35` 是「真值方向最优答」的上帝视角上界,±30/±60 仍低于发布门(BUG-980)。T1 申报偏差敏感性 sweep、T2 有效重跑 + 契约对齐 + **防复发新测试**、T3 只出 v5 采集协议、T4 记录。**硬红线:不得改 12 个打分文件、不得用封存集调参、不得把 `status` 改 `ready`。** 家庭信息(父母职业/兄弟姐妹)在拿到基线数字前不开工——现有七领域全是带日期事件,静态属性没有输入口。前置:owner-case-purge 三提交仍未合入 staging。BUG-978~980 | **已验收通过(2026-09-20,Claude 独立复算)**;独立盲测仍 blocked;门禁/部署待核验 | `932f2fff`。Claude 独立复核:T1 完整重跑 900 组合**逐例 8 字段 0 差异**、summary/specification 全等,另从 900 条逐例重算 45 格表与发布表逐位相同;T2 独立复跑 0.45/0.50/6.45/0/1.0/0.0 与哈希全序 0.05/0.10 全部一致;12 个打分文件字节未动、`status=not_ready`、`confirmation_coverage_rate=0`、实跑 `holdout_passed()`=False;新增/触及 Python 测试本机 38 条全绿;freshness 测试比对时排除 `frozen_at_utc`(BUG-693/694 教训已用上)。**执行方正确推翻任务书 T2.3**:「首次口径干净的官方盲测」与 BUG-428 防复发(已看过结果的案例不得再计入盲测)冲突,已核 BUG-428 原文,是任务书写错。环境缺口:本机 frontend 无 node_modules,tsc/lint/npm test/build 未能复核,采信执行方自报。遗留 → `TASK-rectification-cross-midnight-dasha-20260920.md`(BUG-981) |
|
||||
| `TASK-rectification-cross-midnight-dasha-20260920.md` | — | **跨午夜候选的 Dasha 边界错一天(生产打分)**:`scoring_service.py` 调 `merge_transition_proximity()` 只传**一个** `birth_date`,该函数用它算全部候选的 Vimshottari / Narayana 起始日期,候选之间只靠 `_context_time()` 的 `HH:MM` 区分、**日期被丢掉**。窗口跨午夜时午夜后候选的 dasha 边界整体错一天。Claude 验收时在生产调用链独立复现:窗口 `23:50→00:10`、21 个候选,**恰好那 11 个跨日候选分数错、10 个同日候选逐位相同**(幅度 +0.0267 / −0.0133,本例头名未变)。算术上界 = `cap/kernel_width`,day 精度 0.067 分/件,18 件可累计约 1.2 分,而随分钟变化项总量仅约 2.1 分 —— **上界是推的不是实测,真实幅度本单必须实测**。踩中路径:`late_night` 时段 `23:00–03:59`、`unknown` `00:00–23:59`、23:45 后或 00:15 前申报的 ±15 窗。连带发现:`calculation_spec()` 不含打分实现身份,修复后同一 spec hash 对应不同分数,历史 Case 静默失去可复现性(同 BUG-427 类型)。**产品 2026-09-20 已就三点拍板:A 修、B 修完重新冻结并重跑 T1/T2、C 让新旧结果可区分。** C 的做法经查证已修正:`calculation_spec_hash` 全在 **V4** 链路、**V9 零引用**,原提案 bump `INPUT_CONTRACT_VERSION` 对真实历史无效已作废;改为随修复 bump `engine_version`(`v9EngineVersion()` 缺省串,全仓只写不比、无相等性门控),**不得动 `skill_version`**(BUG-621:open RPC 要求绑定 Skill 等于当前版本,bump 会让历史校正打不开)。硬红线:只改「按候选日期取 dasha 起始」,不得动 kernel/cap/share 任一常数;确认门不变。BUG-981 | **待领取**(产品已放行) | — |
|
||||
|
||||
|
||||
Reference in New Issue
Block a user