docs(tasks): Jev 修复单补产品拍板:线上模型=DeepSeek Flash、来源 B 157 条已交付

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_0155nFCgCHtoA7jhSDGmZmMu
This commit is contained in:
Jesse_Chen
2026-09-19 02:30:16 +00:00
co-authored by Claude Fable 5
parent 4f4cd6843a
commit 69a44fe78d
@@ -39,8 +39,20 @@
1. 产品 2026-09-19 原话:「能不能让 agent 模拟生时流程来得语料……不怕消耗 token」。这是来源 C 的授权来源,**模板拼接不满足**;本单据此要求全量重造来源 C。 1. 产品 2026-09-19 原话:「能不能让 agent 模拟生时流程来得语料……不怕消耗 token」。这是来源 C 的授权来源,**模板拼接不满足**;本单据此要求全量重造来源 C。
2. 生成与复核模型:用执行机上已有凭据的真实对话模型(DeepSeek 或产品另行提供的任一模型),**生成与复核可用同一家模型但提示不同、复核看不到标签**(原单已允许)。若能用两家不同模型更好,不强求。 2. 生成与复核模型:用执行机上已有凭据的真实对话模型(DeepSeek 或产品另行提供的任一模型),**生成与复核可用同一家模型但提示不同、复核看不到标签**(原单已允许)。若能用两家不同模型更好,不强求。
3. 现行分类器对照:生产会话默认模型由数据库模型目录决定,代码里没有;产品在本单开工前告知模型名(或确认 `deepseek-flash` 就是线上默认)。未告知前,对照继续用 DeepSeek,但报告必须继续标「不是线上会话模型」。 3. 现行分类器对照:产品 2026-09-19 确认**线上现行模型就是 DeepSeek Flash**。原报告的对照模型身份因此成立,偏差只剩「抽 33%」;本单要求全量(红线 8),报告改标「= 线上会话模型」。
4. 来源 B执行机拿不到 staging 库。若产品授权,Claude 会话 staging 主机 `docker exec … psql` 只读抽取、脱敏后交给执行方本地文件;未授权则维持让步 1(只报数、不判定)。本单不阻塞在来源 B 上 4. 来源 B产品 2026-09-19 授权,Claude 会话已从 staging 只读抽取并去重脱敏,文件 `source_b.jsonl`(157 条,不入仓)由产品转交执行方,放到 `.cache/jev_intent/source_b.jsonl`(已 gitignore)。抽取口径:`agentic_rectification_turns.user_message` 非空 697 行 → 剔除点选回显(`A. …` / 「先这样」)339 行 → 剔除前端建议芯片原文 76 行 → 按消息文本去重 → 157 条;每条带当轮焦点(按 `asked_at ≤ turn.created_at` 取最近一条,`focus_stale` 标记焦点已在本轮前 resolved 的 22 条)与可反推的 `runtime_intent`85 条:no 49 / weak_yes 18 / yes 13 / unsure 5)。`gold` 留空,执行方逐条人工标注
来源 B 实测分布(**来源 C 生成的长度约束以此为准,取代原单兜底值**):
| 指标 | 值 |
| --- | --- |
| 条数 / 层 | 157:采集 107、无焦点 33、点选 17 |
| 字数 P25 / 中位 / P75 / 最长 | 12 / 21 / 28 / 172 |
| 含标点比例 | 13% |
| 含语气词(吧/呢/啊/嗯/哦/额/emm)比例 | 4% |
| 含年份或月份比例 | 81% |
对照模板语料(中位 11 字、惜字如金 45%、方言前缀 24%):真人回复更长、几乎不用语气词、绝大多数直接报年月。生成提示的人设权重必须按此校正:「惜字如金」与「方言/网络语」两种人设合计不得超过 20%。
5. 原报告结论「不可接」**撤回改为「缺数据」**,`docs/tasks/README.md` 状态行同步改;不得保留「不可接」字样误导后续拍板。 5. 原报告结论「不可接」**撤回改为「缺数据」**,`docs/tasks/README.md` 状态行同步改;不得保留「不可接」字样误导后续拍板。
## 5. 硬红线 ## 5. 硬红线
@@ -48,8 +60,8 @@
原单 §4 五条全部继续生效,另加: 原单 §4 五条全部继续生效,另加:
6. `jev_intent_corpus_build.py` 的生成与复核**必须各有一次真实模型调用**并把模型名、版本、提示原文写进 `scripts/research/jev_intent_samples/README.md``GENERATOR_NAME` / `REVIEWER_NAME` 必须是模型标识,不得再出现 `template` / `rule``tests/test_jev_intent_research.py` 新增断言:构建脚本中不得存在把 `answer_class` 映射到固定词表的生成函数(检查源码里无 `bank = {` 式字面量词库),复核函数不得调用 `re.search` 判标签。 6. `jev_intent_corpus_build.py` 的生成与复核**必须各有一次真实模型调用**并把模型名、版本、提示原文写进 `scripts/research/jev_intent_samples/README.md``GENERATOR_NAME` / `REVIEWER_NAME` 必须是模型标识,不得再出现 `template` / `rule``tests/test_jev_intent_research.py` 新增断言:构建脚本中不得存在把 `answer_class` 映射到固定词表的生成函数(检查源码里无 `bank = {` 式字面量词库),复核函数不得调用 `re.search` 判标签。
7. 来源 C 去重后唯一条数 ≥ 810(≥ 90%);单条重复不得超过 5 次;八种人设每种 ≥ 60 条(点选+采集合计)。不满足即重跑,不得进 T2。 7. 来源 C 去重后唯一条数 ≥ 810(≥ 90%);单条重复不得超过 5 次;八种人设每种 ≥ 40 条(点选+采集合计),且「惜字如金」+「方言/网络语」合计 ≤ 20%;字数 P25 / 中位 / P75 落在来源 B 实测值 ±30% 内(即 P25 816、中位 1527、P75 2036。不满足即重跑,不得进 T2。
8. 现行分类器对照不得再抽样:来源 C **全量**跑一次(自洽率第二次可抽 1/3,与原单让步 2 一致)。 8. 现行分类器DeepSeek Flash= 线上)对照不得再抽样:来源 B 与来源 C **全量**跑一次(自洽率第二次可抽 1/3,与原单让步 2 一致)。
## 6. 任务分解 ## 6. 任务分解
@@ -74,10 +86,11 @@
- 结论三选一:可接 / 不可接 / 缺数据,附 T3 全表、θ 曲线、错例画像(改写后)。来源 B 仍为 0 时,结论最高只能给到「可接(待真机代表性检验)」或「不可接」,不得写成无条件可接。 - 结论三选一:可接 / 不可接 / 缺数据,附 T3 全表、θ 曲线、错例画像(改写后)。来源 B 仍为 0 时,结论最高只能给到「可接(待真机代表性检验)」或「不可接」,不得写成无条件可接。
- 验收:报告「模型」一节列出生成模型、复核模型、对照模型三行各自的模型名 / 版本 / 是否线上会话模型。 - 验收:报告「模型」一节列出生成模型、复核模型、对照模型三行各自的模型名 / 版本 / 是否线上会话模型。
### F4 · 来源 B(条件项) ### F4 · 来源 B
- 仅当产品授权且 Claude 会话交付脱敏文件后执行:执行方逐条人工标注 ≥ 30 条,跑代表性检验(原单 T3) - 文件已交付(§4 第 4 条)。执行方逐条人工标注全部 157 条 `gold``runtime_intent` 只做参考列,不得直接抄为 gold
- 未授权:BLOCKED 条目保持 open,报告写「代表性检验缺席」 - 跑 Jev 两次 + 现行一次,做原单 T3 代表性检验:来源 B 与来源 C 同层准确率差 > 10pp → 结论降为「缺数据」并写明是哪一层
- 验收:README 来源 B 段填实际条数、三层分布、长度分布、标注耗时;BLOCKED 来源 B 条目划掉。
### F5 · 记录 ### F5 · 记录
@@ -91,8 +104,7 @@
1. 争议率两轮提示后仍 > 15%:按实际通过条数跑,配额偏差如实报;**不得**回退到模板生成补数。 1. 争议率两轮提示后仍 > 15%:按实际通过条数跑,配额偏差如实报;**不得**回退到模板生成补数。
2. 单条生成三次重试仍不过复核:丢弃该组合,换人设重抽;红线 7 三项仍须满足。 2. 单条生成三次重试仍不过复核:丢弃该组合,换人设重抽;红线 7 三项仍须满足。
3. 模型调用限流:退避重试,脚本断点续跑;不得缩小样本。 3. 模型调用限流:退避重试,脚本断点续跑;不得缩小样本。
4. 现行对照模型名产品未告知:用 DeepSeek 顶,报告标明 4. 来源 B 人工标注做不完 157 条:至少标满点选 17 + 采集 60 + 无焦点 20 = 97 条,其余标 `unlabeled` 不计入分母;不得用模型代标
5. 来源 B 未授权:维持让步 1。
## 8. 开工前置命令 ## 8. 开工前置命令