research(rectification): DeepSeek Flash 抽 33% 对照现行分类器提示词
Independent Staging Quality Gate / validate (push) Successful in 10m16s
Independent Staging Quality Gate / publish (push) Successful in 3m57s

来源 B 仍为 0。Flash 套生产提示词,采集题相对门槛未过。结论仍不可接。
This commit is contained in:
jesse-ux
2026-09-19 09:45:29 +08:00
parent fde541c2ca
commit d6fc4fb8b3
7 changed files with 8610 additions and 527 deletions
File diff suppressed because it is too large Load Diff
+17 -3
View File
@@ -9,7 +9,7 @@
## 结论
**不可接**。来源 C 上 Jev 的绝对门槛未过:高置信错误率 7.0% > 3%;低置信召回 34.1% / 34.2% < 60%(错了却仍高置信);点选题 `answer_class` 准确率 65.0%(写库字段)。来源 B 不足 30 条,代表性检验只报数、不判定。现行模型对照未跑,相对 −3pp 门槛无法计算
**不可接**。来源 C 上 Jev 的绝对门槛未过:高置信错误率 7.0% > 3%;低置信召回 34.1% / 34.2% < 60%(错了却仍高置信);点选题 answer_class 准确率 65.0%(写库字段)。来源 B 不足 30 条,代表性检验只报数、不判定。 相对 3pp(同一样本):choice Jev 89.5% vs 现行 92.5%(门槛 89.5%,过);collect Jev 91.0% vs 现行 95.5%(门槛 92.5%,未过);none Jev 100.0% vs 现行 97.0%(门槛 94.0%,过)
若接:不接。现行分类器继续用会话选定的贵模型。若还要观察中文口语,只允许 (b) 影子双跑只记日志,不得按 confidence 写库。曲线上 θ=0.9 时高置信错误仍未清零。
@@ -21,11 +21,25 @@
| collect | 400 | 90.5% | 83.6% | 97.0% | 7.0% | 13.5% | 34.2% | 22 | 98.0% | 901 | 1026 | 987 |
| none | 100 | 100.0% | — | 100.0% | 0.0% | 4.0% | — | 0 | 100.0% | 923 | 1018 | 923 |
来源 A(测试夹具,n=10intent 90.0%answer_class 85.7%,高置信错误 0.0%。
来源 A(测试夹具,n=10intent 90.0%answer_class 85.7%,高置信错误 0.0%。
## 现行模型对照
本机无会话模型目录凭据(模型 key 在数据库加密配置里)。现行 `classifyRectificationTurnIntent` 对照未跑
模型:`deepseek-flash`。DeepSeek Flash 顶现行 `classifyRectificationTurnIntent` 提示词;来源 C 分层随机 33%seed 20260919),来源 A 全量。不是线上会话模型
| 层 | n | intent | answer_class | dated | 自洽率 | 中位 ms |
| --- | ---: | ---: | ---: | ---: | ---: | ---: |
| choice | 133 | 92.5% | 83.0% | 100.0% | 100.0% | 638 |
| collect | 133 | 95.5% | 95.8% | 97.7% | 95.5% | 611 |
| none | 33 | 97.0% | — | 100.0% | 100.0% | 705 |
同一样本上 Jev vs 现行(相对门槛用这一表):
| 层 | n | Jev intent | 现行 intent | 差(Jev−现行) | 门槛现行−3pp |
| --- | ---: | ---: | ---: | ---: | ---: |
| choice | 133 | 89.5% | 92.5% | -3.0% | 89.5% |
| collect | 133 | 91.0% | 95.5% | -4.5% | 92.5% |
| none | 33 | 100.0% | 97.0% | 3.0% | 94.0% |
## 代表性检验(来源 B vs 来源 C)
@@ -25,7 +25,7 @@
- Jev`jev-1.13.0``POST /v1/systemone`SDK `typesafe-sdk 0.7.0`,三题同一请求。
- 时间:2026-09-19,来源 A+C 各 2 次;unavailable = 0。
- 现行分类器:未跑(模型 key 在数据库加密配置,本机没有)
- 现行对照:`deepseek-flash`(官方 Chat Completionsthinking 关)套生产分类器提示词。来源 C 分层随机 33%seed 20260919= 133+133+33,来源 A 全 10 条;第一次 309,第二次分层 1/3。unavailable = 0。**不是线上会话模型。** 来源 B 仍为 0
## 指标(来源 C
@@ -37,23 +37,34 @@
来源 A n=10intent 90.0%answer_class 85.7%,高置信错误 0。
两次合计输入约 1.85M tok,按 $0.042/Mtok ≈ $0.08。输出免费。
Jev 两次合计输入约 1.85M tok,按 $0.042/Mtok ≈ $0.08。
### 同一样本 DeepSeek Flash vs JevC 分层 33%
| 层 | n | Jev intent | Flash intent | Flash answer_class | 差 | 门槛(Flash3pp | 相对 |
| --- | ---: | ---: | ---: | ---: | ---: | ---: | --- |
| 点选题 | 133 | 89.5% | 92.5% | 83.0% | 3.0pp | 89.5% | 过 |
| 采集题 | 133 | 91.0% | 95.5% | 95.8% | 4.5pp | 92.5% | **未过** |
| 无焦点 | 33 | 100% | 97.0% | — | +3.0pp | 94.0% | 过 |
Flash 自洽率:点选题 100%、采集 95.5%、无焦点 100%。中位延迟 611705 ms。
## 结论
**不可接。** 绝对门槛未过:高置信错误 7.0% > 3%;低置信召回 ≈34% < 60%;点选题 `answer_class` 65%。中文口语(「就是那段」「嗯那会儿吧」)和字面理解是主要错因。自洽率高,说明错得稳定,不是随机抖动
**不可接。** 绝对门槛未过:高置信错误 7.0% > 3%;低置信召回 ≈34% < 60%;点选题 `answer_class` 65%。相对门槛在采集题上也未过(91.0% < 92.5%)。Flash 在点选题 `answer_class`(83%)和采集题(95.8%)都明显高于 Jev。中文口语和字面理解是 Jev 主错因
若接:不接。继续用会话贵模型。只允许 (b) 影子双跑记日志;不得按 confidence 写库。θ=0.9 时高置信错误仍未清零。
若接:不接。继续用会话贵模型。只允许 (b) 影子双跑记日志;不得按 confidence 写库。
相对 −3pp 因现行模型未跑而无法计算,不改变「不可接」
来源 B 仍为 0,代表性检验只报数
## 偏离
1. 来源 B = 0:无 staging 库。按让步 1。
2. 来源 A:测试文件并无 10 条 `(userMessage, 期望输出)` 夹具,改从该文件的 schema + 两句真实 `userMessage` 构造。
3. 来源 C 生成未走会话贵模型(无凭据)。产品口径「Agent 模拟造语料」;生成/复核模型名写进报告。
4. Windows 上 worktree `.venv` 是 25 字节 Linux symlink。`typesafe-sdk` 装进本机 Anaconda 3.11.7,未改 `requirements*.txt`
5. 未写 BUG_HISTORY(本单不是 Bug;现行分类器未跑,没有「同一输入稳定分错」的实证)
4. 现行对照用 `deepseek-flash` 套同一提示词,不是数据库里的会话默认模型
5. Windows 上 worktree `.venv` 是 25 字节 Linux symlink。`typesafe-sdk` 装进本机 Anaconda 3.11.7,未改 `requirements*.txt`
6. 未写 BUG_HISTORY(本单不是 Bug)。
## 验证