research(rectification): DeepSeek Flash 抽 33% 对照现行分类器提示词
来源 B 仍为 0。Flash 套生产提示词,采集题相对门槛未过。结论仍不可接。
This commit is contained in:
File diff suppressed because it is too large
Load Diff
@@ -9,7 +9,7 @@
|
||||
|
||||
## 结论
|
||||
|
||||
**不可接**。来源 C 上 Jev 的绝对门槛未过:高置信错误率 7.0% > 3%;低置信召回 34.1% / 34.2% < 60%(错了却仍高置信);点选题 `answer_class` 准确率 65.0%(写库字段)。来源 B 不足 30 条,代表性检验只报数、不判定。现行模型对照未跑,相对 −3pp 门槛无法计算。
|
||||
**不可接**。来源 C 上 Jev 的绝对门槛未过:高置信错误率 7.0% > 3%;低置信召回 34.1% / 34.2% < 60%(错了却仍高置信);点选题 answer_class 准确率 65.0%(写库字段)。来源 B 不足 30 条,代表性检验只报数、不判定。 相对 −3pp(同一样本):choice Jev 89.5% vs 现行 92.5%(门槛 89.5%,过);collect Jev 91.0% vs 现行 95.5%(门槛 92.5%,未过);none Jev 100.0% vs 现行 97.0%(门槛 94.0%,过)。
|
||||
|
||||
若接:不接。现行分类器继续用会话选定的贵模型。若还要观察中文口语,只允许 (b) 影子双跑只记日志,不得按 confidence 写库。曲线上 θ=0.9 时高置信错误仍未清零。
|
||||
|
||||
@@ -21,11 +21,25 @@
|
||||
| collect | 400 | 90.5% | 83.6% | 97.0% | 7.0% | 13.5% | 34.2% | 22 | 98.0% | 901 | 1026 | 987 |
|
||||
| none | 100 | 100.0% | — | 100.0% | 0.0% | 4.0% | — | 0 | 100.0% | 923 | 1018 | 923 |
|
||||
|
||||
来源 A(测试夹具,n=10):intent 90.0%,answer_class 85.7%,高置信错误 0.0%。
|
||||
来源 A(测试夹具,n=10)intent 90.0%,answer_class 85.7%,高置信错误 0.0%。
|
||||
|
||||
## 现行模型对照
|
||||
|
||||
本机无会话模型目录凭据(模型 key 在数据库加密配置里)。现行 `classifyRectificationTurnIntent` 对照未跑。
|
||||
模型:`deepseek-flash`。DeepSeek Flash 顶现行 `classifyRectificationTurnIntent` 提示词;来源 C 分层随机 33%(seed 20260919),来源 A 全量。不是线上会话模型。
|
||||
|
||||
| 层 | n | intent | answer_class | dated | 自洽率 | 中位 ms |
|
||||
| --- | ---: | ---: | ---: | ---: | ---: | ---: |
|
||||
| choice | 133 | 92.5% | 83.0% | 100.0% | 100.0% | 638 |
|
||||
| collect | 133 | 95.5% | 95.8% | 97.7% | 95.5% | 611 |
|
||||
| none | 33 | 97.0% | — | 100.0% | 100.0% | 705 |
|
||||
|
||||
同一样本上 Jev vs 现行(相对门槛用这一表):
|
||||
|
||||
| 层 | n | Jev intent | 现行 intent | 差(Jev−现行) | 门槛现行−3pp |
|
||||
| --- | ---: | ---: | ---: | ---: | ---: |
|
||||
| choice | 133 | 89.5% | 92.5% | -3.0% | 89.5% |
|
||||
| collect | 133 | 91.0% | 95.5% | -4.5% | 92.5% |
|
||||
| none | 33 | 100.0% | 97.0% | 3.0% | 94.0% |
|
||||
|
||||
## 代表性检验(来源 B vs 来源 C)
|
||||
|
||||
|
||||
@@ -25,7 +25,7 @@
|
||||
|
||||
- Jev:`jev-1.13.0`,`POST /v1/systemone`,SDK `typesafe-sdk 0.7.0`,三题同一请求。
|
||||
- 时间:2026-09-19,来源 A+C 各 2 次;unavailable = 0。
|
||||
- 现行分类器:未跑(模型 key 在数据库加密配置,本机没有)。
|
||||
- 现行对照:`deepseek-flash`(官方 Chat Completions,thinking 关)套生产分类器提示词。来源 C 分层随机 33%(seed 20260919)= 133+133+33,来源 A 全 10 条;第一次 309,第二次分层 1/3。unavailable = 0。**不是线上会话模型。** 来源 B 仍为 0。
|
||||
|
||||
## 指标(来源 C)
|
||||
|
||||
@@ -37,23 +37,34 @@
|
||||
|
||||
来源 A n=10:intent 90.0%,answer_class 85.7%,高置信错误 0。
|
||||
|
||||
两次合计输入约 1.85M tok,按 $0.042/Mtok ≈ $0.08。输出免费。
|
||||
Jev 两次合计输入约 1.85M tok,按 $0.042/Mtok ≈ $0.08。
|
||||
|
||||
### 同一样本 DeepSeek Flash vs Jev(C 分层 33%)
|
||||
|
||||
| 层 | n | Jev intent | Flash intent | Flash answer_class | 差 | 门槛(Flash−3pp) | 相对 |
|
||||
| --- | ---: | ---: | ---: | ---: | ---: | ---: | --- |
|
||||
| 点选题 | 133 | 89.5% | 92.5% | 83.0% | −3.0pp | 89.5% | 过 |
|
||||
| 采集题 | 133 | 91.0% | 95.5% | 95.8% | −4.5pp | 92.5% | **未过** |
|
||||
| 无焦点 | 33 | 100% | 97.0% | — | +3.0pp | 94.0% | 过 |
|
||||
|
||||
Flash 自洽率:点选题 100%、采集 95.5%、无焦点 100%。中位延迟 611–705 ms。
|
||||
|
||||
## 结论
|
||||
|
||||
**不可接。** 绝对门槛未过:高置信错误 7.0% > 3%;低置信召回 ≈34% < 60%;点选题 `answer_class` 65%。中文口语(「就是那段」「嗯那会儿吧」)和字面理解是主要错因。自洽率高,说明错得稳定,不是随机抖动。
|
||||
**不可接。** 绝对门槛未过:高置信错误 7.0% > 3%;低置信召回 ≈34% < 60%;点选题 `answer_class` 65%。相对门槛在采集题上也未过(91.0% < 92.5%)。Flash 在点选题 `answer_class`(83%)和采集题(95.8%)都明显高于 Jev。中文口语和字面理解是 Jev 主错因。
|
||||
|
||||
若接:不接。继续用会话贵模型。只允许 (b) 影子双跑记日志;不得按 confidence 写库。θ=0.9 时高置信错误仍未清零。
|
||||
若接:不接。继续用会话贵模型。只允许 (b) 影子双跑记日志;不得按 confidence 写库。
|
||||
|
||||
相对 −3pp 因现行模型未跑而无法计算,不改变「不可接」。
|
||||
来源 B 仍为 0,代表性检验只报数。
|
||||
|
||||
## 偏离
|
||||
|
||||
1. 来源 B = 0:无 staging 库。按让步 1。
|
||||
2. 来源 A:测试文件并无 10 条 `(userMessage, 期望输出)` 夹具,改从该文件的 schema + 两句真实 `userMessage` 构造。
|
||||
3. 来源 C 生成未走会话贵模型(无凭据)。产品口径「Agent 模拟造语料」;生成/复核模型名写进报告。
|
||||
4. Windows 上 worktree `.venv` 是 25 字节 Linux symlink。`typesafe-sdk` 装进本机 Anaconda 3.11.7,未改 `requirements*.txt`。
|
||||
5. 未写 BUG_HISTORY(本单不是 Bug;现行分类器未跑,没有「同一输入稳定分错」的实证)。
|
||||
4. 现行对照用 `deepseek-flash` 套同一提示词,不是数据库里的会话默认模型。
|
||||
5. Windows 上 worktree `.venv` 是 25 字节 Linux symlink。`typesafe-sdk` 装进本机 Anaconda 3.11.7,未改 `requirements*.txt`。
|
||||
6. 未写 BUG_HISTORY(本单不是 Bug)。
|
||||
|
||||
## 验证
|
||||
|
||||
|
||||
Reference in New Issue
Block a user