The earlier report had no previous-turn rows. This run measures V0, V1, V2, and Flash on the re-extracted corpus and records that the real sample is not representative of the simulated set. Co-authored-by: Cursor <cursoragent@cursor.com>
3.9 KiB
3.9 KiB
进度 · Jev 意图分类 v2:上一轮放进 state(2026-09-27)
- 分支:
codex/jev-intent-v2-20260927 - 基线:
origin/staging@fdb7087b(任务书提交710c848b在其历史上;本机 fetch 后 staging 尖端是fdb7087b) - 任务书:
docs/tasks/TASK-rectification-jev-intent-classifier-research-v2-20260927.md - 报告:
docs/research/jev_intent_2026_09_27.md/.json - 结论:缺数据。来源 B 与来源 C 同层 intent 差超过 10pp(点选 23.7 pp,无焦点 38.8 pp)。只看这批来源 B,V2 链式高置信错误 8.0% > 3%,低置信召回 27.2% < 60%,同样过不了门。
已跑到的数
| 项 | 结果 |
|---|---|
| 来源 B | 715(点选 269 / 采集 336 / 无焦点 110)。有上一轮 634,无上一轮 81 |
| gold | 执行方阅读 565;点选回显 150。09-19 文件不在本机,按 turn_id 对回 0 |
| Jev V0 | intent 79.4%,高置信错误 12.9%,低置信召回 15.1%,自洽 98.9% |
| Jev V1 | intent 75.0%,高置信错误 9.4%,低置信召回 31.9%,自洽 94.3% |
| Jev V2 链式(自喂) | intent 75.9%,高置信错误 8.0%,低置信召回 27.2%,自洽 93.3% |
| Jev V2 gold 上界 | intent 75.7%,高置信错误 7.7%,低置信召回 28.8%,自洽 93.8% |
| Flash V0 / Flash+V1 | intent 75.7% / 74.0%。Flash 没有置信度 |
| 无焦点 unclear→answer | V0 43,V1 32,V2 链式 33,Flash V0 42,Flash+V1 43 |
| 无焦点 intent | V0 58.2%,V2 链式 46.4%。高置信错误 32.7% → 16.4% |
| 承接分 | 链式中位 0.16,最大 0.86,≥0.9 为 0,沿用上一轮 0 条 |
| 来源 C V0(只跑一次) | 点选 98.8%(公布 99.0%,−0.25 pp),采集 92.5%(+0.30 pp),无焦点 97.0%(+1.0 pp) |
门槛不放宽。V2 相对 V0 的无焦点高置信错误下降了,但绝对数仍高于 3%,而且无焦点层总准确率下降。来源 C 与 09-19 公布值的差在 ±1 pp 内。
接口
- SDK:
typesafe-sdk 0.7.0(未升级) - 模型:响应字段
model=jev-1.13.0 - 来源 B:Jev V0/V1/V2 链式/V2 gold 各两次,Flash V0 与 Flash+V1 各一次。715 条全部
ok - 来源 C:Jev V0 一次,900 条全部
ok。没有上一轮,不跑 V1/V2 - 延迟(来源 B 第一次,中位 / P95 ms):V0 1178 / 1376,V1 1187 / 1358,V2 链式 1206 / 1362,V2 gold 1207 / 1399,Flash V0 705 / 989,Flash+V1 717 / 1016
- 费用:来源 B 的 Jev 八次 6887443 input tok,约 $0.2893;来源 C 一次 939273 input tok,约 $0.0394。Flash 两次 747581 input tok,不按 Jev 单价计。原文只在 gitignore 的
.cache/jev_intent/
代码
build_state(..., variant=):默认仍是四字段。V1 加previous_turn,V2 再加previous_decision和承接 Noul。Choice 的 criteria 原文没改continues_previous_turn ≥ 0.9时沿用上一轮 intent,再走enforce_combo。这一批最大 0.86,规则没有改过任何一条- 已关闭焦点(
resolved_at早于本轮)不再当成当前题 - 未改
frontend/src/**,未加部署环境变量
测试
PYTHONPATH=. python3 -m unittest tests.test_jev_intent_research:16 passed。任务书要求从 11 增到至少 14。现有文件在开工时已有 V1/V2 与报告重算用例,本次再加 1 条:已关闭焦点不是当前题。
--from-report 能从报告 JSON 的 rows 重算上表。rows 不含用户原文。
偏离
- 上一笔进度写「deploy 被拒、来源 B 抽不出」。本机用
deploy与~/.ssh/jyotisha-staging抽出 715 条。那条阻塞解除。 - 09-19 的
source_b.jsonl不在本机,旧 157 条对不回turn_id。新增 gold 是执行方按生产标注规范逐组阅读后写入,不是模型代标,也不是关键词表。点选回显 150 条单独记option_echo。 - 来源 C 按任务书只跑 V0 一次,所以自洽率空着。公布值对照用这一次。
- 高置信阈值仍是 0.8,与 09-19 相同,没有改成 0.9。