Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
27 changes: 27 additions & 0 deletions scripts/bench/README.md
Original file line number Diff line number Diff line change
Expand Up @@ -664,3 +664,30 @@ bound / none / undecided。0044 的门槛:裁判精度不低于完整原型的
每篇 token 从 15.8 万 / 18.3 万到 3.1 万 / 3.4 万。组 4 有两篇文档的勘误回复不是合法 JSON,重试三次后
放弃,那两篇没勘误,任务记为失败(`jobs.last_error`)。

### 温库第二批:产品口径的每篇边际成本(2026-09-25,同一二进制,组 3 的库再灌 100 篇)

`--into <kb> --corpus redocred-100b`:`fetch-redocred.mjs --seed 2 --name redocred-100b --exclude corpora/redocred-100.json`
抽的第二批 100 篇(与第一批零重叠,3600 条金标全在库里那 95 条属性上),灌进组 3 跑完的库,只排新文档的
抽取,对齐照常(已判过、指纹没变的签名不重问),只对新文档打分,token 从服务端日志按阶段算
(`BENCH_SERVER_LOG`)。裁判只抽本批文档有证据的事实——全库抽样会抽到第一批的事实,脚本正文表里没有它们,
模型读到空正文就判 not_stated(第一次跑就是这么得出 24.6% 的)。

| 第二批 | 值 |
|---|---|
| 开放陈述 / 全库实体 | 1491 / 3217 |
| 全库签名 bound / none / undecided(第一批跑完时 426 / 1178 / 178) | 674 / 1698 / 277 |
| 类型化 勘误前 → 后 | 486 → 684 |
| gold recall 勘误前 → 后(同句) | 5.6%(7.7%)→ 8.3%(11.7%) |
| 裁判精度(勘误后,200 抽样) | 80.0% |
| 勘误 | 看了全库 200 篇 1209 条:撤 7 / 改 2 / 加 499 / 留人 221 |
| token:抽取 / 对齐 / 勘误 / 合计 | 68 万 / 142 万 / 39 万 / 255 万 |
| 每篇 | 2.5 万(新库 3.1 万) |
| 用时 | 67 分 |

读数:温库只省了 18%,对齐从每篇 2.2 万到 1.4 万,没有摊薄多少——第二批 100 篇带来约 800 条新签名
(绑定 +248,判无 +520),和第一批的约 1000 条差不多。Re-DocRED 是维基百科各领域的条目,短语签名跨文档
几乎不重复;每条签名约 1.4 千 token,每篇 8 到 10 条。同一领域的语料重复率会高得多,那是摊薄能兑现
的地方,这份语料量不出来。第二批召回低于第一批(同句 7.7% 对 14.2%),因为库里已经判"无"的签名不再重问,
第一批判错的"无"第二批照样错——温库就是这样工作的。勘误在温库上复查了全部 200 篇:新绑定给旧文档也添了
类型化事实,所以旧文档也在它的清单里,每篇边际里的勘误那 0.4 万有一半是复查旧文档。

Loading
Loading