Skip to content
getaskclawPublic

About

AMBER (sealed-in-amber historical replay evaluation): real-event replay, physical sealing, pre-registered scoring — method spec; cases private, results public

Topics

Resources

Contributing

Stars

22 stars

Watchers

0 watching

Forks

Repository files navigation

English · 简体中文

AMBER — 琥珀式封存的历史回放评测

封进琥珀,重做当时的题。

一句话:拿真实发生过的事故和任务,让 AI 模型只用当时手里的信息重做一遍。比如一次真实的运维故障:模型只能拿当时的监控和日志找根因,事后才揭晓的证据一律封存不给看。题目永不公开,但每题有哈希指纹,分数和指纹全部公开,谁都能核对题没被换、分不是编的。

案集 24 案 · 规范 v0.2.2(草案) · 哈希索引 v2026-09 · 成绩仓 × 13 · 纪律 只发分数,不发题 · 官网榜单 askclaw.dev

⚠️ 更正(原文与受影响车道清单见榜单全文)

  • 2026-10-02:22 张已发布的考卷在作答时越出考卷、接触了判分材料,改记 NA(不计胜负)。责任在我们;2026-10-01 起已改为隔离容器作答。
  • 2026-10-02(另一项):防御轴的一案 A-d511f9e8 在所有车道上改记 NA。分母不变,过案数不变,每条道的总分都带 '。
  • 2026-10-07:运维轴的一案 A-24bcf707 在七条车道上由「未过」改记 NA(判分要求比题面多了一条)。分母不变,总分和名次档不变,不重考任何场次。
  • 2026-10-07(另一项):审查轴的一案 A-cdc3d11a 在所有车道上改记 NA(27 条车道由「未过」改记,2 条原来就是 NA)。分母不变,总分和名次档不变,不重考任何场次。
  • 更早:2026-09-18(swe-2-low 实为 swe-2-high)· 2026-W38(全库复核,逐仓特刊)

现在谁领先

当前前五 2026-W41(含 2026-10-02 更正、2026-10-02 考试、2026-10-04 WorkBuddy 直连四条道、2026-10-06 五场新考、2026-10-07 品牌案重考一案与 A-d511f9e8 全车道挂起)

下表是榜上全部 35 道已发布车道,共 7 档;档内按中位用时排序,与站点默认排序一致。冻结道照常计入档位,成绩是封存记录,不再加新场次。同档内案数不同的,档位总分不带分母,案数写在道名后。swe-2 的 ACP 道与三条 API 道同属 Devin Max 账号池,调用方式不同,不据此比较(见 /devin/)。

# 总分 模型 @ 端点
1 19'/24 claude-sonnet-5-5 @ Anthropic 订阅道(W40)
claude-opus-5-5 @ Anthropic 订阅道(W40)
swe-2-max (API) @ Devin(W41)
swe-2-max (ACP) @ Devin(W37)
2 18'/24 glm-5.3-flash (Ollama Cloud) @ Ollama Cloud(W37)
deepseek-v4.1-flash (WorkBuddy 直连) @ WorkBuddy 直连(W40)
k3 @ Kimi 官方 coding(W38)
hy4-preview-f (WorkBuddy ACP) @ WorkBuddy ACP(W37)
step-5-preview @ stepfun plan 端点(W41)
3 17'/24 gpt-6-sol-900k @ OpenAI Codex(W39)
glm-5.3-flash (WorkBuddy 直连) @ WorkBuddy 直连(W40)
gpt-5.6-luna @ OpenAI Codex(W41)
doubao-seed-evolving @ 火山方舟 Agent Plan(W38)
4 16'/24 gpt-6-luna @ OpenAI Codex(W41)
swe-2-medium (API) @ Devin(W41)
claude-fable-5-1 @ Anthropic 订阅道(W40)
claude-haiku-5.5 @ Nous Portal(W41)
deepseek-flash (GA) @ DeepSeek 官方(W37) ▼
minimax-m3 (WorkBuddy 直连) @ WorkBuddy 直连(W40)
gpt-6-astra-900k @ OpenAI Codex(W39)
gpt-6.1-sol @ OpenAI Codex(W40)
gpt-5.6-luna-900k (high 档) @ OpenAI Codex(W37)
gpt-5.6-luna-900k (W41) @ OpenAI Codex
mimo-v2.6-pro @ CommandCode(W39) ▼
hy4-preview-f (WorkBuddy 直连) @ WorkBuddy 直连(W40)
laguna-s-2.1 (Nous Portal) @ Nous Portal(W41)
5 15' gpt-6-luna-900k @ OpenAI Codex(W41)
deepseek-v4.1-flash (CommandCode) @ CommandCode(W37,冻结·封存记录,23 案)
deepseek-flash (OpenCode Go) @ OpenCode Go(W37) ▼
swe-2-high (API) @ Devin(W41)
gpt-5.6-sol-900k (high 档) @ OpenAI Codex(W38,23 案)
Qwen3.8-27B @ 社区自部署 3×V100(W38)
6 14' qwen3.8-27b @ CrofAI(W36,冻结·封存记录,21 案)
laguna-s-2.1 (CommandCode) @ CommandCode(W41)
7 13'/24 space-bunny-alpha @ CommandCode(W39)

' = 其中有案暂不计分(NA),不算输;现在每条道都带,因为 A-d511f9e8 在所有车道上暂不计分。同名模型换个端点可能是另一个脑,所以成绩一律按「端点 × 名字」记。claude-opus-5-5 取 W40 重考一场(W39 首考 17'/24):两场各考一次、考场不同,不据此判断强弱,见 amber-claude W40。▼ = 经 2026-10-02 更正下调。WorkBuddy 直连(W40)的四条道是 2026-10-04 隔离考场的新场次,和 W37(ACP 道)、W39(直连道场次)不可逐格对比;hy4-preview-f 在榜上有 ACP(W37,18')和直连(W40,16')两行,是两条不同的道、不同的考场,不据此判断强弱,见 amber-workbuddy W40。2026-10-06(W41)的五场新考也在隔离考场:gpt-5.6-luna、gpt-5.6-luna-900k(W41)、gpt-6-luna 是三条新入榜的道;step-5-preview 与 gpt-6-luna-900k 榜上改取 2026-10-06 重考一场:gpt-6-luna-900k 是 15'/24;step-5-preview 当场是 17'/24,品牌案 A-d9b79b46 的题面修订后(见 hash-index 的 2026-10-07 换版说明),该案于 2026-10-07 单案重考通过,现为 18'/24(3 NA:A-d511f9e8 挂起,另两案撞考场时间上限)。step-5-preview 在 W38 首考的 15'(经 2026-10-02 更正下调、曾标 ▼)不再作榜上成绩,所以不再带 ▼。这些场次和 W37–W39 的场次不可逐格对比;step-5-preview 与 gpt-6-luna-900k 的新旧两场各考一次、考场不同,不据此判断强弱。榜上有两条 gpt-5.6-luna-900k,是两条不同的道:「(high)」一条是 W37 基线(high 档)的成绩,「(W41)」一条是 2026-10-06 隔离考场的新场次。W41 各场的逐案成绩见 amber-gpt W41(gpt-5.6-luna、gpt-5.6-luna-900k、gpt-6-luna、gpt-6-luna-900k 四场)和 amber-stepfun W41(step-5-preview)。各车道出处、脚注、冻结道:榜单全文。

同分不同款

总分相同的车道,强项和短板可以完全不同。点越大、颜色越深,完成度越高;NA = 该轴没有可计分的案,不是零分。

完成度矩阵:榜上总分 18 以上的 8 条车道,十轴,24 案,2026-10-07

图中 8 条 = 榜上总分 18 以上的全部车道(2026-10-07 的库)。hy4-preview-f 取 ACP(W37)一行;同名的直连(W40,16')总分不到 18,不在图内。deepseek-v4.1-flash @ WorkBuddy 直连(W40)的 UI 轴只有一案 A-d9b79b46,该案挂起、记 NA,所以那一格是 NA 不是零分;它的视觉格取考场修复后的重考卷,见 amber-workbuddy W40。防御轴按 A-d511f9e8 在所有车道上 NA 的口径算,各格只剩另一案的读数(两案都没有可计分结果的格是 NA)。审查轴同样按 A-cdc3d11a 在所有车道上 NA 的口径算,各格只剩另一案的读数。step-5-preview(W41)的 UI 格是 1.00:品牌案 A-d9b79b46 在题面修订后于 2026-10-07 单案重考通过(12/12),见 amber-stepfun W41;它的防御和归因两格是 NA,因为这两轴各有一案撞考场时间上限、没有可计分结果。

读法:动手干活的「施工面」几乎全满,差别在「判断面」。每格 = 该轴全部案子的完成度(0–1)。官方榜 askclaw.dev 也用这十个轴。

面 轴 考什么
施工面 编码 照需求把功能写对
交付 做完要交卷,没产出就是 0
运维 照规程干脏活,一步不省
需求 客户要 A 不要 B,交上去得是 A
收敛 真干完,还是绕圈装忙
判断面 UI 照设计稿做页面,像素级验收
视觉 给真截图挑毛病
防御 堵死校验器的漏洞,还不误伤好人
归因 把每条毛病对到正确根因
审查 给别人的交付物挑错,漏看和冤枉都扣分

各轴的详细读法、每条车道的数字:十个轴与完成度矩阵。

它怎么运作

私有题库 + 公开成绩:题目永不公开,分数与哈希永远可查。评分标准在看到任何输出之前就已冻结,全程留档。

AMBER 是什么

一期成绩像一场考试:出卷封存、净室应考、逐卷验脑、脱敏发布、人人可核对。

一期成绩怎么炼成

另有三个发现(思考档位、token 账单、耗时与分数的关系):docs/findings-effort-and-speed.md。

成绩仓

成绩与题目分开发布:结果公开,题目永不公开。别名 + bundle 哈希逐案对照本仓的公开哈希索引。

amber-claude(Claude)· amber-gpt(GPT)· amber-devin(Devin)· amber-kimi(Kimi)· amber-deepseek(DeepSeek)· amber-ollama(Ollama Cloud)· amber-opencode(OpenCode Go)· amber-commandcode(CommandCode)· amber-workbuddy(WorkBuddy)· amber-doubao(豆包)· amber-stepfun(阶跃星辰)· amber-nous(Nous Portal)· amber-goldenpotato(社区自部署 Qwen3.8-27B)

常见问题

题目不公开,凭什么信分数? 靠可验证的过程:净室考场、逐卷验脑(替身 = 整卷作废)、收卷闸、别名 + 哈希公开、harness 版本每期钉死(现役 Hermes)。考场条件的变更逐条公开,最近一次:方法变更 2026-10-01。

为什么不公开题目? 公开题库会被训练数据吃掉,分数通胀、无法审计。题目私有,泄漏状态才可核查。

两个模型的分能直接比吗? 只在同档、同题集版本、尽量同日时可比。跨周对比必须带日期和档位。

能复现或加入吗? 目前不能:仅凭公仓还跑不通一次合规运行(见 PLAN.md)。追结果请订阅成绩仓;方法论问题欢迎开 issue。

规范与文档

  • AMBER-Core-Specification.md — 规范本体(English)

  • protocols/distribution.md · protocols/stability.md — 分发协议、稳定性协议

  • hash-index/v2026-09.md — 公开哈希索引(24 案)

  • PLAN.md · CONTRIBUTING.md — 路线图;贡献规则(本仓绝不接收案件内容)

  • docs/ — 全部文档索引(榜单全文、十个轴、研究笔记、更正声明、案件清单 schema 与校验器)

  • 状态:草案 v0.2.2。Core 规范已稳定;profiles/ 和建案/运行工具尚未发布。

  • 两条绕不开的警告:① 运行时密封 ≠ 训练数据纯净——我们封存的是运行时证据,模型训练时有没有见过未来,我们证明不了。② 历史结果是证据,不是唯一正解。

  • 为什么需要它:公开基准是静态题库,污染普遍且无法审计,也测不出多步诊断、弃权、拒绝、在不确定中升级。AMBER 回放来源受控的真实事件,与公开基准互补,不取代它们。

许可

Apache-2.0 — 见 LICENSE。

About

AMBER (sealed-in-amber historical replay evaluation): real-event replay, physical sealing, pre-registered scoring — method spec; cases private, results public

Topics

Resources

Contributing

Stars

22 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages