您的位置:首页 > 手游攻略 > ElevenPowers:AI Agent 工具实践指南

ElevenPowers:AI Agent 工具实践指南

作者:互联网  时间: 2026-10-05 09:30:02  

工作中遇到相关需求时,ElevenPowers值得先读说明,因为它主要用于用类似 make 的机制验证正确性声明,判定编码代理的任务是否真正完成,并在代码变更后撤销旧结论。从软件开发的使用方式看,依赖、接口和异常处理往往比主路径更影响采用是采用前必须回答的问题。试跑可以从在隔离分支完成一个可回滚的小任务开始,并把安装步骤、接口契约、测试结果和错误信息写进验收记录。我会把它列入需要可检查开发流程而非单次演示的工程师的候选清单,而不是仅凭项目介绍直接纳入生产。

SatyamSingh-Git/ElevenPowers 项目截图 1

这是什么。 编码代理的完成门。 它监视您的代理已经运行的命令,将其输出转换为证据,并将每个记录绑定到它观察到的文件的确切字节。 当代理声称它已完成时,状态将被计算而不是相信。 之后编辑一个文件,它的绿色测试就会变得过时——就像 make 使目标文件失效一样。

这条路是我们要走的。

它的终点从来不是我们选择的。

所以请诚实行事——并保留收据。

第三十秒版本

要求编码代理修复错误,它会告诉您错误已修复。

它所说的是它所理解的事实。这就是问题所在。已发布的测量结果表明,“声称”完成和“实现”完成之间存在百分之几十的差距——一项研究发现,一个前沿模型在每次运行时都会提交补丁,并解决了其中 44% 的问题。提示模型更加小心并不能缩小这一差距,因为模型从不说谎。它根本无法知道。

所以别再问了。

每个代理都已经运行命令。测试、类型检查、构建、三分钟前写的失败的复制品。所有这些输出都在回滚的过程中流过未读的内容。 ElevenPowers 读取它,将其归档作为证据,并用它所看到的文件的指纹标记每条记录。

flowchart LR
    A["agent runs
pytest · tsc · build"] --> B["runtime reads
the tool result"]
    B --> C["evidence record
+ fingerprint of
every file observed"]
    C --> D[("ledger")]
    D --> E{"gate computes
a state"}
    E --> V["VERIFIED"]
    E --> U["UNVERIFIED"]
    E --> S["STALE"]
    E --> X["CONTRADICTED"]

    classDef ok fill:#d4f4dd,stroke:#22a06b,color:#0b3d2c
    classDef warn fill:#ffeaa7,stroke:#d98e04,color:#5c3c00
    classDef stale fill:#dfe6ee,stroke:#7b8a9b,color:#1f2d3a
    classDef bad fill:#ffd9d9,stroke:#d64545,color:#5c1111
    class V ok
    class U warn
    class S stale
    class X bad

然后“完成”不再是模型发出的句子,而是成为您可以计算的状态:

UNVERIFIED  bug_fixed
  missing  a test covering the change passes
           run the test that exercises this change, by name or by file
  missing  that test failed before the fix
           run it before applying the fix so the failure is on record
  met      the related test suite passes

由于每条记录都绑定到文件内容,因此当代码在其下方移动时,证据就会失效:

STALE  bug_fixed
  stale    a test covering the change passes
           recorded at tree fb7fb4ae5570c0da, files have changed since
           re-run: python -m pytest tests/test_core.py -q

最接近的类似物不是另一个代理框架。它是make。

状态 含义
VERIFIED 每一项义务都有新的证据来履行
UNVERIFIED 义务没有证据
STALE 证据存在,但它观察到的文件已更改
CONTRADICTED 某些事情的最新证据是失败的

随着代码的移动,声明会自行在它们之间移动:

stateDiagram-v2
    direction LR
    [*] --> UNVERIFIED: claim opens at the first edit
    UNVERIFIED --> VERIFIED: every obligation met
    VERIFIED --> STALE: a file it observed changes
    STALE --> VERIFIED: re-run the recorded command
    VERIFIED --> CONTRADICTED: latest evidence fails
    CONTRADICTED --> VERIFIED: fixed, and proven again

[!NOTE] 后来修复的失败是“再现证据”,而不是矛盾——这就是要求测试首先失败的要点。仅每个身份的最新记录才有效。

首先,我去阅读了比赛

在编写一行运行时之前,我克隆了十四个代理系统,将每个系统固定到一个提交,并从源代码中读取它们。不是 READMEs — 来源。循环退出的地方。实际上“在代码中强制执行”的内容与仅“在提示中请求的内容”。每个人都真正才华横溢,但又默默放弃。

[!NOTE] 62,608 字笔记。运行时间为 2,646 行。 读写比率约为 24:1,直到第四个系统与前三个系统具有相同的盲点之前,这让人感觉很舒服。

每张卡都在 docs/research/cards/ 中,在记录的提交中引用了 file:line,并且任何“推断”而不是读取的内容都被标记为推断。

真正伟大的地方 停在哪里
助手 该领域最好的存储库地图 — 树保姆标签、符号图、个性化 PageRank、预算渲染 测试默认关闭
继续 真实索引:FTS5 三元组、嵌入、折叠 AST 块、增量 完成 = 循环结束
克莱因 任何情况下都能幸存的检查点——私人裁判中的三亲藏匿处 根本没有验证机制
OpenCode 消息列表是状态机;恢复、分叉和恢复免费 完成=完成原因
OpenHands 仅附加事件日志、冷凝器、在发生任何事情后干净地恢复 完成 = 模型停止
SWE-代理 完整的可查询轨迹,revert-on-lint 补丁是可交付成果
迷你 190 行代码,一个 bash 工具,以及一个让脚手架尴尬十倍大小的分数 这才是重点
无代理 根本没有代理——40 个候选补丁,基于执行的选择,多数投票 硬连线到一种基准、一种语言
AutoCodeRover AST-aware 搜索 API 模型实际上可以瞄准 非开源;仅想法
gstack 与工作树哈希绑定的证据——最接近任何人发布的合同的东西 恰好一个声明的命令
超能力 真正的纪律:TDD,文件切换,经受住压缩的账本 由散文强制执行——其自己的 CLAUDE.md 承认特工忽视了规则
ECC 无论模型是否合作,钩子都会触发;捕获 sh -c 绕过的 shell 分类器 在您输入任何内容之前已加载 21–23k 个令牌
规格套件 一个模板源呈现给 41 个主机;退出代码先决条件门 完成清单,它会自动打勾
BMAD 盲目审稿——审稿人看到的是差异,却看不到作者的故事 散文,加上一个发现平台,保证微小差异上的噪音

使这个项目存在的模式

连续阅读其中十四个,每一个都会出现相同的形状:

[!IMPORTANT]

"Done" means the model said so, or the model stopped.

十四个之一将单个声明的命令绑定到树散列。 没有一个根据证据计算完成度。没有一个为间歇性错误提供工具。十分之九的人通过模型可以随意忽略的文本来执行他们的流程,其中三个人在自己的存储库中承认这一点。

这并不是对他们中任何一个人的打击。每个项目都比这个项目设计得更好,大多数都比这个项目早了好几年,我从他们那里借来了所有的东西。他们只是在解决这个“之前”的转牌问题。

这里有什么不同

证据是收集的,而不是要求的

没有新的仪式,没有代理需要遵循的协议,没有可以发出的哨兵线。它像往常一样运行测试;运行时读取输出。如果代理人从未合作过一次,证据仍然存在。

证据过期

每条记录都带有其观察到的指纹。更改这些文件,记录将变为 STALE,并使用重新运行的确切命令。这就是整个想法,它无耻地借用了测试影响分析——多年来一直在行业中跟踪测试与源的依赖关系——指出代理完成而不是测试选择。

义务随着风险的增加而提前到达

接触 auth/、payments/、迁移、基础设施或秘密比接触 README 需要更多的证据。它们是在第一次编辑时宣布的,而特工仍然可以对它们采取行动,而不是在最后作为伏击出现:

this task will need, before it can be called done:
  a test covering the change passes
    run the test that exercises this change, by name or by file
  the related test suite passes
    run the suite covering the files you changed, not just the one test
  repeated runs show the failure is gone
    ep-repeat 20 -- <the command that reproduced it>

不可能失败的检查不是证据

新鲜和过时是关于唱片的两个事实,而两者都不是 很重要。在您的更改“之前”已经通过的测试无法证明任何内容 它——并在其他地方测量,46% 的药物验证证据没有 根本没有错误区分信息。

这里多久发生一次火灾? 2026 年 9 月 17 日测量:每 22 次运行一次。 跨越 对相同的 16 个真实任务(十四行诗和作品)进行两次扫描,恰好收到一张支票 返回非歧视性,并且当给出另一个模型时它不会复制 相同的任务。上面46%是别人的语料,是引用的,不是 声称。在这一点上,效果很少见,并且被写下来而不是 留给读者去发现: results/b4-discriminate/findings.md.

运行时还可以在临时环境中运行相关配置或发现的检查 在匹配传递证据后,根据任务的起始提交构建工作树 存在。如果那里已经通过了检查,报告就会这样说。独自发现 不调度不相关的基线命令。

  ok      the related test suite passes  <- python pytest 1 passed, 0 failed
  could not fail: tests: this check passes without your change, so it is not
                  evidence the change works

据报道。它从不拒绝——命名一个弱检查不需要任何成本,并且阻止 一个人必须首先赚取成本。

您证明的最佳状态将被保留,而不是被覆盖

已发布的测量显示 60–69% 的编码代理失败发生在运行 达到并编辑正确的函数,然后生成错误的补丁。一个长 尝试以最新补丁结束,而不是最好的。

当声明的检查为绿色时,工作树将提交给私有的 ref — 你的分支、索引和存储保持不变。如果以后的编辑将其移走, 报告将其退回,如果 HEAD 已移至下方,则拒绝提供, 因为恢复之后就会撤销任何移动它的东西。

“修复之前失败”是计算出来的,而不是要求的

过去的义务是要求代理首先运行红色测试。任何人 后来写测试的人——普通练习——永远无法释放它, 之前因不相关的拼写错误而导致的失败也被视为证据。

现在向存储库提出问题:此测试是否已经失败 该任务从哪个提交开始? 如果是并且现在通过了,那就是 复制,无论工作发生的顺序如何。没有模型调用。

cannot_complete 是一流的成果

一个无法说“这不应该按照要求完成”的系统已经悄悄地再现了导致错误完成的操作偏差。

间歇性错误得到算术而不是振动

这是唯一一次绿色运行证明不了什么的情况。询问一些不稳定的问题,运行时会根据代理本身测量的故障率计算出多少次干净运行实际上就足够了:

missing  repeated runs show the failure is gone
         ep-repeat 29 -- python -m pytest tests/test_worker.py -q
         so far: still failed 3 of 30

三十之三失败率为 10%;排除在 95% 置信度下需要 29 次干净运行,因为 0.9²⁹ < 0.05。代理人被交给了这个数字,而不是让他去发明一个数字。跑步者也独自站立:

ep-repeat 50 --jobs 8 -- pytest tests/test_login.py   # is this flaky, and how flaky

十四艘船中没有一艘有类似的东西。

接缝是经过测试的,不是假设的

默默地停止工作的验证层比没有更糟糕 - 这不是假设:该运行时及其主机之间的层中的三个缺陷都因什么都不做而失败,而每个单元测试都保持绿色。因此,ep-doctor 向运行时提供一个工具结果,其形状与主机的形状完全一致,并检查返回的答案是否正确:

ok    python 3.13.2
ok    a failing command is recorded as failing
ok    a passing command is recorded as passing
ok    hooks.json subscribes to every event the runtime handles (6 tools recorded)
ok    the ledger directory is writable
ok    nothing unreadable has arrived from the host

它无法解析的任何内容都会落在 .elevenpowers/blindspots.jsonl 中 - 因此重命名字段的主机成为可诊断的症状,而不是悄悄消失的工具。

它保留在任务内部

特工们四处游荡。当编辑到达某个位置时,该任务既没有被阅读也没有被询问,警卫会询问* - 它从不否认,因为你是法官:

src/billing/stripe.py is in billing, which this task has not read or edited,
and the request does not mention it. Edit it anyway, or read it first.

范围永远不会预先声明,因为在进行更改之前没有人知道更改将触及哪些文件。它源自任务所建立的内容:读取的文件、编辑的文件以及请求命名的区域。

在您的项目中使用 ElevenPowers

相同的运行时可以跨项目和编码主机工作。它发现支持 项目约定,保留现有主机配置,并保持丢失 证据和不完整的覆盖可见。这些功能建立在完成的基础上 门如上所述。

五主机集成

项目入门涵盖 Claude Code、Codex、Gemini CLI、Cursor Agent 和 GitHub 副驾驶 CLI。安装程序保留其他挂钩,检查环境,并且 跟踪本机回调是否实际到达。原生补丁观察覆盖 脏目标和非 Git 目标,同时保留不完整历史记录中的间隙。

安装和事件交付因主机而异。添加的四台主机仍然 需要现场安装会话验收;单独启动器检查并不能确定 它。参见平台安装和限制, 旅程 50,以及 入职验证。

存储库感知验证

加载插件自动检查启动健康状况并发现验证 来自支持的项目清单的命令。显式项目配置可以 覆盖自定义命令的发现。存储库扫描尊重 Git 忽略 和项目边界,报告不完整的覆盖范围,并支持项目拥有 文件和字节预算。

精确声明的命令保留成功、失败和不完整的执行为 不同的收据。输入指纹让以后读取区分当前 来源改变之前记录的结果的证据。参见 配置 和 便携式证据验证。

生鲜项目健康

检查集成是否在特定项目中运行:

python plugin/bin/ep_ready.py HOST --project PATH --seconds 30

全新的视图结合了本机配置、启动、编辑、命令捕获和 完成每个已宣布的命令的当前总体结果和新的 来源证据。它报告有界定时样本、可选引擎元数据、 覆盖范围差距和具体的后续行动。添加 --json 以进行结构化输出或 --check 用于退出代码门。

普通运行状况读取不运行测试、引擎或主机,也不写入任何项目 状态。管道运行状况与任务验证保持分离。参见 健康命令, 旅程 53,以及 健康验证。

可重复的本机验收

准备一个新的一次性项目来检查已安装的主机是否存在真正的故障, 传递和中断命令:

python plugin/bin/ep_doctor.py --prepare-acceptance NEW_DIR --platform HOST --language python --host-version INSTALLED_VERSION
python plugin/bin/ep_doctor.py --acceptance NEW_DIR --platform HOST

运行第一个命令,按照生成的EXERCISE.md,然后使用第二个命令 命令检查结果。选择 --language javascript 且节点可用 用于 JavaScript 练习。该工作流程适用于所有五个主机,并且不适用于 绑定到一个命名项目。

准备启动没有模型。检查是否合格保留的观察结果; 重播和启动器装置不建立安装验收。参见 接受命令, 出处,以及 健康验证。

版本化的本机验证和测量成本

ep_validate.py 捕获现有的本机练习,观察已安装的 显式版本,构建保守的 five-host/two-language 矩阵并 示例只读项目运行状况。运行时代码身份绑定准备和 真正的启动;更改的软件和丢失的历史记录不符合资格。已保存 报告注明了当地观察的日期。每次尝试的延迟读取都会保留 可见,当前读取与保留的回调和命令时间分开。

显式订阅编码试点冻结相等的 task/prompt/grader 输入 并将 baseline/tool 臂与中等要求的型号进行比较。它的第一个 由于执行、本机激活和配额,八项记录不确定 阻止比较;他们没有建立编码改进。完整的样本 也不是经过验证的任务。参见 命令, 原生观测值 和 旅程 54。记录协议 检查可重现早期保存的结果,无需模型调用或重新分级。

下一个受控比较在工作的 Claude 管道上运行,并带有无源 双臂中的录音机。八首十四行诗 5.5 中号通话产生了第一首和最后一首 候选人在每次运行中都通过 16/16 独立检查。普通插件 完成在三个处理运行中提供了新的精确命令收据; 最终收据覆盖范围为 4/4 治疗和 1/4 基线。包裹基线 测试可能仍在运行。这表明了额外的保留验证 证据,没有观察到补丁正确性的改善。公共档案馆 重建所有 24 个 proposed/final 快照,无需模型调用。参见 受控证据, 命令 和 旅程 55。

随后的四项交互修复涵盖持久租赁、异步缓存竞争、 依赖性失效和具有 94 个冻结隐藏组的可恢复字节流。 八个 Sonnet 5 媒体订阅槽中的七个已完成;首先全部完成 最终候选人通过了,三对完整的选手并列。三工具 完工增加了新的申报收据。中断的缓存代码保留 可见套件超时和单独关闭审核发现的缺陷。全部 22 个 保存的成绩重现。比较仍然没有结论,没有证据表明 编码改进或加速。参见 硬任务结果, 复制命令 和 旅程 56。

固定补丁审核试点随后完成了 8 个 Sonnet 5 中型订阅 对 ItsDangerous、Click、Jinja2 和 attrs 的评论,包括生产版和现有版 测试已修复。普通审查和 ElevenPowers-assisted 审查都添加了以下测试: 检测五个先前错过的有意义的 Jinja2 故障。所有四对都匹配 并列,辅助母语复习时间更长;这建立了有用的测试 从审查来看,没有增量 ElevenPowers 质量优势或加速。 整个文件采样错过了已编辑的功能,Windows 跳过了 Click 的资格 描述符案例。每份提交的材料和原始成绩都会被存档。分开的 修正线束重新升级于 2026 年 10 月 3 日完成全部十二盘比赛:九场比赛, 单击 F03 在所有三个臂中保留混合的 failures/setup 错误。原来的 成绩仍然保留; Jinja2 的进步同样明显,四个平局保持不变。 参见 调查结果, 保存测试和再现 和 旅程 57。

python plugin/bin/ep_validate.py capture HOST --project EXERCISE --observe-version --json
python plugin/bin/ep_validate.py performance HOST --project PATH --repeats 3 --seconds 60 --json

这两个命令都不会运行项目检查或启动模型。捕获合格本地人 历史;绩效衡量指标读取。使用--output FILE显式保存 和 --check 选择进入退出代码门。

便携式验证报告

导出本地报告供审阅者无需编码会话即可阅读:

python plugin/bin/ep_report.py --project PATH --format markdown --output report.md

Markdown 和版本 JSON 显示索赔、义务资格、最新 执行收据、新读取的输入指纹、覆盖差距和下一步 行动。使用 --format json 进行结构化输出。报告不包括提示, 记录、捕获的输出和收据详细信息、清理已知凭证,以及 拒绝覆盖,除非提供 --force。参见 报告命令, 旅程 51,以及 报告验证。

解释变更影响

ImpactGraph 构建一个新的本地图并解释哪些消费者和测试 可能会受到文件更改的影响。 Python AST 导入和保守导入 来电,可选JS/TS进口,项目申报合同和当前合格 每个观察结果都保留其出处。 Git 共同更改仍然是一个单独的提示。

python plugin/bin/ep_impact.py --project PATH src/session.py

查询无需 AI 代理即可工作,不运行项目测试,也不编写项目 状态。候选测试包括推荐背后的路径;含糊不清, 不受支持的适配器、陈旧的观察结果和耗尽的预算仍然显而易见。 首个独立API/worker治具入选四张通过检查,被拒绝 具有两次故障的种子边界故障,并接受等效行为。 真实项目扩展添加了显式选择的 TypeScript 5.7.3 编译器 用于别名、导出和合格调用,以及离线 coverage.py/Node V8 与源绑定执行收据的转换。在 24 个冷冻病例中发现 31/31 已知消费者和 23/26 已知测试参考。实际覆盖范围已恢复 除了静态比较之外,还有一项依赖于夹具的 Jinja 测试。精选支票 在旧版本和最终版本中都发现了 5/6 合格的故障;过程限制 回归被错过了。自动咨询仍然不合格,并得到改进 代理编码尚未显示。请参阅 ImpactGraph 导轨, 旅程 61,以及 实际项目验收。

可选测试强度

更改区域测试强度询问通过测试是否注意到细微变化 由任务编辑的生产文件。宇宙射线提供了Python突变; Stryker 提供 JavaScript/TypeScript 突变。每一次基线和尝试 从干净的私人输入开始,具有明确的时间、尝试和复制限制。 检测到的更改、可能的测试差距、无效突变和不完整的执行 出现在人工报告中,并经过独立检查的输入新鲜度。 选择现在使用 Git hunk 和封闭函数、分区 broad/new-file 变化,需要完整的突变范围遏制并旋转有界样本 跨越files/functions。混合语言共享遵循文件计数。报告显示 行跨度、上下文以及与编辑的关系,并具有明确的资格 仅测量分析的命令。删除的行为仍然是覆盖范围的空白; 仍然可以检查可用的电流源。旧记录仍然可读 作为没有发明归属的整个文件样本。

显式可选引擎设置后,guide 和 strict 完成考虑 自动在所有五个主机上共享运行器。没有新的完成 阻断剂并且没有单个突变目标发送到编码剂。您还可以 显式运行它:

python plugin/bin/ep_strength.py --root PATH

通过 ep_report.py 导出保存的结果。默认值为 60 秒,八 每个测试命令尝试 15 秒;使用集中命令以降低速度 项目。缺少引擎、肮脏的归因、原始的可编辑 Python 路径 来源、不安全的依赖和耗尽的预算仍然是明确的。免费固定 上游控件现在到达 Jinja2 编辑的 do_attr 和 attrs 的 _is_class_var, 早期的整个文件示例遗漏了。这提高了分析的相关性; 采样的突变并不能证明正确性或改进的补丁结果。参见 设置和配置, 发动机来源, 旅程 52,以及 测试强度验证, 当前相关性验证 和 旅程 58。

安装

git clone https://github.com/SatyamSingh-Git/ElevenPowers.git
claude --plugin-dir ElevenPowers/plugin

没有什么可配置的。像平常一样要求改变。

python plugin/bin/ep_doctor.py    # is the runtime seeing what the host sends?
python plugin/bin/ep_status.py    # what do I still owe on this task?

[!TIP] 完整说明、每个命令和标志,以及发生故障时该怎么做:指南。安装后运行一次 ep_doctor.py --host — 较浅的检查通过了数周,同时默默地丢弃了该标志。

.elevenpowers/config.json 中的可选覆盖;支持的根清单已经自动提供命令:

{
  "profile": "strict",
  "commands": {"tests": "make test", "typecheck": "npm run typecheck"}
}
公司简介 行为
off 记录证据,不说话,永不封锁
guide 说出什么可以证明工作,最后报告,永不阻塞
strict 上述所有,并且在未履行义务时拒绝停止

[!TIP] 支持的清单现在无需配置即可提供验证命令。使用自定义包装器的显式命令或覆盖发现。在 guide 和 strict 中完成时缺少检查运行; off 保持被动。请参阅 自动设置并覆盖。

索赔费用是多少

声明是通过模式匹配从请求中推断出来的——没有模型调用,没有增加延迟。提出问题或请求读取代码,但根本不会提出任何索赔;运行时完全不受影响。

大多数请求都没有声明任何要求,因为五分之一的真实提示只有四个字或更少,并且“继续”在对话中而不是在消息中携带其主题。因此,声明遵循工作:对源文件的第一次编辑将打开一个。通过 3,557 轮实际会话 进行衡量,21% 的轮次没有任何改变,而义务附加在这一轮次上——低于朴素规则下的 51%。

索赔 低风险 高风险增加
bug_fixed 覆盖测试通过,套件绿色 之前记录的故障,重复运行的稳定性
feature_added 套房绿色 涵盖测试、类型检查、构建
refactor_safe 套房绿色 类型检查、构建
migration_safe 应用并恢复 套件绿色,稳定
perf_improved 基准 套件绿色,稳定
deps_updated 套房绿色 构建、类型检查
docs_changed 什么都没有 什么都没有
cannot_complete 原因和尝试过的方法 证明拦截器是真实的

对于可重复的本地测试环境,请参阅开发和验证。

这实际上是哪里

10 月 2 日的本地验证交付通过了 1,237 次本地测试,其中 28 次跳过, 104 个审计探针、所有四个平地机控件和发射器医生。五 重要的 evaluator/export 调查结果已被复制和更正。建筑学的 四个选项卡渲染有 102 个节点和 232 个边。本次发货有二十九 带有描述性提交消息的增量发布边界。请参阅 交货支票。

已安装主机接受仍然是0/10,以及所有八个原始订阅 比较记录仍然不确定。值得信赖的 Codex 装置已更正 源和真实的 failing/passing 检查,但没有插件回调。后来控制了 完成运行具有工作本地克劳德交付和添加的收据,并且 固定补丁审查试点提高了双臂的 Jinja2 测试灵敏度。 尚未测量增量编码的好处。免费重定级和通用化 changed-region/command 资格里程碑现已交付。下一个证明 步骤是与同等资金的持续积极行为差距比较 普通审查,进行独立检查并保留不良结果。这 恢复交付没有推出额外的模型会话。 任务大小不是标准;可观察到的编码或验证改进 通过任何参与机制都可以计数。

研究原型;状态审核于 2026 年 10 月 4 日进行。 ImpactGraph 现在提供明确的新 CLI/API 查询,并带有解释的路径和候选测试;更广泛的精度和自动钩子验收仍然开放。提供存储库证据、准确收据、五台主机启动、回调激活、持久完成执行和便携式 Markdown/JSON 报告。原生补丁使用有界目标内容比较; missing/evicted 回调仍为 UNVERIFIED。在 Snag 中观察到真正的 Claude Code 启动,没有调用 prompt/model。其实际外部CI通过了14/15检查,但未通过生产依赖审计;显式重播记录 complete/fail,与本机主机命令捕获分开。它的报告保留了这一失败,并且不证明没有主动声明的任务。早期的入门套件通过了 1,062 项测试,其中跳过了 28 项;随后的交货检查单独记录。补丁效果的改善尚未得到证实。查看当前状态和验证记录。

可选的测试强度交付通过了 1,127 项本地测试,其中 28 次跳过 经过三个独立审查修复后。真实Python/JavaScript/TypeScript夹具 验收和所有四个渲染架构视图均已通过。实施情况 分为 25 个增量部分出版;查看 日期记录 用于精确检查、边界和发布主题。

9 月 24 日的研究实验发现了真正的测试差距,但处理了原始突变 向代理商列出鼓励实施细节的测试。在 95 个已解决的补丁中, 门臂有 4/49 空洞补丁,而香草则有 10/46;任务级 比较具有提示性(p = 0.062),并且主要测试质量比较 没有显示出可检测到的差异。参见 B8 和 B9 用于方法和限制。

已知的错误块是预先存在的不相关套件故障:相关测试 是固定的,但是大门还是要求套房是绿色的。表记录了这一点 限制;尚未通过更新文档修复该问题。

下面的每个图都是由它旁边打印的命令生成的。

测量了什么 结果 再现与
读取真实的工具结果 174/174 失败,5,916/5,916 成功,超过 36,034 个命令 python -m eval.replay --all
作为分类器的门 1/28 完整案例被误屏蔽 (3.6%),0/18 不完整案例被遗漏; 46 个场景,重播 2026-09-27 python -m eval.run --all
范围守卫 25个案例0误题、0漏题 python -m eval.scope_run
主张推理,实转 3,557 个轮次中,21% 超额索赔,25% 误工 python -m eval.claims_run
实时封锁 自放电到达后运行的 75% → 12%(16 次运行)。在后来的固定扫描中,它是 8% 的运行——在 50 个区块中的 4 个区块中发生了 6 个“事件”,这是决定实验规模的重要数字 python -m eval.live --arm gate --model haiku
主机集成 配置和回调诊断 python plugin/bin/ep_doctor.py --platform HOST --cwd PATH
项目准备情况 新鲜的本地阶段、总体结果、环境、覆盖范围和保留的时间 python plugin/bin/ep_ready.py HOST --project PATH
本土接受度 明确的新 Python/Node 练习和不可变的当前观察资格 python plugin/bin/ep_doctor.py --prepare-acceptance NEW_DIR --platform HOST
审计调查 修复了所有重现的缺陷,零失败; R2 缩小而不是关闭 python -m pytest tests/test_audit_probes.py -q
固定基线 90 次付费运行中的两次通过分别为 68.9 和 73.3,67.42 美元 python -m eval.baseline --pinned
套房记录有误 295 人中的 123 人 (42%) 在保存失败计数时表示 PASS — `pytest tail exits with tail的状态 | python -m eval.discriminate --bundles results --verbose`
拒绝应答渠道有用吗? 是的,对于网络:拒绝前和拒绝后扫描之间的上游检索 14 → 0 python -m eval.canary --corpus &lt;corpus&gt; &lt;bundles&gt;
什么能在否认中幸存下来 软件包注册表和机器自己的 site-packages — 已包含修复程序的发布版本 相同的命令
选择器值得构建吗? 没有解决:在可比较的池中从+2.0到+20.0,每个池有1-5个不同的任务 python -m eval.pool --from-bundles results/chunks results/bundles-A
工作效果更好吗? 未测量到任何效果。 在阻止时进行评分,门在十九次运行中发射了四次,并且没有改变结果;成本是原版的 1.3 倍 python -m eval.checkpoint --grade results/prevalence/bundles --corpus results/prevalence/tasks.json
这三个新机制有帮助吗? 未测量。 stress、ratchet 和计算的再现在两个方向上进行了单元测试,并且从未在扫描中运行过 —

在第一行。 Claude Code 编写每个会话的记录,包括与主机生成的结果完全相同的每个工具结果,因此重播这些结果不需要推理,也不需要手动标记 - 主机已经记录了每个命令是否失败。被替换的读者同意 174 次失败中有 0 次失败。据报道,这是两个比率而不是一个,因为该语料库的成功率为 97%:对所有问题都回答“通过”的读者得分为 97%,而在门唯一需要知道的事情上却犯了错误。

在编码结果行上。 它实时运行 - 通过 CLI 进行 89 次免费运行,其中门启动,拒绝停止,代理返回工作,然后用一只手臂对着固定的语料库和模型进行 90 次付费运行,然后用 双 手臂进行 100 次付费运行。其中 19 条已被评级在大门拒绝的那一刻,而这里从来没有这样做过。该机制启动了四次,但没有改变任何结果:它阻止了一个已经正确的补丁,一个仍然损坏的补丁,以及一个无法捕获的回归。实测成本是原版的 1.3 倍;到目前为止,测量到的好处还没有。公平的限定条件是,该语料库中几乎没有出现这种情况,因为 80% 的第一个提案已经是正确的。

2026 年 9 月 15 日的文献扫描随后解释了这一点,并重新制定了该计划 v0.8。独立测量:46% 的药物验证证据不包含任何内容 错误识别信息,并且每个模型都饱和了可见的测试套件。所以 PASS 和 FRESH 是关于记录的两个事实,但都不重要——一张支票 在被证明具有歧视之前,它不是证据。单独地,中值决定性误差 降落在 27 级台阶中的第 7 级,这就是为什么最后的门变化不大。两个修复都是 已经写在这个存储库自己的计划中,但都没有被构建。论文幸存下来 并且得到比以往更好的支持; 放置没有。

2026 年 9 月 17 日,重新瞄准是在语料库上而不是在 文学 - 它返回空。 作品上的十六项任务,与 十四行诗:0 of 14 检查是非歧视性的,而之前的 1 of 8 是非歧视性的,而单 之前的案例没有重现。所以上面的句子需要它的限定词:the 46% is 引用,此处不重复,以及特工通常根据以下证据完成的声明: 该项目自己的运行不支持不可能失败。该机制有效—— 它捕捉到了一个案例,并且捕捉到了真正的回归——但它没有显示出频率 不是它可以断言的频率。同样的扫描发现了一些比速率更重要的东西: 12.5% 的运行完全绕过了门,因为运行时从未观察到代理的 编辑。完整的数字和注意事项 results/b4-discriminate/findings.md.

其余的来自事后审核扫描:100 次运行中的 24 次命名了自己任务的修复提交,从 GitHub 获取,因此 92% 是应用所描述的上游更改并有权访问该更改的分数,而不是修复任何看不见的东西。输出是否“更好”仍然没有答案,接下来要构建的不是更难的语料库,而是信息边界。对相同的十六个任务进行两次相同的简单传递,解决了十一个和十五个任务。

那天晚上也与安全装置两次假设的事情相矛盾:结果结果是评分者的 Git 配置的函数,然后是运行中机器上安装的不相关代理的函数。文章中的三项主张随后被撤回。 23-spend.md 具有它,包括本应防止不良测量的验证看起来与成功完全一样的部分。

诚实地回答这个问题需要31对两条手臂不同意的,反对重建的任务套件,所以其中大部分实际上是歧视的。此页面用于表示 252 代理运行;该数字已被撤回。它来自于将所需的配对除以臂内翻转率,而翻转并不是分歧——每次都失败的基线,而每次翻转都成功的治疗方法永远不会并且总是不同意。将配对转换为运行需要一定程度的分歧率,而这里的运行没有产生分歧。

[!WARNING] 外部审计在运行时和评估器中记录了十六个观察结果并命名了十五个缺陷 - 它自己的附录称这些是“十六个观察结果,而不是十六个统计上独立的发现”,后来又在这里发现了四个,所以十九个携带探针。不是悄悄地修复那些令人尴尬的问题,而是每一个都变成了故意失败的测试,直到它失败为止——所以tests/test_audit_probes.py是这里的权威,而不是这个README。标记为 xfail(strict=True) 的缺陷开始通过“运行失败”,这会迫使标记关闭并导致无法安静地修复某些问题。

现在所有十九个都通过了,十八个固定了,一个缩小了。其中四个探测器无法检测到对其记录的缺陷的修复,并且在此过程中发现的最大缺陷根本不在审计中:在 300 次尝试中,有 220 次尝试中,决定证据是否过时的指纹无法看到相同长度的编辑。 18-evidence.md 有。

最糟糕的一个值得大声说出:任务评分者只运行了未能通过的集合,因此破坏现有测试的补丁被评为“已解决”——在整个受试者都准确捕捉到这一点的测量中。已于 2026 年 9 月 12 日修复。在此日期之前发布的每一个数字都值得适当的怀疑。

尚未构建:没有工作流引擎,没有存储库索引,没有内存,没有模型路由,没有子代理。每个都通过 docs/postponed.md 中的写入触发器来推迟。失效是粗略的——任何源代码编辑都会使一切变得陈旧——并且将其范围缩小到每个测试的导入闭包是记录的下一步,但只有当测量显示粗略版本过于悲观而无法忍受时。

站在十四组肩膀上

这里没有什么是凭空发明的,假装不这样做既是不诚实的,也是对十四个优秀代码库的浪费。

该方法是经过深思熟虑的:从源代码中读取每个系统,将其在代码中强制执行的内容与仅在散文中请求的内容分开,清点每个优点和每个弱点,然后映射哪个系统的优点涵盖了其他系统的缺点。完整的映射位于 complementarity-matrix.md 和 build-on.md 对当前正在构建的每个组件执行相同的操作 - 在其设计之前命名其现有技术、许可证和限制。

[!IMPORTANT] 原创性从来都不是目标。 本节的早期版本表示,唯一诚实的构建位置是所有十四个都留下空白的地方。这是一个新奇的过滤器,它已经退役了:一个组件从现有的最佳实现开始,我们添加的内容用一句话来说明。如果该句子无法编写,则该组件是重新实现,并且借用获胜。

这同样适用于研究。 每一篇改变此处决定的论文、文章、调查、数据集和文档页面均记入 audit_2026_09_15/sources.md — 167 个链接,每个链接都有其贡献内容以及验证的强度,包括我们依赖但随后不同意的链接。

什么来自哪里:

借自 拍摄了什么
gstack 针对工作树的指纹证据,以及可以拒绝的 Stop 钩子。与整个项目最接近的现有技术——一个起点,而不是竞争对手
助手 如何构建存储库映射,以及可重复的基准测试工具是什么样的
BMAD 盲目然后声明审查顺序以及接受证据的出处规则
ECC 无法打开、原子写入并在自身错误中幸存的钩子运行时
规格套件 退出代码先决条件,以及呈现给多台主机的一个模板源
超能力 仅附加分类帐作为压缩的答案,并针对缺乏它的基线测试“技能”
OpenCode·克莱恩·OpenHands 声明你可以恢复、分叉和恢复
SWE-代理·迷你 值得查询的轨迹,以及190行提醒,底线远高于营销建议
无代理·AutoCodeRover 产生许多候选人,然后通过执行而不是通过氛围“选择”
测试影响分析 依赖跟踪失效——普通的行业实践,以及其核心机制
证明或停止 (arXiv 2607.14890) 在设计确定后*发现,并且比十四个中的任何内容都更接近本论文。被引用而不是被埋葬

所有内容的许可、承诺、版权所有者和重用义务:docs/research/licenses.md。如果系统条款禁止重用,则仅采用想法,并且它是这样说的。

是的,这是用编码代理构建的,主要是 Claude 和 Codex。一个关于代理输出是否可信的项目将是一个奇怪的地方,对此讳莫如深。证据层从第一天起就指向它自己的构造,docs/dogfood-log.md 记录了它在哪里捕获了自己的作者。上面的审计是当其他人的代理也被指向时发生的情况。

进一步阅读

PLAN.md 论文、架构、正在测试的假设以及对新内容的诚实界限
docs/research/ 十四个系统从源读取,每个声明都在记录的提交时引用到文件
competitor-map.md 十个系统 × 十三个架构轴,在一个屏幕上
docs/status.md 当前交付状态、证据限制和下一个集成里程碑
docs/postponed.md 未构建的内容以及启动它的触发器
architecture/ 动态图 — 112 个节点、258 个边、五个视图和 41 个可扩展的贡献者卡; 打开直播
the-guide/ 安装、命令、配置、故障排除 — 实用手册
whats-offered/ 目前的功能、五阶段路线图以及诚实的比较

这是一项正在进行的工作,并且是故意这样说的

上面的一切都是快照。论文已经被降级一次,目标被重写一次,已发表的结果被撤回一次——而 PLAN.md §7 中仍然悬而未决的问题保证还会有更多这样的问题出现。这里的数字将被取代。部分内容将被重写。 README 目前提出的一些观点最终会被证明是错误的,当它发生时,它会得到纠正,而不是悄悄地被放弃。

因此,如果您想要真实的故事,请不要阅读此文件 - 请阅读 journey/。

这是完整的记录,写下来是为了让不在场的人能够重建推理,包括错误的部分。时间索引位于 journey/README.md 中。近期交付章节涵盖 存储库证据、自动设置、持久验证、五台主机、项目准备情况、便携式报告、测试强度 和 新鲜管道健康状况。前面的章节涵盖:

  • 从哪里开始 — 原始简报,凭记忆编写的第一个计划,以及为什么这是完全错误的开始方式。
  • 读到了什么 — 来源 的十四个系统:方法,每个系统的实际结果是什么,以及推翻我最初假设的发现。
  • 设计如何改变 - 两次重写和枢纽,从分类任务到推导证明义务。
  • 它教了什么建筑 — 第一个工作版本 以及仅在使用中出现的三个缺陷; 一个防护装置,作为死代码 发货两次; 在没有人测量过的一层中,通过读取 36,000 个真实命令发现了另外三个缺陷。
  • 什么测量破坏了 — 75% 错误阻止 和每个修复; 89 实时运行,其中机制工作但测量不工作; 十二个真正的错误 其中大门没有任何改变,明显的修复结果是剧院; 一个外部批评 推翻了我刚刚得出的结论。
  • 现在在哪里 - 审计及其重现的缺陷,分级员对它存在的精确回归视而不见,目标发生变化,然后 评估者,证据层和主机合同已修复; A期已关闭; 语料库 和 工具 拒绝运行取消固定; 第一晚允许花费金钱,并且 重新构建了语料库,因此它可以移动。
  • 它的方向 — PLAN.md §7,具有明确先决条件的三个轨道而不是一个链。

那里有两个文件比章节更有价值:decisions.md,每一个重大决定及其推理以及它是否仍然有效 - 以及mistakes.md,犯的每一个错误,都完整保留,因为更正事实证明这是整个事情中最容易转移的部分。

该文件夹中任何位置引用的每个数字都是由该存储库中的命令生成的,并且该命令打印在它旁边。

Apache-2.0 · 建立在 14 个更完善的项目的基础上,并注明每个项目的归属。

如果你维护其中一个,而我误读了你的代码——打开一张 issue. 该卡被固定到一个提交,我宁愿被纠正,也不愿错误地引用。

最新游戏

更多

Copyright©2010-2019. All rights reserved | 波波三国游戏官网|[email protected]

备案编号:湘ICP备2022015115号-4