Jev Harness / 验收证据与评测范围

验收证据与范围

English · 简体中文

开放任务工具包与真实验收(0.2.0,2026-10-11)

通用底座现在组合 TaskScript、EvidenceTask、EvidenceStore、 工作区发现和 HTTP/Camofox 发现。可信薄脚本定义来源范围、工具、schema 字段标记和 独立完成检查。主 AI 通过 MCP 引用操作,与 Jev 原生循环使用同一组注册工具; 链接、文件和段落根据反馈发现,执行路线不写死在脚本里。

真实调用账本保留 15 组、53 条记录,包括 36 条开发阶段记录。合成夹具公开三个任务族、 两个变体和缺来源变体。有界验收的执行方输入仅含 schema 前缀,不包含验收方的 预期字段答案或正确来源路径。

九条记录的 toolkit-acceptance-frozen-20261011 组使用变体 1,保存产物 均通过独立检查。下表每格为一次测试,不是统计分布:

合成任务 Jev 整段耗时 主 AI 直接操作 自由选择 Jev 工具步数 / 请求数
HTTP 来源调研 5.6267 秒 54.9784 秒 53.4884 秒,直调 10 / 15
仓库证据调查 4.3970 秒 36.7928 秒 57.3461 秒,直调 7 / 11
无头 Camofox 依赖诊断 8.8917 秒 55.6485 秒 56.7695 秒,直调 9 / 15

这些测试中,Jev 的完整执行耗时较短。计时包含任务构建/采集、模型与工具决策、 产物检查和日志;主 AI 耗时还包含一个连续 CLI 进程的启动和最终回答。 不包含夹具/服务器准备与脚本编写。因此没有测量 AI 编写新脚本的速度, 也不代表普遍的延迟或费用优势。

Jev 实际返回模型为 jev-1.13.0。主 AI 请求 gpt-6.1-sol/high, 实际解析模型身份仍为未知。变体 1 的直接操作组实测 token 如下:

任务 Jev 输入 / 输出 主 AI 输入(其中缓存)/ 输出
HTTP 62,715 / 1,143 370,649(缓存 330,752)/ 618
仓库 42,377 / 999 194,406(缓存 174,208)/ 536
Camofox 59,632 / 1,127 364,930(缓存 326,144)/ 612

账本分别保留自由选择组 token、推理 token、失败尝试已知用量和未知用量。 缓存输入是主 AI 输入的一部分,不是额外 token。Jev 共享上下文字节数与 返回的 MCP 结果字节数属于不同测量口径;不据此折算节省 token, 不假定当前价格,也不声称已证明账单费用优势。

首个九条验收组早于 MCP state_ref 强制检查和 JSON 配置预检加固, 没有测试前运行时来源快照,因此不是与最终发布源码完全绑定的基准。 后续组保留运行时、runner 和夹具源码哈希;它们是测试前源码快照, 不是实际导入字节码的证明。使用状态引用协议的变体 0 仓库测试分别以 Jev 4.4084 秒、 直调 64.0395 秒、自由选择 65.4748 秒通过;变体 0 的 HTTP 与 Camofox Jev 测试也分别以 6.4555 秒、10.0094 秒通过。账本区分每组版本与阶段。

五次有界自由选择均选择主 AI 直调:0/5 委托给 Jev。 早先四次提示要求检查状态和参数引用,可能偏向直调。另补一组仓库对照, 去掉这句,只保留目标、可用工具和保存产物的输出要求:直调 56.0326 秒、 自由选择 61.4696 秒均通过,仍选择直调(这个更中性组单独为 0/1)。 第一项操作前两条路径均可用,测试禁用产品 skill,也没有规定必须选哪条路线。 这是自然采用的负面结果,不证明自动委托。开发阶段尝试不计入分母。

缺来源仓库验收在 5.7759 秒后返回 needs_review,独立完成检查为 false, 没有虚假 done。早期复核/无匹配、CLI 接线、非预期活动和缺失产物结果 均保留在开发组;部分早期执行方收到开发阶段答案短语,不属于盲测证据。 测试范围为有界本地合成数据,不包含桌面、客户或生产数据。

浏览器检查结合规范化的静态夹具原文与完整捕获 DOM 文本的段落、来源引用、 SHA-256 核验。首个成功的变体 1 Jev 浏览器记录补用了同一静态夹具的 另一直调组 DOM 捕获;后续浏览器记录保留自身捕获。这证明静态夹具证据, 不保证任意动态网站都有新鲜、独立的 DOM 验证。

在安装 .[dev] 的完整 Git 检出中复现,并显式提供本机测试凭证; 以下命令是主动启用的付费测试,输出目录必须新建:

python benchmarks/toolkit_acceptance.py --live --output local-results/toolkit-reproduction \
  --credential-file /absolute/path/to/your-test-key --primary-model gpt-6.1-sol \
  --variant 1 --families http files browser --arms jev direct choice

使用 --variant 0 测试另一夹具顺序,或添加 --missing --families files --arms jev 测试缺来源;每次选新输出目录。离线协议 A/B 使用脚本决策、零付费模型用量, 属于另一验证口径,不能与上述真实调用账本混为一谈。

离线工具包协议对照

离线策略/投影对照包含 15 个固定合成场景,每臂三次, 共 90 行。两臂各自的 45 个预期结果全部符合,包括刻意的 REVIEW、错误引用与跨路由拒绝。 基线在同一运行时注入旧的严格匹配策略和全记录投影,并非执行 v0.1.17 源码快照。 真实推理用量为零。允许探索继续后,模拟操作由 21 增至 39,mock SDK 尝试由 66 增至 78, 选择输入由 185,507 增至 276,065 字节,共享上下文由 47,189 增至 87,722 字节。 12 条记录场景的观察由 21,838 降至 6,493 字符,验证器仍拿到全部 12 条。 每臂三条脚本用量未知记录保持未知;这是协议证据,不代表语义准确率、降费或无限历史能力。 复现:python benchmarks/toolkit_protocol.py --output local-results/toolkit-protocol-ab.json。

历史证据

运行时是本项目的产品;这些案例测试的是可复用的接口边界,而不是为个别场景定制的 功能。所有输入均为本地合成数据。没有进行预订,也没有发送消息。

0.1.0 的浏览器验收:使用真实 Jev 1.13.0 和具名无头会话中的 Camofox, 执行了四次工具操作,并独立验证最终 DOM 文本和字段。一条早期操作序列 需要复核;另一条在目标授权关卡停止。这些负面结果仍保留在 公开的统计中。不声称普遍的速度或费用优势,也不声称可完成开放网页上的任意任务。

桌面验收被锁屏的 Mac 阻塞。独立的计算机操作检查 确认了锁屏状态。仅有辅助功能信任授权,不能证明存在可观察的目标 窗口。离线界面测试通过;原生 macOS/Windows 任务完成情况仍未验证。

机器可读验收记录记录运行结果、整个操作的 耗时、已知用量及不确定性。实际供应商用量在返回模型身份时按模型 分组;缺少模型身份的用量仍标为未知。金额估算 不是账单,也不假定任何当前费率。

AI 上手流程与参数语义

生成的任务模板已用真实 Jev 运行:最初的通用参数 问题返回复核状态;改为带条件的问题后,以两次工具操作、 三次模型请求完成。配对提示词 A/B固定了 小规模合成状态,并比较通用问题与带条件的问题,各重复三次。 在这个开发测试夹具中,所选 ID 的正确次数从 0/3 变为 3/3;默认的 不确定性准入规则另行报告。输入上下文增加作为负面结果保留; 这不是独立留出集校准,也不是对模型整体表现的声明。

离线联合/分阶段比较还保留了小规模独立 参数域中分阶段选择增加的决策次数,以及联合枚举遇到过大空间时的停止结果。

证据进展与完成保护(0.1.1)

离线运行时 A/B针对七个 固定合成场景,执行提交 e00bb1c1c6e063030446e7e795d33cc371f21032 中 已发布的 0.1.0 源码与候选版本,每个场景进行三次配对重复。基线符合 9/21 个预期 结果;候选版本符合 21/21 个。预期结果包括有意阻塞和 拒绝配置,而不只是完成。回归案例覆盖只读 证据之后继续调用其他工具、不同绑定对象具有相同摘要、防止重复 查询/副作用、未获准进入上下文的私有结果、空完成条件,以及 将缺失控制字段错误解释为观察到的 null。

报告记录全部状态、整个操作的耗时、返回上下文字节数、 脚本决策/上下文计数、候选源码哈希,以及零实际模型用量。 本实验没有付费调用、原生浏览器/桌面操作,也没有测量语义 准确率。在这些测试夹具中,新增的继续执行行为使脚本决策次数从 15 翻倍至 30,并增加上下文量;不声称节省费用。 针对固定观察结果的相同调用,仍不适合用于重复轮询。

安装 .[dev] 后,可在完整 Git 检出中复现(无需凭证):

python benchmarks/progress.py --output local-results/evidence-progress-ab.json

输出必须写入新文件。计时涵盖任务创建、决策、回调和 私有日志写入,不包括解释器/导入和源码快照准备。CI 在 Python 3.10、3.12 和 3.14 上运行两个离线基准。较早的真实浏览器证据 属于 0.1.0,未在 0.1.1 中重跑;桌面验收仍未验证。

决策诊断(0.1.2)

离线诊断 A/B比较提交 4f8e274bf598fbe674ee08eccccda1fa55655732 中已发布的完整 0.1.1 源码与候选版本。 十个固定合成场景各进行三次配对重复,通过固定版本的 SDK 和类型化批处理 接口使用 HTTP mock 或注入的已脱敏 ProviderError。无需凭证、模型调用、 浏览器或桌面操作。

两组均符合全部 30 个预期终态和执行次数,包括 有意放弃选择/阻塞,并保留未知用量。诊断协议检查 从 3/30 变为 30/30:基线仅符合成功案例预期的“没有失败诊断”; 候选版本可在工具或参数阶段识别凭证问题、安全的 HTTP 状态、 不确定性、模型明确要求复核,以及没有匹配项。这是 新增元数据的覆盖情况,不代表语义准确率提升,也不证明 AI 恢复成功。

两组都有 36 次脚本决策和 33 次 mock HTTP 尝试。固定版本的 SDK 已经 对 429/503/529 最多重试三次;这里模拟这些重试,其行为没有变化。 本次运行的终态返回字节数从 37,111 增至 43,251。所有测量时间、 上下文字节数、模拟模型身份、未知用量及状态均保留在报告中。 真实模型用量明确为零,与合成响应 token 分开记录。 不声称延迟或费用优势;未知供应商代码仍会丢失细节,静态 候选/策略/执行失败保留原有原因,且尚未测量真实 AI 恢复 成功情况。

额外的行为回归覆盖了自行处理可选选择失败的可信 Workflow 绑定: 后续成功和不确定执行不应携带 旧的失败诊断。较后的选择失败不会撤销先前已发生的副作用。

python benchmarks/diagnostics.py --output local-results/decision-diagnostics-ab.json

使用安装了 .[dev] 的完整 Git 检出,并选择新输出文件。CI 在 Python 3.10、3.12 和 3.14 上运行此基准。源码哈希将候选报告绑定到其运行时。 历史真实浏览器证据仍来自 0.1.0;0.1.2 没有重试浏览器或锁屏 桌面。搜索收录和 AI 引用仍未得到证明。

不限定领域的下一工具选择范围(0.1.3)

核心不再将浏览器表单要求强加给所有任务。由宿主控制的 decision_stage 标记循环中的工具和参数调用;工具问题询问 下一步,并允许证据/前置条件操作,而不要求它们单独完成 整个目标。不带该标记的直接记录选择仍保持通用的选择 语义。任务作者提供领域约束、优先级和前置条件。

离线协议 A/B和 真实下一决策 A/B比较已发布的完整 0.1.2 源码(b51614e8acfbac5a64bbad3c7da34a5a3698fa27)与候选版本。六个固定 开发案例涵盖产物交接、记录复核、计算依赖、 只读证据、合成表单和明确优先级。每个案例有三个工具选项 及循环退出选项,在候选项原顺序和反序下测试,并配对安排两组运行顺序。 报告包含测试夹具和预期 ID 的理由。不声称进行了独立留出集校准。

真实实验进行了 24 次逻辑决策和 24 次网络尝试。每次响应 均确认使用 Jev 1.13.0,并完整报告用量。两组在 12/12 次探测中均选择并准入 预期工具,包括表单案例的两种排列。没有 供应商失败或因不确定性而复核的结果。范围协议检查从 0/12 变为 12/12;这些检查描述请求构造,不代表语义准确率提高。 探测刻意在绑定阶段停止,未进入意图记录或执行。其 max_steps/decision_probe_no_execution 终态不代表任务完成。

本实验没有测得正确率提升。输入 token 从 13,925 增至 14,828(增加 903);两组均报告 972 个输出 token。完整探测耗时的中位数 约为 0.812 秒与 0.810 秒,在这次小规模串行试验中相差太小,不能据此声称 速度提高。完整基准耗时、每次探测的耗时、上下文字节数、原始选择、 准入结果、实际模型及用量均保留在真实报告中。在明确提供的 输入费率 R 美元/百万 token 下,已知输入费用为 tokens * R / 1000000;不假定任何当前费率 或账单金额。未知或中断的尝试仍标为未知。

离线答案由脚本提供,只能证明协议/路由行为。新增 行为回归测试最终请求范围、不依赖顺序的 ID 绑定、私有 参数绑定、直接记录选择兼容性,以及不确定尝试的统计。 结果不证明完整任务、浏览器/桌面执行或通用 AI 恢复能力。 清晰的开发案例描述可能高估不完整真实契约下的表现。

python benchmarks/tool_choice.py --output local-results/tool-choice-offline.json
# 需主动启用,会产生费用;通过环境配置所提供的私有凭证。
python benchmarks/tool_choice.py --live --output local-results/tool-choice-live.json

使用完整 Git 检出和新输出路径。真实运行器在每次派发前预留记录, 以原子方式保存检查点,遇到供应商/运行时失败即停止,且不会自动恢复不确定的 提交。CI 仅运行离线模式。原生桌面验收和 搜索收录仍未验证;没有重复任何浏览器 UI 或桌面操作。

静态任务准入(0.1.4)

check-task 现在解析并编译 UTF-8 源码而不执行它,随后检查 是否存在显式的顶层 workflow 赋值。没有值的类型注解不算 赋值。编译器/解析器警告映射为固定代码和行号; 源码片段与异常文本不会进入输出。非 UTF-8 输入返回 结构化失败。推理、提示词、工具执行和运行时关卡不变。

离线静态 A/B针对 13 个固定合成 脚本,将已发布的完整 0.1.3 源码 (37358ff83a83203b270c4cf92f8db7272239cca6)与候选版本比较,每个脚本进行三次配对重复。 正确接受/拒绝从 18/39 变为 39/39。分类和警告次数的联合检查从 15/39 变为 39/39;基线 在三次非 UTF-8 输入探测中抛出异常,候选版本则返回结构化失败。 两组记录的被检查脚本副作用、源码暴露和模型调用均为零。 测试夹具包括可解析但无法编译的作用域/控制语句、重复 参数、只有注解的导出、未知导入、可能产生文件副作用的语句,以及 非致命编译器警告。报告包含所有源码输入和预期结果。

负面结果与边界:编译增加本地确定性工作和返回的 诊断字节数。缺少依赖、workflow = None 或不可达的赋值, 仍可能被静态检查接受。这不等同于 Task 类型检查、导入/依赖检查、 回调/供应商验证、执行证明或跨版本保证。运行时的警告 策略可能不同。每次检查的耗时、上下文字节数、异常及 零实际模型用量均保留在报告中;不声称节省模型费用或提高速度。

python benchmarks/static_check.py --output local-results/static-check-ab.json

使用安装了 .[dev] 的完整 Git 检出和新输出路径。CI 在 Python 3.10、3.12 和 3.14 下重复离线检查。本次变更没有重跑真实 Jev 测试矩阵、浏览器 UI、 锁屏桌面或 URL 提交。原生桌面和搜索收录仍 未验证。

运行配置准入(0.1.5)

CLI run 现在在创建、注册或 加载可信任务模块前解析并验证配置。引擎共用同一纯验证逻辑:非空 目标、正数步数/时间预算、对象类型的输入/上下文、有效的获准消息列表、 必需路径语法,以及有限且可编码为 UTF-8 的 JSON。CLI 明确传入的 JSON null 会被拒绝; Python API 省略参数或传入 None 时,仍使用文档说明的默认值。类型错误的假值 不再默默替换为默认值。有效必需 路径缺少事实时,仍返回正常的运行时 needs_context 结果。

离线预检 A/B针对 26 个固定合成 配置,将已发布的完整 0.1.4 源码 (26cb69ae54e879043e6f18511da1f39446337de1)与候选版本比较,每个配置进行三次配对重复。 正确终态分类从 66/78 变为 78/78;正确模块加载策略从 21/78 变为 78/78。基线 的无效配置创建了 57 个合成导入标记,候选版本创建 零个。两组仍在九次探测中加载有效脚本,包括三次有效但 缺少事实、返回 needs_context 的配置。报告的配置失败 元数据、每次运行耗时、返回字节数及全部结果均保留在报告中。

负面结果与范围:预检增加本地验证工作和诊断字节数。有效 配置仍会加载调用者信任的 Python,并可能产生顶层副作用;这 不是沙箱,也不保证模块安全。归档、凭证、运行时、工作流和 业务条件保留原有验证。静态 check-task 仍是 独立、不执行代码的编译/赋值检查。合成的已完成状态无需 模型决策;两组实际模型/UI/网络调用均为零,不声称费用或完整 任务性能收益。共享验证还在观察/日志创建前更严格地检查类型错误的假值 SDK 参数及无效 Unicode;SDK 的 None 默认值 和单遍必需路径场景有专门的回归测试。

python benchmarks/run_preflight.py --output local-results/run-preflight-ab.json

使用安装了 .[dev] 的完整 Git 检出和新输出路径。CI 仅在 Python 3.10、3.12 和 3.14 下运行离线案例。没有重跑之前的真实测试矩阵、UI 操作、锁屏桌面 或 URL 提交。原生桌面和搜索收录仍未验证。

回调与参数候选提供器准入(0.1.6)

同步循环现在会在调用其函数体之前,拒绝已知的协程、异步生成器和生成器 回调。普通的生成器 Workflow.candidates 仍然 受支持。类型检查覆盖可调用对象和 partial 的 .func 链,同时保留 显式同步包装器。选择提供器通过绑定两个或 三个位置参数来检查;可选的仅限关键字参数不再导致 错误的参数数量判断。动态提供器保留其身份和绑定资源; 静态选项保留深拷贝快照。需要时仍重新获取参数域, 不缓存结果。固定的 contract_error 代码/角色/类型帮助 AI 修复 脚本,同时不暴露异常文本或可调用对象名称。

离线回调 A/B针对 24 个固定合成 测试夹具,将已发布的完整 0.1.5 源码 (17fa46f76267da428f96f4ca4240a9a07de14b9a)与候选版本比较,进行三次配对重复并交替安排两组顺序。 符合新的本地 API 预期的次数从 15/72 变为 72/72。基线接受全部 45 次延迟执行回调 或不受支持的提供器准入探测;候选版本拒绝这些探测。两组都不在 准入期间调用回调函数体。正向测试夹具覆盖两个/三个参数 绑定、可选关键字参数、持有资源的可调用/partial 提供器、静态快照、 生成器候选项,以及显式同步包装器。原生推理尝试和 实际模型/UI/网络调用均为零;每组进行三次脚本循环决策。 全部结果、预期值、异常类型、上下文字节数及耗时均保留。

负面结果与兼容性:精简测试夹具结果从 12,258 增至 18,885 字节。小规模混合测试夹具的计时不能证明速度收益。当两个和 三个位置参数都可以绑定时,现在优先选择三个;之前接收两个参数的可选/可变参数提供器 现在可能收到已绑定的父参数。如果需要旧行为,请使用显式的两个参数 包装器。比较包含这一有意设置的 迁移边界,因此这些符合性计数不是语义准确率测量。 不声称模型费用收益。

准入检查的是声明和提供器的可绑定性,不是每个回调签名、 包装器返回类型、有界 I/O 或业务行为。可信模块导入可能已在 注册前产生副作用;check-task 仍是不执行代码的静态检查。 执行开始后出现的错误仍是不确定结果,不会自动重试。 本项目仍是同步运行时,不是异步引擎或沙箱。

python benchmarks/callback_contract.py --output local-results/callback-contract-ab.json

使用安装了 .[dev] 的完整 Git 检出和新输出路径。CI 在 Python 3.10、3.12 和 3.14 下运行离线测试夹具。没有重跑较早的真实测试矩阵、UI 操作、锁屏桌面或 URL 提交。原生桌面和搜索收录仍未验证。

CLI 任务输出(0.1.7)

CLI run 现在在可信 模块创建/导入和循环期间丢弃写入被重定向 Python stdout/stderr 的内容。仅保留字符和二进制字节计数, 不保留内容或控制台日志。写入非空时,最终结果包包含可选的 task_output。其他 CLI 命令、配置准入和 SDK 的 Engine.run 保持原有行为。工具返回值及引擎的私有观察/结果日志 仍与控制台输出分开。

离线输出 A/B针对 19 个固定合成 测试夹具,将已发布的完整 0.1.6 源码 (32867087bf173515806958b61acffdd08c743659)与候选版本比较,进行三次配对重复并交替安排两组顺序。 符合新控制台/退出策略的次数从 6/57 变为 57/57。每组的 42 个普通终态中, 严格 JSON 解析从 12/42 变为 42/42;其余 15 次探测按设计退出且不返回 终态结果包。固定合成 stdout/stderr 标记从出现 51/30 次变为零/零。两组均在 57/57 次探测中恢复输出流。原生推理 尝试和实际模型/UI/网络调用均为零;每组进行六次脚本选择。 原始捕获输出保留在各次试验内部;报告仅存储摘要哈希和计数。

测试夹具覆盖导入、观察、验证、成功/不确定副作用、导入 错误、Unicode、无效 UTF-8 二进制写入、空写入和大量写入、警告、返回 计数,以及任务中断。通过诊断恢复基线末尾的结果包,不 计作输出可直接解析。基准在解释器打印中断前捕获它们; 仅凭其异常标记计数,不能证明解释器 隐私。独立的真实 CLI 子进程回归复现异常/源码文本 暴露和错误的成功退出码,随后验证安静的非零退出。副作用 中断回归独立确认只发生一次副作用、保留意图、没有终态 或捏造的安全失败结果,以及没有自动重试。

CLI 任务中的 KeyboardInterrupt 现在抛出安静的 SystemExit(130)。任务 SystemExit 保留 精确的整数码 1..255;文本、零、None 或其他代码变为 1。这些退出不会返回已验证的 终态结果包或计数;可能已发生的运行时副作用和用量 仍需核对。SDK 和解析器/帮助退出不变。

负面结果:控制台调试文本被丢弃,无法恢复。总返回 字节数从 3,016,230 变为 19,906,主要由刻意设置的大量合成 输出案例决定。排除该测试夹具后,由于元数据增加,字节数从 15,212 增至 18,454。 混合测试夹具的耗时中位数略有增加;不声称速度、语义质量或模型费用 收益。计数器分别统计 Unicode 码点和缓冲区字节, 不对文本进行编码。这是只计数的写入目标,不是完整的 BufferedIO 模拟器。

重定向作用于整个进程,不能隔离重叠运行的任务或线程。已保存的 输出流/日志处理器、操作系统描述符、子进程和显式文件日志可能绕过 它;被重定向的流不支持 fileno()。对于任意可信 Python, 不提供沙箱、所有输出的隐私保障或无条件终态 JSON 保证。

python benchmarks/task_output.py --output local-results/task-output-ab.json

使用安装了 .[dev] 的完整 Git 检出和新输出路径。CI 仅在 Python 3.10、3.12 和 3.14 下运行离线测试夹具。没有重跑较早的真实测试矩阵、UI 操作、锁屏桌面或 URL 提交。原生桌面和搜索收录仍未验证。

CLI 参数失败(0.1.8)

当 argparse 在任一命令解析器中报告错误时,CLI 现在返回一个固定的 JSON 结果包,包含 failed、阶段 arguments、代码 invalid_command_arguments、 script_loaded: false 和 model_calls: 0,随后以 2 退出。直接调用 main 返回 2。 不输出原始错误文本、argv 值或用法说明。解析先于命令派发、 任务源码访问和可信模块加载。解析成功后,对于 格式错误的 JSON 或无效运行配置,仍使用独立的 configuration 阶段。

离线参数 A/B针对 25 个固定合成 argv 测试夹具,将已发布的完整 0.1.7 源码 (609d76822dc721a1f19bb7c3b2837f553507d24f)与候选版本比较,进行三次配对重复并交替安排两组顺序。 符合新接口策略的次数从 27/75 变为 75/75。每组有 48 次解析器失败探测、 九次面向人的帮助探测,以及 18 次其他离线/有效/配置探测。严格 JSON 结果包从 18 个变为 66 个;九次帮助结果仍为文本且以 0 退出。固定 合成 stderr 标记从出现 24 次变为零。两组均在 75/75 次探测中恢复输出流,实际模型/UI/网络调用均为零。

两组全部 48 次解析器失败中,测得的任务源码读取、模块 spec/exec 尝试及新文件创建均为零。这是保留下来的属性,不是由本次变更带来的执行安全 提升。正向测试夹具验证规范、静态检查、排他 初始化、已完成运行、合法的长选项缩写,以及格式错误的 JSON 配置。有效运行刻意导入本地合成标记,无需 工具或模型决策。真实 CLI 子进程回归还验证无效整数值时的严格 JSON、退出码 2,以及不含原始 stderr。

负面结果:具体的 argparse 修复信息被丢弃。总返回字节数 从 39,492 变为 34,578;非解析器测试夹具则从 26,319 增至 27,810, 因为机器可读规范现在说明了这一边界。小规模混合计时和个别 较慢测试夹具均保留在报告中;不声称速度、语义质量或模型费用收益。 支持普通字符串 argv,不支持任意 Python 对象。Argparse 可能 临时构造原始诊断字符串,因此抑制输出不等于内存 清零或沙箱。

帮助保留原有优先级并显示 prog。它可能在检查 后面的未知 token 前退出;并非每个含有错误 token 的命令都会产生 JSON。安静的 运行时中断仍没有终态结果包,需要核对副作用/用量。 输出流失败和任意进程失败仍在 该解析器边界之外。SDK 和 Jev 的工具/参数决策不变。

python benchmarks/cli_arguments.py --output local-results/cli-arguments-ab.json

使用安装了 .[dev] 的完整 Git 检出和新输出路径。CI 在 Python 3.10、3.12 和 3.14 下运行离线测试夹具。没有重跑较早的真实测试矩阵、UI 操作、锁屏桌面或 URL 提交。原生桌面和搜索收录仍未验证。

双语站点与发现基线

双语站点报告记录发布前的本地构建:16 个中英文页面、 语言对应关系、项目身份、常见问题、案例证据,以及固定品牌/非品牌查询。 抽样基线未返回 Harness 官方 URL;这不证明项目未被收录。HTTP 可达、抓取、索引、 查询发现、AI 引用和采用是不同阶段。构建成功或收到 IndexNow 回执,不证明曝光或排名已经提升。

可观测的循环上下文预算(0.1.9)

循环仍按原有的 15,000 个序列化 JSON 字符上限准入共享上下文。恰好 15,000 仍准入, 只有更大的 len(json.dumps(context, ensure_ascii=False)) 才拒绝,保持原有默认 分隔符。单位是序列化 JSON 的 Unicode 码点,包括转义与标点,不是 UTF-8 字节、 原始字符串长度或模型 token。spec 现在公开这一门槛和范围。拒绝时新增仅含计量信息的 context_budget,包含固定 scope、stage、unit、limit 和 observed 长度。返回的循环 调用新增 context_characters、context_character_limit,保留 UTF-8 context_bytes。

离线预算 A/B对比已发布的完整 0.1.8 源码 (c757179c22e6104df06a44e8ce66e5217f1d96c7)与候选版本,使用 14 个固定合成 测试夹具、三次配对重复,交替安排两组顺序。两组均保留 42/42 个预期行为,逐对的 状态/决策/效果完全一致。每组包含 18 次脚本化完成循环、18 次预期复核和六次准入的 直接决策探测,分别有 33 次脚本化选择、18 次效果及 18 次 intent。新计量/诊断契约 的符合次数从 6/42 变为 42/42;这些是 host 协议检查,不是语义准确率提升。 请求的共享上下文字符/UTF-8 字节计数在两组间保持一致。原生推理尝试及真实模型、 UI、网络调用均为零。

夹具覆盖 ASCII、中文和 emoji、投影及选择阶段的恰好达限/超限、阶段标记增量、 参数增量,以及直接 Engine.decide 的兼容性。15,000 字符投影在加入工具阶段标记 后可以超限;参数上下文也可能在更早的一次选择之后超限。Unicode 探测仅说明循环的 字符准入规则在 UTF-8 计量更大时仍保留;脚本化完成不证明真实提供方 payload 限制 会准入这些输入。独立回归保留此前未知用量、已完成步骤/已花费调用、可信绑定回退 及效果发生后的执行不确定性。拒绝某次决策不表示整次运行没有调用或效果。

负面结果:终态/上下文输出从 15,414 增至 19,692 字节。混合测试夹具的耗时中位数 略有增加;不声称提速、模型质量或费用收益。预算覆盖已纳入的共享上下文:选择之前 的策略投影加剩余预算,再加入 host 阶段及参数上下文增量。候选记录文本、选择问题 和完整 prompt 不在这项计量内。直接决策保留独立的上游 spec/提供方限制,已有的 提供方问题/状态/body 限制仍有效;这不是总 payload、token、费用或内存预算。 上下文不会被静默截断或缓存。只有标量计量成为诊断,原始上下文不进入终态输出。 推理异常路径可能缺少返回调用的计量,未知用量仍保留。

python benchmarks/context_budget.py --output local-results/context-budget-ab.json

使用安装了 .[dev] 的完整 Git 检出和新输出路径。CI 在 Python 3.10、3.12 和 3.14 下运行离线夹具。没有重跑之前的真实测试矩阵、锁屏桌面或 URL 提交。 原生桌面完成及搜索收录仍未验证。

类型化请求规划交接(0.1.10)

原生 Choice 规划为空时,harness 现在保留 NEEDS_NARROWING 或 NEEDS_CONTEXT 类型状态,并报告固定规划原因。未知状态统一为 UNAVAILABLE 和 request_planning_review,不导出原状态或异常文字。可选的 telemetry.planning (循环中位于某次 call 的 planning)包含 scope: current_selection、 phase: request_planning 和 inference_dispatched: false。这些字段只在 host 的实际 空计划路径、进入 native batch dispatcher 之前生成;选择诊断保留工具/参数阶段和固定原因码。

离线规划 A/B比较完整已发布 0.1.9 源码 (bb808e1472d3894e276689115574f126c193c52a)与候选版本,使用 14 个固定场景、 三次配对重复并交替顺序。两组最终状态、选择、效果、派发和用量行为均为 42/42 正确, 逐对行为一致。新诊断/计量符合预期的次数从 12/42 变为 42/42。三个场景、九条记录的 类型状态修正单独计数(33/42 至 42/42),不代表模型准确率提升。候选组返回 30 条 延后调用的规划记录。两组均有 18 次模拟 batch 派发、21 次 MockTransport 尝试和三次 合成效果/intent;真实模型与网络调用均为零。

场景覆盖 pinned planner 的实际 fit 检查:大段 ASCII/中文记录、254 个候选、必需记录 字段缺失、工具与依赖参数延后、模拟重试后的既有未知用量、可信默认值恢复、未知或注入 规划状态、完整 spec 验证异常及 HTTP 413。九条记录保留未知的模拟用量,重试仅来自 SDK 已有的有界策略。参数延后不清除先前调用或未知用量;可信恢复清除当前失败诊断但保留历史 规划信息,后续执行异常仍是不确定结果。独立回归保留空记录的旧完成语义及固定码严格投影。

负面结果:返回内容从 33,295 增至 37,777 字节;部分本地场景更慢,小规模混合计时不证明 提速、语义质量或费用收益。规划器限制、fit 规则、问题、实际推理及循环上下文上限均未改。 这不是新增输入尺寸 ProviderError 分类:SDK 在规划阶段给出类型化延后。普通 ValueError 保持普通异常;已派发的 HTTP 413 仍是 http_413_body_suppressed,用量保持未知。 不按异常文字猜原因,也不引入盲目重试。

未派发、已知零调用的范围仅是当前 selection,同一 run 可能已有调用、未知计费或效果; 缺少 planning 也不证明已派发。主 AI 应保留目标与安全约束,再收窄程序候选/描述或补齐 必需上下文。模型选择仍不是授权或完成证据。

python benchmarks/planning_diagnostics.py --output local-results/planning-diagnostics-ab.json

使用安装了 .[dev] 的完整 Git 检出和新输出路径。CI 仅在 Python 3.10、3.12、3.14 运行离线场景。没有重跑付费矩阵、锁屏桌面或 URL 提交。原生桌面完成、真实抓取、索引与 AI 引用仍是相互独立的未验证证据层。

不确定停止的当前动作标识(0.1.11)

当前执行窗口发生 DecisionStop 时,execution_uncertain 在当前 pending 的已绑定 action_id 存在时携带它。这个窗口覆盖 execute、结果准入、即时 observe 及观察未变时 的 verify。运行时不从历史推断 ID,也不把已清零的 ID 附到下一轮停止。普通异常已 携带 pending ID。这个标识供定位私有日志并核对目标状态,不证明效果成功或执行次数, 不是幂等 key,也不许可重跑。这个终态字段不新增绑定参数。

离线标识 A/B对比已发布的完整 0.1.10 源码 (c4486ed8cc3c82a00f421f3bac32653b814f2d40)与候选版本,使用 16 个固定合成 夹具、三次配对重复并交替顺序,每组 48 条记录。新标识契约符合次数从 21/48 变为 48/48。两组预期状态/原因/步数/效果/intent/派发/用量行为均为 48/48,逐对完全一致; 这是接口修复,不是语义质量提升。每组有 30 次不确定退出;候选版本为 27 条 DecisionStop 记录新增当前 ID,三条普通异常记录原已携带。两组均有 51 次脚本化选择、42 次效果/intent, 以及 21 条未知脚本用量记录。原生推理尝试及真实模型/网络/UI 调用均为零。

夹具覆盖四个执行窗口阶段及已知/未知的既有脚本用量、执行前停止、普通异常的既有 标识、独立验证完成、pending 清零后的下一轮停止,以及不能借用前一动作 ID 的第二 个动作。独立的合成效果计数和持久 intent 用于确认当前动作。另有 CLI 回归检查退出码 2、一次本地效果标记、保留标识/未知用量及丢弃 print 输出;这些不能证明真实目标 核对成功或外部动作恰好执行一次。

负面结果:返回上下文从 24,069 增至 24,897 字节(+828);混合测试夹具的整段耗时 中位数约从 1.371 增至 1.463 毫秒,较慢的局部记录保留在报告中。计时包括合成注册、 loop 准入、脚本化选择、回调、效果及日志序列化,不包含进程/导入准备和终态/源码哈希 分析。脚本用量与真实模型用量区分;标明动作不会清除未知脚本用量。授权与重试策略 不变,不声称提速、模型质量或费用收益。

python benchmarks/execution_identity.py --output local-results/execution-identity-ab.json

使用安装了 .[dev] 的完整 Git 检出和新输出路径。没有重跑付费矩阵、浏览器操作、 锁屏桌面或 URL 提交。原生桌面完成、真实抓取、索引及 AI 引用仍保留各自证据边界。

本次运行拥有的传输计数(0.1.12)

已有 telemetry.requests 和逐次调用的 transport 证据保留:原生 Choice 计逻辑打包 请求。可选 telemetry.owned_transport 单独在日志终态写入和 client close 前,记录 本次拥有的 provider client 从 Session 起点到终态 finish 的 Client.stats 差值,包含 SDK request_attempts(已有重试也计入)、HTTP client 对象创建/复用及 counters_complete,scope 和 snapshot 固定。起点/终点须为精确的非负整数,终点不 低于起点或已见 Session.run 值;缺失/无效/回退字段为 null,不补零。不检测观察间的 每一次重置;没有活跃的本次 Session 时省略元数据,不证明本次拥有的尝试为零。

离线计数 A/B对比已发布的完整 0.1.11 源码 (95276bd77eef162645b45bfcd8c40c7a06dac212)与候选版本,使用 16 个固定合成 夹具、三次配对重复并交替顺序,每组 48 条记录。新快照契约符合次数从 6/48 变为 48/48,两组均保留 48/48 个预期行为,逐对完全一致。候选组有 42 个本次拥有的快照, 其中 12 个计数部分未知;六条不活跃/独立 SDK 记录按契约省略元数据。两组均保留 42 个逻辑请求、45 次操作内 MockTransport 进入,加上三次不在运行范围内的 seed 进入、27 次合成效果和 15 条未知 mock 用量记录。真实模型/网络/UI 调用及被禁止的 真实 transport 尝试均为零。这些是协议检查,不是语义质量提升。

初始离线报告及对应源码仍保留在本地。本次发布报告在澄清 spec 的固定 snapshot 值 与独立采样顺序描述后离线重测,运行时计数行为及全部场景/计数预期均未变。

夹具覆盖重试、凭据拒绝、非零起始计数、nullable 无效/bool/字符串/负数字段、低于 已见高位的重置、固定 key 投影、早期终态、不活跃归属,以及原有失败/用量处理。 独立 SDK 编码反例记录一次尝试、零次 MockTransport handler 进入,不产生 Engine 终态快照,说明 SDK 计数不等于 HTTP 派发次数。Seed 操作不在本次差值内;一个 逻辑请求在重试后可有三次 SDK 尝试,也可因凭据拒绝而没有尝试。

负面结果:返回上下文从 45,627 增至 53,319 字节(+7,692);混合测试夹具的整段 耗时中位数约从 1.660 增至 1.698 毫秒,较慢的局部记录保留。计时包括 loop 准入、 固定版本规划、有界 mock 重试/验证、效果、快照及日志 flush/fsync,不含进程/导入/ client/任务准备、seed 操作及调用后分析。完整计数不会让未知 token 用量变为已知。 尝试不证明 HTTP 发出、服务端收到、推理或计费;HTTP client 对象/复用不是 TCP 连接,其他工具流量不在范围内。模型身份、授权、执行、退出和重试处理不变。 不声称真实 provider 测量、提速、模型质量或费用收益。

python benchmarks/owned_transport.py --output local-results/transport-counters-ab.json

使用安装了 .[dev] 的完整 Git 检出和新输出路径。没有重跑付费矩阵、浏览器操作、 锁屏桌面或 URL 提交,历史验收及 GEO 声明保留已有范围。

候选 provider 的入口签名(0.1.13)

Provider 参数数量判断先取 inspect.signature(..., follow_wrapped=False),仍尊重 显式 signature。没有 *args,或至少有三个显式位置槽位时,由入口签名决定; 少于三个槽位的通用转发入口保留 advertised 委托契约。只有这个通用分支要求所选参数 同时可绑定两个签名,其余由入口签名决定;先尝试三参数,再尝试两参数。 只改变 provider,Task.tool 签名处理及回调类型检测不变, 准入不调用 provider 函数体。显式签名元数据仍可能有误,不证明函数体行为, 也不保证支持每个 decorator。

离线签名 A/B对比已发布的完整 0.1.12 源码 (851a865345230a0d151de60679cd776fcac16070)与候选版本,使用 18 个固定合成 夹具、三次配对重复并交替顺序,每组 54 条记录。符合夹具预期的次数从 27/54 变为 54/54;绑定修复组从 0/24 变为 24/24,提前准入组从 0/3 变为 3/3,兼容组均为 27/27 且逐对行为一致。整个矩阵有意不保持行为完全相同:provider 函数体调用和 合成效果从 27 增至 45。候选组符合预期包含应拒绝的 provider,不代表执行了 54 次, 也不代表语义质量提升。

夹具覆盖带 decorator 的显式两/三槽入口、前缀 partial、方法/可调用对象、可选父参数 及具名三槽可变参数 bridge。对照保留普通/可选签名、显式 signature、透明通用 两/三/partial 转发及原有无效/协程拒绝。实际要求四参数的 wrapper 现在在调用函数体 或推理之前,以 provider_signature_unsupported 拒绝准入。基线可选父参数的六条 记录各执行一次程序提供的错误候选,独立 digest 验证仍未通过,max_steps=1 限定 该负面案例。另有 CLI 回归覆盖声明 async 两参数委托的同步三槽 bridge, 私有参数不进入终态。

两组准入时的函数体调用、被禁止的原生推理/真实 HTTP 尝试及私有值暴露均为零, 均保留 45 次脚本化决策、三条未知脚本用量记录、107,415 字节选择输入和 12,105 字节共享上下文。真实模型/网络/UI 调用为零,脚本选择及 token 用量与真实用量区分。 Advertised 契约检查保留受支持的透明转发;盲目使用入口 *args 容量,不能证明委托兼容。

负面结果:返回上下文从 30,249 变为 29,673 字节(-576),来自终态/阶段组合变化, 不代表输入上下文减少或费用节省。混合测试夹具整段耗时中位数约从 1.471 增至 1.621 毫秒,包括前缀 partial 在内的较慢局部记录仍保留。计时包括准入、合成注册、脚本 选择、绑定/效果、验证和日志 flush/fsync,不含进程/导入/provider factory 准备和 终态/源码哈希分析。带一/两个命名槽位的复杂 *args wrapper 若元数据不实,仍可能 不支持,应使用明确的两/三参数入口或准确 Signature。未知用量、授权、执行保护和 候选刷新/无缓存规则不变。不声称异步引擎支持、模型质量、提速或费用收益。

python benchmarks/provider_signature.py --output local-results/provider-signature-ab.json

使用安装了 .[dev] 的完整 Git 检出和新输出路径。没有重跑付费矩阵、浏览器操作、 锁屏桌面或 URL 提交。历史验收、传输计数及 GEO 声明保留已有范围。

独立验证的值类型(0.1.14)

verify_state 递归区分布尔与数字,保留有限数字 1/1.0 等价,包括数字 key。 List/tuple 只匹配同类,字典 key 保留布尔/数字区别。不支持的值/子类不匹配,比较 不委托自定义相等。观察根和控件记录在 lookup 前要求 builtin dict/字符串字段, 观察控件集合为 builtin list/tuple。异常记录让验证失败,不过滤后伪造唯一匹配。 预期文本在 strip 前只接受 None/builtin str,其他类型/子类以原有配置错误拒绝; 不支持的比较值则返回 false。观察文本必须为 builtin str,不用 list/dict 成员关系。

离线验证 A/B对比已发布的完整 0.1.13 源码 (8e25a38293284265edb4d3b512234f42bfa53d2c)与候选版本,使用 35 个固定合成 夹具、三次配对重复并交替顺序,每组 105 条记录。符合预期从 36/105 变为 105/105。 36 条兼容记录逐对行为一致,整个矩阵有意不一致。18 个 helper 不匹配场景(54 条) 从错误初始完成变为 blocked,效果/推理为零;三个无效构造场景(九条)从错误完成 变为构造拒绝,不运行 Engine,也没有终态包。两个继续执行场景(六条)在一次合成 效果后采集 builtin true 并独立验证。在本固定 builtin 类型 oracle 下,机械错误初始 匹配从 69 变为零,无工具错误完成从 63 变为零。Oracle 包含有意的 unsupported/子类 兼容收窄,不是实测业务失败率,也不是全部 Jev 应用的错误完成率。这是 helper 正确性 检查,不是 AI 语义准确率或真实浏览器/桌面验收。

夹具覆盖布尔/数字与嵌套/容器/key 区别、文本类型、不支持的相等/metaclass 值、 记录/root 的字符串子类 alias key、预期文本构造,以及保留的数字/容器/null/缺失/ 重复/子串行为。调用方自定义验证不变。Helper 比较内的自定义相等调用从 90 变为零, metaclass/float/strip 调用两组均为零;整个准备/helper/loop 序列的自定义相等从 96 变为六,metaclass 相等两组仍为三,custom strip 从三变为零。初始 smoke 断言错误地 要求所有 hook 都消失,现已改为比较范围断言,并保留全部累积计数:deepcopy/JSON/ 其他可信 loop 工作仍会调用 hook。这不是沙箱;日志也不能恢复 tuple/list 原类型, 或恢复 Python 构造时已经合并的字典 key。

原生推理/真实 HTTP 尝试、真实模型/网络/UI 调用及私有原始标记暴露均为零。 脚本决策/效果从三增至九,未知脚本用量记录从三增至六,来自新增的未知继续调用, 不是先前未知用量丢失或被清零。选择输入从 5,661 增至 16,959 字节,共享上下文从 930 增至 2,766 字节。拒绝错误 done 可能增加后续工具、额外选择和日志工作,执行 门槛及调用方授权不变。

负面结果:返回字节从 42,297 变为 42,138(-159),来自终态/阶段组合,不代表上下文 或费用节省。仅构造记录计固定异常类型投影,不伪造 Engine 终态。混合中位数约从 1.089 变为 1.078 毫秒,不证明提速;已知/未知继续执行场景分别约慢 0.463/0.426 毫秒。计时包括 helper 构造/检查、注册、loop 准入、可选脚本选择/效果、验证及日志 flush/fsync,不含进程/导入/输入准备和调用后分析。隐式 matcher/子类支持收窄, 复杂有意语义应使用自定义 verify。全局准入、模型、执行权限及候选刷新/无缓存不变。 不声称模型质量、真实 UI 验收、提速或费用收益。

python benchmarks/verification_types.py --output local-results/verification-types-ab.json

使用安装了 .[dev] 的完整 Git 检出和新输出路径。没有重跑付费矩阵、浏览器操作、 锁屏桌面或 URL 提交。历史签名、传输及 GEO 声明保留已有范围,原生桌面验收仍未证明。

参数候选快照(0.1.15)

_domain 在重复 ID/数量检查后、选择之前深拷贝完整候选列表。普通 existing Option 与原始 dict/list 值不再共享来源引用,避免等待选择期间来源修改改写实际绑定值。 Provider 保留身份并继续每次新调用,staged/joint 接口保留;这是逐次候选域采集, 不是缓存、原子采集、全局 freshness 或沙箱。

快照 A/B对比基线提交 ad86eb02098b0a1ed0f1dc114e55ea735d97e068与候选版本:20 个固定合成 fixture, 交替两臂顺序做 3 次配对重复,共 120 行、每臂 60 行。7 个修改场景在候选域已构造后、 scripted 选择等待期间修改来源;独立观察的目标和完整参数 digest 必须与描述的合成值 一致。基线执行修改后的值,产生一次错误模拟 effect 后到达 max_steps;候选版本绑定 已提供的快照并完成。这测试候选/实际值一致性,不是 AI 语义质量或真实 UI 验收。

指标 基线 候选版本
修改场景中目标与描述一致 0/21 21/21
兼容、限额和复制成本场景符合预期 36/36 36/36
全矩阵符合各臂自己的预期 39/60 60/60
模拟 effects / scripted decisions 54 / 111 51 / 108
scripted 用量未知行数 9 9
序列化来源记录字节数 2,825,790 2,825,790
记录描述 / 选择输入 / 共享上下文字节数 37,764 / 233,010 / 54,921 37,605 / 228,075 / 52,410
返回上下文字节数 53,829 52,980
混合场景整段耗时中位数 1.802 ms 1.800 ms
16 候选、每候选 5,000 整数场景整段耗时中位数 6.329 ms 13.480 ms

36 行兼容/限额/复制成本场景逐对行为一致,全矩阵不是 parity。3 行未选值复制 hook 场景明确收窄兼容性:基线选择正常值,以一次 effect、两次 scripted decisions 完成; 候选版本调用一次失败 hook,在执行前 failed,只做一次 scripted decision。两臂均符合 各自不同的预期,既有用量仍是 None。因此 39/60 → 60/60 是包含更早失败的逐臂符合度, 不是通用成功率。少三次 effects/decisions 来自这个失败,不证明费用节省。每臂 provider 调用数均为 parent 6、first 6、target 99,包括工具/前序参数等待后的候选域刷新。

复制按全部候选值的对象结构增加时间/内存开销,包括未选值。大候选域中位数增加约 7.151 ms,混合中位数不证明提速。返回减少 849 字节来自终态/阶段变化,不是复制节省 上下文。不可变字符串可能沿用,来源 JSON 字节数只是序列化表示,不是新增堆字节。 可信 deepcopy hook 可执行或失败,不回退到带来源别名的候选域。未测试复制过程中的 并发修改;快照不使采集原子化、不冻结 staged preview、不缓存后续候选域、不证明目标 freshness,也不替代授权/独立验证。

原生推理、真实 HTTP/模型/UI 调用及固定私有值暴露检查均为零。已知/未知 scripted 用量与真实模型用量分开,未知行仍未知。不假设费率、质量、速度或费用收益。真实 perf_counter 计时覆盖注册/准入、新 provider 调用、来源大小标量采集、复制、scripted 选择、绑定/effects、验证及私有 journal flush/fsync;排除进程/导入/fixture 构造及调用后 分析/来源哈希,仅 loop 预算时钟冻结。使用安装了 .[dev] 的完整 Git 检出及新输出路径 复现:

python benchmarks/parameter_snapshots.py --output local-results/parameter-snapshots-ab.json

没有重跑付费模型矩阵、浏览器操作、锁屏桌面或 URL 提交。历史验证、签名、传输及 GEO 证据保留已有范围,原生桌面验收仍未证明。

候选采集前的墙钟预算(0.1.16)

在每轮顶部,验证返回 false 后原有 max_steps 检查仍优先,再在启动 workflow.candidates 前 重查耗时。该检查发现达到或超过预算时返回 budget_exceeded;晚到的 true 仍完成 done。 验证为 false 时,max_steps 在此位置仍优先于超时检查。此前调用/效果及未知用量保留。这只是一处协作式 检查点,不会中断回调,不是完整硬截止,不新增上下文、模型、授权、selector 或参数规则。

候选预算 A/B对比基线提交 30524752a83438decb431b36267ac81378f0bcb8与候选版本:10 个固定合成 Task/Workflow/Engine fixture,交替两臂顺序做 3 次配对重复,共 60 行、每臂 30 行。 回调控制的单调时钟不 sleep,模拟达到或超过十秒预算;这个虚拟耗时与真实测量的 整段延迟分开。6 个 fixture(每臂 18 行)验证已知预算耗尽且验证为 false 后不启动 新一轮候选采集。4 个控制 fixture 保留初始过期、正常快速进展、晚到验证完成及步骤 上限优先级;含上限的 elapsed >= timeout 边界不变。

指标 基线 候选版本
过预算 false 验证检查点符合预期 0/18 18/18
兼容场景符合预期 12/12 12/12
全矩阵候选采集进入次数 27 9
Task provider 调用 / Workflow generator yields 3 / 3 0 / 0
模拟 effects / scripted decisions 9 / 9 9 / 9
scripted 用量未知行数 3 3
选择输入 / 共享上下文字节数 15,156 / 2,448 15,156 / 2,448
返回上下文字节数 14,361 14,184
混合场景整段耗时中位数 1.131 ms 1.124 ms

12 行控制场景逐对行为一致,全矩阵不是 parity。原来 6 行 blocked、3 行 failed 改为 budget_exceeded,因为空候选或抛错 collector 未被调用;那些下游诊断不可获得,也 不能猜测。另 9 行修复场景先前就返回 budget_exceeded,但仍开始了多余采集。此前合法 采集/effects、未知 scripted 用量及逐行回调/journal 事件序列保留。减少的合成采集次数 不证明真实 API 请求或费用减少。

返回减少 177 字节来自终态/阶段变化,不是节省上下文。混合中位数不证明提速;动态 Task fixture 的中位数增加约 0.721 ms。原生推理、真实 HTTP/模型/UI 调用为零,真实 用量与已知/未知 scripted 用量分开。不假设费率、AI 质量、普遍速度或费用收益。真实 perf_counter 计时覆盖 run 准入、可信回调、可选 scripted decisions/effects 及私有 journal flush/fsync;排除导入、合成时钟/workflow 设置及调用后分析/来源哈希。不验证 真实 I/O 截止、回调取消、回滚或安全重试;其他验证路径和执行规则保留已有范围。 使用安装了 .[dev] 的完整 Git 检出及新输出路径复现:

python benchmarks/candidate_budget.py --output local-results/candidate-budget-ab.json

没有重跑付费模型矩阵、浏览器操作、锁屏桌面或 URL 提交。历史验证、快照、传输及 GEO 证据保留已有范围,原生桌面验收仍未证明。

已提供动作的类型一致性(0.1.17)

Task.bind/execute 复用已有内部类型比较,核对标准 Action 字段与最近提供的快照, 查找前检查 builtin str ID。布尔/数字替换及 list/tuple 转换不再误通过,有限数字 1/1.0 仍等价。这不是字节相同或对象身份,标准 Engine 不主动改写 Action。全局 Action.eq、fingerprint、验证、模型、授权、缓存及 freshness 规则不变,不新增公开 API。

动作一致性 A/B对比基线提交 dd6a63325e149a287e3600d0ae9b7bd2789a83dd与候选版本:18 个固定合成 fixture, 交替两臂顺序做 3 次配对重复,共 108 行、每臂 54 行。7 个 fixture 通过公开的低层 Task API 手工替换已提供/已绑定的字段或类型;标准 Engine 不做这些修改,不是模型 输出攻击。6 个控制 fixture 保留 staged/joint 数字 1/1.0 及数字 key 等价、正常 Engine 进展和带未知 scripted 用量的依赖动作刷新。5 个负面 fixture 使用不同的逐臂预期, 记录未修改的 JSON 兼容值或元数据失去兼容。

指标 基线 候选版本
7 个手工修改场景中被接受的尝试 21/21 0/21
兼容场景符合预期 18/18 18/18
全矩阵符合各臂自己的预期 33/54 54/54
模拟 effects 57 21
scripted decisions / provider 调用 27 / 6 27 / 6
scripted 用量未知行数 3 3
execution_uncertain 行数 / 其中测量的工具函数体未进入 0 / 0 9 / 9
guard fixture 自定义 equality 调用 / class-property 读取 6 / 3 0 / 0
选择输入 / 共享上下文字节数 60,207 / 7,932 60,207 / 7,932
返回投影字节数 17,583 18,918
混合场景整段耗时中位数 0.775 ms 0.816 ms

18 行控制场景行为逐对一致,全矩阵不是 parity。15 行负面场景均符合各臂不同预期: 基线未修改的 IntEnum、字符串 enum、字典子类值/元数据或字符串 enum 工具 ID 可以 正确执行;候选版本有 9 行 execute guard execution_uncertain、6 行 bind failed。 9 行 uncertain 已记录 intent,未进入测量的工具函数体;这个合成计数不能证明全局 没有副作用,也不授权重试。因此 33/54 → 54/54 是指定结果符合度,不是任务成功率 或 AI 质量。少 36 次 effects 包含拒绝 21 次手工修改,也包含失去的 15 次原本合法执行, 不是普遍安全或成本收益。应在提供候选前正规化,不要绑定后转换。

递归比较增加本地 guard 开销。混合中位数增加约 0.04025 ms;布尔/数字 execute fixture 增加约 0.236209 ms,兼容的 joint 数字 fixture 增加约 0.180542 ms。返回增加 1,335 字节;混合终态/投影变化不能衡量上下文或费用节省。直接 API 行使用现有 ValueError 原因码的固定异常投影,不伪造 Engine 终态。自定义 equality/class-property 计数只针对这些 guard fixture;可信 deepcopy/序列化/调用方代码仍可执行 hook,因此 不是 Python 沙箱或通用能力边界。数字等价有意保留,不支持的类型/子类即使 Action 未修改也可能被拒绝。

原生推理、真实 HTTP/模型/UI 调用及固定私有 marker 暴露检查均为零。scripted 已知/ 未知用量与真实用量分开,未知行仍未知。不假设费率、AI 语义质量、真实 UI 验收、提速 或费用收益。真实 perf_counter 计时覆盖 Task 候选域构造/绑定/guard/执行或 Engine 准入、scripted 选择、effects 及私有 journal flush/fsync;排除导入/task fixture 设置及 调用后分析/来源哈希,仅 loop 预算时钟冻结。返回投影不含本地归档路径,输入/上下文 大小标量不代表提供方 token 数。使用安装了 .[dev] 的完整 Git 检出及新输出路径复现:

python benchmarks/action_identity.py --output local-results/action-identity-ab.json

没有重跑付费模型矩阵、浏览器操作、锁屏桌面或 URL 提交。历史 helper、快照、预算、 传输及 GEO 证据保留已有范围,原生桌面验收仍未证明。

在 GitHub 查看本文源码 ↗