资讯详情

资讯详情

jevgrep 评测全揭秘:SWE-bench 10 任务 8/10 通过、总成本降 25.8% 的完整方法论

jevgrep 评测全揭秘SWE-bench 10 任务 8/10 通过、总成本降 25.8% 的完整方法论【免费下载链接】jevgrepFind code by asking what it does. A CLI for coding agents that uses Jev to discover relevant files and source context.项目地址: https://gitcode.com/gh_mirrors/je/jevgrepjevgrep是一款面向编程 Agent 的代码检索 CLI用自然语言问“这个功能在哪”jg命令就返回相关文件、逐字源码摘录和阅读线索。它的官方评测在SWE-bench的 10 个 Python 任务上与无检索基线正面对比两边都通过 8/10 任务而把 Jev 检索费也算进去后总成本从 $7.62 降到 $5.66降低 25.8%。这篇文章完整拆解这套 jevgrep 评测的方法论、每一笔成本构成以及这些结论的边界。jevgrep 是什么用“问题”而不是“路径”找代码编程 Agent 每接到一个陌生任务都要花一部分时间“找对文件”。jevgrep 给它一个起点把仓库问题交给 Jev 模型在目录、文件、声明三个层级上判断相关性再挑选有用的源码单元和上下文一次性通过 stdout 输出给 Agent。它的工作分三步 分层发现先读目录元数据和内容预览决定往哪些分支探索而不是一上来上传整棵目录树相关文件筛选通过相关性门槛文件准入 0.5保留文件不设固定 Top-N源码优先输出先给摘要和文件列表然后是逐字源码块和行号最后才是详细的声明与调用位置——Python 和 TypeScript/JavaScript 支持声明解析其他文本走有界分片兜底。设计细节见 docs/architecture.md教 Agent 如何使用它的是仓库里的公开技能 skills/jevgrep/SKILL.md。评测方法论SWE-bench 对比怎么做才可信这套 jevgrep SWE-bench 评测的核心原则只有一条让对比无法被事后美化。具体做法如下。任务与评分官方评分器是唯一裁判使用10 个 Python SWE-bench 任务Django、pytest、SymPy、Sphinx 等知名项目通过与否只由SWE-bench 官方行为评分器判定不添加任何补充断言基线不使用 jevgrep 的纯 Agent 运行对每个任务/模型/测试组合只跑一次并冻结绝不重跑来“改善”对比结果。成本口径失败也算钱Jev 也算钱这是方法论里最容易被质疑的部分评测把规则写死在 evals/accounting.md 和 evals/cost-quality-policy.md 中规则说明总成本 Sol Jev编程 Agent 费用和检索费都计入未来所有评测默认如此计完整任务研究、实现、自验证、失败尝试全部计入Token 不混淆Jev token 永不加进 Agent token 总和但检索返回的上下文会计入 Agent 账单缺失即未知任何缺失的用量数据让总成本标记为“未知”而不是记为 0执行器跑真实的已安装包不跑实验代码评测驱动器 evals/implementation/swebench/installed.md 驱动的是真实的jg可执行文件冻结的已发布 npm 包 0.4.3加上 Solopenai/gpt-5.6-sol中强度。每次尝试都有全新的 home/缓存状态、可审计的生命周期回执原始的 Jev 请求/响应体由 gateway_broker.py 完整保留。冻结的基线档案见 fixed-baselines.json评测总入口说明在 evals/README.md。结果拆解25.8% 的节省从哪里来最新一轮含 Jev 的总成本复测evals/results/total-cost-2026-09-28.md逐任务成本如下任务官方结果Sol 成本Jev 成本合计无 jevgrep 基线pydata__xarray-3305✅ pass$0.4309$0.2701$0.7009$0.4937sphinx-doc__sphinx-8638✅ pass$0.3715$0.1678$0.5392$1.0595scikit-learn__scikit-learn-13124✅ pass$0.2129$0.0794$0.2923$0.2944django__django-15629✅ pass$1.1522$0.3515$1.5037$1.5055psf__requests-1142✅ pass$0.3368$0.0128$0.3496$0.2685astropy__astropy-13579✅ pass$0.3436$0.1501$0.4938$0.4286pytest-dev__pytest-6197✅ pass$0.4169$0.1119$0.5289$2.3445sympy__sympy-16792✅ pass$0.2662$0.0930$0.3592$0.5480matplotlib__matplotlib-26466⏸️ 未解决$0.4214$0.1752$0.5966$0.3957pylint-dev__pylint-4604⏸️ 未解决$0.2256$0.0667$0.2923$0.2836合计8/10$4.1780$1.4784$5.6564$7.6221几个值得注意的点 最大的单任务节省来自 pytest基线花了 $2.34 大量摸索用 jevgrep 后 $0.53 搞定——检索直接给了正确文件Agent 少走了弯路单任务均值从 $0.7622 降到 $0.5656按“每解决一个任务的花费”算则是 $0.9528 → $0.7070包含失败任务的花费不是只算成功尝试的平均Django 这类复杂任务基本持平说明节省不是均匀分布的不是每个任务都保证省钱此前的 Sol-only 口径evals/results/relevance-threshold-2026-09-27.md显示编程 Agent 成本从 $7.62 降到 $5.44降幅28.6%即 README 中“~30%”说法的出处。附带收益更快、更省 token独立的 速度研究 还测了本地优化 TypeSafe 原生端点后的效果同一 8/10 通过总耗时12.7% 更快Sol token 用量减少 41.5%581 万 vs 993 万。不过官方口径里时间是诊断性的不是优化目标。诚实的边界这个结果不能证明什么评测自己反复强调的局限性同样值得读者知道这是10 个调优过的 Python 任务不是留出集也不覆盖其他语言和任意仓库每个任务只有一次首次尝试不足以估计方差也不能单独归因到某个参数两个未解决任务Matplotlib、Pylint在两边都未解决——Pylint 的失败源于测试夹具本身的限制两边评分器表现一致Sol 在检索不足时仍可用普通工具补齐所以“为什么补丁通过”不能简单归功检索Jev 成本是按公开价目估算值$0.042 / 百万输入 token不是发票对账。自己动手试试 安装只需三步要求 Node.js 22macOS 或 Linuxnpm install -g dzhng/jevgrep jg auth jg skill然后在任意项目里用自然语言提问jg 数据库连接如何创建、池化和关闭 ./srcjg skill会自动检测你正在用的编程 AgentClaude Code、Codex、OpenCode 等并安装配套技能。认证、缓存和完整参数见 apps/cli/README.md。结语jevgrep 这套 SWE-bench 评测的价值与其说在 25.8% 这个数字本身不如说它示范了一种可复现的编程 Agent 工具评测方法论官方评分器裁决、冻结基线永不重跑、失败尝试全额计费、检索费透明入账。如果你的团队也在为 Coding Agent 选型这套口径可以直接参考 evals/cost-quality-policy.md 照抄。【免费下载链接】jevgrepFind code by asking what it does. A CLI for coding agents that uses Jev to discover relevant files and source context.项目地址: https://gitcode.com/gh_mirrors/je/jevgrep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →