SWE Refactor Bench:当AI编程智能体遭遇全仓库级别长线重构
AI工具
摘要
SWE Refactor Bench是一项针对AI编程智能体全仓库级长线重构能力的新评估基准。传统基准易被“复制旧代码”策略欺骗,该基准设计了三阶段防作弊协议,结合迁移审计与智能体互测,以穿透评估盲区。在520次实测中,仅5.4%的任务被成功完成,反映出当前AI在复杂重构场景下的真实能力短板。该基准旨在更客观地衡量智能体在真实开发环境中的长期代码维护与重构表
告别“测试骗局”!当AI编程智能体遭遇全仓库级长线重构,传统基准彻底失效。我们推出SWE Refactor Bench:三阶段防作弊协议,用迁移审计+智能体互测,刺穿“复制旧代码”的评估盲区。520次实测仅5.4%通关,揭示AI重构能力的真实短板。
转载信息
原文:
SWE Refactor Bench:当AI编程智能体遭遇全仓库级别长线重构
(2026-09-05 05:01)
作者:
yweng18
分类:
技术
0
0
63
评论 (0)
请 登录 后发表评论
暂无评论,来留下第一条评论吧