跳到正文
评测来源

SWE-rebench

Nebius / 编程 · 持续收集真实仓库问题,比较模型在多种编程语言中的软件修复能力。

官方评测
在 MyHOT 中观察中
证据预算不计分
上游数据时间待核实
最近成功同步尚未开始采集

它测什么,怎么测

固定任务窗口、ReAct 环境和 text/tools 交互协议,采用多次运行的平均解决率与标准误;不把完整 Agent 产品与基础模型混为同一对象。

如何使用这份证据

候选观察:真实仓库任务值得补充,等待可验证运行日期、稳定成绩协议与再展示边界;尚未启用自动采集或计分。

评测局限与数据署名

滚动题目、运行环境和任务窗口影响可比性;网站近期维护不等于所有模型重新测试。

数据许可:官方 Hugging Face CC BY 4.0 数据集是任务题库;尚未确认网页最终成绩的稳定导出与再展示边界。

成绩由 Nebius 发布,原始分数与 MyHOT 共识分使用不同尺度,不能直接相加。