技术博客/Quantifying infrastructure noise in agentic coding evals
Anthropic入门2026-02-05· 3 分钟· Agent 智能体

Quantifying infrastructure noise in agentic coding evals

Agent 编程评测受基础设施配置显著影响——Terminal-Bench 2.0 上最宽松与最严格配置成功率差达 6 个百分点(p<0.01),排行榜上的「2 分领先」可能只是硬件差异而非能力差异。

🔒

本文需解锁后阅读

免费开放 feed 中最新 5 篇博客。其余文章输入通行码后可阅读全文。

支持链接自动解锁:在地址后加 ?access=你的通行码