AGI Pulse

Separating signal from noise in coding evaluations

动态 OpenAI

2026-07-08 · A new analysis from OpenAI reveals issues in SWE-Bench Pro, a popular coding benchmark, raising concerns about reliability and accuracy in evaluating AI models.

原文 →

本页由 AGI Pulse 聚合,仅保留标题与链接,不转载正文。