Separating signal from noise in coding evaluations
动态 OpenAI
2026-07-08 · A new analysis from OpenAI reveals issues in SWE-Bench Pro, a popular coding benchmark, raising concerns about reliability and accuracy in evaluating AI models.
本页由 AGI Pulse 聚合,仅保留标题与链接,不转载正文。