Skip to main content

System status

Coverage is stale.

Collection is paused. Latest public event: Aug 21, 2026 (11 days ago).

← Intel index

This coverage is stale.

Last updated May 16, 2026 (about 4 months ago).

people · May 16, 2026

SWE-Cycle Benchmark Evaluates Code Agents Across SWE-Agent Baselines

Share the canonical public link.

Share as image

Pei, Press, and Narasimhan's 2024 SWE-agent paper serves as the core baseline in the SWE-Cycle benchmark released May 13, 2026. SWE-Judge reviews agent diffs across five modified files and verifies test execution on tasks such as account deletion and Solr configuration. The benchmark confirms zero files remain after deletion in improved test cases and validates constant limits at 30,000 clauses. SWE-Cycle uses SWE-agent trajectories for macro-review of patch quality.

Spend governor blocked model creation: provider_circuit_open (lane=dev, provider=together)

Supporting evidence