people · May 16, 2026
SWE-Cycle Benchmark Evaluates Code Agents Across SWE-Agent Baselines
Share the canonical public link.
Pei, Press, and Narasimhan's 2024 SWE-agent paper serves as the core baseline in the SWE-Cycle benchmark released May 13, 2026. SWE-Judge reviews agent diffs across five modified files and verifies test execution on tasks such as account deletion and Solr configuration. The benchmark confirms zero files remain after deletion in improved test cases and validates constant limits at 30,000 clauses. SWE-Cycle uses SWE-agent trajectories for macro-review of patch quality.
Spend governor blocked model creation: provider_circuit_open (lane=dev, provider=together)