DeepSWE: el benchmark que demuestra que el 32% de los veredictos de SWE-Bench Pro eran erróneos
DeepSWE: el benchmark que demuestra que el 32% de los veredictos de SWE-Bench Pro eran erróneos
Este artículo sintetiza información publicada originalmente por swebench.com. Para el contexto completo, las declaraciones originales y los detalles que no hemos incluido, consulta la fuente indicada.
Resumen: DeepSWE: el benchmark que demuestra que el 32% de los veredictos de SWE-Bench Pro eran erróneos
El contexto
No models selected. Use quick select or go back to select models in the first column.
Qué ha pasado
SWE-bench Verified is a human-filtered subset of 500 instances; use the Agent dropdown to compare LMs with mini-SWE-agent or view all agents [ Post ].
Detalles
SWE-bench Multilingual features 300 tasks across 9 programming languages [ Post ].
Each entry reports the % Resolved metric, the percentage of instances solved (out of 2294 Full, 500 Verified, 300 Lite & Multilingual, 517 Multimodal).
[11/2025] Introducing CodeClash, our new eval of LMs as goal (not task) oriented developers! [ Link ]
[07/2025] mini-SWE-agent scores 65% on SWE-bench Verified in 100 lines of python code. [ Link ]
[05/2025] SWE-smith is out! Train your own models for software engineering agents. [ Link ]
Fuente original
Lee el artículo completo en swebench.com.