FuzzingBrain V2: el sistema multi-agente que encuentra vulnerabilidades que ni los humanos detectan

FuzzingBrain V2: el sistema multi-agente que encuentra vulnerabilidades que ni los humanos detectan

Este artículo sintetiza información publicada originalmente por huggingface.co. Para el contexto completo, las declaraciones originales y los detalles que no hemos incluido, consulta la fuente indicada.

Resumen: Papers arxiv:2509.07225. All You Need Is A Fuzzing Brain: un sistema basado en LLMs para detección y parcheo automatizado de vulnerabilidades. Publicado el 8 de septiembre de 2025.

El contexto

Nuestro equipo, "All You Need Is A Fuzzing Brain", fue uno de los siete finalistas en el Artificial Intelligence Cyber Challenge (AIxCC) de DARPA, quedando en cuarto lugar en la ronda final. Durante la competencia, desarrollamos un Cyber Reasoning System (CRS) que descubrió de forma autónoma 28 vulnerabilidades de seguridad - incluyendo seis zero-days previamente desconocidos - en proyectos reales de código abierto en C y Java, y parcheó con éxito 14 de ellas. El CRS completo es open source en https://github.com/o2lab/afc-crs-all-you-need-is-a-fuzzing-brain. Este paper ofrece una descripción técnica detallada de nuestro CRS, con énfasis en sus componentes y estrategias basadas en LLM. Construyendo sobre AIxCC, además presentamos una leaderboard pública para benchmarking de LLMs de última generación en tareas de detección y parcheo de vulnerabilidades, derivada del dataset de AIxCC. La leaderboard está disponible en https://o2lab.github.io/FuzzingBrain-Leaderboard/.

El paper tiene como autores a Ze Sheng, Qingxiao Xu, Jianwei Huang, Matthew Woodcock, Heqing Huang, Alastair F. Donaldson, Guofei Gu y Jeff Huang. El resumen destaca que se trata de un Cyber Reasoning System usando LLMs que descubrió y parchó vulnerabilidades de seguridad de forma autónoma en proyectos open-source, con una leaderboard pública para hacer benchmarking de LLMs en estas tareas.

Qué ha pasado

El equipo "All You Need Is A Fuzzing Brain" quedó en cuarto lugar en las finales del AIxCC de DARPA con un Cyber Reasoning System (CRS) que descubrió de forma autónoma 28 vulnerabilidades (incluyendo 6 zero-days) y parchó 14 de ellas en proyectos reales en C y Java. Este paper presenta un informe técnico detallado del CRS, con foco en sus componentes integrados con LLMs y sus estrategias autónomas de triaje y parcheo de vulnerabilidades.

El paper está disponible en arXiv y Hugging Face, y cuenta con un project page y código en GitHub. Se ha convertido en referencia para evaluar la capacidad de los LLMs en tareas de seguridad ofensivas y defensivas.

Detalles

El CRS usa LLMs tanto para generar casos de prueba (fuzzing dirigido) como para analizar el output y proponer parches. Una de las innovaciones clave es el uso del LLM para priorizar áreas de código con mayor probabilidad de contener bugs, acelerando la búsqueda de vulnerabilidades en comparación con fuzzing aleatorio.

Durante AIxCC, el sistema descubrió vulnerabilidades reales que afectan a proyectos open-source ampliamente utilizados, demostrando que los LLMs ya son útiles para auditorías de seguridad automatizadas, aunque todavía con falsos positivos y limitaciones en la calidad de los parches propuestos.

La leaderboard pública permite comparar el rendimiento de distintos LLMs en tareas de detección y parcheo, dando a la comunidad una métrica objetiva para evaluar avances en este campo.

Fuente original

Lee el artículo completo en huggingface.co.