El problema invisible de los agentes de IA: código que funciona pero pipelines que nadie puede gobernar
Investigadores de Peking y Shanghái documentan con datos el gap entre el código que genera un agente de IA y el pipeline que producción realmente necesita: 10,9 puntos porcentuales de diferencia. DataFlow-Harness lo cierra con MCP, DAGs persistentes y Skills inyectados en el contexto.
Pide a un agente de IA que escriba un script en Python para procesar un JSON y lo tendrás en segundos, limpio y funcional. Pero pídele que construya un pipeline de datos de producción —ingesta de miles de documentos, chunking, filtrado de ruido, indexación para un RAG— y lo que genera es código que funciona... una vez. Después se convierte en deuda técnica que nadie sabe mantener ni auditar.
Ese es exactamente el problema que un equipo de investigadores de la Universidad de Peking, la Zhongguancun Academy y el Shanghai Institute for Advanced Algorithms Research acaba de documentar con números en un paper publicado esta semana: lo llaman el gap NL2Pipeline, y sus efectos son cuantificables.
El gap NL2Pipeline: por qué el código descartable es fácil y el pipeline production-ready es difícil
Los modelos de lenguaje pueden traducir requisitos en lenguaje natural a código ejecutable. Pero precisión en la generación de código no equivale a idoneidad para producción. El primer obstáculo rara vez es escribir Python: los agentes de codificación modernos producen scripts plausibles con facilidad. El problema difícil es anclar ese script en una plataforma de producción real, usando operadores que estén instalados, respetando el esquema real del dataset, referenciando datasets y modelos registrados, preservando las dependencias entre etapas... y dejando un artefacto que otro ingeniero pueda entender y modificar.
Los investigadores llaman a este problema el gap NL2Pipeline: la desconexión entre lo que un usuario expresa en lenguaje natural y lo que el entorno de producción exige como activo estructurado, persistente y auditable.
Los datos del paper lo cuantifican con un experimento claro. Cuando Claude Code pudo escribir scripts libres con acceso al codebase completo, logró un 94,2% de éxito en tareas de procesamiento de datos. Cuando se le restringió a usar exclusivamente los bloques de construcción nativos de una plataforma de pipelines —construir un grafo DAG nativo— su tasa de éxito cayó al 83,3%. Esa diferencia de casi 11 puntos porcentuales es el hallazgo central del trabajo.
DataFlow-Harness: cuatro componentes para orientar al agente
Para cerrar ese gap, los investigadores proponen DataFlow-Harness, un framework open-source disponible en GitHub bajo licencia Apache 2.0. La idea central: en lugar de pedir al agente que genere código arbitrario, se le guía para que construya un workflow estructurado paso a paso usando un conjunto limitado de operaciones predefinidas —lo que el paper llama operators— organizadas como un grafo acíclico dirigido (DAG).
La arquitectura tiene cuatro componentes: