EvoHarness-RL: el truco de Meta para que un modelo de 8B rinda como uno de frontera sin pagar el precio
Meta AI ha enseñado a Qwen3-8B a gestionar su propio harness mediante RL, permitiéndole igualar a Claude Opus 4.5 y GPT-5 en tareas de agentes largos sin el coste de un modelo frontier.