Por qué los modelos de IA son más confident cuando están más equivocados
Un eval harness contra ground truth sintético revela que los LLMs son más seguros exactamente cuando más se equivocan. Por qué la revisión cualitativa no basta y cómo medir precisión real.