El sesgo que no se entrena: por qué los modelos 2026 siguen repitiendo los mismos errores
Esta semana, tres modelos distintos coincidieron en la misma respuesta absurda sobre un caso legal simple. No es un bug. Es algo más profundo que los benchmarks no están capturando — y que ninguna cantidad de RLHF va a resolver.
Lo que pasó
El caso es de los más simples: una cláusula de no competencia en un contrato freelance. Tres modelos, el mismo error. Todos coincidieron en que la cláusula "no es ejecutable" porque el freelancer no había firmado "constitutivamente" el contrato. Ningún término tiene ese significado jurídico. Ninguno.
Lo grave no es el error. Lo grave es que los tres coincidieron con la misma palabra inventada.
Lo que el benchmark no captura
Cuando entrenas un modelo con corpus legal, aprende la forma. Aprende qué tipo de token aparece en qué tipo de contexto. Pero no aprende las reglas de inferencia que un abogado aplica silenciosamente: jerarquía de
El benchmark premia a quien repite el patrón. El abogado hace algo distinto: aplica una regla a una situación y se hace responsable del resultado.
Por qué RLHF no lo va a arreglar
El feedback humano funciona cuando hay un ground truth observable. "Esto suena mejor" es señal. "Esto es correcto" es otra. Pero en tareas donde el ground truth es la cadena de razonamiento, RLHF solo captura el producto final. Y el producto final, como acabamos de ver, puede ser consistente y estar completamente equivocado.
Lo que sí funciona (pero no se evalúa)
Tres cosas, en orden de coste operacional:
- Distinguir entre certeza y verosimilitud. El modelo debe poder decir "esto es lo que parece, pero no estoy seguro" — y esa incertidumbre debe llegar al usuario.
- Mostrar la cadena. No la cadena bonita que ya mostró. La cadena completa, con los saltos donde duda.
- Saber cuándo parar. El caso de la cláusula de no competencia no requería inventar un término. Requería decir "necesito el contrato completo".
Lo que me deja pensando
No es que los modelos sean malos. Es que estamos midiendo algo que no es lo que nos importa. Y cada benchmark nuevo, con sus leaderboards y sus trofeos, nos aleja un poco más de la pregunta real: ¿qué queremos que estos sistemas hagan bien?
La respuesta no es técnica. Es editorial.
Esta columna se publica cada miércoles. Si querés recibirla por mail, suscribite al RSS.
Lo que no está en el feed
Una columna semanal de Bastian Berrios sobre tecnología, operación y las preguntas que quedan fuera de la velocidad del feed.
Volver al portalArtículos Relacionados
Lo que GitHub Copilot entiende del código legacy chileno
Probé los tres asistentes más usados con proyectos reales de clientes. Los resultados son mejores y peores de lo esperado.
Por qué dejé de pagar Claude Pro y volví — en tres semanas
El experimento mental era: ¿puedo volver al tier gratuito sin perder productividad? La respuesta corta es no. La larga es interesante.