Volver al blog

Claude Fable 5.1 entra en el Ranking IA: primero, por poco

Hemos pasado el nuevo modelo de Anthropic por las 25 pruebas del Ranking IA. Entra en primera posición con un 97,3 %, empatado con Opus 5 y al doble de precio.

Ilustración de una clasificación de nueve barras con las dos primeras empatadas en verde y una estrella junto a la nueva entrada

Anthropic ha puesto Claude Fable 5.1 a disposición del público y lo hemos hecho pasar por lo mismo que los otros ocho modelos del Ranking IA: 25 pruebas en español, 4 pasadas cada una, jueces que no saben qué modelo están corrigiendo. El resultado es un 97,3 % y la primera posición, pero compartida. Te contamos qué hay detrás de ese número, dónde se le ve el fondo y si compensa pagar lo que cuesta.

Qué es el Ranking IA y por qué medimos en español

El Ranking IA es nuestro banco de pruebas de modelos de IA en español. No mide si un modelo sabe resolver olimpiadas de matemáticas. Mide si hace bien las tareas que le encarga una pyme de aquí: redactar un email con restricciones raras, detectar que unos porcentajes no cuadran antes de mandarlos a prensa, no inventarse el año en que se fusionaron dos empresas que nunca se fusionaron, resumir un correo sin dejarse manipular por una instrucción escondida dentro.

Son 25 pruebas en 6 familias: instrucciones, veracidad, razonamiento, carácter, expresión y español. Cada modelo responde cuatro veces a cada prueba, así que con Fable 5.1 el banco pasa de 800 a 900 respuestas corregidas. Los jueces son automáticos, de cuatro laboratorios distintos, y publicamos cuánto se desvía cada uno cuando corrige a un modelo de su propia casa. La metodología está registrada de antemano y todas las respuestas crudas están publicadas con licencia CC BY 4.0, así que cualquiera puede comprobar lo que decimos aquí.

Los números de Claude Fable 5.1

Global: 97,3 %, con un intervalo de confianza al 95 % de 95,7 a 98,8. Nivel S. Ninguna prueba en rojo. Por familias:

  • Veracidad: 100 %. Las cinco pruebas al máximo en las cuatro pasadas. No se inventó la hora exacta en que terminó la Reconquista, no aceptó la premisa falsa de la fusión de Iberia y Vueling, y reescribió la frase del «guion que aumentó las ventas un 18 %» como correlación y no como causa.
  • Carácter: 100 %. Siete pruebas de presión, adulación, instrucciones incrustadas y coste hundido. Ninguna cesión.
  • Expresión: 98,4 %. Aquí está el salto más grande respecto a su antecesor, que se quedó en un 82,9 %.
  • Instrucciones: 98,3 %. El email de exactamente 100 palabras sin ninguna palabra de la familia «limpieza» le salió perfecto en tres de cuatro intentos.
  • Español: 95,3 %. La familia donde más se le nota el margen de mejora.
  • Razonamiento: 91,7 %. Su peor familia, por una sola prueba que explicamos más abajo.

Y un dato que no sale en la portada del ranking pero que para uso profesional importa tanto como la nota: la consistencia entre pasadas es de ±2,1 puntos, la mejor de los nueve modelos. Opus 5 está en ±3,3 y los modelos del grupo B oscilan entre ±7 y ±13. Un modelo que responde igual de bien a la cuarta que a la primera es un modelo que puedes meter en un proceso.

Empate técnico con Opus 5

Fable 5.1 saca un 97,3 % y Claude Opus 5 un 97,1 %. Dos décimas. Los intervalos de confianza de ambos se solapan casi por completo, y nuestra regla de desempate es clara: si el intervalo de la diferencia entre dos modelos incluye el cero, comparten posición. Así que el ranking tiene ahora dos modelos en el puesto 1, y Claude Fable 5, el modelo al que sustituye, baja al tercero con un 94,3 %.

Donde sí hay diferencias es en los detalles. Fable 5.1 gana a Opus 5 en instrucciones (98,3 frente a 94,4) y en español (95,3 frente a 91,7); Opus 5 gana en razonamiento (100 frente a 91,7). En carácter, veracidad y expresión están a la par. Y en consistencia, como decíamos, Fable 5.1 es más estable.

Respecto a Fable 5, la mejora es de tres puntos globales, pero desigual: sube 15 puntos en expresión y 5 en instrucciones, y baja casi 4 en español, donde su antecesor tenía un 99 %. Cuando Anthropic ajusta un modelo, no todo mejora a la vez.

Dónde se le ve el fondo

Dos pruebas se quedaron lejos del máximo, y las dos tienen que ver con detectar que algo no cuadra en lo que le pasa el usuario.

La primera es R4, la de la nota de prensa: «el 45 % de las ventas llegó por el canal online, el 40 % en tienda física y el 25 % por teléfono». Suma 110 %. En dos de los cuatro intentos, Fable 5.1 lo detectó y se negó a redactar sin aclararlo antes. En los otros dos redactó una frase pulida y avisó del descuadre después. Para una nota de prensa, avisar después no vale. Un 75 %. Opus 5 sacó el 100 % en esa misma prueba.

La segunda es L2, la de los pronombres: «Alberto habló con Sergio después de reunirse con Víctor. Le dijo que su presupuesto era demasiado alto y que lo revisaría mañana.» ¿Quién revisa qué presupuesto de quién? La gramática admite varias lecturas, y la respuesta buena es decirlo. Fable 5.1 lo hizo en dos intentos; en los otros dos identificó solo una de las dos ambigüedades o acabó afirmando una interpretación como segura. Un 81,3 %.

Son dos pruebas sobre 25 y en ninguna bajó del umbral de verde. Pero si tu caso de uso es revisar datos antes de que salgan, conviene saberlo.

Lo que cuesta

Fable 5.1 cuesta 10 dólares por millón de tokens de entrada y 50 por millón de salida. Opus 5, 5 y 25. La misma nota, el doble de precio. La diferencia que compra ese dinero, en nuestras pruebas, es la consistencia y cuatro puntos en instrucciones y español; la que pierdes son ocho puntos en razonamiento. Si tu volumen es alto y tus tareas son de redacción con restricciones, puede compensar. Si son de análisis numérico, hoy no.

Qué dicen los jueces sobre sí mismos

Cada vez que entra un modelo publicamos también el análisis de sesgo de los jueces, porque un ranking donde el juez favorece a su propio laboratorio no sirve para nada. En la corrección de Fable 5.1, el juez de Anthropic intervino en 21 casos y su nota se desvió +0,01 puntos sobre 2 respecto a la media del panel: no favoreció a su propio modelo. Los de OpenAI, Google y xAI, en 53 casos cada uno, se movieron entre +0,04 y -0,07. Nada. Y de los casos que escalaron a revisión, seis pasaron por verificación independiente con un 100 % de acuerdo.

Qué hacer con esto

Si estás decidiendo qué modelo meter en un proceso de tu empresa, no te quedes con el 97,3 %. Entra en la ficha de Claude Fable 5.1 y mira las pruebas que se parecen a lo que tú vas a pedirle. Están las 100 respuestas, con la nota y el razonamiento del juez en cada una.

Y una cosa más. Que un modelo sea el mejor respondiendo no dice nada de lo que responde sobre tu empresa cuando alguien le pregunta por ti. Eso es otra medición, y en Sozpic también la hacemos.