SCómo probar dos modelos de IA con tus casos reales (y decidir con datos)
// syswork LOG · categoríaTutorialeslectura8 MIN

Cómo probar dos modelos de IA con tus casos reales (y decidir con datos)

Guía paso a paso para montar una prueba comparativa entre dos modelos de IA con los documentos y casos de tu empresa. Rúbrica, plantilla y criterio de decisión.

Dos respuestas de inteligencia artificial enfrentadas en pantallas holográficas mientras una analista las califica con una rúbrica
Dos respuestas de inteligencia artificial enfrentadas en pantallas holográficas mientras una analista las califica con una rúbrica

Todas las comparativas de modelos de IA —incluidas las nuestras— tienen el mismo límite: están hechas con los casos de alguien más. La única prueba que decide de verdad es la que corres con tus documentos, tus criterios y tus clientes.

La buena noticia es que montarla toma una tarde y no requiere saber nada técnico. Esta es la metodología que usamos con clientes, en seis pasos.

Por qué vale la pena la tarde

Porque la diferencia de precio entre modelos de una misma familia llega a ser de diez veces, y la diferencia de calidad en tu tarea concreta puede ser de cero. Sin prueba, la decisión se toma por intuición — y la intuición siempre dice "usa el más potente", que es la respuesta cara.

Tres horas de trabajo pueden ahorrarte la mitad de tu factura mensual de IA durante todo el año, o evitarte meses de respuestas mediocres que alguien tiene que corregir.

Paso 1: una tarea, un criterio escrito

El error más común es querer probar "la IA" en general. No se puede. Se prueba una tarea concreta:

  • ❌ "Ver cuál escribe mejor"
  • ✅ "Extraer de una factura el RFC del emisor, el total y la fecha, en formato de tabla"
  • ✅ "Identificar los tres riesgos principales de un contrato de arrendamiento y citar la cláusula de cada uno"
  • ✅ "Clasificar un correo de soporte en una de estas seis categorías"

Y escribe, antes de correr nada, cómo se ve una respuesta correcta. Ese párrafo es tu rúbrica; sin él vas a calificar por impresión, que es exactamente lo que estás tratando de evitar.

Paso 2: cinco casos reales, uno difícil

Cinco es el número: suficiente para que no sea anécdota, poco para hacerlo en una tarde.

Requisitos de los casos:

  1. Reales. De tu operación, no inventados. Los casos sintéticos son demasiado limpios y hacen que todos los modelos se vean bien.
  2. Con respuesta conocida. Alguien de tu equipo ya sabe cuál era la respuesta correcta.
  3. Al menos uno difícil. El contrato con la cláusula rara, la factura mal escaneada, el correo que podría ir en dos categorías. Aquí es donde se decide la prueba — en los casos fáciles siempre hay empate.
Vas a pasar documentos reales por dos servicios distintos. Usa cuentas de paga empresariales, no las gratuitas: son las que dan garantía contractual de que tus datos no se usan para entrenar. Y si los casos tienen datos personales de clientes, anonimízalos antes o consigue el consentimiento correspondiente — la LFPDPPP aplica igual durante una prueba piloto.

Paso 3: un prompt, congelado

Escribe un solo prompt claro y úsalo idéntico en ambos modelos. Nada de "en este le agrego una instrucción porque no entendió". Si lo haces, estás midiendo tu habilidad para escribir prompts, no la capacidad del modelo.

Estructura que funciona bien:

Eres [rol]. Tu tarea es [acción concreta].

Sigue estas reglas:
- [regla 1]
- [regla 2]

Devuelve el resultado en [formato exacto].

Documento a analizar:
[aquí va el caso]

Si nunca has escrito un prompt estructurado, empieza por cómo escribir tu primer prompt efectivo. Un prompt vago hace que los dos modelos se vean igual de mal y desperdicia la prueba.

Paso 4: las corridas

Diez corridas en total (cinco casos × dos modelos). Conversación nueva para cada una — si reutilizas el hilo, el modelo arrastra contexto del caso anterior y el resultado se contamina.

Registra en tu hoja de cálculo, por corrida:

CasoModeloRespuestaTiempoNotas
1A...12 s
1B...1 min 40 s

Anota el tiempo. En tareas donde una persona espera frente a la pantalla, un modelo que tarda dos minutos pierde contra uno que tarda quince segundos aunque su respuesta sea un poco mejor. Los modelos de frontera de 2026 pueden tardar varios minutos en un solo turno difícil — es una característica de diseño, no una falla, pero cambia por completo si sirven para trabajo interactivo.

Paso 5: calificación a ciegas

El paso que más gente se salta y el que más resultados invierte.

Pega las diez respuestas en una hoja nueva, etiquetadas solo como A1, B1, A2, B2…, y guarda la equivalencia en otra hoja que no abras hasta terminar. Idealmente que califique alguien que no corrió la prueba.

Rúbrica, del 1 al 5 en cada criterio:

CriterioQué preguntas
Exactitud¿Los datos y conclusiones son correctos? ¿Inventó algo?
Completitud¿Se le fue algo relevante que sí estaba en el documento?
Usabilidad¿Cuánto habría que editarla antes de usarla de verdad?

Suma los tres por respuesta y saca el promedio por modelo. Hasta aquí, tres horas de trabajo y ya sabes más que cualquier comparativa publicada.

Paso 6: el criterio de decisión

Con los promedios en la mano, aplica esta regla:

  • Modelo económico ≥ 4.0 → quédate con el económico. La diferencia entre "muy bien" y "perfecto" casi nunca vale el doble o el triple de precio.
  • Modelo económico entre 3.0 y 4.0 → depende del riesgo. Si un error se corrige en un minuto, quédate con el económico. Si tiene consecuencias legales o financieras, sube.
  • Modelo económico < 3.0 → sube al modelo caro, sin discusión. Estás pagando en trabajo de corrección más de lo que ahorras en tokens.
  • Empate → gana el más barato y rápido. Siempre. Un empate es un resultado, no una prueba fallida.
4.0

Calificación a partir de la cual el modelo económico gana: la diferencia con el caro rara vez justifica el precio

Y ahora documenta (y agenda la repetición)

Escribe media página: qué tarea probaste, qué modelos, los promedios, la decisión y la fecha. Esa fecha importa más de lo que parece.

En 2026 el terreno se movió dos veces en siete semanas: primero llegó un modelo de frontera carísimo, luego salió uno que cuesta la mitad y le gana en la mayoría de las pruebas. Cualquier conclusión tiene fecha de caducidad de unos tres meses.

Agenda desde ahora la repetición trimestral. Ya tienes el banco de casos y la rúbrica: la segunda vez toma una hora, no tres. Y esa hora al trimestre es lo que separa a las empresas que optimizan su gasto en IA de las que descubren en diciembre que llevan medio año pagando el doble.

Decisiones con evidencia

Montamos la prueba comparativa por ti

Banco de casos con tus documentos, corridas en los modelos candidatos, calificación a ciegas e informe con la recomendación. En días.

Agendar sesión

// FAQ

Preguntas frecuentes

// Temas relacionados

#ia#modelos#productividad#metodologia

// Autor

Líder de IA y Automatización

Valeria Ríos

Consultora en inteligencia artificial aplicada al negocio. Ayuda a empresas mexicanas a automatizar procesos y tomar decisiones con datos.

¿Te fue útil? Compártelo

// Sigue leyendo

Artículos relacionados

Ver todos

// Consultoría gratuita

¿Prefieres que la prueba la monte alguien que ya la hizo cien veces?

Diseñamos el banco de casos, corremos la comparación y te entregamos el informe con la recomendación y los números que la respaldan.

Agendar sesión