Todas las comparativas de modelos de IA —incluidas las nuestras— tienen el mismo límite: están hechas con los casos de alguien más. La única prueba que decide de verdad es la que corres con tus documentos, tus criterios y tus clientes.
La buena noticia es que montarla toma una tarde y no requiere saber nada técnico. Esta es la metodología que usamos con clientes, en seis pasos.
Por qué vale la pena la tarde
Porque la diferencia de precio entre modelos de una misma familia llega a ser de diez veces, y la diferencia de calidad en tu tarea concreta puede ser de cero. Sin prueba, la decisión se toma por intuición — y la intuición siempre dice "usa el más potente", que es la respuesta cara.
Tres horas de trabajo pueden ahorrarte la mitad de tu factura mensual de IA durante todo el año, o evitarte meses de respuestas mediocres que alguien tiene que corregir.
Paso 1: una tarea, un criterio escrito
El error más común es querer probar "la IA" en general. No se puede. Se prueba una tarea concreta:
- ❌ "Ver cuál escribe mejor"
- ✅ "Extraer de una factura el RFC del emisor, el total y la fecha, en formato de tabla"
- ✅ "Identificar los tres riesgos principales de un contrato de arrendamiento y citar la cláusula de cada uno"
- ✅ "Clasificar un correo de soporte en una de estas seis categorías"
Y escribe, antes de correr nada, cómo se ve una respuesta correcta. Ese párrafo es tu rúbrica; sin él vas a calificar por impresión, que es exactamente lo que estás tratando de evitar.
Paso 2: cinco casos reales, uno difícil
Cinco es el número: suficiente para que no sea anécdota, poco para hacerlo en una tarde.
Requisitos de los casos:
- Reales. De tu operación, no inventados. Los casos sintéticos son demasiado limpios y hacen que todos los modelos se vean bien.
- Con respuesta conocida. Alguien de tu equipo ya sabe cuál era la respuesta correcta.
- Al menos uno difícil. El contrato con la cláusula rara, la factura mal escaneada, el correo que podría ir en dos categorías. Aquí es donde se decide la prueba — en los casos fáciles siempre hay empate.
Paso 3: un prompt, congelado
Escribe un solo prompt claro y úsalo idéntico en ambos modelos. Nada de "en este le agrego una instrucción porque no entendió". Si lo haces, estás midiendo tu habilidad para escribir prompts, no la capacidad del modelo.
Estructura que funciona bien:
Eres [rol]. Tu tarea es [acción concreta].
Sigue estas reglas:
- [regla 1]
- [regla 2]
Devuelve el resultado en [formato exacto].
Documento a analizar:
[aquí va el caso]
Si nunca has escrito un prompt estructurado, empieza por cómo escribir tu primer prompt efectivo. Un prompt vago hace que los dos modelos se vean igual de mal y desperdicia la prueba.
Paso 4: las corridas
Diez corridas en total (cinco casos × dos modelos). Conversación nueva para cada una — si reutilizas el hilo, el modelo arrastra contexto del caso anterior y el resultado se contamina.
Registra en tu hoja de cálculo, por corrida:
| Caso | Modelo | Respuesta | Tiempo | Notas |
|---|---|---|---|---|
| 1 | A | ... | 12 s | |
| 1 | B | ... | 1 min 40 s |
Anota el tiempo. En tareas donde una persona espera frente a la pantalla, un modelo que tarda dos minutos pierde contra uno que tarda quince segundos aunque su respuesta sea un poco mejor. Los modelos de frontera de 2026 pueden tardar varios minutos en un solo turno difícil — es una característica de diseño, no una falla, pero cambia por completo si sirven para trabajo interactivo.
Paso 5: calificación a ciegas
El paso que más gente se salta y el que más resultados invierte.
Pega las diez respuestas en una hoja nueva, etiquetadas solo como A1, B1, A2, B2…, y guarda la equivalencia en otra hoja que no abras hasta terminar. Idealmente que califique alguien que no corrió la prueba.
Rúbrica, del 1 al 5 en cada criterio:
| Criterio | Qué preguntas |
|---|---|
| Exactitud | ¿Los datos y conclusiones son correctos? ¿Inventó algo? |
| Completitud | ¿Se le fue algo relevante que sí estaba en el documento? |
| Usabilidad | ¿Cuánto habría que editarla antes de usarla de verdad? |
Suma los tres por respuesta y saca el promedio por modelo. Hasta aquí, tres horas de trabajo y ya sabes más que cualquier comparativa publicada.
Paso 6: el criterio de decisión
Con los promedios en la mano, aplica esta regla:
- Modelo económico ≥ 4.0 → quédate con el económico. La diferencia entre "muy bien" y "perfecto" casi nunca vale el doble o el triple de precio.
- Modelo económico entre 3.0 y 4.0 → depende del riesgo. Si un error se corrige en un minuto, quédate con el económico. Si tiene consecuencias legales o financieras, sube.
- Modelo económico < 3.0 → sube al modelo caro, sin discusión. Estás pagando en trabajo de corrección más de lo que ahorras en tokens.
- Empate → gana el más barato y rápido. Siempre. Un empate es un resultado, no una prueba fallida.
Calificación a partir de la cual el modelo económico gana: la diferencia con el caro rara vez justifica el precio
Y ahora documenta (y agenda la repetición)
Escribe media página: qué tarea probaste, qué modelos, los promedios, la decisión y la fecha. Esa fecha importa más de lo que parece.
En 2026 el terreno se movió dos veces en siete semanas: primero llegó un modelo de frontera carísimo, luego salió uno que cuesta la mitad y le gana en la mayoría de las pruebas. Cualquier conclusión tiene fecha de caducidad de unos tres meses.
Agenda desde ahora la repetición trimestral. Ya tienes el banco de casos y la rúbrica: la segunda vez toma una hora, no tres. Y esa hora al trimestre es lo que separa a las empresas que optimizan su gasto en IA de las que descubren en diciembre que llevan medio año pagando el doble.
Decisiones con evidencia
Montamos la prueba comparativa por ti
Banco de casos con tus documentos, corridas en los modelos candidatos, calificación a ciegas e informe con la recomendación. En días.



