[{"data":1,"prerenderedAt":490},["ShallowReactive",2],{"blog-/blog/tutorial/probar-dos-modelos-ia-casos-reales":3,"prev-/blog/tutorial/probar-dos-modelos-ia-casos-reales":454,"next-/blog/tutorial/probar-dos-modelos-ia-casos-reales":457,"related-/blog/tutorial/probar-dos-modelos-ia-casos-reales":460,"author-Valeria Ríos":479},{"id":4,"title":5,"author":6,"authorUrl":7,"body":8,"category":382,"cta":383,"date":386,"dateModified":386,"description":387,"draft":388,"extension":389,"faq":390,"featured":388,"howto":403,"image":432,"imageAlt":433,"intent":434,"keywords":435,"meta":440,"navigation":441,"path":442,"publishedTime":443,"readingTime":444,"seo":445,"seoTitle":446,"stem":447,"tags":448,"__hash__":453},"blog/blog/tutorial/probar-dos-modelos-ia-casos-reales.md","Cómo probar dos modelos de IA con tus casos reales (y decidir con datos)","Valeria Ríos","/autores/valeria-rios",{"type":9,"value":10,"toc":370},"minimark",[11,20,23,28,35,38,42,46,53,69,76,80,83,86,111,125,129,132,135,146,154,157,161,168,171,230,236,240,243,250,253,297,300,304,307,333,339,343,350,358,361],[12,13,14,15,19],"p",{},"Todas las comparativas de modelos de IA —incluidas las nuestras— tienen el mismo límite: ",[16,17,18],"strong",{},"están hechas con los casos de alguien más",". La única prueba que decide de verdad es la que corres con tus documentos, tus criterios y tus clientes.",[12,21,22],{},"La buena noticia es que montarla toma una tarde y no requiere saber nada técnico. Esta es la metodología que usamos con clientes, en seis pasos.",[24,25,27],"h2",{"id":26},"por-qué-vale-la-pena-la-tarde","Por qué vale la pena la tarde",[12,29,30,31,34],{},"Porque la diferencia de precio entre modelos de una misma familia llega a ser de ",[16,32,33],{},"diez veces",", y la diferencia de calidad en tu tarea concreta puede ser de cero. Sin prueba, la decisión se toma por intuición — y la intuición siempre dice \"usa el más potente\", que es la respuesta cara.",[12,36,37],{},"Tres horas de trabajo pueden ahorrarte la mitad de tu factura mensual de IA durante todo el año, o evitarte meses de respuestas mediocres que alguien tiene que corregir.",[39,40],"steps",{":steps":41},"[{\"title\":\"Elige una sola tarea y define qué es \\\"bien hecho\\\"\",\"description\":\"Una tarea concreta y repetitiva. Escribe en dos líneas cómo se ve una respuesta correcta: 'identifica los tres riesgos contractuales principales y cita la cláusula donde está cada uno'. Sin esa definición no hay nada que medir.\"},{\"title\":\"Junta cinco casos reales, uno de ellos difícil\",\"description\":\"Casos verdaderos de tu operación con la respuesta correcta ya conocida. Incluye al menos uno atípico o ambiguo: en los casos fáciles todos los modelos empatan.\"},{\"title\":\"Escribe un prompt único y congélalo\",\"description\":\"El mismo texto exacto para las dos corridas. Si le ajustas el prompt a un modelo y al otro no, estás midiendo tu prompt, no el modelo.\"},{\"title\":\"Corre los cinco casos en cada modelo\",\"description\":\"Conversación nueva por cada caso, para que no se contaminen entre sí. Guarda las respuestas completas en la hoja y anota cuánto tardó cada una.\"},{\"title\":\"Califica a ciegas con la rúbrica\",\"description\":\"Etiqueta las respuestas como A y B sin decir qué modelo es cuál. Tres criterios del 1 al 5: exactitud, completitud y cuánto habría que corregir antes de usarla.\"},{\"title\":\"Aplica el criterio de decisión y documenta\",\"description\":\"Si el modelo económico saca 4 o más, te quedas con él. Escribe la conclusión con los números y la fecha — vas a repetir esto cada trimestre.\"}]",[24,43,45],{"id":44},"paso-1-una-tarea-un-criterio-escrito","Paso 1: una tarea, un criterio escrito",[12,47,48,49,52],{},"El error más común es querer probar \"la IA\" en general. No se puede. Se prueba ",[16,50,51],{},"una tarea concreta",":",[54,55,56,60,63,66],"ul",{},[57,58,59],"li",{},"❌ \"Ver cuál escribe mejor\"",[57,61,62],{},"✅ \"Extraer de una factura el RFC del emisor, el total y la fecha, en formato de tabla\"",[57,64,65],{},"✅ \"Identificar los tres riesgos principales de un contrato de arrendamiento y citar la cláusula de cada uno\"",[57,67,68],{},"✅ \"Clasificar un correo de soporte en una de estas seis categorías\"",[12,70,71,72,75],{},"Y escribe, antes de correr nada, ",[16,73,74],{},"cómo se ve una respuesta correcta",". Ese párrafo es tu rúbrica; sin él vas a calificar por impresión, que es exactamente lo que estás tratando de evitar.",[24,77,79],{"id":78},"paso-2-cinco-casos-reales-uno-difícil","Paso 2: cinco casos reales, uno difícil",[12,81,82],{},"Cinco es el número: suficiente para que no sea anécdota, poco para hacerlo en una tarde.",[12,84,85],{},"Requisitos de los casos:",[87,88,89,95,101],"ol",{},[57,90,91,94],{},[16,92,93],{},"Reales."," De tu operación, no inventados. Los casos sintéticos son demasiado limpios y hacen que todos los modelos se vean bien.",[57,96,97,100],{},[16,98,99],{},"Con respuesta conocida."," Alguien de tu equipo ya sabe cuál era la respuesta correcta.",[57,102,103,106,107,110],{},[16,104,105],{},"Al menos uno difícil."," El contrato con la cláusula rara, la factura mal escaneada, el correo que podría ir en dos categorías. ",[16,108,109],{},"Aquí es donde se decide la prueba"," — en los casos fáciles siempre hay empate.",[112,113,116],"callout",{"icon":114,"title":115},"i-lucide-shield","Cuida los datos que subes",[12,117,118,119,124],{},"Vas a pasar documentos reales por dos servicios distintos. Usa cuentas de paga empresariales, no las gratuitas: son las que dan garantía contractual de que tus datos no se usan para entrenar. Y si los casos tienen datos personales de clientes, anonimízalos antes o consigue el consentimiento correspondiente — la ",[120,121,123],"a",{"href":122},"/blog/guia-empresarial/proteger-datos-clientes-lfpdppp","LFPDPPP"," aplica igual durante una prueba piloto.",[24,126,128],{"id":127},"paso-3-un-prompt-congelado","Paso 3: un prompt, congelado",[12,130,131],{},"Escribe un solo prompt claro y úsalo idéntico en ambos modelos. Nada de \"en este le agrego una instrucción porque no entendió\". Si lo haces, estás midiendo tu habilidad para escribir prompts, no la capacidad del modelo.",[12,133,134],{},"Estructura que funciona bien:",[136,137,142],"pre",{"className":138,"code":140,"language":141},[139],"language-text","Eres [rol]. Tu tarea es [acción concreta].\n\nSigue estas reglas:\n- [regla 1]\n- [regla 2]\n\nDevuelve el resultado en [formato exacto].\n\nDocumento a analizar:\n[aquí va el caso]\n","text",[143,144,140],"code",{"__ignoreMap":145},"",[12,147,148,149,153],{},"Si nunca has escrito un prompt estructurado, empieza por ",[120,150,152],{"href":151},"/blog/tutorial/primer-prompt-efectivo-ia","cómo escribir tu primer prompt efectivo",". Un prompt vago hace que los dos modelos se vean igual de mal y desperdicia la prueba.",[155,156],"ad-banner",{},[24,158,160],{"id":159},"paso-4-las-corridas","Paso 4: las corridas",[12,162,163,164,167],{},"Diez corridas en total (cinco casos × dos modelos). ",[16,165,166],{},"Conversación nueva para cada una"," — si reutilizas el hilo, el modelo arrastra contexto del caso anterior y el resultado se contamina.",[12,169,170],{},"Registra en tu hoja de cálculo, por corrida:",[172,173,174,196],"table",{},[175,176,177],"thead",{},[178,179,180,184,187,190,193],"tr",{},[181,182,183],"th",{},"Caso",[181,185,186],{},"Modelo",[181,188,189],{},"Respuesta",[181,191,192],{},"Tiempo",[181,194,195],{},"Notas",[197,198,199,216],"tbody",{},[178,200,201,205,208,211,214],{},[202,203,204],"td",{},"1",[202,206,207],{},"A",[202,209,210],{},"...",[202,212,213],{},"12 s",[202,215],{},[178,217,218,220,223,225,228],{},[202,219,204],{},[202,221,222],{},"B",[202,224,210],{},[202,226,227],{},"1 min 40 s",[202,229],{},[12,231,232,235],{},[16,233,234],{},"Anota el tiempo."," En tareas donde una persona espera frente a la pantalla, un modelo que tarda dos minutos pierde contra uno que tarda quince segundos aunque su respuesta sea un poco mejor. Los modelos de frontera de 2026 pueden tardar varios minutos en un solo turno difícil — es una característica de diseño, no una falla, pero cambia por completo si sirven para trabajo interactivo.",[24,237,239],{"id":238},"paso-5-calificación-a-ciegas","Paso 5: calificación a ciegas",[12,241,242],{},"El paso que más gente se salta y el que más resultados invierte.",[12,244,245,246,249],{},"Pega las diez respuestas en una hoja nueva, etiquetadas solo como ",[16,247,248],{},"A1, B1, A2, B2…",", y guarda la equivalencia en otra hoja que no abras hasta terminar. Idealmente que califique alguien que no corrió la prueba.",[12,251,252],{},"Rúbrica, del 1 al 5 en cada criterio:",[172,254,255,265],{},[175,256,257],{},[178,258,259,262],{},[181,260,261],{},"Criterio",[181,263,264],{},"Qué preguntas",[197,266,267,277,287],{},[178,268,269,274],{},[202,270,271],{},[16,272,273],{},"Exactitud",[202,275,276],{},"¿Los datos y conclusiones son correctos? ¿Inventó algo?",[178,278,279,284],{},[202,280,281],{},[16,282,283],{},"Completitud",[202,285,286],{},"¿Se le fue algo relevante que sí estaba en el documento?",[178,288,289,294],{},[202,290,291],{},[16,292,293],{},"Usabilidad",[202,295,296],{},"¿Cuánto habría que editarla antes de usarla de verdad?",[12,298,299],{},"Suma los tres por respuesta y saca el promedio por modelo. Hasta aquí, tres horas de trabajo y ya sabes más que cualquier comparativa publicada.",[24,301,303],{"id":302},"paso-6-el-criterio-de-decisión","Paso 6: el criterio de decisión",[12,305,306],{},"Con los promedios en la mano, aplica esta regla:",[54,308,309,315,321,327],{},[57,310,311,314],{},[16,312,313],{},"Modelo económico ≥ 4.0"," → quédate con el económico. La diferencia entre \"muy bien\" y \"perfecto\" casi nunca vale el doble o el triple de precio.",[57,316,317,320],{},[16,318,319],{},"Modelo económico entre 3.0 y 4.0"," → depende del riesgo. Si un error se corrige en un minuto, quédate con el económico. Si tiene consecuencias legales o financieras, sube.",[57,322,323,326],{},[16,324,325],{},"Modelo económico \u003C 3.0"," → sube al modelo caro, sin discusión. Estás pagando en trabajo de corrección más de lo que ahorras en tokens.",[57,328,329,332],{},[16,330,331],{},"Empate"," → gana el más barato y rápido. Siempre. Un empate es un resultado, no una prueba fallida.",[334,335],"stat-card",{"icon":336,"label":337,"value":338},"i-lucide-check-check","Calificación a partir de la cual el modelo económico gana: la diferencia con el caro rara vez justifica el precio","4.0",[24,340,342],{"id":341},"y-ahora-documenta-y-agenda-la-repetición","Y ahora documenta (y agenda la repetición)",[12,344,345,346,349],{},"Escribe media página: qué tarea probaste, qué modelos, los promedios, la decisión y ",[16,347,348],{},"la fecha",". Esa fecha importa más de lo que parece.",[12,351,352,353,357],{},"En 2026 el terreno se movió dos veces en siete semanas: primero llegó un modelo de frontera carísimo, luego ",[120,354,356],{"href":355},"/blog/comparativa/claude-fable-5-vs-opus-5","salió uno que cuesta la mitad y le gana en la mayoría de las pruebas",". Cualquier conclusión tiene fecha de caducidad de unos tres meses.",[12,359,360],{},"Agenda desde ahora la repetición trimestral. Ya tienes el banco de casos y la rúbrica: la segunda vez toma una hora, no tres. Y esa hora al trimestre es lo que separa a las empresas que optimizan su gasto en IA de las que descubren en diciembre que llevan medio año pagando el doble.",[362,363],"call-to-action",{"description":364,"eyebrow":365,"icon":366,"label":367,"title":368,"to":369},"Banco de casos con tus documentos, corridas en los modelos candidatos, calificación a ciegas e informe con la recomendación. En días.","Decisiones con evidencia","i-lucide-flask-conical","Agendar sesión","Montamos la prueba comparativa por ti","/contacto",{"title":145,"searchDepth":371,"depth":372,"links":373},2,3,[374,375,376,377,378,379,380,381],{"id":26,"depth":371,"text":27},{"id":44,"depth":371,"text":45},{"id":78,"depth":371,"text":79},{"id":127,"depth":371,"text":128},{"id":159,"depth":371,"text":160},{"id":238,"depth":371,"text":239},{"id":302,"depth":371,"text":303},{"id":341,"depth":371,"text":342},"tutorial",{"title":384,"description":385,"label":367,"to":369,"icon":366},"¿Prefieres que la prueba la monte alguien que ya la hizo cien veces?","Diseñamos el banco de casos, corremos la comparación y te entregamos el informe con la recomendación y los números que la respaldan.","2026-08-04","Guía paso a paso para montar una prueba comparativa entre dos modelos de IA con los documentos y casos de tu empresa. Rúbrica, plantilla y criterio de decisión.",false,"md",[391,394,397,400],{"question":392,"answer":393},"¿Cuánto tiempo toma hacer esta prueba?","Unas tres horas para una tarea: una hora de preparación (elegir casos y escribir el prompt), una hora de corridas y una de calificación. Si es la primera vez, súmale una hora. Comparado con meses pagando el modelo equivocado, es la inversión de tiempo con mejor retorno de todo el proyecto de IA.",{"question":395,"answer":396},"¿Por qué hay que calificar a ciegas?","Porque el sesgo de expectativa es brutal: si sabes que una respuesta viene del modelo caro, la calificas mejor. Lo hemos visto invertir el resultado de pruebas completas. Basta con pegar las respuestas en dos columnas etiquetadas A y B y guardar la equivalencia en otra hoja hasta terminar de calificar.",{"question":398,"answer":399},"¿Qué hago si los dos modelos empatan?","Quédate con el más barato y rápido, sin dudarlo. Un empate en calidad es una victoria clara del modelo económico: mismo resultado, menor costo, menor espera. El empate es un resultado útil, no una prueba fallida.",{"question":401,"answer":402},"¿Sirve comparar modelos de proveedores distintos con este método?","Sí, el método es idéntico. La única precaución adicional es que cada proveedor responde mejor a estilos de prompt ligeramente distintos, así que un prompt muy afinado para uno puede castigar al otro. Usa un prompt claro y neutral, sin trucos específicos de una casa, y anótalo como limitación de la prueba.",{"name":404,"description":405,"totalTime":406,"tool":407,"supply":410,"steps":413},"Probar dos modelos de IA con casos reales","Método para montar una prueba comparativa entre dos modelos de inteligencia artificial usando documentos y casos reales de la empresa, con rúbrica y criterio de decisión.","PT3H",[408,409],"Cuenta de paga con acceso a ambos modelos","Hoja de cálculo para la rúbrica",[411,412],"5 casos reales con su respuesta correcta conocida","Un prompt único para las dos corridas",[414,417,420,423,426,429],{"name":415,"text":416},"Elige una sola tarea y define qué es 'bien hecho'","Una tarea concreta y repetitiva, con una definición escrita de cómo se ve una respuesta correcta. Sin eso no hay nada que medir.",{"name":418,"text":419},"Junta cinco casos reales, uno de ellos difícil","Casos verdaderos de tu operación con la respuesta correcta ya conocida. Incluye al menos uno atípico: ahí se separan los modelos.",{"name":421,"text":422},"Escribe un prompt único y congélalo","El mismo texto exacto para las dos corridas. Si cambias el prompt entre modelos, mides el prompt, no el modelo.",{"name":424,"text":425},"Corre los cinco casos en cada modelo","Conversación nueva por cada caso para que no se contaminen entre sí. Guarda las respuestas completas y anota el tiempo.",{"name":427,"text":428},"Califica a ciegas con la rúbrica","Que quien califica no sepa qué modelo produjo qué respuesta. Tres criterios del 1 al 5: exactitud, completitud y corrección necesaria.",{"name":430,"text":431},"Aplica el criterio de decisión y documenta","Si el modelo económico saca 4 o más, quédate con él. Escribe la conclusión con los números y la fecha de la prueba.","/images/blog/tutorial/probar-dos-modelos-ia-casos-reales.jpg","Dos respuestas de inteligencia artificial enfrentadas en pantallas holográficas mientras una analista las califica con una rúbrica","informational",[436,437,438,439],"comparar modelos de ia","prueba a/b inteligencia artificial","evaluar modelo de ia empresa","cómo saber qué ia es mejor",{},true,"/blog/tutorial/probar-dos-modelos-ia-casos-reales",null,8,{"title":5,"description":387},"Cómo comparar dos modelos de IA","blog/tutorial/probar-dos-modelos-ia-casos-reales",[449,450,451,452],"ia","modelos","productividad","metodologia","J4jjGPwiVD2s26hCojUTYFgYPKO1QYq_oPTQR-EyJjc",{"path":455,"title":456},"/blog/tutorial/elegir-modelo-ia-por-tarea","Cómo elegir el modelo de IA correcto para cada tarea (guía paso a paso)",{"path":458,"title":459},"/blog/tutorial/no-depender-de-un-solo-modelo-ia","Cómo diseñar tus procesos de IA para no depender de un solo modelo",[461,466,472],{"path":458,"title":459,"description":462,"date":463,"category":382,"image":464,"imageAlt":465,"readingTime":444},"Guía práctica para que tu operación pueda cambiar de modelo de IA sin rehacerlo todo: capa intermedia, prompts portables, plan B y prueba de sustitución.","2026-08-11","/images/blog/tutorial/no-depender-de-un-solo-modelo-ia.jpg","Procesos de una empresa conectados a varios modelos de IA intercambiables mediante un conmutador holográfico central",{"path":455,"title":456,"description":467,"date":468,"category":382,"image":469,"imageAlt":470,"readingTime":471},"Método en 6 pasos para asignar el modelo de IA correcto a cada tarea de tu empresa: inventario, clasificación por riesgo, prueba comparativa y regla escrita.","2026-08-01","/images/blog/tutorial/elegir-modelo-ia-por-tarea.jpg","Tablero holográfico donde distintas tareas de una empresa se dirigen hacia modelos de inteligencia artificial de distinto tamaño",9,{"path":473,"title":474,"description":475,"date":476,"category":382,"image":477,"imageAlt":478,"readingTime":471},"/blog/tutorial/conectar-tienda-online-erp","Cómo conectar tu tienda en línea con tu ERP e inventario (paso a paso)","Conecta tu tienda en línea con tu ERP: sincroniza inventario, pedidos, precios y facturación CFDI para dejar de capturar doble y vender sin errores.","2026-07-24","/images/blog/tutorial/conectar-tienda-online-erp.jpg","Puente de datos conectando una tienda en línea con el sistema ERP y el almacén de una empresa",{"id":480,"avatar":443,"bio":481,"entityType":482,"expertise":483,"extension":484,"meta":485,"name":6,"role":486,"slug":487,"social":443,"stem":488,"url":7,"__hash__":489},"authors/authors/valeria-rios.yml","Consultora en inteligencia artificial aplicada al negocio. Ayuda a empresas mexicanas a automatizar procesos y tomar decisiones con datos.","Person","Valeria encabeza el área de IA y automatización de Syswork México. Ha diseñado e implementado asistentes de IA, automatizaciones no-code y proyectos de Business Intelligence para empresas de manufactura, retail y servicios. Escribe sobre IA aplicada con un enfoque práctico y sin tecnicismos, pensado para dueños de negocio y equipos no técnicos.","yml",{},"Líder de IA y Automatización","valeria-rios","authors/valeria-rios","3nnwul4W96j-Iq-KzcJAp0CSl2lr3ThDBWItUu8k_Tg",1787950324126]