Contratar IA en 2026 implica leer una hoja de precios llena de palabras que nadie te explicó: tokens, ventana de contexto, nivel de esfuerzo, caché de prompts. Y como no las entiendes, terminas eligiendo por marca o por precio de lista — que son las dos peores formas de decidir.
Este es el diccionario, ordenado por lo que más te va a servir. Sin tecnicismos innecesarios y con la implicación de negocio de cada término.
Los términos que aparecen en tu factura
Token
El pedacito de texto con el que el modelo cuenta su trabajo: unas tres cuartas partes de una palabra en español. Mil tokens son unas 750 palabras, o página y media.
Por qué importa: es la unidad de cobro. Y hay dos precios distintos — los tokens que entran (tu pregunta y tus documentos) y los que salen (la respuesta). La salida cuesta alrededor de cinco veces más, lo que hace que pedir respuestas cortas sea la palanca de ahorro más simple que existe. El desglose completo está en cuánto cuesta realmente la IA por token.
Ventana de contexto
Cuánto texto puede tener el modelo "en la cabeza" al mismo tiempo: tu pregunta, los documentos que adjuntaste y todo lo que llevan de conversación. Los modelos tope de 2026 llegan a un millón de tokens, unas 750 mil palabras.
Por qué importa: define el tamaño máximo de lo que puedes analizar de una sola vez. Con una ventana grande cabe un expediente completo; con una pequeña hay que trocearlo, y el modelo pierde la visión de conjunto.
Nivel de esfuerzo
Una perilla que decide cuánto piensa el modelo antes de responder. En la familia de Claude tiene cinco posiciones: bajo, medio, alto (el valor por omisión), muy alto y máximo.
Por qué importa: más esfuerzo significa mejor razonamiento en problemas difíciles, pero también más tiempo de espera y más tokens facturados. Es la palanca de ahorro más rápida de mover porque es un parámetro, no un rediseño. Lo desarrollamos en nivel de esfuerzo en los modelos de IA.
Caché de prompts
Un descuento por repetición. Si tus peticiones empiezan siempre con el mismo bloque de texto —un manual, un catálogo, unas instrucciones largas—, el proveedor lo guarda y te lo cobra a una fracción del precio en las siguientes peticiones.
Por qué importa: en procesos automatizados que mandan el mismo contexto cientos de veces al día, el ahorro sobre esa porción llega al 80 o 90 por ciento. Se activa con una opción de configuración.
Más caro cuesta un token de salida que uno de entrada: pedir respuestas cortas es la palanca de ahorro más simple
Los nombres de los modelos
Modelo vs. asistente
El asistente es el producto que usas (Claude, ChatGPT, Gemini) y el modelo es el motor que trae dentro. Un mismo asistente ofrece varios modelos con precios que varían hasta diez veces entre sí.
Por qué importa: cuando alguien dice "usamos Claude", no ha dicho nada sobre su costo ni su capacidad. La pregunta que sigue es: ¿con qué modelo?
Las gamas (con el ejemplo de Anthropic)
| Nombre | Gama | Para qué |
|---|---|---|
| Haiku | Rápido y económico | Volumen alto, tareas triviales |
| Sonnet | Equilibrado | El caballo de batalla diario |
| Opus | Insignia | Criterio, análisis, riesgo alto |
| Fable | Frontera | Lo más difícil que existe hoy |
El número que sigue (4.5, 5) es la generación. Las otras casas usan sus propios nombres para exactamente lo mismo: en GPT-5.6, el 5.6 es la generación y Luna, Terra y Sol son los niveles económico, equilibrado e insignia. La escalera es universal: siempre hay un modelo barato de volumen, uno equilibrado, uno insignia y —en algunas casas— uno de frontera.
| Nivel | Anthropic | OpenAI (GPT-5.6) |
|---|---|---|
| Económico | Haiku | Luna |
| Equilibrado | Sonnet | Terra |
| Insignia | Opus | Sol |
| Frontera | Fable | — |
Confundir la generación con el nivel es el error más común al pedir una cotización. "Queremos GPT-5.6" no dice nada del precio: entre Luna y Sol hay una diferencia de cinco veces.
Modelo de frontera
El más capaz que un proveedor tiene disponible. Suele costar el doble o más que el insignia y estar reservado para las tareas más difíciles.
Por qué importa: la intuición dice "usa el mejor" y esa intuición sale cara. En julio de 2026, el modelo insignia de Anthropic salió costando la mitad que su modelo de frontera y ganándole en 8 de 13 pruebas. La comparación está en Fable 5 vs. Opus 5.
Cómo se comportan
Alucinación
Cuando el modelo produce información falsa con total seguridad: cita una ley inexistente, inventa una cifra verosímil, atribuye una frase a quien nunca la dijo.
Por qué importa: los modelos de 2026 alucinan mucho menos que los de hace dos años, pero ninguno está libre. Toda salida que vaya a un cliente, a una autoridad o a una decisión importante necesita revisión humana. No es desconfianza, es diseño de proceso.
Rechazo (o negativa)
Cuando el modelo se niega a responder porque sus filtros de seguridad detectaron un tema sensible. Los modelos tope de 2026 llevan clasificadores reforzados en temas de ciberseguridad y biología, y a veces producen falsos positivos en trabajos completamente legítimos.
Por qué importa: si automatizas un proceso encima de un modelo, un rechazo no es un error técnico que salte con alarma — es una respuesta vacía. Tu proceso necesita detectarlo y tener plan B.
Razonamiento (o "pensamiento")
La fase en la que el modelo piensa internamente antes de escribir la respuesta. Los modelos de frontera actuales razonan siempre y en tareas difíciles pueden tardar varios minutos por turno.
Por qué importa: define si un modelo sirve para atención en vivo. Lo tratamos en IA rápida vs. IA que piensa.
Agente
Un sistema de IA que ejecuta tareas, no solo responde preguntas: consulta tus sistemas, crea registros, manda correos, encadena varios pasos hasta terminar un trabajo.
Por qué importa: es la diferencia entre una IA que te dice cómo generar la factura y una que la genera. La comparación completa está en agentes de IA vs. chatbots clásicos.
Lo que aparece en el contrato
Retención de datos
Cuánto tiempo el proveedor conserva lo que le mandas. Los planes empresariales suelen permitir configurarlo, incluso a cero — con excepciones importantes: hay modelos de frontera que exigen un plazo mínimo de 30 días y no operan bajo retención cero.
Por qué importa: puede decidir qué modelos tienes permitido usar. Ver retención de datos en modelos de IA.
Entrenamiento con tus datos
Si el proveedor usa tu información para mejorar sus modelos. Los planes empresariales de las tres grandes casas se comprometen contractualmente a no hacerlo; las versiones gratuitas no dan esa garantía.
Por qué importa: es la razón número uno por la que ningún dato confidencial debe pasar por una cuenta gratuita.
Prompt
La instrucción que le das al modelo. Un buen prompt define rol, tarea, reglas y formato de salida.
Por qué importa: la diferencia entre un prompt vago y uno bien escrito supera con frecuencia la diferencia entre dos modelos. Antes de pagar por un modelo más caro, arregla el prompt: cómo escribir tu primer prompt efectivo.
La tarjeta de referencia rápida
| Si te dicen… | Traduce a… |
|---|---|
| "1M de contexto" | Cabe un archivero completo en una conversación |
| "5 dólares por millón de tokens" | Unas 750 mil palabras de entrada por 5 dólares |
| "esfuerzo muy alto" | Piensa más, tarda más, cuesta más |
| "retención cero" | No guardan nada de lo que mandas |
| "modelo de frontera" | El más capaz y el más caro; rara vez el que necesitas |
| "caché de prompts" | Descuento por mandar el mismo texto muchas veces |
| "el modelo alucinó" | Se inventó algo con cara de verdad |
Con estos quince términos puedes leer cualquier hoja de precios de IA, hacer las preguntas correctas en una demostración y detectar cuándo te están vendiendo capacidad que no necesitas.
Y si quieres el siguiente paso —pasar del vocabulario a decidir qué modelo usar para qué—, el método está en cómo elegir el modelo de IA correcto para cada tarea.
Del vocabulario a la práctica
Traducimos todo esto a un proyecto concreto
Qué automatizar primero, con qué modelo, a qué costo mensual y con qué garantías de privacidad. Sin tecnicismos, con números.



