SGlosario de modelos de IA 2026: token, contexto, esfuerzo y todo lo que ves en la factura
// syswork LOG · categoríaRecursoslectura8 MIN

Glosario de modelos de IA 2026: token, contexto, esfuerzo y todo lo que ves en la factura

Diccionario claro de los términos que aparecen al contratar IA: token, ventana de contexto, nivel de esfuerzo, caché de prompts, alucinación y más.

Términos técnicos de inteligencia artificial flotando como tarjetas holográficas ordenadas sobre un escritorio de oficina nocturno
Términos técnicos de inteligencia artificial flotando como tarjetas holográficas ordenadas sobre un escritorio de oficina nocturno

Contratar IA en 2026 implica leer una hoja de precios llena de palabras que nadie te explicó: tokens, ventana de contexto, nivel de esfuerzo, caché de prompts. Y como no las entiendes, terminas eligiendo por marca o por precio de lista — que son las dos peores formas de decidir.

Este es el diccionario, ordenado por lo que más te va a servir. Sin tecnicismos innecesarios y con la implicación de negocio de cada término.

Los términos que aparecen en tu factura

Token

El pedacito de texto con el que el modelo cuenta su trabajo: unas tres cuartas partes de una palabra en español. Mil tokens son unas 750 palabras, o página y media.

Por qué importa: es la unidad de cobro. Y hay dos precios distintos — los tokens que entran (tu pregunta y tus documentos) y los que salen (la respuesta). La salida cuesta alrededor de cinco veces más, lo que hace que pedir respuestas cortas sea la palanca de ahorro más simple que existe. El desglose completo está en cuánto cuesta realmente la IA por token.

Ventana de contexto

Cuánto texto puede tener el modelo "en la cabeza" al mismo tiempo: tu pregunta, los documentos que adjuntaste y todo lo que llevan de conversación. Los modelos tope de 2026 llegan a un millón de tokens, unas 750 mil palabras.

Por qué importa: define el tamaño máximo de lo que puedes analizar de una sola vez. Con una ventana grande cabe un expediente completo; con una pequeña hay que trocearlo, y el modelo pierde la visión de conjunto.

Nivel de esfuerzo

Una perilla que decide cuánto piensa el modelo antes de responder. En la familia de Claude tiene cinco posiciones: bajo, medio, alto (el valor por omisión), muy alto y máximo.

Por qué importa: más esfuerzo significa mejor razonamiento en problemas difíciles, pero también más tiempo de espera y más tokens facturados. Es la palanca de ahorro más rápida de mover porque es un parámetro, no un rediseño. Lo desarrollamos en nivel de esfuerzo en los modelos de IA.

Caché de prompts

Un descuento por repetición. Si tus peticiones empiezan siempre con el mismo bloque de texto —un manual, un catálogo, unas instrucciones largas—, el proveedor lo guarda y te lo cobra a una fracción del precio en las siguientes peticiones.

Por qué importa: en procesos automatizados que mandan el mismo contexto cientos de veces al día, el ahorro sobre esa porción llega al 80 o 90 por ciento. Se activa con una opción de configuración.

~5x

Más caro cuesta un token de salida que uno de entrada: pedir respuestas cortas es la palanca de ahorro más simple

Los nombres de los modelos

Modelo vs. asistente

El asistente es el producto que usas (Claude, ChatGPT, Gemini) y el modelo es el motor que trae dentro. Un mismo asistente ofrece varios modelos con precios que varían hasta diez veces entre sí.

Por qué importa: cuando alguien dice "usamos Claude", no ha dicho nada sobre su costo ni su capacidad. La pregunta que sigue es: ¿con qué modelo?

Las gamas (con el ejemplo de Anthropic)

NombreGamaPara qué
HaikuRápido y económicoVolumen alto, tareas triviales
SonnetEquilibradoEl caballo de batalla diario
OpusInsigniaCriterio, análisis, riesgo alto
FableFronteraLo más difícil que existe hoy

El número que sigue (4.5, 5) es la generación. Las otras casas usan sus propios nombres para exactamente lo mismo: en GPT-5.6, el 5.6 es la generación y Luna, Terra y Sol son los niveles económico, equilibrado e insignia. La escalera es universal: siempre hay un modelo barato de volumen, uno equilibrado, uno insignia y —en algunas casas— uno de frontera.

NivelAnthropicOpenAI (GPT-5.6)
EconómicoHaikuLuna
EquilibradoSonnetTerra
InsigniaOpusSol
FronteraFable

Confundir la generación con el nivel es el error más común al pedir una cotización. "Queremos GPT-5.6" no dice nada del precio: entre Luna y Sol hay una diferencia de cinco veces.

Modelo de frontera

El más capaz que un proveedor tiene disponible. Suele costar el doble o más que el insignia y estar reservado para las tareas más difíciles.

Por qué importa: la intuición dice "usa el mejor" y esa intuición sale cara. En julio de 2026, el modelo insignia de Anthropic salió costando la mitad que su modelo de frontera y ganándole en 8 de 13 pruebas. La comparación está en Fable 5 vs. Opus 5.

Cómo se comportan

Alucinación

Cuando el modelo produce información falsa con total seguridad: cita una ley inexistente, inventa una cifra verosímil, atribuye una frase a quien nunca la dijo.

Por qué importa: los modelos de 2026 alucinan mucho menos que los de hace dos años, pero ninguno está libre. Toda salida que vaya a un cliente, a una autoridad o a una decisión importante necesita revisión humana. No es desconfianza, es diseño de proceso.

Rechazo (o negativa)

Cuando el modelo se niega a responder porque sus filtros de seguridad detectaron un tema sensible. Los modelos tope de 2026 llevan clasificadores reforzados en temas de ciberseguridad y biología, y a veces producen falsos positivos en trabajos completamente legítimos.

Por qué importa: si automatizas un proceso encima de un modelo, un rechazo no es un error técnico que salte con alarma — es una respuesta vacía. Tu proceso necesita detectarlo y tener plan B.

Razonamiento (o "pensamiento")

La fase en la que el modelo piensa internamente antes de escribir la respuesta. Los modelos de frontera actuales razonan siempre y en tareas difíciles pueden tardar varios minutos por turno.

Por qué importa: define si un modelo sirve para atención en vivo. Lo tratamos en IA rápida vs. IA que piensa.

Agente

Un sistema de IA que ejecuta tareas, no solo responde preguntas: consulta tus sistemas, crea registros, manda correos, encadena varios pasos hasta terminar un trabajo.

Por qué importa: es la diferencia entre una IA que te dice cómo generar la factura y una que la genera. La comparación completa está en agentes de IA vs. chatbots clásicos.

Lo que aparece en el contrato

Retención de datos

Cuánto tiempo el proveedor conserva lo que le mandas. Los planes empresariales suelen permitir configurarlo, incluso a cero — con excepciones importantes: hay modelos de frontera que exigen un plazo mínimo de 30 días y no operan bajo retención cero.

Por qué importa: puede decidir qué modelos tienes permitido usar. Ver retención de datos en modelos de IA.

Entrenamiento con tus datos

Si el proveedor usa tu información para mejorar sus modelos. Los planes empresariales de las tres grandes casas se comprometen contractualmente a no hacerlo; las versiones gratuitas no dan esa garantía.

Por qué importa: es la razón número uno por la que ningún dato confidencial debe pasar por una cuenta gratuita.

Prompt

La instrucción que le das al modelo. Un buen prompt define rol, tarea, reglas y formato de salida.

Por qué importa: la diferencia entre un prompt vago y uno bien escrito supera con frecuencia la diferencia entre dos modelos. Antes de pagar por un modelo más caro, arregla el prompt: cómo escribir tu primer prompt efectivo.

La tarjeta de referencia rápida

Si te dicen…Traduce a…
"1M de contexto"Cabe un archivero completo en una conversación
"5 dólares por millón de tokens"Unas 750 mil palabras de entrada por 5 dólares
"esfuerzo muy alto"Piensa más, tarda más, cuesta más
"retención cero"No guardan nada de lo que mandas
"modelo de frontera"El más capaz y el más caro; rara vez el que necesitas
"caché de prompts"Descuento por mandar el mismo texto muchas veces
"el modelo alucinó"Se inventó algo con cara de verdad

Con estos quince términos puedes leer cualquier hoja de precios de IA, hacer las preguntas correctas en una demostración y detectar cuándo te están vendiendo capacidad que no necesitas.

Y si quieres el siguiente paso —pasar del vocabulario a decidir qué modelo usar para qué—, el método está en cómo elegir el modelo de IA correcto para cada tarea.

Del vocabulario a la práctica

Traducimos todo esto a un proyecto concreto

Qué automatizar primero, con qué modelo, a qué costo mensual y con qué garantías de privacidad. Sin tecnicismos, con números.

Agendar asesoría

// FAQ

Preguntas frecuentes

// Temas relacionados

#ia#modelos#glosario#recursos

// Autor

Líder de IA y Automatización

Valeria Ríos

Consultora en inteligencia artificial aplicada al negocio. Ayuda a empresas mexicanas a automatizar procesos y tomar decisiones con datos.

¿Te fue útil? Compártelo

// Sigue leyendo

Artículos relacionados

Ver todos

// Consultoría gratuita

¿Quieres pasar del vocabulario a la implementación?

Traducimos estos conceptos a un proyecto concreto para tu empresa: qué automatizar, con qué modelo y cuánto costará al mes.

Agendar asesoría