Qué son los Tokens y Cómo se Cuentan: La Fundamentación Arquitectónica en la Era de los LLMs
Los tokens son las piezas fundamentales que traducen el texto humano en números para que las inteligencias artificiales puedan procesarlo. Entender cómo funcionan y se calculan ayuda a controlar los costos y a optimizar la memoria de los modelos en la práctica.
Resumen
- Los tokens actúan como la unidad atómica de traducción entre el lenguaje humano y los vectores numéricos que las redes neuronales pueden procesar.
- Algoritmos como BPE, WordPiece y SentencePiece dividen el texto en subpalabras para equilibrar la eficiencia y el tamaño del vocabulario.
- Los idiomas como el español y el código fuente consumen más tokens que el inglés debido al desbalance en el entrenamiento inicial de los modelos.
- La ventana de contexto y los costos de API aumentan de forma no lineal cuando se envían prompts demasiado largos o redundantes.
- El uso de caché de prompts, resúmenes previos y observabilidad middleware permite controlar el presupuesto operativo en sistemas empresariales.
La Anatomía Atómica: El Puente Entre el Lenguaje Humano y los Vectores
En el centro de cualquier inteligencia artificial moderna, vive un concepto clave que muchos ingenieros de software confunden: el token. Para entender cómo funcionan redes como GPT-4 o Llama 3, hay que aceptar que las computadoras no leen palabras como nosotros; solo manejan números y matrices gigantescas. El token es la pieza que traduce el significado humano a vectores numéricos (listas de números que representan conceptos).
Cuando mandas texto a una API de IA, este pasa por un filtro antes de tocar el modelo. Si las máquinas leyeran letra por letra, la memoria explotaría debido al mecanismo de atención (el sistema interno que conecta palabras lejanas para dar contexto). Si leyeran palabras enteras, el diccionario sería infinito y fallaría con palabras nuevas. El token pica el texto en pedazos más pequeños llamados subpalabras, logrando un balance entre significado y velocidad.
Algoritmos de Tokenización por Dentro: BPE, WordPiece y SentencePiece
La conversión de texto en números está controlada por algoritmos de tokenización. Los principales son Byte Pair Encoding (BPE), WordPiece y SentencePiece.
El Byte Pair Encoding (BPE) empieza tratando cada letra como un token suelto. Luego, busca cuáles pares de letras aparecen juntos más veces y los une en un nuevo token repetidas veces hasta llenar su diccionario. El siguiente código muestra cómo se cuentan esos pares en la práctica:
def get_stats(vocab):
pairs = {}
for word, freq in vocab.items():
symbols = word.split()
for i in range(len(symbols) - 1):
pair = (symbols[i], symbols[i+1])
pairs[pair] = pairs.get(pair, 0) + freq
return pairs
initial_vocab = {"l o w": 5, "l o w e r": 2, "n e w e s t": 6}
print(get_stats(initial_vocab))Por su parte, el WordPiece (usado por BERT) junta pares basándose en probabilidades estadísticas (Maximum Likelihood Estimation, un cálculo matemático para ver qué combinación hace que el resultado sea el más probable) para mejorar el lenguaje global. Mientras tanto, SentencePiece lee el texto como una tira continua de bytes sin depender de los espacios, por lo que funciona muy bien en varios idiomas como T5 y Llama.
La Disparidad Multilingüe: Por Qué el Portugués, el Español y el Código Consumen Más Tokens
Uno de los mayores dolores de cabeza para las empresas que operan fuera de Estados Unidos es que los modelos se entrenaron mayoritariamente en inglés. Por eso, su vocabulario interno tiene muchas más piezas optimizadas para el inglés que para el español o para lenguajes de programación.
En la práctica, esto significa que una palabra común en español se rompe en muchos más pedazos. Lo mismo pasa con el código en Python o TypeScript, donde los símbolos especiales obligan a dividir el texto con agresividad. La tabla abajo muestra esto:
| Texto / Idioma | Contenido de Ejemplo | Conteo Aproximado de Tokens (GPT-4) | Factor de Ineficiencia vs. Inglés |
|---|---|---|---|
| Inglés | "Software architecture patterns." | 4 tokens | 1.0x (Base) |
| Español | "Patrones de arquitectura de software." | 7 tokens | 1.75x |
| Portugués | "Padrões de arquitetura de software." | 8 tokens | 2.0x |
| Código (Python) | def calculate_user_metrics(df): | 9 tokens | 2.2x |
Esto no solo encarece el uso de la API; también achica la ventana de contexto (el espacio máximo de memoria que la IA puede retener en una charla). Si tu texto en español gasta más tokens, la IA olvidará rápido las instrucciones o la documentación que le pases mediante RAG (una técnica para buscar documentos externos en una base de datos y entregárselos a la IA para que responda con datos reales).
Matemática de Costos y Límites de Context Window
Controlar el presupuesto y la ventana de contexto es vital. La ventana de contexto —ya sea de 8k o 128k tokens— es el límite de memoria que el modelo procesa en una sola inferencia (cuando la red calcula una respuesta). Sin embargo, el costo y la tardanza crecen mucho más rápido que el tamaño del texto, ya que cada palabra debe compararse contra todas las demás.
Además, las APIs separan los cobros en dos partes:
- Input Tokens (Prompt): Lo que envías al modelo (instrucciones, historial, documentos). Cuesta menos por millón de tokens.
- Output Tokens (Completion): Lo que la IA responde palabra por palabra (un proceso donde usa su propia salida anterior para seguir escribiendo). Cuesta de 3 a 4 veces más porque se genera de forma secuencial y lenta.
Los ingenieros deben evitar enviar manuales gigantes de 50 páginas en cada mensaje, ya que eso genera un desperdicio financiero enorme.
Técnicas de Ingeniería para Optimización, Caching y Compresión de Prompt
Para gastar menos y lograr respuestas rápidas, hay que aplicar varias estrategias en producción:
- Prompt Caching: Proveedores como Anthropic y OpenAI ofrecen sistemas de caché (almacenamiento temporal para reutilizar datos ya calculados sin pagar de nuevo) para textos largos. Si mandas siempre las mismas reglas de negocio de 20k tokens, el sistema las guarda y reduce el costo hasta en un 90% y acelera la primera respuesta (Time-to-First-Token o TTFT, el tiempo que tardas en ver la primera letra escrita).
- Compresión Semántica y Summarization: Antes de meter chats largos en la memoria, usa modelos pequeños para resumir los mensajes viejos y conservar solo lo importante.
- Reducción de Verbosidad y Minificación de Prompts: Quita los saludos educados y preámbulos. Las órdenes directas usando etiquetas limpias o JSON ahorran muchos tokens inútiles.
Observabilidad y Control Presupuestario en Sistemas Empresariales
Poner IA en producción exige una buena observabilidad (medir y entender lo que pasa dentro del sistema mediante datos). Tienes que usar middleware (software intermediario que se coloca entre las peticiones del cliente y el servidor) para registrar cada token gastado. Herramientas como LangSmith o OpenTelemetry ayudan a medir el consumo por usuario o por función. Poner límites de gasto y bloqueos por sesión evita que un ciclo infinito en agentes autónomos vacíe tus cuentas en la nube de la noche a la mañana. Dominar el token significa dominar el dinero en la era de la inteligencia artificial.