¿Cuántas palabras son 1 millón de tokens?
Medimos texto real en español e inglés con los tokenizadores de OpenAI: un millón de tokens son unas 710,000 palabras en español con GPT-4o y unas 600,000 con GPT-4. El Quijote completo ocupa 592,000 tokens.
La respuesta corta
Un millón de tokens equivale a unas 710,000 palabras en español con el tokenizador de GPT-4o (o200k_base), y a unas 600,000 palabras con el de GPT-4 y GPT-3.5 (cl100k_base). En inglés la misma cantidad de tokens alcanza para unas 750,000-763,000 palabras. El español gasta más tokens por palabra porque los tokenizadores se entrenaron con más inglés.
No son estimaciones copiadas de otra web: las medimos el 3 de octubre de 2026 con la librería oficial tiktoken de OpenAI. Abajo está el método para que puedas repetirlo.
La medición
Tomamos cuatro artículos completos de Wikipedia (Ciudad de México, Lima, Inteligencia artificial y Fútbol) en su versión en español y en inglés, y contamos palabras y tokens con los dos tokenizadores de OpenAI más usados.
| Texto | Tokenizador | Tokens por palabra | 1 millón de tokens ≈ |
|---|---|---|---|
| Wikipedia en español (72,608 palabras) | o200k_base (GPT-4o) | 1.41 | 710,000 palabras |
| Wikipedia en español | cl100k_base (GPT-4, GPT-3.5) | 1.67 | 598,000 palabras |
| Wikipedia en inglés (48,058 palabras) | o200k_base (GPT-4o) | 1.31 | 763,000 palabras |
| Wikipedia en inglés | cl100k_base (GPT-4, GPT-3.5) | 1.33 | 749,000 palabras |
Dos cosas salen de la tabla. La primera: el tokenizador nuevo de OpenAI trata bastante mejor al español (1.41 tokens por palabra frente a 1.67). La segunda: aun con el nuevo, el español sigue costando cerca de un 8 % más tokens que el inglés para la misma cantidad de palabras.
¿Cuántos tokens tiene el Quijote?
Medimos también el texto completo de *Don Quijote de la Mancha* (las dos partes, edición del Proyecto Gutenberg): 386,614 palabras.
- Con o200k_base (GPT-4o): 592,079 tokens.
- Con cl100k_base (GPT-4): 663,832 tokens.
El castellano del siglo XVII se tokeniza peor que el actual (1.53 tokens por palabra), pero la conclusión práctica es clara: el Quijote entero cabe en una ventana de contexto de un millón de tokens, y sobra espacio para tus preguntas.
¿Cuántos tokens tiene una palabra?
En español actual, entre 1.4 y 1.7 tokens por palabra según el modelo. Las palabras cortas y frecuentes («de», «que», «casa») suelen ser un solo token. Las largas, raras o con tildes se parten en varios: «desafortunadamente» o un apellido poco común pueden ocupar tres o cuatro.
Una regla rápida que funciona bien para presupuestar:
- Español con GPT-4o: palabras × 1.4 = tokens.
- Español con modelos anteriores: palabras × 1.7 = tokens.
- Inglés: palabras × 1.3 = tokens. Coincide con la referencia de OpenAI de que 100 tokens son unas 75 palabras en inglés.
¿Y en Claude o Gemini?
Cada empresa usa su propio tokenizador, así que la cifra cambia. Nuestra medición es solo de los tokenizadores públicos de OpenAI, porque son los que se pueden ejecutar en local sin llamar a una API. Para Claude y Gemini, la forma fiable de saberlo es la función de conteo de tokens de su propia API, o una estimación como la que hace el contador de tokens de Toolram, que sirve para presupuestar antes de enviar un texto largo.
¿Cuántas páginas son 200,000 tokens?
Depende de cuántas palabras tenga tu página. Si tomamos una página A4 de unas 500 palabras (texto corrido a 12 puntos y espacio sencillo, una medida habitual pero no fija):
| Tokens | Palabras en español (GPT-4o) | Páginas A4 de ~500 palabras |
|---|---|---|
| 8,000 | 5,700 | 11 |
| 32,000 | 22,700 | 45 |
| 128,000 | 90,900 | 182 |
| 200,000 | 142,000 | 284 |
| 1,000,000 | 710,100 | 1,420 |
Con el tokenizador anterior (cl100k_base), 200,000 tokens son unas 119,500 palabras, unas 239 páginas.
¿Cuánto pesa un archivo de un millón de tokens?
Con 4.4 caracteres por token (lo que medimos en español con o200k_base), un millón de tokens son unos 4.4 millones de caracteres. Guardado como texto plano en UTF-8, eso ronda los 4.5 MB: las letras sin tilde ocupan un byte y las acentuadas y la ñ ocupan dos. Un PDF con el mismo texto pesará más por las fuentes y el formato.
Cómo repetir la medición
Si quieres comprobarlo con tus propios textos, basta Python y tiktoken:
pip install tiktoken
python -c "import tiktoken; t=open('texto.txt').read(); e=tiktoken.get_encoding('o200k_base'); print(len(t.split()), len(e.encode(t)))"El primer número son las palabras y el segundo los tokens. Divide el segundo entre el primero y tendrás tu ratio.
Preguntas frecuentes
¿Cuántas palabras son un millón de tokens en español?
Unas 710,000 palabras con el tokenizador de GPT-4o y unas 600,000 con el de GPT-4 y GPT-3.5, según nuestra medición con tiktoken sobre artículos de Wikipedia en español (3-oct-2026).
¿Cuántos tokens tiene una palabra en español?
Entre 1.4 y 1.7 tokens por palabra de media, según el modelo. En inglés la media está en 1.3.
¿Cabe el Quijote en un millón de tokens?
Sí. El texto completo (386,614 palabras) ocupa 592,079 tokens con el tokenizador de GPT-4o y 663,832 con el de GPT-4.
¿Cuántas páginas son 200,000 tokens?
Unas 284 páginas A4 de 500 palabras con el tokenizador de GPT-4o (unas 142,000 palabras en español), o unas 239 con el tokenizador anterior de OpenAI.
¿Por qué el español gasta más tokens que el inglés?
Porque los tokenizadores se construyeron con más texto en inglés, así que tienen más palabras inglesas completas en su vocabulario y parten más las españolas.