Historia de los LLM

En una frase: la historia de los LLM desde 2017, con tres grandes cambios.

LLM son las siglas en inglés de «modelo de lenguaje grande». Primero crecieron mucho (2020). Luego aprendieron a seguir instrucciones (2022). Después, a razonar antes de responder (2024). Es una selección de modelos y productos, no la lista completa.

Desde 2023 también hay modelos potentes que se pueden descargar. Hoy casi todos los modelos punteros salen de empresas, no de universidades.

Cómo se ve

Línea del tiempo de 2017 a 2024 con Transformer, GPT-3, ChatGPT, LLaMA y o1; los tres grandes cambios van en color

Hitos y fechas

    1. Google presenta el Transformer, un diseño más rápido de entrenar que los de antes.
  • 2018 y 2019. OpenAI saca GPT-1 y GPT-2. Google publica BERT, que se puede descargar.
    1. GPT-3 es enorme: 175.000 millones de parámetros, los números que ajusta al aprender. Aprende tareas nuevas solo con ver unos ejemplos en el mensaje.
    1. InstructGPT aprende a seguir instrucciones. A finales de año llega ChatGPT, que es un producto, no un modelo nuevo.
  • 2023 y 2024. Llegan LLaMA, GPT-4, Gemini y Mixtral. GPT-4 acepta texto e imágenes. En 2024 sale o1, entrenado con refuerzo para razonar.
  • 2025 y 2026. Los grandes laboratorios sacan generaciones nuevas cada pocos meses. OpenAI vuelve a publicar un modelo descargable.

Ojo con las fechas. Unas son de un artículo, otras de un anuncio o de una descarga. No siempre marcan el día en que se pudo usar.

La lista completa, con fechas de dos fuentes, está en la versión adulta.

Qué pasa, paso a paso

  • 2017-2019: el diseño. El Transformer es una alternativa a las redes de antes. Puede hacer más cuentas a la vez. Entrenar con mucho texto y ajustar después se vuelve la receta habitual.
  • 2020-2022: el tamaño. GPT-3 muestra que un modelo grande resuelve tareas nuevas con pocos ejemplos. Chinchilla corrige el rumbo: faltaban más datos, no solo modelos más grandes.
  • 2022-2023: los asistentes. InstructGPT aprende a seguir instrucciones gracias a las notas de personas. ChatGPT, lanzado el 30 de noviembre de 2022, hace popular el chat con IA.
  • 2023 en adelante: más modelos abiertos. LLaMA, Mixtral, DeepSeek y Qwen tienen pesos abiertos: puedes descargar los números que los forman. No fueron los primeros: BERT y GPT-2 ya se podían descargar. Es como una receta publicada en vez de un plato que solo sirve un restaurante.
  • 2024 en adelante: el razonamiento. o1 y DeepSeek-R1 piensan antes de responder. Se entrenan con refuerzo: prueban, reciben una nota y mejoran.

Un ejemplo de la vida real

Si tienes 13 años, el Transformer apareció cuando tenías unos 4. ChatGPT llegó cuando tenías unos 9.

Todo lo que cuenta esta ficha ha pasado mientras crecías.

Lo que se repite

  • Desde 2020, entrenar los modelos punteros exige cada año unas cinco veces más cálculo. Y su coste crece unas tres veces y media al año.
  • En 2025, más de 9 de cada 10 modelos punteros salieron de empresas.
  • Los mejores modelos de Estados Unidos y de China ya rinden casi igual. Lo dice un informe de 2026 de la Universidad de Stanford.

Por qué no coinciden las fechas

  • Cada fuente fecha cosas distintas. Wikipedia usa el día en que se publicó el primer documento técnico. Epoch AI, otra fuente, no explica su criterio.
  • InstructGPT es el caso típico. Epoch AI dice enero de 2022, pero el artículo científico salió en marzo.
  • En DeepSeek-V4, la diferencia entre las dos fuentes es de meses.
  • Epoch AI tiene una base de modelos que no para de crecer. Solo marca como notables los que destacan por resultados, citas, uso o coste.
  • Por eso la versión adulta muestra las dos fechas cuando no coinciden.

Pruébalo tú

  1. ¿Qué fue antes, el Transformer o ChatGPT? ¿Cuántos años hay entre los dos?
  2. ¿Por qué un mismo modelo puede aparecer con dos fechas distintas?
Respuestas
  1. El Transformer, en 2017. ChatGPT llegó a finales de 2022, unos cinco años después.
  2. Porque cada fuente fecha una cosa distinta. Una mira el primer documento técnico; otra puede usar otro criterio.

Palabras clave

  • LLM: modelo de lenguaje grande, que predice cómo sigue un texto.
  • Parámetros: números internos que el modelo ajusta mientras aprende.
  • Pesos abiertos: modelo cuyos números se pueden descargar y usar por tu cuenta.
  • Modelo de razonamiento: modelo que piensa antes de responder.
  • Laboratorio: empresa o centro que crea modelos de IA.
  • Modelo puntero: de los más avanzados de su momento.

Si quieres saber más