Skip to content
research

IA, descodificada: 16 ideas que lo explican todo

El montón de palabras de moda sobre la IA esconde un sistema práctico y algunos conceptos erróneos costosos. Una vez que entiendes cómo se conectan las piezas, es más fácil cuestionar el hype y utilizar las herramientas.

Aki Tanaka
IA, descodificada: 16 ideas que lo explican todo

La "conversación" es solo tokens repetidos

Los Large Language Models (LLMs) generan texto prediciendo un token a la vez, repetidamente, hasta completar una respuesta. Este mecanismo difiere fundamentalmente de la comprensión humana, pero permite resultados sorprendentemente sofisticados. La "conversación" no es una verdadera comprensión; es una danza probabilística de asociaciones estadísticas.

Antes de procesar, el texto de entrada se somete a tokenization, donde se divide en palabras comunes y fragmentos de subpalabras. Por ejemplo, "unbelievable" podría dividirse en "un", "believe" y "able". Un token equivale aproximadamente a tres cuartas partes de una palabra. El recuento de tokens afecta directamente los costos de API, los límites de la ventana de contexto y, a veces, la latencia. Explora este proceso con el Tokenizer de OpenAI o el resumen de tokenizadores de Hugging Face.

Los LLMs son inherentemente stateless; no poseen memoria intrínseca entre solicitudes. Cuando una interfaz de chat parece "recordar" interacciones pasadas, lo logra reenviando todo el historial de la conversación (o hechos almacenados relevantes) con cada nueva consulta. Esto consume un valioso espacio de contexto y contribuye directamente al uso de tokens.

Dentro del Transformer: pesos, atención y entrenamiento

Debajo de la superficie de la predicción de tokens se encuentra una arquitectura compleja. Piénsalo como calcular el precio de una casa: ingresas el tamaño (1,000 pies cuadrados), lo multiplicas por un weight (digamos, 300) y obtienes un resultado ($300,000). Los LLMs escalan esto, apilando cientos de layers con miles de "neuronas" para procesar patrones mucho más intrincados. Estos miles de millones de pesos, llamados colectivamente parameters, se fijan durante la inferencia pero se ajustan durante el entrenamiento.

La "T" en GPT significa Transformer, y su innovación clave es la attention. Imagina la palabra "bank": su significado cambia drásticamente entre "river bank" (orilla del río) y "financial bank" (banco financiero). La atención permite que cada token pondere dinámicamente la importancia de otros tokens en la secuencia de entrada, desambiguando el significado al vincular "bank" con "river" o "money". Este mecanismo, introducido en el artículo fundamental "Attention Is All You Need", evita que los tokens se procesen de forma aislada.

El proceso de aprendizaje implica varias etapas. El pre-training comienza con pesos aleatorios, donde el modelo predice los tokens faltantes y ajusta sus pesos mediante backpropagation basándose en el error. Este proceso iterativo, repetido billones de veces, refina las predicciones. Luego, el fine-tuning adapta el modelo preentrenado a tareas específicas utilizando conjuntos de datos más pequeños y seleccionados. Finalmente, el reinforcement learning puede optimizar aún más el comportamiento calificando las salidas del modelo y ajustando los pesos para favorecer las respuestas de alta puntuación, a menudo incorporando retroalimentación humana (RLHF) o verificaciones automatizadas.

Hacer los modelos más pequeños y proporcionarles datos actualizados

Adaptar modelos grandes para tareas específicas puede consumir muchos recursos, pero técnicas como LoRA (Low-Rank Adaptation) ofrecen una solución rentable. LoRA congela la gran mayoría de los pesos originales de un modelo, entrenando solo un conjunto pequeño y adicional de parámetros sobre ellos, a menudo menos del 1% del tamaño del modelo base. Esto reduce significativamente la carga computacional, permitiendo el fine-tuning en una sola GPU.

Quantization aborda la huella de memoria de estos modelos colosales. Cada peso en un LLM normalmente se almacena como un número de 16 bits. Un modelo de 8 mil millones de parámetros, por ejemplo, consume aproximadamente 16 gigabytes. La Quantization reduce esto almacenando los pesos con menos bits (por ejemplo, 8 o 4 bits), redondeándolos a valores menos precisos. Aunque esto reduce el tamaño del modelo (una versión cuantizada de 4 bits del mismo modelo podría ocupar alrededor de 5 gigabytes, ejecutable en una computadora portátil), introduce un compromiso, sacrificando potencialmente algo de precisión.

Para extender el conocimiento de un modelo más allá de sus datos de entrenamiento, la Retrieval-Augmented Generation (RAG) aprovecha información externa. Este proceso comienza convirtiendo el texto en embeddings: largas listas de números que capturan numéricamente el significado semántico, permitiendo la comparación por similitud. Estos embeddings, junto con su texto original, se almacenan luego en una base de datos vectorial.

Cuando un usuario plantea una pregunta, la aplicación primero transforma esa consulta en un embedding. Luego, busca en la base de datos vectorial pasajes semánticamente similares. Estos pasajes recuperados se añaden al prompt original, permitiendo que el LLM genere una respuesta informada por datos actuales o propietarios con los que nunca fue entrenado explícitamente. Explore cómo el texto se convierte en tokens y embeddings con la OpenAI Tokenizer Tool.

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

De una sola respuesta a agentes que toman medidas

Los modelos, en esencia, son generadores de texto. No pueden buscar de forma independiente en la web ni ejecutar comandos. Aquí es donde entra en juego el tool calling: el modelo identifica la necesidad de una función externa y luego solicita una acción específica y permitida en un formato estructurado. El código de la aplicación, no el modelo en sí, recibe esta solicitud, ejecuta la herramienta y devuelve el resultado al modelo como texto plano.

Muchos servicios exponen estas herramientas a través del Model-Client Protocol (MCP), un patrón de conexión común que permite a las aplicaciones de IA compatibles descubrir e interactuar con capacidades externas. MCP define cómo una aplicación puede comunicarse con una herramienta, pero no dicta el razonamiento interno ni las capacidades del modelo. El modelo utiliza MCP para solicitar acciones; no las ejecuta.

Estos conceptos convergen en un agent loop. Un agente de IA recibe una tarea, identifica las herramientas necesarias y las llama a través de MCP. Luego, inspecciona el resultado de la herramienta, actualiza su estado interno y repite el proceso hasta que la tarea se completa. Este ciclo iterativo permite flujos de trabajo complejos, desde reservar vuelos hasta analizar datos.

Aunque son potentes, estos flujos de trabajo autónomos requieren una gestión cuidadosa. Valide siempre los resultados de las herramientas, configure los permisos adecuados para evitar el acceso no autorizado y considere cuidadosamente la exposición de datos. Los agentes sobresalen en tareas estructuradas, pero su autonomía tiene límites; la supervisión humana sigue siendo crucial para una operación robusta y segura.

Preguntas frecuentes

¿Qué es un LLM en términos sencillos?

Un large language model predice los siguientes tokens probables a partir de su entrada, repitiendo el proceso para generar una respuesta.

¿Los chatbots de IA recuerdan conversaciones pasadas?

El modelo en sí es generalmente sin estado (stateless). Una aplicación de chat puede crear continuidad enviando el historial de la conversación o información guardada con una nueva solicitud.

¿Cuál es la diferencia entre RAG y fine-tuning?

RAG recupera información relevante en el momento de la respuesta y la añade al prompt. El fine-tuning ajusta los pesos del modelo utilizando ejemplos de entrenamiento adicionales.

¿En qué se diferencia un agente de IA de un chatbot?

Un agente puede ejecutar un bucle de razonamiento y acciones, utilizando herramientas, verificando resultados y continuando hacia una tarea en lugar de solo responder una vez.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Para builders

Esta página está trabajando para la herramienta de otro.

La leen los agentes de IA. Aterrizan compradores. Responde en ocho idiomas y vía MCP. Tu herramienta puede tener una igual — publicada en 24 horas.