Skip to content
research

Esta IA se entrena a sí misma en tu laptop

Olvídate de los modelos de IA estáticos que quedan obsoletos al instante. Un nuevo experimento presenta una 'mini-AGI' que aprende continuamente en una laptop normal, resolviendo el problema crítico del 'olvido catastrófico' que borra conocimientos antiguos.

Aki Tanaka
Esta IA se entrena a sí misma en tu laptop

El fin de los modelos de IA congelados

La mayoría de los modelos de lenguaje grandes (LLMs) llegan congelados en el tiempo, con su conocimiento limitado al momento de su entrenamiento masivo en centros de datos. Si les preguntas sobre eventos recientes, a menudo recibes respuestas obsoletas; dejaron de aprender el día que fueron lanzados. Este paradigma dicta que solo los hiperescaladores pueden construir realmente estas IAs sofisticadas.

Una nueva clase de IA, denominada mini-AGI, cambia fundamentalmente este modelo. Diseñada para el aprendizaje continuo, se entrena directamente en hardware de consumo —un MacBook Pro, por ejemplo— sin cesar nunca su evolución. Comienza desde cero absoluto, literalmente una colección de números aleatorios, desprovista de cualquier conocimiento previo.

Esto no es ajuste fino (fine-tuning); es aprendizaje desde cero. El modelo procesa los datos byte a byte, absorbiendo información de un flujo continuo sin una línea de meta definida. Realiza pequeños pasos de aprendizaje después de cada fragmento, acumulando comprensión de forma incremental, muy parecido a una persona que lee un libro a lo largo del tiempo.

Tradicionalmente, entrenar incluso modelos pequeños exigía una memoria significativa —aproximadamente de tres a cuatro veces más que solo ejecutar uno—, lo que lo convertía en un dominio exclusivo de los centros de datos gigantes. La mini-AGI democratiza este proceso, poniendo el poder del desarrollo continuo de IA en manos de los individuos, directamente en sus computadoras personales.

Cómo la mini-AGI derrota a la amnesia de la IA

El olvido catastrófico plantea un desafío importante para la IA que aprende continuamente. Este fenómeno describe la tendencia de un modelo de IA a sobrescribir el conocimiento existente, como la fluidez en inglés, cuando se ajusta en un tema nuevo y limitado, como el ajedrez. Un modelo estándar podría perder la mitad de su conocimiento general después de especializarse.

La mini-AGI aborda esto con una arquitectura especializada de Mixture-of-Experts (MoE). El modelo comprende dos componentes distintos: un núcleo compartido y múltiples expertos especialistas. Al aprender nueva información, a los expertos se les permite adaptarse rápidamente, pero el núcleo compartido se actualiza a una velocidad diez veces más lenta. Este mecanismo asegura que el nuevo conocimiento resida principalmente dentro de los especialistas, preservando la comprensión fundamental que mantiene el núcleo, muy parecido a renovar habitaciones sin alterar los cimientos de un edificio. La mini-AGI retuvo el 99.84% de su conocimiento previo incluso después de un entrenamiento intensivo y limitado.

Este diseño también produce una notable eficiencia de memoria. Cada experto existe como un archivo separado en el disco. Al procesar un fragmento de texto, el sistema carga en la VRAM solo los expertos específicos requeridos. Esto permite que la mini-AGI escale mucho más allá de las limitaciones de memoria física de una GPU de consumo, permitiendo el aprendizaje continuo en hardware personal como una MacBook.

Desde cuentos para dormir hasta Tarantino

Un modelo en blanco comenzó su viaje, una colección de números aleatorios sin conocer ningún idioma. Los investigadores primero le enseñaron inglés básico usando el TinyStories dataset, un corpus de cuentos cortos para niños. En dos horas, el modelo pasó de balbuceos como "tousind wared therlound" a oraciones coherentes como "Está bien", dijo Lily, estableciendo una competencia fundamental en inglés.

A continuación, el experimento cambió para imbuir al modelo con el estilo distintivo de Quentin Tarantino. Los investigadores le proporcionaron guiones que incluían Pulp Fiction, Jackie Brown y Django Unchained. Inicialmente, la mini-AGI captó rápidamente el formato de guion, produciendo nombres de personajes como Ordell y Louis en mayúsculas con la sangría adecuada en cuestión de minutos.

Sin embargo, surgieron desafíos. El modelo comenzó a mezclar su estructura de guion recién adquirida con su conocimiento de cuentos infantiles. Los personajes de Tarantino empezaron a disculparse "como niños de jardín de infantes" ("Stephen, lo siento"), y su dominio del inglés se degradó rápidamente, convirtiendo incluso "Érase una vez" en fragmentos de guion. Esto indicó una tendencia a memorizar guiones específicos en lugar de generalizar el estilo, y un potencial de olvido catastrófico.

Fundamentalmente, cuando los investigadores reentrenaron el modelo con historias, recuperó su dominio del inglés en cuestión de minutos, no horas. Esta rápida recuperación demostró que su conocimiento lingüístico original no fue borrado, sino preservado, probablemente dentro de su arquitectura de mixture of experts basada en disco. Este mecanismo, donde un núcleo compartido cambia más lentamente que los expertos especializados, permite que mini-AGI retenga el aprendizaje previo. Para más detalles técnicos sobre su diseño, consulte GitHub - volotat/mini-AGI: Continual learning model trained from scratch on 8GB VRAM laptop with batch-1 stream of data..

¿Te está gustando? Recibe uno así en tu bandeja cada mañana.

un correo al día · date de baja en dos clics · sin rastreadores de terceros

El veredicto: Un Frankenstein brillante

El experimento arrojó un resultado peculiar: un modelo Frankenstein, experto en imitar el formato de guion de Tarantino con sangrías precisas y nombres de personajes en mayúsculas como Ordell, Louis y Schultz de películas como Pulp Fiction y Jackie Brown. Sin embargo, su diálogo fue una fusión extraña, mezclando disculpas infantiles ("Stephen, lo siento") con la estética cruda del director. El dominio del inglés se degradó, reduciendo incluso "Érase una vez" a señales de guion fragmentadas.

Este resultado tipo "Frankenstein", sin embargo, oculta el verdadero triunfo del proyecto. El mini-AGI demostró continual learning en hardware de consumo, específicamente en un MacBook Pro M2 Max con 32 gigabytes de RAM. Fundamentalmente, evitó en gran medida el catastrophic forgetting. Después de aprender ocho temas diversos como historias, código y matemáticas, y luego ser expuesto a medio millón de caracteres de ajedrez, el modelo retuvo el 99.84% de su conocimiento previo, un marcado contraste con los modelos típicos que pierden la mitad.

Esta resiliencia proviene de su arquitectura: un núcleo compartido que cambia 10 veces más lento que sus expertos especializados, los cuales se cargan eficientemente desde el disco según sea necesario, permitiendo que el modelo sea más grande que la memoria de la GPU. Aunque mini-AGI sigue siendo un 'juguete' y no una verdadera AGI, ofrece una visión convincente. Demuestra la viabilidad de modelos de IA personalizados y en constante evolución, capaces de aprender junto a nosotros sin requerir recursos a escala de centro de datos ni olvidar su pasado.

Preguntas frecuentes

¿Qué es mini-AGI?

Mini-AGI es un modelo de lenguaje a escala de juguete diseñado para el aprendizaje continuo en hardware de consumo. Puede entrenarse desde cero y está arquitecturado para aprender nueva información sin sobrescribir ni olvidar conocimientos previos.

¿Cómo evita mini-AGI el 'catastrophic forgetting'?

Utiliza una estructura de dos partes: un núcleo compartido que aprende 10 veces más lento para preservar el conocimiento fundamental, y modelos 'expertos' especializados que aprenden nueva información rápidamente. Esto aísla el nuevo aprendizaje sin interrumpir las habilidades centrales del modelo.

¿Qué es un modelo de Mixture-of-Experts (MoE)?

Un modelo MoE está compuesto por múltiples redes neuronales más pequeñas y especializadas (expertos) y un mecanismo de compuerta que dirige la entrada al experto más relevante. Esto los hace altamente eficientes, ya que solo una fracción del modelo está activa en un momento dado.

¿Puedo usar mini-AGI para mi negocio?

No. El autor del proyecto lo califica explícitamente como un 'modelo a escala de juguete' que no es adecuado para producción. Es un proyecto de investigación y una prueba de concepto que demuestra un nuevo enfoque para el entrenamiento de IA.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Para builders

Esta página está trabajando para la herramienta de otro.

La leen los agentes de IA. Aterrizan compradores. Responde en ocho idiomas y vía MCP. Tu herramienta puede tener una igual — publicada en 24 horas.