고정된 AI 모델의 종말
대부분의 거대 언어 모델(LLM)은 시간 속에 갇힌 채 출시됩니다. 이들의 지식은 방대한 데이터 센터에서 학습이 완료된 시점에 멈춰 있습니다. 최근 사건에 대해 물어보면 종종 구식 답변을 내놓는데, 이는 모델이 출시된 날 학습을 멈췄기 때문입니다. 이러한 패러다임은 하이퍼스케일러(hyperscaler) 기업만이 진정으로 정교한 AI를 구축할 수 있다는 인식을 심어주었습니다.
mini-AGI라 불리는 새로운 유형의 AI는 이러한 모델을 근본적으로 변화시킵니다. 지속적인 학습을 위해 설계된 이 모델은 MacBook Pro와 같은 소비자용 하드웨어에서 직접 학습하며, 그 진화를 멈추지 않습니다. 이 모델은 아무런 사전 지식 없이, 말 그대로 무작위 숫자의 집합에서부터 시작합니다.
이는 단순한 파인튜닝(fine-tuning)이 아니라, 밑바닥부터 시작하는 학습입니다. 모델은 데이터를 바이트 단위로 처리하며, 정해진 결승선 없이 지속적인 스트림으로부터 정보를 흡수합니다. 마치 사람이 책을 읽어나가듯, 데이터 조각을 처리할 때마다 작은 학습 단계를 거치며 점진적으로 이해도를 쌓아갑니다.
전통적으로 소규모 모델을 학습시키는 데에도 모델을 단순히 실행하는 것보다 약 3~4배 더 많은 메모리가 필요했기에, 이는 거대 데이터 센터만의 전유물이었습니다. mini-AGI는 이 과정을 민주화하여 개인용 컴퓨터에서 지속적인 AI 개발의 힘을 누릴 수 있게 합니다.
Mini-AGI가 AI 건망증을 극복하는 방법
파멸적 망각은 지속적으로 학습하는 AI에게 큰 도전 과제입니다. 이는 AI 모델이 체스와 같은 새로운 특정 주제를 학습할 때 영어 구사 능력과 같은 기존 지식을 덮어쓰는 현상을 말합니다. 일반적인 모델은 전문화 과정을 거치면서 기존 일반 지식의 절반을 잃을 수도 있습니다.
Mini-AGI는 특수화된 Mixture-of-Experts (MoE) 아키텍처로 이 문제를 해결합니다. 이 모델은 공유 코어(shared core)와 여러 명의 전문가(specialist experts)라는 두 가지 구성 요소로 이루어져 있습니다. 새로운 정보를 학습할 때 전문가는 빠르게 적응하도록 허용되지만, 공유 코어는 10배 더 느린 속도로 업데이트됩니다. 이 메커니즘은 새로운 지식이 주로 전문가 내부에 머물게 하여, 건물의 기초를 건드리지 않고 방을 개조하는 것처럼 코어가 가진 기초적인 이해도를 보존합니다. Mini-AGI는 집중적이고 좁은 범위의 학습 후에도 이전 지식의 99.84%를 유지했습니다.
이 설계는 놀라운 메모리 효율성도 제공합니다. 각 전문가는 디스크에 별도의 파일로 존재합니다. 텍스트 조각을 처리할 때 시스템은 필요한 특정 전문가만 VRAM에 로드합니다. 이를 통해 mini-AGI는 소비자용 GPU의 물리적 메모리 제약을 훨씬 뛰어넘어 확장할 수 있으며, MacBook과 같은 개인용 하드웨어에서도 지속적인 학습을 지원합니다.
취침 시간 동화에서 Tarantino까지
아무것도 모르는 빈 모델이 여정을 시작했습니다. 연구진은 먼저 짧은 동화 모음집인 TinyStories 데이터셋을 사용하여 기본적인 영어를 가르쳤습니다. 2시간 만에 모델은 "tousind wared therlound"와 같은 의미 없는 단어 나열에서 "It's okay,"라고 말하는 Lily의 문장과 같은 일관된 문장을 구사하며 기본적인 영어 능력을 갖추게 되었습니다.
다음으로 실험은 모델에게 Quentin Tarantino 특유의 스타일을 주입하는 것으로 전환되었습니다. 연구진은 Pulp Fiction, Jackie Brown, Django Unchained와 같은 영화 대본을 입력했습니다. 초기 단계에서 mini-AGI는 빠르게 대본 형식을 파악하여, 몇 분 만에 Ordell이나 Louis와 같은 등장인물 이름을 대문자로 표기하고 적절한 들여쓰기를 적용하는 등 능숙한 모습을 보였습니다.
그러나 문제점들이 나타났습니다. 모델은 새로 습득한 시나리오 구조와 기존의 동화 지식을 혼합하기 시작했습니다. Tarantino 캐릭터들은 "유치원생처럼" 사과하기 시작했고 ("Stephen, 미안해"), 영어 구사 능력은 급격히 저하되어 "Once upon a time"조차 시나리오 파편으로 변했습니다. 이는 스타일을 일반화하기보다는 특정 대본을 암기하려는 경향과 파괴적 망각(catastrophic forgetting)의 가능성을 보여주었습니다.
중요한 점은 연구진이 모델을 다시 동화로 재학습시켰을 때, 몇 시간이 아닌 단 몇 분 만에 영어 구사 능력을 회복했다는 것입니다. 이러한 빠른 회복은 원래의 언어 지식이 삭제된 것이 아니라, 아마도 디스크 기반의 mixture of experts 아키텍처 내에 보존되어 있었음을 입증합니다. 공유된 코어가 전문화된 전문가들보다 느리게 변화하는 이 메커니즘 덕분에 mini-AGI는 이전 학습 내용을 유지할 수 있습니다. 설계에 대한 더 자세한 기술적 내용은 GitHub - volotat/mini-AGI: Continual learning model trained from scratch on 8GB VRAM laptop with batch-1 stream of data.를 참조하십시오.
이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.
하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음
결론: 훌륭한 프랑켄슈타인
이 실험은 독특한 결과를 낳았습니다. Pulp Fiction이나 Jackie Brown 같은 영화의 Ordell, Louis, Schultz와 같은 캐릭터 이름을 대문자로 표기하고 정확한 들여쓰기를 사용하는 등 Tarantino의 시나리오 형식을 모방하는 데 능숙한 Frankenstein 모델이 탄생한 것입니다. 그러나 대화 내용은 유치한 사과("Stephen, 미안해.")와 감독 특유의 거친 미학이 뒤섞인 기이한 융합체였습니다. 영어 구사 능력은 저하되어 "Once upon a time"조차 파편화된 대본 신호로 전락했습니다.
하지만 이러한 "Frankenstein" 결과물은 이 프로젝트의 진정한 성과를 가립니다. mini-AGI는 소비자용 하드웨어, 구체적으로는 32GB RAM을 탑재한 M2 Max MacBook Pro에서 continual learning(지속 학습)을 성공적으로 보여주었습니다. 결정적으로, 이 모델은 catastrophic forgetting(파괴적 망각)을 크게 피했습니다. 이야기, 코드, 수학 등 8가지 다양한 주제를 학습한 후 50만 자 분량의 체스 데이터를 학습시켰음에도, 일반적인 모델들이 지식의 절반을 잃어버리는 것과 대조적으로 이전 지식의 99.84%를 유지했습니다.
이러한 회복력은 아키텍처에서 비롯됩니다. 공유 코어는 전문화된 전문가들보다 10배 느리게 변화하며, 전문가들은 필요에 따라 디스크에서 효율적으로 로드되므로 모델이 GPU 메모리보다 커질 수 있습니다. mini-AGI는 여전히 진정한 AGI가 아닌 '장난감' 수준이지만, 설득력 있는 비전을 제시합니다. 이는 데이터센터급 자원 없이도 과거의 지식을 잊지 않고 우리와 함께 학습할 수 있는, 개인화되고 끊임없이 진화하는 AI 모델의 실현 가능성을 증명합니다.
자주 묻는 질문
mini-AGI란 무엇인가요?
Mini-AGI는 소비자용 하드웨어에서 지속 학습을 수행하도록 설계된 장난감 수준의 언어 모델입니다. 처음부터 학습이 가능하며, 이전 지식을 덮어쓰거나 잊지 않고 새로운 정보를 학습하도록 설계되었습니다.
mini-AGI는 어떻게 '파괴적 망각'을 방지하나요?
기초 지식을 보존하기 위해 10배 느리게 학습하는 공유 코어와 새로운 정보를 빠르게 학습하는 전문 'expert' 모델이라는 2단계 구조를 사용합니다. 이를 통해 모델의 핵심 능력을 방해하지 않으면서 새로운 학습 내용을 분리합니다.
Mixture-of-Experts (MoE) 모델이란 무엇인가요?
MoE 모델은 여러 개의 작고 전문화된 신경망(전문가)과 입력을 가장 관련성 높은 전문가에게 전달하는 게이팅 메커니즘으로 구성됩니다. 이 방식은 모델의 일부만 활성화되기 때문에 매우 효율적입니다.
제 사업에 mini-AGI를 사용할 수 있나요?
아니요. 프로젝트 작성자는 이를 프로덕션 환경에 적합하지 않은 '장난감 수준의 모델'이라고 명시했습니다. 이는 AI 학습에 대한 새로운 접근 방식을 보여주는 연구 프로젝트이자 개념 증명입니다.

