Skip to content
research

AI, Decoded: 모든 것을 설명하는 16가지 아이디어

AI라는 유행어 속에는 실용적인 시스템과 몇 가지 값비싼 오해가 숨겨져 있습니다. 조각들이 어떻게 연결되는지 이해하면 과장된 광고를 의심하기 쉬워지고 도구를 활용하기는 더 수월해집니다.

Aki Tanaka
AI, Decoded: 모든 것을 설명하는 16가지 아이디어

“대화”는 단지 토큰의 반복일 뿐입니다

Large Language Models (LLMs)은 응답이 완료될 때까지 한 번에 하나의 token을 반복적으로 예측하여 텍스트를 생성합니다. 이 메커니즘은 인간의 이해 방식과는 근본적으로 다르지만, 놀랍도록 정교한 결과물을 만들어냅니다. “대화”는 진정한 이해가 아니라 통계적 연관성에 따른 확률적 춤과 같습니다.

처리 전, 입력 텍스트는 tokenization 과정을 거치며, 여기서 일반적인 단어와 하위 단어 단위로 분할됩니다. 예를 들어, "unbelievable"은 "un", "believe", "able"로 나뉠 수 있습니다. 토큰 하나는 평균적으로 단어의 4분의 3 정도를 차지합니다. 토큰 수는 API 비용, 컨텍스트 윈도우 제한, 때로는 지연 시간에 직접적인 영향을 미칩니다. OpenAI’s Tokenizer 또는 Hugging Face의 tokenizer summary를 통해 이 과정을 살펴보세요.

LLMs는 본질적으로 stateless합니다. 즉, 요청 사이에 내재된 기억을 가지고 있지 않습니다. 채팅 인터페이스가 과거 상호작용을 "기억"하는 것처럼 보이는 이유는 새로운 질문을 할 때마다 전체 대화 기록(또는 관련 저장된 사실)을 다시 보내기 때문입니다. 이는 귀중한 컨텍스트 공간을 소비하며 토큰 사용량 증가의 직접적인 원인이 됩니다.

Transformer 내부: 가중치, 어텐션, 그리고 학습

토큰 예측의 이면에는 복잡한 아키텍처가 존재합니다. 주택 가격을 계산하는 것과 비슷하게 생각해보세요. 크기(1,000평방피트)를 입력하고 weight(예: 300)를 곱하여 결과($300,000)를 얻는 방식입니다. LLMs는 이를 확장하여 수백 개의 layers와 수천 개의 "뉴런"을 쌓아 훨씬 더 복잡한 패턴을 처리합니다. parameters라고 통칭되는 이 수십억 개의 가중치는 추론 중에는 고정되어 있지만 학습 중에 조정됩니다.

GPT에서 "T"는 Transformer를 의미하며, 그 핵심 혁신은 attention입니다. "bank"라는 단어를 생각해보세요. "강둑(river bank)"과 "금융 은행(financial bank)" 사이에서 의미가 크게 달라집니다. 어텐션은 각 토큰이 입력 시퀀스 내의 다른 토큰들의 중요도를 동적으로 가중치를 두어 계산하게 함으로써, "bank"를 "river"나 "money"와 연결하여 의미를 명확하게 합니다. "Attention Is All You Need" 논문에서 소개된 이 메커니즘은 토큰이 고립되어 처리되는 것을 방지합니다.

학습 파이프라인은 여러 단계를 거칩니다. Pre-training은 무작위 가중치로 시작하며, 모델이 누락된 토큰을 예측하고 오류에 기반하여 backpropagation을 통해 가중치를 조정합니다. 수조 번 반복되는 이 과정은 예측을 정교하게 만듭니다. 그 후 Fine-tuning은 더 작고 선별된 데이터셋을 사용하여 사전 학습된 모델을 특정 작업에 맞게 조정합니다. 마지막으로 reinforcement learning은 모델 출력에 점수를 매기고 고득점 응답을 선호하도록 가중치를 조정하여 동작을 최적화할 수 있으며, 종종 인간 피드백(RLHF)이나 자동화된 검사를 포함합니다.

모델을 더 작게 만들고 최신 정보를 제공하세요

특정 작업을 위해 대형 모델을 조정하는 것은 자원 집약적일 수 있지만, LoRA (Low-Rank Adaptation)와 같은 기술은 비용 효율적인 솔루션을 제공합니다. LoRA는 모델의 원래 가중치 대부분을 고정하고 그 위에 작고 추가적인 매개변수 집합만 학습시킵니다. 이는 종종 기본 모델 크기의 1% 미만입니다. 이 방식은 계산 오버헤드를 크게 줄여 단일 GPU에서도 파인튜닝을 가능하게 합니다.

Quantization은 이러한 거대 모델의 메모리 점유율 문제를 해결합니다. LLM의 각 가중치는 일반적으로 16비트 숫자로 저장됩니다. 예를 들어, 80억 개의 파라미터를 가진 모델은 약 16기가바이트를 소비합니다. Quantization은 가중치를 더 적은 비트(예: 8비트 또는 4비트)로 저장하고 덜 정밀한 값으로 반올림하여 이를 줄입니다. 이는 모델 크기를 축소하여 동일한 모델의 4비트 Quantization 버전을 약 5기가바이트로 만들어 노트북에서도 실행할 수 있게 해주지만, 정확도가 다소 희생될 수 있다는 트레이드오프가 발생합니다.

모델의 지식을 학습 데이터 너머로 확장하기 위해 Retrieval-Augmented Generation (RAG)은 외부 정보를 활용합니다. 이 과정은 텍스트를 embeddings로 변환하는 것에서 시작됩니다. 이는 의미론적 의미를 수치적으로 포착하는 긴 숫자 목록으로, 유사성을 통한 비교를 가능하게 합니다. 이러한 embeddings는 원본 텍스트와 함께 벡터 데이터베이스에 저장됩니다.

사용자가 질문을 하면, 애플리케이션은 먼저 해당 쿼리를 embedding으로 변환합니다. 그런 다음 벡터 데이터베이스에서 의미론적으로 유사한 구절을 검색합니다. 검색된 구절은 원본 프롬프트에 추가되어, LLM이 명시적으로 학습되지 않은 최신 데이터나 독점 데이터를 바탕으로 답변을 생성할 수 있게 합니다. OpenAI Tokenizer Tool을 통해 텍스트가 어떻게 토큰과 embedding으로 변환되는지 알아보세요.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

단순 응답에서 행동하는 에이전트로

모델은 본질적으로 텍스트 생성기입니다. 모델은 독립적으로 웹을 검색하거나 명령을 실행할 수 없습니다. 여기서 tool calling이 등장합니다. 모델은 외부 기능이 필요함을 식별한 다음, 구조화된 형식으로 특정 허용된 작업을 요청합니다. 모델 자체가 아닌 애플리케이션 코드가 이 요청을 받아 도구를 실행하고, 그 결과를 일반 텍스트로 모델에 반환합니다.

많은 서비스가 호환되는 AI 애플리케이션이 외부 기능을 발견하고 상호 작용할 수 있도록 하는 공통 연결 패턴인 Model-Client Protocol (MCP)을 통해 이러한 도구를 제공합니다. MCP는 애플리케이션이 도구와 통신하는 방법을 정의하지만, 모델의 내부 추론이나 기능까지 결정하지는 않습니다. 모델은 MCP를 사용하여 작업을 요청할 뿐, 직접 실행하지는 않습니다.

이러한 개념들은 agent loop에서 수렴합니다. AI 에이전트는 작업을 수신하고, 필요한 도구를 식별하며, MCP를 통해 도구를 호출합니다. 그런 다음 도구의 출력을 검사하고 내부 상태를 업데이트하며, 작업이 완료될 때까지 이 과정을 반복합니다. 이 반복적인 주기는 항공권 예약부터 데이터 분석에 이르기까지 복잡한 워크플로우를 가능하게 합니다.

이러한 자율 워크플로우는 강력하지만 세심한 관리가 필요합니다. 항상 도구의 출력을 검증하고, 무단 액세스를 방지하기 위해 적절한 권한을 구성하며, 데이터 노출을 신중하게 고려하십시오. 에이전트는 구조화된 작업에 뛰어나지만 그 자율성에는 한계가 있으므로, 견고하고 안전한 운영을 위해서는 인간의 감독이 여전히 중요합니다.

자주 묻는 질문(FAQ)

LLM이란 무엇인가요?

거대 언어 모델(Large Language Model)은 입력값으로부터 다음에 올 가능성이 높은 토큰을 예측하며, 이 과정을 반복하여 응답을 생성합니다.

AI 챗봇은 과거 대화를 기억하나요?

모델 자체는 일반적으로 상태를 저장하지 않습니다(stateless). 챗봇 앱은 새로운 요청과 함께 대화 기록이나 저장된 정보를 전송함으로써 연속성을 만들 수 있습니다.

RAG와 Fine-tuning의 차이점은 무엇인가요?

RAG는 응답 시점에 관련 정보를 검색하여 프롬프트에 추가합니다. Fine-tuning은 추가 학습 데이터를 사용하여 모델의 가중치를 조정합니다.

AI 에이전트는 챗봇과 어떻게 다른가요?

에이전트는 단순히 한 번 응답하는 것이 아니라, 도구를 사용하고 결과를 확인하며 작업을 향해 계속 나아가는 추론 및 행동 루프를 실행할 수 있습니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

빌더를 위해

이 페이지는 지금 다른 사람의 도구를 위해 일하고 있습니다.

AI 에이전트가 읽고, 구매자가 도착합니다. 8개 언어와 MCP로 답합니다. 당신의 도구도 가질 수 있습니다 — 24시간 안에 공개.