Skip to content
industry insights

AMD의 AI 칩, 돌아올 수 없는 강을 건너다

AMD가 NVIDIA의 최고 성능 칩보다 48배 빠른 AI 칩을 인수했지만, 치명적인 결함이 있습니다. 영구적이고 업데이트가 불가능한 실리콘에 대한 이 도박은 AI 하드웨어를 재정의하거나 업계에서 가장 비싼 문진이 될 수도 있습니다.

Cassidy Wolfe
AMD의 AI 칩, 돌아올 수 없는 강을 건너다

업데이트할 수 없는 칩을 만나보세요

2026년 4분기로 예정된 AMD의 Taalas 인수는 AI 추론 하드웨어 분야의 급격한 변화를 예고합니다. 토론토에 본사를 둔 이 스타트업은 AI 모델이 실리콘과 상호 작용하는 방식을 근본적으로 재정의하는 설계 철학인 MSIC(Model-Specific Integrated Circuits)를 개척했습니다. 이는 단순한 새로운 칩이 아니라 AI 가속을 위한 완전히 새로운 패러다임입니다.

Taalas는 AI 모델의 가중치를 실리콘에 직접 새겨 넣어 소프트웨어 정의 데이터에서 칩 자체의 물리적 배선으로 변환합니다. 이러한 가중치는 하드웨어의 불변하는 부분이 되어 장치에 하드코딩됩니다. 이 접근 방식은 대부분의 컴퓨팅을 특징짓는 기존의 소프트웨어 정의 유연성을 제거하여 모델을 하드웨어의 본질적인 구성 요소로 만듭니다.

NVIDIA와 같은 기존 GPU는 각 추론 작업마다 외부 메모리에서 AI 모델 가중치를 처리 장치로 로드하는 방식으로 작동합니다. 이러한 지속적인 데이터 전송은 "메모리 벽(memory wall)"이라고 불리는 심각한 성능 병목 현상을 일으켜 AI 추론의 속도와 효율성을 제한합니다. Taalas는 이 제약을 완전히 우회하여 특정 모델에 대해 전례 없는 처리량을 약속합니다. TSMC의 6nm 공정으로 제작된 HC1 테스트 칩은 Meta의 Llama 3.1 8B 모델을 사용자당 초당 약 17,000 토큰으로 처리하며, NVIDIA GPU보다 48배 빠른 속도를 구현한다고 주장합니다.

NVIDIA보다 48배 빠르지만, 대가가 따릅니다

Taalas의 MSIC(Model-Specific Integrated Circuits)는 거의 신화적인 수준의 추론 성능을 약속합니다. TSMC의 6nm 공정으로 제작된 HC1 테스트 칩은 Meta의 Llama 3.1 8B 모델을 사용자당 초당 약 17,000 토큰으로 처리했습니다. 이는 NVIDIA B200보다 최대 48배, NVIDIA H200보다는 73배 더 빠르면서도 전력 소모는 10분의 1에 불과하다는 놀라운 수치로 해석됩니다. 815mm² 다이에 530억 개의 트랜지스터를 통합한 HC1 칩은 약 200W를 소비하며 놀라운 효율성을 보여줍니다.

하지만 여기에는 매우 큰 함정이 있습니다. Taalas는 AI 모델 가중치를 실리콘 자체에 물리적으로 새겨 넣음으로써 이 속도를 달성합니다. 가중치는 메모리에 로드되는 데이터가 아니라 칩의 물리적 배선 그 자체입니다. 이로 인해 모델은 일단 제조되면 변경할 수 없으며, 업데이트가 불가능합니다.

이러한 유연성 부족은 막대한 비용과 긴 리드 타임을 동반합니다. 내장된 모델을 새로 고치기 위한 새로운 마스크 세트 비용은 약 150만 달러에 달합니다. 또한 Taalas는 두 개의 금속 레이어만 수정하면 된다고 주장하지만, 새로 고침 주기에는 TSMC에서 약 2개월의 시간이 소요됩니다. 모델이 매주 진화하는 AI 환경에서 이는 최고의 성능을 위해 즉각적인 구식화의 위험을 감수하는 엄청난 전략적 도박입니다.

AMD가 구식화에 베팅하는 이유

AMD의 Taalas 인수는 신중한 발걸음이 아니라 특수 AI 추론 시장을 향한 거침없는 도전입니다. 2026년 8월 6일 인수에 합의한 AMD는 특정하고 안정적인 AI 모델의 경우 획기적인 효율성이 범용 GPU의 유연성보다 훨씬 더 중요할 것이라고 판단했습니다. 이러한 전략적 전환은 적응성보다 원시적인 성능을 우선시하여 수익성 높은 시장 부문을 선점하려는 의도입니다.

이 비전은 disaggregated inference(분산 추론)를 통해 실현됩니다. 모델 가중치가 하드웨어에 직접 설계된 Taalas의 Model-Specific Integrated Circuits(MSIC)는 초고속 토큰 생성을 전담하여, HC1 칩에서 Llama 3.1 8B와 같은 모델의 경우 초당 최대 17,000개의 토큰을 처리합니다. 반면, AMD의 강력한 GPU는 연산 부하가 큰 프롬프트 프리필(prompt prefill)을 관리하여 상호 보완적이고 최적화된 파이프라인을 구축합니다.

이러한 대담한 행보는 NVIDIA의 아성에 정면으로 도전하는 것으로, 특정 대용량 애플리케이션에는 전용 칩이 더 우수하다는 점을 강조합니다. AMD는 NVIDIA B200 대비 48배, H200 대비 73배 빠른 성능을 10분의 1의 전력으로 구현함으로써 구식화의 위험을 감수할 가치가 있다고 판단합니다. 모델의 진화는 빠르지만, Taalas는 단 두 개의 금속 레이어만 수정하면 갱신이 가능하며, 이를 통해 주기를 약 2개월로 단축할 수 있다고 주장합니다. 이러한 전문화된 접근 방식은 AMD to Acquire Xilinx, Creating the Industry's High-Performance and Adaptive Computing Leader에서 입증된 바와 같이, 적응형 컴퓨팅 역량을 확장하기 위해 보완 기술을 인수하는 AMD의 광범위한 전략과 맥을 같이 합니다.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

AI의 유효기간과의 경주

AMD의 Taalas 인수는 즉각적이고 명확한 위험을 내포하고 있습니다. Taalas 기술의 핵심 사례였던 실리콘에 각인된 Groq 모델은 AMD가 인수를 완료한 바로 그 달에 지원이 중단되었습니다. 이는 미래의 model deprecation(모델 지원 중단)에 대한 이론적인 우려가 아니라, 수년간 사용하도록 설계된 칩이 몇 주 만에 가치를 잃을 수 있음을 보여주는 생생한 사례입니다.

이 사건은 AI 업계의 눈부신 혁신 속도가 실리콘 제조의 영속성과 정면으로 충돌한다는 근본적인 긴장 관계를 조명합니다. Taalas가 주장하는 두 개의 금속 레이어만 변경하는 2개월 주기라 하더라도, 모델 갱신을 위한 새로운 마스크 세트 비용은 약 150만 달러에 달합니다. LoRA 파인튜닝 어댑터가 재기록 가능한 SRAM을 통해 약간의 유연성을 제공할 수는 있지만, 근본적인 아키텍처 변화는 완전히 새로운 하드웨어 없이는 불가능합니다.

AMD는 모델의 수명에 거대한 도박을 걸고 있습니다. AMD는 특정 AI 모델이 안정적인 유틸리티급 기능으로 진화하여 Model-Specific Integrated Circuit (MSIC)에 하드웨어로 고정될 만큼 충분히 기초적인 단계에 이를 것이라고 확신합니다. 만약 일부 모델이 이러한 영속성을 확보하여 NVIDIA B200 전력의 일부만으로 초당 17,000 토큰이라는 혁신적인 효율성을 제공한다면, 이 일방통행은 수익성이 높을 수 있습니다. 그렇지 않다면, AMD는 너무 빨리 다가올 유효기간을 위해 구축된 기술을 인수하는 위험을 감수하게 됩니다.

자주 묻는 질문

Model-Specific Integrated Circuit(MSIC)이란 무엇인가요?

Taalas의 제품과 같은 MSIC는 모델의 가중치가 메모리에 저장되는 것이 아니라 실리콘 배선에 물리적으로 각인된 AI 칩입니다. 따라서 이는 단일 모델을 위한 영구적인 가속기입니다.

Taalas 칩은 어떻게 GPU보다 훨씬 빠른가요?

모델 가중치를 하드웨어에 직접 설계함으로써 '메모리 병목 현상(memory wall)'을 제거합니다. 데이터를 메모리에서 프로세서로 지속적으로 불러올 필요가 없으므로 AI 추론에서 엄청난 속도와 효율성 향상을 얻을 수 있습니다.

Taalas 기술의 주요 단점은 무엇인가요?

칩이 영구적이라는 점입니다. 칩이 설계된 AI 모델이 구식이 되거나 중요한 업데이트가 필요한 경우, 패치를 적용할 수 없습니다. 비용과 시간이 많이 드는 완전히 새로운 실리콘을 제조해야 합니다.

Taalas 칩을 어느 정도 커스터마이징할 수 있나요?

네, 하지만 제한적입니다. HC1 칩은 작은 재기록 가능 SRAM 영역을 통해 LoRA 어댑터를 사용한 경량 파인튜닝을 지원하지만, 핵심 모델은 고정된 상태로 유지됩니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

빌더를 위해

이 페이지는 지금 다른 사람의 도구를 위해 일하고 있습니다.

AI 에이전트가 읽고, 구매자가 도착합니다. 8개 언어와 MCP로 답합니다. 당신의 도구도 가질 수 있습니다 — 24시간 안에 공개.