Skip to content
research

Meta의 10억 달러 규모 RAM 해킹

Meta는 '죽은' 서버 메모리를 대량으로 되살리기 위해 맞춤형 칩을 제작하여, 전자 폐기물을 엄청난 경쟁 우위로 탈바꿈시켰습니다. 이 화려하지 않은 공학적 경이로움은 수백만 달러를 절약하고 있으며, 데이터 센터의 미래를 조용히 재편하고 있습니다.

Aki Tanaka
Meta의 10억 달러 규모 RAM 해킹

하이퍼스케일러의 황금 무덤

디지털 세계의 조용한 일꾼인 데이터 센터 서버는 일반적으로 3~5년 후 폐기되는 매우 짧은 운영 수명을 가지고 있습니다. 이러한 빠른 폐기 주기는 역설적인 부품의 무덤을 만듭니다. 즉, RAM 모듈은 여전히 완벽하게 작동함에도 불구하고 전자 폐기물로 체계적으로 버려집니다. 이러한 관행은 증가하는 환경적 부담에 크게 기여합니다.

이러한 회수된 메모리를 직접 재사용하는 것은 근본적인 비호환성 때문에 기술적으로 불가능합니다. 구형 DDR4 RAM은 여전히 견고하지만, 최신 DDR5와는 다른 특정 속도로 작동하며 물리적 핀 배열도 다릅니다. DDR5의 더 높은 대역폭과 다른 아키텍처를 위해 독점적으로 설계된 새로운 서버는 이러한 레거시 모듈을 물리적 또는 전기적으로 통합할 수 없습니다. 두 세대는 상호 배타적이어서 간단한 교체가 불가능합니다.

Meta의 거대한 운영 규모에서 이러한 비호환성은 매년 수 테라바이트에 달하는 완벽하게 작동하는 메모리를 폐기하는 결과로 이어집니다. 이는 기능적인 DDR4를 대체하기 위해 새로운 DDR5 RAM을 구매하는 데 막대한 비용이 들기 때문에 엄청난 재정적 손실을 의미하며, 특히 AI 붐으로 인한 수요 폭증이 가격을 전례 없는 수준으로 끌어올리고 있는 상황에서는 더욱 그렇습니다. 금전적 손실을 넘어, 버려지는 기능성 하드웨어의 끊임없는 흐름, 즉 진정한 '황금 무덤'이 초래하는 환경적 영향은 모든 하이퍼스케일러에게 지속 불가능한 중대한 도전 과제입니다.

Vistara: 죽은 RAM을 되살리는 맞춤형 칩

Meta는 기능은 멀쩡하지만 버려지는 RAM 문제를 해결하기 위해 Vistara라는 맞춤형 ASIC을 개발했습니다. 이 특수 Chip은 정교한 번역기 역할을 하여, 폐기된 기계에서 나온 완벽한 DDR4 모듈을 현대식 서버에서 재사용할 수 있게 해줍니다. 이를 통해 Vistara는 Meta가 죽은 서버 RAM을 재사용하여 잠재적인 전자 폐기물을 가치 있는 컴퓨팅 자원으로 변환할 수 있게 합니다.

핵심적으로 Vistara는 CXL 2.0 Type-3 메모리 확장기 역할을 합니다. CXL(Compute Express Link)은 CPU가 다른 장치에 연결된 메모리에 일관되게 액세스하고 관리할 수 있게 해주는 고속, 저지연 인터커넥트입니다. 이 프로토콜은 통합 메모리 공간을 생성하여 재활용된 RAM을 CPU 자체 메모리의 투명하지만 별개의 확장 영역으로 효과적으로 처리합니다.

물리적으로 Vistara Chip은 표준 PCIe 5.0 x16 카드에 탑재되어 두 개의 독립적인 72비트 DDR4 메모리 채널을 제공합니다. 이 카드는 표준 DDR4 DIMM을 수용하여 ASIC당 최대 256GB의 재활용 메모리 용량을 통합할 수 있습니다. 현대식 서버에 연결되면 Vistara는 즉시 전체 메모리 풀을 확장하여 원시 속도보다 용량을 우선시하는 워크로드에 최적화합니다.

더 빠르게가 아닌 더 똑똑하게: 계층형 메모리의 실현

Vistara의 진정한 독창성은 하드웨어를 넘어 정교한 하드웨어-소프트웨어 공동 설계를 통합하는 데 있습니다. Meta의 소프트웨어 스택은 CXL로 연결된 메모리를 별도의 NUMA(Non-Uniform Memory Access) 노드로 투명하게 노출합니다. 이를 통해 Linux 커널은 재활용된 RAM을 별도의 액세스 가능한 계층으로 취급하여 데이터를 지능적으로 관리할 수 있습니다.

계층형 메모리(tiered memory) 시스템은 데이터를 동적으로 분류하여 성능을 최적화합니다. 커널은 614GB/s의 압도적인 대역폭을 제공하는 빠른 로컬 DDR5 RAM에 '핫(자주 액세스되는)' 데이터를 자동으로 유지합니다. 반대로, 용량 집약적인 작업에 대해 여전히 준수한 76GB/s의 대역폭을 제공하는 느린 재활용 DDR4 풀로 '콜드(덜 사용되는)' 데이터를 이동시킵니다.

이러한 동적 시스템은 방대한 메모리 용량은 필요하지만 모든 데이터에 걸쳐 균일하게 높은 속도가 필요하지는 않은 워크로드에 완벽합니다. 특히 매개변수 수가 많은 AI inference models와 대규모 캐싱 시스템이 직접적인 혜택을 받습니다.

Meta의 "MemServer" 플랫폼이 이를 잘 보여주는데, 768GB의 DDR5-6400 로컬 메모리와 256GB의 CXL 연결 DDR4-2400을 결합했습니다. 이를 통해 총 서버 메모리가 1TB로 확장되어, 하이퍼스케일러의 흔한 병목 현상인 비용이 많이 드는 out-of-memory 오류를 효과적으로 방지합니다.

Meta는 이 아키텍처가 필요한 AI inference 서버 수를 최대 25%까지 줄이고, 작업 재시작 및 리소스 파편화 오버헤드를 33% 감소시킨다고 보고합니다. 이는 지능적인 리소스 할당을 통한 상당한 효율성 향상을 입증합니다. 이 획기적인 접근 방식에 대한 포괄적인 기술적 통찰력을 얻으려면 Vistara: Making CXL Real—Full Path from ASIC Design and OS Support to Hyperscale Deployment를 참조하십시오.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

업계의 경각심

Meta의 Vistara ASIC은 인프라에 즉각적이고 심대한 영향을 미칩니다. 이 독창적인 솔루션은 AI inference 서버 수요를 최대 25%까지 줄이고, 작업 실패 및 리소스 파편화 오버헤드를 33%나 감소시킵니다. 결정적으로, 이 이니셔티브를 통해 Meta는 전 세계적인 DDR5 부족 사태와 치솟는 가격 인상을 피하면서, 신규 구매 비용의 일부만으로 필수적인 메모리 용량을 확보할 수 있게 되었습니다.

이는 데이터 센터 경제학에서 엄청난 성과를 의미합니다. 폐기된 서버의 기능성 RAM은 전자 폐기물에서 가치 있는 자산으로 변모하며, 은퇴한 하드웨어는 고철이라는 오랜 통념에 도전합니다. Meta의 접근 방식은 지속 가능성과 비용 효율성 모두에 강력한 선례를 남겼으며, 지능적인 엔지니어링이 하드웨어의 유용성을 초기 수명 주기 훨씬 너머까지 확장할 수 있음을 증명했습니다.

Vistara로 입증된 Meta의 성공은 의심할 여지 없이 다른 하이퍼스케일러들이 유사한 CXL 기반 재사용 전략을 개발하도록 자극할 것입니다. 이러한 근본적인 변화는 업계가 하드웨어 수명 주기를 관리하고 전자 폐기물 문제를 해결하는 방식을 바꿀 것이며, 맞춤형 ASIC 개발이 리소스 최적화를 주도할 것입니다. 메모리가 계층화되고, 재사용되며, 전례 없는 지능으로 관리되는 미래를 기대하십시오.

자주 묻는 질문

Meta Vistara 칩이란 무엇입니까?

Vistara는 Meta가 설계한 맞춤형 Application-Specific Integrated Circuit (ASIC)입니다. 이는 구형 DDR4 서버 RAM을 최신 DDR5 RAM용으로 제작된 현대적인 서버에 연결하고 함께 작동할 수 있게 해주는 가교 역할을 합니다.

CXL이란 무엇이며 여기서 왜 중요한가요?

CXL (Compute Express Link)은 CPU와 메모리 가속기와 같은 장치 간의 고속 통신을 허용하는 개방형 산업 표준입니다. Meta의 Vistara 칩은 CXL을 사용하여 재활용된 DDR4 RAM이 새로운 서버의 프로세서에 추가 메모리 풀로 보이도록 합니다.

왜 구형 DDR4 RAM을 새 서버에 직접 사용할 수 없나요?

새로운 서버와 CPU는 DDR5와 같은 최신 RAM 표준에 특화된 메모리 컨트롤러로 설계되었습니다. 구형 DDR4 RAM은 물리적 또는 전자적으로 호환되지 않으며, Vistara와 같은 특수 컨트롤러 없이는 새 CPU와 직접 연결하기에는 너무 느립니다.

Meta의 메모리 재사용 전략의 주요 이점은 무엇입니까?

주요 이점은 비싼 새 DDR5 RAM 구매를 피함으로써 얻는 상당한 비용 절감, 엄청난 양의 전자 폐기물 감소, 그리고 총 메모리 용량을 늘려 out-of-memory 오류를 완화함으로써 특정 워크로드의 성능을 향상시키는 것입니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only