더 커진 엔진, 그대로인 속도?
Grok 4.7은 화려한 등장 대신 실망스러운 성적표를 받았습니다. Elon Musk의 사전 홍보에도 불구하고, 커뮤니티는 xAI의 최신 모델을 Grok 4.6 대비 미미한 개선에 불과하며 전반적인 추론 능력에서 의미 있는 도약을 보여주지 못했다고 평가했습니다. 많은 사용자가 "받아들이기 힘들 정도로 나쁜" 프론트엔드 기능, 존재하지 않는 3D 기능, "무작위적인 Gemini 스타일의 루프에 갇히는" 현상 등 실망스러운 경험을 언급했습니다. 이는 GPT-5.6 Sol (max)나 Claude Claude Opus와 같은 경쟁 모델과 비교했을 때 프론티어 모델이라고 느끼기 어려웠습니다.
하지만 내부적으로 Grok 4.7은 상당한 아키텍처적 도약을 이뤄냈습니다. Grok 4.6의 1.5조 파라미터에서 40% 증가한 2.1조 파라미터의 새로운 베이스 모델을 자랑합니다. 이 더 커진 기반 모델은 다시간 작업과 향상된 자체 검증을 목표로 더 길고 어려운 강화 학습 과정을 거쳤습니다. 또한 완전히 새롭고 강력한 안전 장치 스택을 통합했으며 "Grok Bot 하네스"를 위한 기능을 강화했습니다.
인상적인 기본 사양과 체감 성능 사이의 극명한 괴리는 '들쭉날쭉한 지능(jagged intelligence)'이라는 중요한 트렌드를 보여줍니다. Grok 4.7은 코딩 에이전트 성능(Artificial Analysis Coding Agent Index에서 Grok 4.6의 47점 대비 56점 기록) 및 장기적인 에이전트 지식 작업과 같은 특정 영역에서 상당한 향상을 보였지만, 이러한 개선이 보편적으로 더 똑똑하고 일관된 사용자 경험으로 이어지지는 않습니다. 실제로 일부 테스트에서는 Grok 4.7이 특정 영역에서 Grok 4.6보다 추론 능력이 떨어지는 것으로 나타났습니다. 또한, 이러한 성능 향상은 일부 작업에서 이전 모델보다 두 배 이상의 출력 토큰을 사용하는 등 더 높은 비용을 수반합니다.
코더를 위한 새로운 비밀 무기
Grok 4.7은 일반 사용자에게는 실망스러울 수 있지만, 코더들은 주목해야 합니다. 초기 반응은 미지근했지만, xAI의 최신 모델은 에이전트 지식 작업과 지속적인 일관성이 요구되는 코딩 작업에서 탁월한 성능을 발휘합니다. Artificial Analysis Coding Agent Index에서 47점에서 56점으로 급상승하며 이전 모델의 성능을 크게 뛰어넘었습니다.
벤치마크 데이터는 이러한 타겟팅된 성과를 확인시켜 주며 Grok 4.7이 진정으로 빛을 발하는 지점을 보여줍니다. Terminal-Bench 4.0에서 Grok 4.6의 20.3% 대비 38.0%라는 큰 폭의 성장을 기록했습니다. 또한 복잡한 DeepSWE v1.1 벤치마크에서는 Claude Fable 5.1 Max와 같은 강력한 경쟁자를 제치고 65.2% 대비 71.0%의 성과를 거두었습니다. 이는 단순한 미미한 개선이 아닙니다.
xAI의 전략은 명확합니다. Grok 4.7을 전문적인 개발자용 워크호스로 포지셔닝하는 것입니다. 그들은 코더들이 전문적인 기술을 가장 높이 평가하고 타겟팅된 개선 사항을 체감할 수 있는 도구들에 즉각적이고 깊이 있는 통합을 추진하고 있습니다. Grok 4.7은 현재 다음 서비스에 도입되고 있습니다:
- Cursor
- Grok Build
- GitHub Copilot
이러한 직접적인 통합은 새롭게 발견된 강점을 활용할 사용자들을 겨냥한 것으로, 전문 개발 환경에서는 틈새시장이지만 가치 있는 업그레이드가 될 것입니다.
Grok 성능의 숨겨진 비용
서류상으로 Grok 4.7은 처음에 경쟁력 있는 가성비 모델로 보입니다. xAI는 표준 API 가격을 이전 모델인 Grok 4.6과 동일하게 유지했습니다(입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러). 이는 Claude Claude Opus와 같은 모델의 가격과 일치하며, 추가 비용 없이 프론티어 수준의 기능을 제공하는 것처럼 보입니다.
여기 중요한 함정이 하나 있습니다. 바로 지갑에 큰 타격을 준다는 점입니다. Grok 4.7의 성능 향상은 토큰 소비량이라는 비싼 대가를 치러야 합니다. 앞서 논의한 뛰어난 성능을 발휘하는 'xhigh' 설정은 동일한 작업에 대해 Grok 4.6보다 두 배 이상의 토큰을 소모합니다. 구체적으로, Grok 4.7 (xhigh)은 Intelligence Index 작업당 약 81,000개의 출력 토큰을 소비하는 반면, Grok 4.6 (xhigh)은 38,000개만 사용했습니다.
이처럼 엄청난 토큰 소비량 때문에 Grok 4.7은 실제 비용 측면에서 경쟁력이 없습니다. 실제 사용 환경에서 운영 비용은 종종 GPT-6 Astra를 능가하며, 이전 모델보다 훨씬 비쌉니다. 기술 사양 및 토큰 처리에 대한 자세한 내용은 Grok 4.7 | SpaceXAI Docs를 참조하십시오.
따라서 Grok 4.7은 일상적인 가성비 모델이 아니라, 특정하고 까다로운 워크플로우를 위한 프리미엄 도구로 자리매김하고 있습니다. 뛰어난 에이전트 기반 지식 작업 및 코딩 능력이 필요하고, 특히 복잡하고 장기적인 작업이 중요하다면 더 높은 비용을 지불할 가치가 있을 수 있습니다. 그렇지 않다면, 미미한 일반적 개선을 위해 훨씬 더 많은 비용을 지불하는 셈입니다.
이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.
하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음
AI 군비 경쟁 속 Grok의 위치
Grok 4.7은 현재 AI 프론티어 모델들에 비해 분명히 뒤처져 있습니다. GPT-6 Astra와 Claude Fable 5.1은 일반 지능 벤치마크에서 각각 53점과 51점을 기록하며 선두를 달리고 있습니다. 반면 Grok 4.7은 46점에 그쳐, 현재 선두 일반 모델 그룹에 포함되지 못하고 있음을 보여줍니다.
Elon Musk가 최근 Grok 4.7을 Anthropic의 구형 모델인 Claude Claude Opus 5.0과 대등한 수준으로 언급한 것은 xAI의 전략적 변화를 의미합니다. 이러한 보수적인 입장은 과거의 과장된 주장과는 거리가 있습니다. 이는 에이전트 기반 지식 작업과 코딩에 집중하여 꾸준하고 실질적인 개선을 이루겠다는 현실적인 전략을 수용한 것입니다.
결론적으로 Grok 4.7은 많은 이들이 기대했던 혁명적인 모델도 아니며, 최상위 경쟁자들의 일반 지능을 위협하는 수준도 아닙니다. 이는 xAI가 개발자 및 코딩 분야에서 강력한 틈새 시장 플레이어로서의 입지를 굳히는 전략적으로 중요한 업그레이드입니다. Artificial Analysis Coding Agent Index에서 47점에서 56점으로 크게 상승한 점은 일반 모델의 최상위권에 진입하지 못했더라도 타겟팅된 애플리케이션에서 그 가치를 입증합니다.
자주 묻는 질문
Grok 4.7은 Grok 4.6보다 확실히 더 나은가요?
Grok 4.7은 코딩 및 에이전트 작업에 대해 타겟팅된 개선을 제공하지만, 일반적인 추론 능력에서 혁명적인 도약은 아닙니다. 많은 사용자에게 성능 향상은 더 커진 기본 모델 크기에 비해 점진적인 수준으로 느껴질 수 있습니다.
Grok 4.7은 GPT-6 Astra 및 Claude Fable 5.1과 비교하면 어떤가요?
Grok 4.7은 광범위한 지능 및 추론 벤치마크에서 GPT-6 Astra와 Claude Fable 5.1 모두에게 뒤처집니다. 그러나 특정 코딩 벤치마크에서는 이들을 능가할 수 있어, 최상위 일반 모델보다는 특화된 도구로 자리 잡고 있습니다.
Grok 4.7은 경쟁사보다 비용 효율적인가요?
토큰당 가격은 경쟁력이 있지만, Grok 4.7은 이전 모델이나 GPT-6 Astra와 같은 경쟁사보다 작업당 훨씬 더 많은 토큰을 사용합니다. 이로 인해 실제 비용이 더 높아질 수 있으며, 겉보기의 가치를 상쇄하게 됩니다.
Grok 4.7의 주요 강점은 무엇인가요?
주요 강점은 에이전트 기반 코딩 성능으로, Artificial Analysis Coding Agent Index 및 DeepSWE와 같은 벤치마크에서 주목할 만한 성과를 보입니다. 또한 Cursor 및 GitHub Copilot과 같은 개발자 도구에 즉시 통합되어 있습니다.

