Skip to content
industry insights

Anthropic의 650억 달러 규모 신뢰 문제

Anthropic의 매출은 급증하고 있지만, 가장 충성도 높은 개발자들과의 갈등이 심화되면서 성장세가 꺾일 위기에 처했습니다. 이는 단순히 결함이 있는 모델 출시 하나만의 문제가 아니라, 고신뢰·고가 전략 전체를 위태롭게 하는 행동 패턴에 관한 것입니다.

Cassidy Wolfe
Anthropic의 650억 달러 규모 신뢰 문제

개발자들을 실망시킨 650억 달러 규모의 모델

Anthropic의 재무적 궤도는 2026년 7월 말 기준 연간 매출 실행률(ARR)이 650억 달러를 돌파했을 정도로 의심할 여지 없이 눈부십니다. Claude Code는 전문적인 워크플로우에 깊숙이 자리 잡았지만, 이러한 거대한 성공은 치명적인 결함을 가리고 있습니다. 바로 2026년 7월에 출시된 Claude Opus 5의 문제적 출시입니다. 이 플래그십 모델은 비약적인 발전을 약속했지만, 결과적으로 수많은 개발자에게 실망을 안겨주었습니다.

Anthropic은 Opus 5의 벤치마크 성능을 대대적으로 홍보하며, Frontier-Bench 코딩 테스트에서 Opus 4.8 대비 두 배 이상의 성능을 기록했고 ARKGIA3에서는 경쟁사 대비 3배 높은 점수를 받았다고 주장했습니다. 이러한 통계는 타의 추종을 불허하는 지능을 가진 것처럼 보였습니다. 그러나 T3 chat의 CEO인 Theo Brown과 같은 개발자들이 체감한 현실은 판이했습니다. Brown은 Opus 5가 일상 업무에 '끔찍하다'고 평가하며, 장황하고 과도하게 설계되었으며 사소한 문제를 거대한 재작성으로 만드는 경향이 있다고 지적했습니다. Code Rabbit의 리뷰 테스트에서도 기존 모델보다 알려진 문제를 더 적게 찾아내고, 가치 없는 잔소리(nitpicks)를 4배 더 많이 생성한다는 점이 확인되었습니다.

이러한 간극은 근본적인 문제를 드러냅니다. 바로 '벤치마크 지능'과 '실용적 판단력' 사이의 현격한 차이입니다. Opus 5는 구조화되고 정의된 테스트에서는 뛰어나지만, 이전 Claude 버전들을 인기 있게 만들었던 미묘하고 실용적인 요구 사항 앞에서는 무너집니다. 순수한 문제 해결 능력은 분명하지만, 실제 상황에서 조정된 판단력이 부족하여 Anthropic이 섬겨야 할 개발자들을 소외시키고 있으며, Anthropic이 절실히 필요로 하는 신뢰를 갉아먹고 있습니다.

데자뷔: 다시 돌아온 '비밀 너프(Secret Nerfs)'

Opus 5의 혼란스러운 출시는 단발적인 사건이 아니었습니다. 이는 Anthropic의 과거를 고통스럽게 반복하는 것이었습니다. 수개월 동안 개발자들은 자신들이 비용을 지불하는 모델의 안정성과 실제 지능에 의문을 제기해 왔으며, 이 문제는 최신 출시 훨씬 이전부터 시작되었습니다. 이러한 조용한 성능 저하 패턴은 신뢰를 심각하게 훼손했으며, 현재의 반발은 충분히 예견된 결과였습니다.

사용자들은 지난 3월에 이러한 '비밀 너프' 현상을 처음 경험했습니다. Anthropic은 Claude Code의 기본 추론 강도를 높음에서 중간으로 조용히 변경했으며, 이후 더 빠른 응답을 위해 '지능이 약간 낮아졌다'는 점을 인정했습니다. 이는 단순한 설정 변경이 아니라, 유료 고객을 위한 제품 기능의 근본적인 변화였습니다.

설상가상으로 별도의 캐시 버그(cache bug)로 인해 Claude가 긴 세션에서 기억력을 잃어 사용자들이 작업을 반복적으로 재설명해야 하는 상황이 발생했습니다. 이후 응답을 단축하기 위한 시스템 지침이 의도치 않게 3%의 코딩 성능 저하를 유발했습니다. Anthropic은 이를 명시적인 모델 너프가 아니라고 주장했지만, 사용자들에게 돌아온 실질적인 결과는 동일했습니다. 바로 더 낮은 성능의 어시스턴트였습니다.

Anthropic은 기술적으로 API 안정성을 주장하며 기본 모델에 대한 '너프'를 부인합니다. 그러나 숨겨진 제품 레이어가 성능을 저하시키는 것이 명백한 상황에서 이러한 의미론적 구분은 사용자들에게 거의 위안이 되지 않습니다. 개발자들에게 결론은 명확합니다. 기술적 설명과 관계없이 반복적으로 저하된 경험을 제공하는 기업은 무조건적인 충성을 요구할 자격을 상실합니다.

'안전'이 불안정하게 느껴질 때

Anthropic은 Opus 5를 세대적 도약이라고 홍보하지만, 모델 이름 자체가 일관된 경험을 보장하지는 않습니다. Anthropic의 자체 문서에서도 Claude, Claude Code 또는 Claude Cowork 내에서 플래그가 지정된 특정 사이버 보안 요청이 Opus 4.8로 대체될 수 있음을 인정하고 있습니다. 기타 안전 및 생물학 관련 쿼리는 내부 분류기에 따라 Fable, Opus 및 이전 모델 간에 라우팅됩니다.

이는 비밀이 아니며 Anthropic은 이 시스템을 공개했습니다. 그러나 이는 '동일한' 모델을 선택한 두 고객이 프롬프트를 변경하지 않고도 완전히 다른 성능을 경험할 수 있음을 의미합니다. 단어 선택에 영향을 미치는 미묘한 텍스트 워터마킹까지 더해지면, Claude는 안정적인 제품이라기보다 Anthropic이 내부 우선순위에 따라 끊임없이 재구성하는 유동적인 서비스처럼 느껴집니다.

Anthropic의 '책임 있는 AI'에 대한 끊임없는 추구가 이러한 선택의 근간을 이루고 있으며, 이러한 기업적 입장은 7월 기준 연간 매출 런레이트(ARR)를 650억 달러 이상으로 끌어올리는 데 기여했습니다 Anthropic, 7월 연간 매출 런레이트 650억 달러 돌파 투자자에게 보고. 그러나 이러한 통제에 대한 헌신은 아무리 고귀하더라도 예측 가능성이라는 직접적인 대가를 치르게 합니다. 사용자는 끊임없이 움직이는 표적처럼 느껴지는 AI에 프리미엄 가격을 지불하고 있으며, 이는 기업 도입에 필수적인 사용자 신뢰를 근본적으로 약화시키고 있습니다.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

탈출구가 붐비고 있다

2026년 7월 기준 Anthropic의 650억 달러 연간 매출 런레이트는 재정적 성공을 보여주지만, 이러한 성공은 더 깊은 취약성을 가리고 있습니다. 현재 초경쟁 시장에서는 OpenAI, Google, XAI가 제공하는 강력하고 종종 더 저렴한 대안들이 존재합니다. 선택지가 풍부한 개발자들은 일관된 결과를 제공하지 못하는 프리미엄 가격의 모델을 참아줄 이유가 없습니다.

Opus 5의 높은 토큰 가격(입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러)은 문제의 일부일 뿐입니다. Code Rabbit의 독립적인 분석에 따르면, Opus 5는 동일한 검토 작업을 수행할 때 GPT 5.6 기준 모델보다 입력 토큰은 약 50%, 출력 토큰은 65% 더 많이 소비하는 것으로 나타났습니다. 이러한 비효율성은 실제 비용을 크게 증가시켜 Anthropic의 제품을 프로덕션 워크플로우에 사용하기에는 지나치게 비싸게 만듭니다.

Anthropic의 매출은 여전히 견고하지만, 이는 후행 지표일 뿐이며 개발자 신뢰를 위한 중요한 경쟁에서 결정적으로 밀리고 있습니다. 위험은 갑작스러운 붕괴가 아니라 조용하고 교묘한 이탈입니다. 한때 Claude에 깊이 의존하던 워크플로우들이 신뢰성, 예측 가능성, 비용 효율성을 제공하는 경쟁사로 꾸준히 이동하고 있습니다. 이 점진적인 탈출구는 빠르게 붐비고 있습니다.

자주 묻는 질문

Claude Opus 5에 대한 주요 불만 사항은 무엇인가요?

강력한 벤치마크 점수에도 불구하고, 많은 개발자들은 Claude Opus 5가 실제 코딩 작업에 비해 장황하고 느리며 과도하게 설계되었다고 느낍니다. 종종 단순한 문제를 복잡한 재작성으로 바꾸거나 이전 버전보다 성능이 떨어지는 경우가 많습니다.

사용자들이 Anthropic에 대한 신뢰를 잃는 이유는 무엇인가요?

Opus 5 문제는 Claude Code의 기본 추론 노력을 줄이는 등 성능에 부정적인 영향을 미친 사전 고지 없는 변경 사항들의 연장선에 있습니다. 이러한 패턴은 개발자들로 하여금 제품이 불안정하며 모델 이름이 일관된 경험을 보장하지 않는다고 느끼게 만듭니다.

Claude Opus 5가 경쟁사보다 더 비싼가요?

네. Opus 5의 API 가격은 OpenAI의 GPT-5.6 Sol이나 Google의 Gemini 3.7 Flash와 같은 경쟁사보다 높습니다. 또한 테스트 결과 동일한 작업에 대해 훨씬 더 많은 토큰을 소비할 수 있어 사용자에게 총비용 부담을 가중시킵니다.

영상에서 말하는 '비밀 너프(secret nerfs)'는 무엇을 의미하나요?

이 용어는 사용자가 체감하는 Claude의 성능 저하를 의미합니다. Anthropic은 핵심 모델을 의도적으로 약화시켰다는 점은 부인하지만, 사용자 경험을 저하시킨 애플리케이션 수준의 변경 사항이 있었음을 인정했으며, 이는 수주 간의 불만이 제기된 후에야 수정되었습니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

빌더를 위해

이 페이지는 지금 다른 사람의 도구를 위해 일하고 있습니다.

AI 에이전트가 읽고, 구매자가 도착합니다. 8개 언어와 MCP로 답합니다. 당신의 도구도 가질 수 있습니다 — 24시간 안에 공개.