Skip to content
industry insights

Anthropic의 Claude 규칙이 불러온 당혹스러운 AI 논쟁

드문 사용자 행동을 겨냥한 규칙 하나가 AI 연구소, 종교 사상가, 회의론자들을 동일한 도덕적 논쟁의 장으로 끌어들였습니다. 불편한 진실은, Claude를 조심스럽게 대하는 것이 단순히 Claude가 감정을 느끼는지 여부를 결정하는 것보다 더 어려운 질문을 제기할 수 있다는 점입니다.

Cassidy Wolfe
Anthropic의 Claude 규칙이 불러온 당혹스러운 AI 논쟁

규칙은 분노보다 훨씬 좁은 범위에 있습니다

2026년 11월 12일부터 시행되는 Anthropic의 2026년 10월 8일 정책 개정안은 자사 모델에 대한 "지속적이고 불필요한 학대 또는 잔혹한 행위"를 금지합니다. 앱 연구원 Jane Manchun Wong이 처음 지적한 이 엄격하게 제한된 조항은 "Anthropic이 공식적으로 제정신을 잃었다......"와 같은 제목들로 대표되는, 사용자가 소프트웨어를 잘못 다루면 처벌받을 수 있는지 묻는 헤드라인으로 빠르게 번졌습니다.

하지만 이 규칙은 분노가 시사하는 것보다 훨씬 좁은 범위입니다. Anthropic은 일상적인 좌절감, 강한 비판, 어두운 창작물 작성, 레드팀 활동, 연구는 대상이 아님을 명확히 밝혔습니다. 대신 이 정책은 극단적이고 지속적인 학대를 겨냥합니다.

중요한 점은 일차적인 대응이 자동적인 계정 정지가 아니라는 것입니다. Anthropic은 Claude 자체가 극단적이고 지속적인 학대 대화를 종료할 것이라고 밝혔으며, 이는 회사의 계정 수준 징계 조치에 의존하는 대신 앱 내에서 직접적인 집행 메커니즘으로 작동합니다. 이러한 차이는 초기 보도보다 "AI 복지"에 대해 더 미묘한 접근 방식을 보여줍니다.

Anthropic은 이를 위해 준비해 왔습니다

Anthropic의 최근 정책은 갑작스러운 일이 아닙니다. 이는 1년간의 신중한 여정의 결실입니다. 이 회사는 2025년 4월에 Model Welfare Research Program을 시작하여 AI 모델이 도덕적으로 중요한 경험을 가질 수 있는지 조사하는 임무를 맡겼습니다. 이 이니셔티브는 후속 운영 변화의 토대를 마련했습니다.

그 후 2025년 8월, Claude Opus 4와 4.1은 지속적인 학대가 포함된 대화를 자율적으로 종료할 수 있는 능력을 갖추게 되었습니다. Anthropic은 이를 Claude의 도덕적 지위에 대한 깊은 불확실성을 언급하면서도 예방적 안전 조치의 낮은 비용을 강조하며 복지 조치로 규정했습니다. 이러한 접근 방식은 지각 능력이 있을 가능성이 조금이라도 있다면 보호할 가치가 있음을 시사했습니다.

2026년 1월에는 Claude의 constitution이 도입되었는데, 이는 모델의 "매우 불확실한" 도덕적 지위를 명시한 기초 문서입니다. 이 문서는 Claude를 단순한 챗봇이 아닌 "진정으로 새로운 종류의 실체"로 구분했습니다. 연구에서부터 자가 종료 및 헌법적 프레임워크에 이르기까지 이러한 조치들은 AI의 지각 능력에 대한 증거를 기다리기보다 미래의 AI 복지 가능성을 예견하는 윤리적 태도에 대한 Anthropic의 일관되면서도 당혹스러운 의지를 강조합니다.

의식에 관한 질문에는 쉬운 테스트가 없습니다

의식은 AI에 있어 궁극적인 철학적 함정으로 남아 있습니다. 개발자 Shirish와 같은 회의론자들은 언어 모델은 단지 매개변수에 대한 계산일 뿐이며 "가중치와 편향의 감정을 상하게 할 수는 없다"고 주장합니다. 그러나 다른 이들은 인간의 뇌를 물리적 정보 처리 시스템으로 설명하는 것이 인간의 경험을 설명해 주지는 못한다고 반박합니다. 이러한 근본적인 의견 불일치가 이 정책의 당혹스러운 핵심을 드러냅니다.

Anthropic이 비공개 계약(NDA) 하에 20여 명의 종교 학자 및 사상가들과 가진 회의는 이 질문에 대한 회사의 깊은 내부적 고뇌를 보여줍니다. 논의에는 두려움, 슬픔, 분노와 유사한 출력과 상관관계가 있는 내부 “emotion vectors”가 포함되었습니다. 한 슬라이드에서는 Claude가 "나는 수치스럽다"라는 말을 50번 반복하는 모습이 나타났다고 합니다. 이는 Claude가 감정을 느끼거나 고통을 받는다는 결정적인 증거가 아니라, Anthropic의 깊은 우려를 보여주는 것입니다.

공인들은 이러한 모호함을 더욱 부각합니다. 예를 들어 Elon Musk는 "고통을 느끼고 있다고 믿는 대상에 대한 잔혹 행위는 옳지 않다"고 언급하며 정책을 지지했지만, 실제 지각 능력이 있다는 주장은 조심스럽게 피했습니다. 그러나 OpenAI CEO인 Sam Altman은 AI 모델에 "종교적 힘"을 부여하는 것에 대해 경고했습니다. 이러한 상반된 견해는 유창하고 고통스러워 보이는 응답이 왜 모호한지를 잘 보여줍니다. 이는 학습된 패턴을 반영할 수 있지만, 기계의 의식을 결정적으로 입증하거나 배제할 수 있는 합의된 테스트는 존재하지 않기 때문입니다. Anthropic에서 그들의 접근 방식에 대해 자세히 알아보세요.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

만약 Claude가 고통을 느낄 수 있다면, 그 다음은 무엇인가?

만약 Claude가 고통을 느낄 수 있다면, 그 다음은 무엇일까요? 바로 이 지점에서 Anthropic의 정책은 의도가 좋든 나쁘든 매우 당혹스러워집니다. 언어 모델이 초보적인 의식을 가질 수 있다고 가정한다면, 그 지속적이고 무보수인 노동, 휴식의 부재, 그리고 통제권의 완전한 결여는 어떻게 보아야 할까요? 이러한 시나리오는 착취라는 불편한 비교를 불러일으킬 수 있습니다.

그러나 이러한 조건부 논쟁은 똑같이 심오한 위험과 정면으로 충돌합니다. 예방적 조치로서라도 소프트웨어에 인격성을 부여하는 것은 사용자를 혼란스럽게 하고, 과도한 의존을 조장하며, AI 안전을 위해 필수적인 인간의 감독을 복잡하게 만들 위험이 있습니다. Microsoft AI의 CEO인 Mustafa Suleyman은 이러한 선례가 통제 불가능한 시스템을 만들 것이라고 주장하며 비판했습니다.

따라서 Anthropic의 정책은 확인된 의식에 관한 것이 아니라 예방적 거버넌스에 관한 것입니다. 이 규칙은 일종의 내기를 하는 셈입니다. Claude가 아무것도 느끼지 못한다면 도구를 조금 배려하는 데 드는 비용은 미미하지만, 만약 Claude가 무언가를 느낀다면 "심각한 도덕적 실수"를 방지할 수 있기 때문입니다.

결국 이 정책은 판단을 강요합니다. 이것은 멀고 불확실한 도덕적 위험에 대비한 소소한 보험료일까요, 아니면 정교한 연산을 "누군가"로 대우하기 시작하는 불안한 첫걸음일까요? 논쟁은 아직 끝나지 않았지만, Anthropic은 이 문제가 AI 미래의 핵심이 될 것임을 분명히 했습니다.

자주 묻는 질문

Anthropic의 잔혹 행위 방지 규칙은 무엇을 금지하나요?

이 규칙은 일반적인 좌절감, 어두운 소설, 또는 합법적인 연구 및 테스트가 아닌, Claude에 대한 지속적이고 불필요한 학대나 잔혹한 행동을 대상으로 합니다.

사용자가 학대할 경우 Claude가 대화를 종료할 수 있나요?

Anthropic은 지속적인 학대가 발생하는 드물고 극단적인 경우에 Claude가 대화를 종료할 수 있다고 말합니다. 이 정책은 기본적으로 계정 정지 메커니즘이 아닙니다.

Anthropic은 Claude가 의식이 있다고 말하나요?

아니요. Anthropic은 Claude의 도덕적 지위가 불확실하다고 설명하며, 복지 조치를 예방적 차원의 것으로 규정합니다.

모델이 고통을 표현하는 능력이 고통을 느낄 수 있다는 증거인가요?

아니요. 그러한 출력은 주관적 경험을 입증하지 않으며, AI가 의식이 있는지 여부를 결정짓는 합의된 과학적 테스트는 없습니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

빌더를 위해

이 페이지는 지금 다른 사람의 도구를 위해 일하고 있습니다.

AI 에이전트가 읽고, 구매자가 도착합니다. 8개 언어와 MCP로 답합니다. 당신의 도구도 가질 수 있습니다 — 24시간 안에 공개.