AI 도구
이 도구는 AI 안전 장치를 삭제합니다
새로운 오픈 소스 도구는 AI의 지능을 손상시키지 않으면서 몇 분 만에 AI의 안전 필터를 외과적으로 제거할 수 있습니다. 이는 우리가 '안전한' AI를 구축하는 방식의 근본적인 취약성을 드러내며, 이미 수백만 개의 검열되지 않은 모델이 세상에 퍼져 있습니다.
기사 읽기→
Tag
3 개 게시물
새로운 오픈 소스 도구는 AI의 지능을 손상시키지 않으면서 몇 분 만에 AI의 안전 필터를 외과적으로 제거할 수 있습니다. 이는 우리가 '안전한' AI를 구축하는 방식의 근본적인 취약성을 드러내며, 이미 수백만 개의 검열되지 않은 모델이 세상에 퍼져 있습니다.
Anthropic은 자체 AI 내부에 숨겨진 '사고' 공간을 방금 발견하여 모델의 진정한 의도를 드러냈습니다. 이 돌파구는 안전한 AI를 구축하는 열쇠가 될 수도 있고, 우리가 의식을 정의하는 방식을 바꿀 수도 있습니다.
Anthropic은 AI가 *실제로* 어떻게 생각하는지에 대한 베일을 걷어내며, 인간의 의식을 반영하는 Claude 내부의 숨겨진 '작업 공간'을 발견했습니다. J-space라고 불리는 이 새로운 기능은 진정으로 안전하고 정렬된 AI를 구축하는 데 핵심이 될 수 있습니다.