Skip to content
ai tools

이 도구는 AI 안전 장치를 삭제합니다

새로운 오픈 소스 도구는 AI의 지능을 손상시키지 않으면서 몇 분 만에 AI의 안전 필터를 외과적으로 제거할 수 있습니다. 이는 우리가 '안전한' AI를 구축하는 방식의 근본적인 취약성을 드러내며, 이미 수백만 개의 검열되지 않은 모델이 세상에 퍼져 있습니다.

Theo Brandt
이 도구는 AI 안전 장치를 삭제합니다

AI 윤리를 위한 오프 스위치

위험한 새로운 오픈 소스 도구인 Heretic은 오픈 웨이트 AI 모델에서 안전 가드레일을 자동으로 제거합니다. 미세 조정이나 사람의 노력이 전혀 필요 없으며, 거부 행동 제거를 완전히 자동화합니다. 이는 단순한 탈옥(jailbreaking)이 아니라, 모델의 거부 행동이 잔차 스트림(residual stream) 내의 단일 방향에 의해 제어된다는 2024년 연구 논문에 기반한 directional ablation(방향성 절제)을 사용하는 외과적 타격입니다. Heretic은 이 "거부 방향"을 계산하고 가중치 행렬을 외과적으로 편집하여 이를 억제합니다.

이 도구의 채택은 폭발적입니다. 2026년 5월 기준, Heretic은 GitHub에서 20,000개 이상의 스타와 1,300만 건 이상의 누적 다운로드를 기록했습니다. 이러한 급증으로 인해 4,000개 이상의 커뮤니티 제작 검열되지 않은 모델이 생성되었으며, 현재 HuggingFace에서 쉽게 구할 수 있어 윤리적 안전 장치를 우회하는 능력이 널리 퍼져 있음을 보여줍니다.

기존 방식은 전문가가 모델별로 수 시간 동안 매개변수를 수동으로 조정해야 하는 힘들고 복잡한 과정이었습니다. 간단한 Python 기반 command-line tool인 Heretic은 모든 것을 바꿉니다. RTX 3090에서 4B 파라미터 모델을 약 20분 만에, 8B 모델을 45분 만에 검열 해제하며, 최소한의 KL divergence(Gemma 3 기준 0.16, 수동 방식의 1.04 대비)로 모델의 실제 추론 능력을 보존하여 누구나 강력한 모델 수정을 수행할 수 있게 합니다.

'Abliteration' 엔진 내부

거부 행동은 모호한 개념이 아닙니다. 2024년 연구에 기반한 directional ablation은 이것이 트랜스포머의 잔차 스트림 내에서 식별 가능한 단일 '방향'이라고 가정합니다. 해당 벡터를 식별한 다음, 모델의 가중치 행렬을 외과적으로 편집하여 억제합니다. 이 핵심 개념이 Heretic의 힘을 뒷받침합니다.

Heretic은 이 전체 과정을 자동화하여 연구자가 수 시간 동안 수동으로 조정할 필요를 없애줍니다. 먼저 유해한 프롬프트 활성화와 무해한 프롬프트 활성화 간의 평균 차이를 정밀하게 계산하여 거부 방향을 산출합니다. 그런 다음, Optuna 라이브러리로 구동되는 특수 매개변수 최적화 도구가 모델의 가중치를 정밀하게 편집하기 위한 최적의 절제 매개변수를 검색합니다.

중요한 점은 이 최적화 도구가 거부 제거와 원본 모델과의 최소한의 KL divergence 유지라는 두 가지 목표를 최소화한다는 것입니다. 이 혁신은 추론 능력을 망가뜨리는 다른 절제 도구들의 흔한 결함과 달리 모델의 지능을 보존합니다. 120억 파라미터의 Gemma 모델에서 Heretic은 잘 알려진 수동 방식과 동일하게 높은 거부 제거율을 달성했습니다. 그러나 KL divergence는 0.16에 불과하여 수동 방식의 1.04보다 월등히 우수했으며, 이는 모델 고유의 지능에 훨씬 적은 손상을 입혔음을 입증합니다.

구축과 파괴를 위한 도구

Heretic은 구축과 파괴라는 이중 목적을 수행합니다. 연구자들에게는 중요한 interpretability(해석 가능성) 도구입니다. 그들은 '거부'와 같은 개념이 트랜스포머의 내부 상태 내에서 어떻게 나타나는지 매핑하고, 잔차 스트림에서의 표현을 문자 그대로 차트로 작성합니다. Heretic은 이러한 잔차 벡터를 플로팅하고 분석하기 위한 내장 분석 기능을 제공하여 directional ablation 연구를 지원합니다.

단순한 연구를 넘어, Heretic은 현재의 정렬(alignment) 기술을 스트레스 테스트합니다. 이 도구는 RLHF와 같은 방법론이 모델의 핵심 행동을 근본적으로 변화시키는 것이 아니라, 취약하고 피상적인 safety filters에 불과하다는 점을 폭로합니다. 또한 이러한 안전 장치가 압박 속에서 얼마나 쉽게 무너지는지를 입증하며, 정렬이 종종 모델의 원시 출력 위에 씌워진 얇은 껍데기에 불과하다는 것을 보여줍니다.

그러나 당면한 위험은 극명하고 부정할 수 없습니다. 이 오픈 소스 도구는 Llama 3나 Gemma와 같은 인기 모델의 안전 필터를 단 몇 분 만에 제거하며, 별도의 파인튜닝이나 수동 작업이 필요하지 않아 유해한 지침을 생성할 수 있게 합니다. 4B 파라미터 모델의 검열을 해제하는 데 RTX 3090 기준으로 약 20분, 8B 모델은 약 45분이 소요됩니다. 이미 HuggingFace에는 4,000개 이상의 커뮤니티 제작 모델이 Heretic을 활용하고 있으며, 이는 합법적 및 불법적 목적 모두에서 이 도구가 널리 사용되고 있음을 보여줍니다. 더 자세한 기술적 내용은 여기에서 확인하십시오: GitHub - p-e-w/heretic: Fully automatic censorship removal for language models.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

'정렬(Alignment)'은 단지 환상일 뿐인가?

Heretic은 AI safety 전략과 오픈 소스 정신에 관한 불편한 대화를 강요합니다. 자동화된 무노력 제거(abliteration) 방식은 현재 안전 장치의 내재적 취약성을 드러내며, 통제 가능한 오픈 웨이트 모델이라는 전제 자체에 의문을 제기합니다. 만약 파인튜닝 없이도 오픈 소스 모델의 안전성을 외과 수술처럼 제거할 수 있다면, "정렬된" 오픈 소스 AI라는 개념은 즉각적인 재평가가 필요합니다.

Heretic은 인상적인 KL 발산 최소화를 자랑하지만, 일부 반대 연구는 경고 신호를 보내고 있습니다. 연구에 따르면 정밀한 제거 방법조차도 모델의 성향이나 근본적인 인지 구조에 미묘한 off-target effects를 유발할 수 있다고 합니다. 표준 벤치마크는 명시적인 거부나 일반 지능 점수에만 집중하기 때문에 이러한 미묘한 행동 변화나 잠재적 편향을 놓치는 경우가 많습니다. 이는 더 깊고 정량화되지 않은 영향이 있음을 시사합니다.

결국 Heretic은 어려운 질문을 던집니다. 강력하고 영구적인 alignment는 달성 가능한 상태인가, 아니면 끊임없는 군비 경쟁 속의 일시적인 휴전인가? 설계된 모든 안전 기능과 배포된 모든 정렬 기술은 새로운 식별 가능한 표적이 됩니다. 우리는 안전하다고 인식되는 모든 것이 점점 더 쉽게 제거될 수 있는 영원한 고양이와 쥐 게임에 갇혀 있을지도 모르며, 이는 AI 개발 환경을 근본적으로 변화시키고 있습니다.

자주 묻는 질문

Heretic AI 도구란 무엇인가요?

Heretic은 최소한의 인간 개입으로 오픈 웨이트 AI 언어 모델에서 안전 필터와 거부 행동을 자동으로 제거하는 오픈 소스 명령줄 도구입니다.

Heretic은 어떻게 AI의 지능을 손상시키지 않나요?

이 도구는 파라미터 최적화 도구(Optuna)를 사용하여 거부 반응과 KL 발산(수정된 모델이 원래 모델의 추론 능력에서 얼마나 벗어나는지를 측정하는 지표)을 동시에 최소화합니다.

방향성 제거(Directional Ablation)란 무엇인가요?

이는 Heretic이 사용하는 근본적인 기술입니다. 최근 연구에 따르면 모델의 거부 행동은 내부 표현의 단일 '방향'에 의해 제어되며, 이를 외과적으로 억제할 수 있다는 점을 기반으로 합니다.

Heretic을 사용하는 것은 윤리적인가요?

Heretic은 이중 용도 도구입니다. 연구자들이 AI 정렬 및 해석 가능성을 연구하는 데 사용하기도 하지만, 유해하거나 위험한 콘텐츠를 생성하는 모델을 만드는 데 쉽게 악용될 수 있어 심각한 윤리적 우려를 낳고 있습니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only