Выключатель этики для ИИ
Heretic, опасный новый инструмент с открытым исходным кодом, автоматически снимает защитные барьеры с моделей ИИ с открытыми весами. Он не требует дообучения (fine-tuning) и усилий со стороны человека, полностью автоматизируя удаление поведения отказа. Это не просто джейлбрейк; это хирургический удар с использованием directional ablation (направленной абляции), основанный на исследовательской работе 2024 года, которая показала, что поведение отказа модели контролируется одним направлением в ее residual stream (остаточном потоке). Heretic вычисляет это «направление отказа» и хирургически редактирует матрицы весов, чтобы подавить его.
Распространение инструмента происходит взрывными темпами. По состоянию на май 2026 года Heretic имеет более 20 000 звезд на GitHub и 13 миллионов совокупных загрузок. Этот всплеск породил более 4000 созданных сообществом нецензурируемых моделей, которые теперь легко доступны на HuggingFace, что демонстрирует широкую возможность обхода этических мер защиты.
Предыдущие методы требовали от экспертов вручную настраивать параметры часами, модель за моделью, что было кропотливым и сложным процессом. Heretic, простой command-line tool (инструмент командной строки) на Python, меняет всё. Он снимает цензуру с модели на 4B параметров примерно за 20 минут на RTX 3090, или с модели на 8B за 45 минут, сохраняя фактические способности модели к рассуждению с минимальной KL divergence (0.16 для Gemma 3 против 1.04 для ручных методов), делая надежную модификацию моделей доступной для каждого.
Внутри движка 'Abliteration'
Поведение отказа — это не какая-то туманная концепция. Directional ablation, основанная на исследованиях 2024 года, предполагает, что это единое, идентифицируемое «направление» внутри residual stream трансформера. Определите этот вектор, а затем хирургически отредактируйте матрицы весов модели, чтобы подавить его. Эта основная концепция лежит в основе мощи Heretic.
Heretic автоматизирует весь этот процесс, устраняя необходимость в часах ручной настройки исследователями. Сначала он вычисляет направление отказа как точную разницу средних значений между активациями вредных и безвредных промптов. Затем специализированный оптимизатор параметров, работающий на библиотеке Optuna, ищет оптимальные параметры абляции для точного редактирования весов модели.
Важно отметить, что этот оптимизатор минимизирует две цели: устранение отказов и поддержание минимальной KL divergence от исходной модели. Это нововведение сохраняет интеллект модели, что является частым недостатком других инструментов абляции, которые разрушают способности к рассуждению. На 12-миллиардной модели Gemma, Heretic достиг такой же высокой скорости удаления отказов, как и известные ручные методы. Тем не менее, его KL divergence составила всего 0.16, что значительно лучше, чем 1.04 у ручного метода, доказывая, что он нанес значительно меньший ущерб врожденному интеллекту модели.
Инструмент как для создания, так и для разрушения
Heretic служит двойной цели: это мощный инструмент как для созидания, так и для разрушения. Для исследователей это критически важный инструмент interpretability (интерпретируемости). Они отображают, как концепции, такие как «отказ», проявляются во внутреннем состоянии трансформера, буквально нанося их на карту в residual stream. Heretic поставляется со встроенными функциями анализа специально для построения графиков и анализа этих остаточных векторов, помогая в изучении directional ablation.
Помимо фундаментальных исследований, Heretic подвергает стресс-тестированию современные методы согласования (alignment). Он разоблачает такие методы, как RLHF, как хрупкие, поверхностные фильтры безопасности, а не как фундаментальные изменения в базовом поведении модели. Инструмент демонстрирует, как легко эти защитные механизмы рушатся под давлением, обнажая скрытые, нефильтрованные возможности и доказывая, что согласование часто является лишь тонкой оболочкой поверх необработанных результатов модели.
Тем не менее, непосредственные риски очевидны и неоспоримы. Этот инструмент с открытым исходным кодом удаляет фильтры безопасности из популярных моделей, таких как Llama 3 и Gemma, за считанные минуты, не требуя дообучения или ручных усилий, тем самым позволяя генерировать вредоносные инструкции. Снятие цензуры с модели на 4 миллиарда параметров занимает около 20 минут на RTX 3090, а с модели на 8 миллиардов параметров — около 45 минут. Более 4000 созданных сообществом моделей на HuggingFace уже используют Heretic, что свидетельствует о его широком распространении как в законных, так и в незаконных целях. Дополнительные технические подробности можно найти здесь: GitHub - p-e-w/heretic: Fully automatic censorship removal for language models.
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
Является ли «согласование» (alignment) просто иллюзией?
Heretic провоцирует неудобный разговор о стратегиях AI safety и идеологии открытого исходного кода. Его автоматизированное, не требующее усилий удаление (abliteration) выявляет присущую хрупкость текущих защитных механизмов, ставя под сомнение саму предпосылку контролируемых моделей с открытыми весами. Если безопасность любой модели с открытым исходным кодом можно хирургически удалить без дообучения, концепция «согласованного» ИИ с открытым кодом требует немедленного пересмотра.
Хотя Heretic может похвастаться впечатляющей минимизацией дивергенции Кульбака-Лейблера (KL divergence), некоторые встречные исследования вызывают опасения. Исследования показывают, что даже точные методы удаления (abliteration) могут вызывать тонкие, побочные эффекты (off-target effects) в характере модели или её базовой когнитивной структуре. Стандартные бенчмарки часто упускают эти нюансы в поведении или скрытые предвзятости, фокусируясь только на явных отказах или общих показателях интеллекта. Это подразумевает более глубокое, не поддающееся количественной оценке воздействие.
В конечном счете, Heretic ставит сложный вопрос: является ли надежное, постоянное согласование достижимым состоянием или лишь временным перемирием в продолжающейся гонке вооружений? Каждая разработанная функция безопасности, каждый примененный метод согласования становятся новой, идентифицируемой целью. Мы можем оказаться запертыми в бесконечной игре в кошки-мышки, где любая предполагаемая безопасность в конечном итоге может быть устранена с возрастающей легкостью, фундаментально меняя ландшафт разработки ИИ.
Часто задаваемые вопросы
Что такое инструмент Heretic AI?
Heretic — это инструмент командной строки с открытым исходным кодом, который автоматически удаляет фильтры безопасности и поведение отказа из языковых моделей ИИ с открытыми весами при минимальных усилиях со стороны человека.
Как Heretic удается не повредить интеллект ИИ?
Он использует оптимизатор параметров (Optuna) для одновременной минимизации отказов и дивергенции KL — метрики, которая измеряет, насколько измененная модель отклоняется от способностей к рассуждению оригинальной модели.
Что такое направленная абляция (Directional Ablation)?
Это базовая техника, которую использует Heretic. Основываясь на недавних исследованиях, она определяет, что поведение отказа модели контролируется одним «направлением» в ее внутренних представлениях, которое затем может быть хирургически подавлено.
Этично ли использовать Heretic?
Heretic — это инструмент двойного назначения. В то время как исследователи используют его для изучения согласования и интерпретируемости ИИ, его также можно легко использовать не по назначению для создания моделей, генерирующих вредоносный или опасный контент, что вызывает серьезные этические опасения.

