Skip to content
KI-Werkzeug

Heretic Review

Heretic ist ein Open-Source-Kommandozeilen-Tool, das automatisch Sicherheitsfilter und Verweigerungsverhalten aus Open-Weight-KI-Sprachmodellen mit minimalem menschlichen Aufwand entfernt.

shipped 27. Aug. 2026freemium
Heretic - AI tool for heretic. Professional illustration showing core functionality and features.

Warum es wichtig ist

1Open-Source-Kommandozeilen-Tool für KI-Sprachmodelle.
2Entfernt automatisch Sicherheitsfilter und Verweigerungsverhalten.
3Unterstützt LoRA-Adapter und 4-Bit-Quantisierung seit v1.2.0 (Februar 2026).
4Integriertes Benchmarking-System (MMLU, EQ-Bench, GSM8K, HellaSwag) eingeführt in v1.3 (Mai 2026).

overview

Was ist Heretic?

Heretic ist ein KI-Tool, das von Philipp Emanuel Weidmann entwickelt wurde und es Benutzern ermöglicht, Sicherheitszensur und Verweigerungsverhalten automatisch aus transformatorbasierten großen Sprachmodellen (LLMs) zu entfernen. Dies wird durch eine fortschrittliche Implementierung der direktionalen Ablation in Kombination mit einem Tree-structured Parzen Estimator (TPE)-Optimierer, der von Optuna angetrieben wird, erreicht, indem interne Modellgewichte modifiziert werden, um Tendenzen zur Verweigerung bestimmter Prompts zu eliminieren.

features

Hauptmerkmale von Heretic

Heretic bietet eine Reihe von Funktionen, die darauf ausgelegt sind, Open-Weight-KI-Sprachmodelle zu modifizieren und zu analysieren, wobei der Fokus auf der Entfernung von Sicherheitsausrichtungen und Verweigerungsverhalten liegt.

  • Automatisches Entfernen von Sicherheitsfiltern aus KI-Sprachmodellen.
  • Eliminierung von Verweigerungsverhalten aus KI-Sprachmodellen.
  • Kompatibilität mit Open-Weight-KI-Sprachmodellen.
  • Kommandozeilen-Schnittstelle für direkte Interaktion.
  • Open-Source-Verfügbarkeit zur Überprüfung und Modifikation durch die Community.
  • Unterstützung für LoRA-Adapter und 4-Bit-Quantisierung (v1.2.0, Februar 2026).
  • Reproduzierbare Ausführungen über verschiedene Hardware- und Softwareumgebungen hinweg (v1.3, Mai 2026).
  • Integriertes Benchmarking-System unter Verwendung von lm-evaluation-harness (v1.3, Mai 2026).
  • Reduzierter Spitzen-VRAM-Verbrauch für die Verarbeitung größerer Modelle (v1.3, Mai 2026).
  • Breite Modellunterstützung, einschließlich Qwen3.5, Gemma 4 und IBM Granite MoE (v1.3, Mai 2026).

use cases

Wer sollte Heretic verwenden?

Heretic wurde primär für Einzelpersonen und Organisationen entwickelt, die eine feingranulare Kontrolle über das Verhalten von KI-Modellen benötigen, insbesondere in Bezug auf Sicherheitsausrichtungen und Inhaltsgenerierung.

  • Modell-Anpassung: Benutzer, die vollständig reaktionsfähige Modelle ohne Sicherheitseinschränkungen für spezifische Anwendungen oder Präferenzen suchen.
  • Modellforschung und Interpretierbarkeit: Forscher, die interne Modellsemantik erkunden, Restvektortransformationen visualisieren und Mechanismen der Sicherheitsausrichtung verstehen möchten.
  • Leistungsoptimierung: Entwickler, die ein Gleichgewicht zwischen der Entfernung von Zensur und der Bewahrung der ursprünglichen Intelligenz und Qualität eines Modells anstreben.
  • Bildung: Studenten und Praktiker, die an praktischen Anwendungen der Sicherheitsausrichtung von Sprachmodellen und Ablationstechniken interessiert sind.

how to use

Wie man Heretic verwendet

Heretic wird als Python-Kommandozeilen-Tool installiert, das es Benutzern ermöglicht, LLM-Gewichte zu modifizieren, um Verweigerungsrichtungen mit minimalem menschlichen Aufwand zu entfernen.

  • 1Heretic über pip installieren oder das GitHub-Repository klonen.
  • 2Ein Ziel-Open-Weight-KI-Sprachmodell zur Modifikation identifizieren.
  • 3Heretic von der Kommandozeile ausführen, dabei das Modell und die gewünschten Ablationsparameter angeben.
  • 4Das integrierte Benchmarking-System nutzen, um die Leistung des modifizierten Modells zu bewerten.
  • 5Das 'entschärfte' Modell für benutzerdefinierte Anwendungen oder weitere Forschung bereitstellen.

pricing

Heretic Preise & Pläne

Heretic basiert auf einem Freemium-Modell. Das Kern-Kommandozeilen-Tool ist Open-Source und kostenlos nutzbar, sodass Benutzer es ohne Kosten installieren und ausführen können. Obwohl das Tool selbst kostenlos ist, deutet die Bezeichnung 'Freemium' auf potenzielle zukünftige Premium-Optionen oder -Dienste hin, obwohl zum aktuellen Zeitpunkt keine expliziten Details dazu vorliegen.

  • Freemium: Kostenlos mit Premium-Optionen (Details nicht spezifiziert)

Pros

  • +Automated removal of safety filters and refusal behaviors from LLMs.
  • +Preserves original model intelligence with low KL divergence (e.g., 0.16).
  • +Open-source and accessible via pip install for local use.
  • +Offers an on-demand decensoring service for various model sizes without local GPU.
  • +Outperforms manual ablation and some other abliteration tools in benchmarks.
  • +Provides a training-free alternative to expensive fine-tuning for decensoring.

Cons

  • Requires Python 3.10 or later for local installation.
  • On-demand service tiers are limited by access token and wallet balance.
  • Primarily a command-line tool, lacking a graphical user interface.
  • Focuses specifically on filter removal, not general model deployment or interaction.
  • Raises ethical concerns among policymakers regarding uncensored AI capabilities.

Ähnliche Tools

Heretic vs. Konkurrenten

Heretic zeichnet sich dadurch aus, dass es den komplexen Prozess der direktionalen Ablation automatisiert, eine Aufgabe, die zuvor erheblichen manuellen Aufwand und spezialisiertes Fachwissen erforderte.

1

Provides a C/C++ implementation for running LLaMA and other open-weight models locally on consumer hardware, primarily via command-line.

Heretic aims to automatically remove filters from existing models. llama.cpp provides the raw, unfiltered access to the model's core inference, allowing users to implement their own prompting strategies or use models that inherently lack strong safety filters. It requires more manual effort in crafting prompts compared to Heretic's automated approach.

2

A comprehensive, script-based web UI for running and interacting with various open-weight LLMs locally, offering extensive control over generation parameters and prompt engineering.

While it primarily presents a web UI, it is launched and managed via command-line scripts, giving users deep control over model behavior and allowing for advanced prompt engineering to bypass model guardrails. Heretic is purely CLI and focuses on automated filter removal, whereas this tool provides a flexible environment for manual experimentation and control.

3
KoboldCpp

A user-friendly, locally runnable inference server for `llama.cpp` compatible models, offering both a web UI and a CLI mode for direct interaction and fine-tuning of generation parameters.

Like Heretic, KoboldCpp allows for local interaction with open-weight models. It provides a more integrated experience for running models and offers a CLI mode for direct control, which can be used to craft prompts and settings that bypass typical safety mechanisms, though it doesn't automate filter removal in the same way Heretic does.

4
MLC LLM

A universal deployment framework that allows users to compile and run LLMs locally on various hardware platforms, providing fine-grained control over model execution via its command-line interface.

MLC LLM focuses on the deployment and execution of LLMs, giving users direct control over the model's runtime environment and parameters through its CLI. This allows for interaction with models without higher-level safety wrappers, similar to Heretic's goal, but requires more technical setup for model compilation and deployment rather than just automated filter removal.

Mehr auf Stork

Verwandte KI-Tools

Weitere Tools dieser Kategorie, über gemeinsame Tags zugeordnet

Featured in articles