Skip to content
ai tools

Cet outil supprime la sécurité de l'IA

Un nouvel outil open-source peut supprimer chirurgicalement les filtres de sécurité d'une IA en quelques minutes, sans altérer son intelligence. Cela expose une fragilité fondamentale dans la manière dont nous construisons une IA « sûre », avec des millions de modèles non censurés déjà en circulation.

Theo Brandt
Cet outil supprime la sécurité de l'IA

L'interrupteur éthique de l'IA

Heretic, un nouvel outil open-source dangereux, supprime automatiquement les garde-fous de sécurité des modèles d'IA à poids ouverts. Il ne nécessite aucun fine-tuning ni aucun effort humain, automatisant complètement la suppression des comportements de refus. Il ne s'agit pas seulement de jailbreaking ; c'est une frappe chirurgicale utilisant l'ablation directionnelle, basée sur un article de recherche de 2024 révélant que le comportement de refus d'un modèle est contrôlé par une direction unique dans son flux résiduel. Heretic calcule cette « direction de refus » et modifie chirurgicalement les matrices de poids pour la supprimer.

L'adoption de l'outil est explosive. En mai 2026, Heretic compte plus de 20 000 étoiles sur GitHub et 13 millions de téléchargements cumulés. Cette vague a engendré plus de 4 000 modèles non censurés créés par la communauté, désormais facilement disponibles sur HuggingFace, démontrant une capacité généralisée à contourner les garde-fous éthiques.

Les méthodes précédentes exigeaient que des experts humains ajustent manuellement les paramètres pendant des heures, modèle par modèle, un processus complexe et fastidieux. Heretic, un simple outil en ligne de commande basé sur Python, change la donne. Il décensure un modèle de 4 milliards de paramètres en environ 20 minutes sur une RTX 3090, ou un modèle de 8 milliards en 45 minutes, tout en préservant le raisonnement réel du modèle avec une divergence KL minimale (0,16 sur Gemma 3 contre 1,04 pour les méthodes manuelles), rendant la modification robuste des modèles accessible à tous.

À l'intérieur du moteur d'« ablitération »

Le comportement de refus n'est pas un concept nébuleux. L'ablation directionnelle, basée sur des recherches de 2024, postule qu'il s'agit d'une « direction » unique et identifiable au sein du flux résiduel d'un transformeur. Identifiez ce vecteur, puis modifiez chirurgicalement les matrices de poids du modèle pour le supprimer. Ce concept fondamental soutient la puissance de Heretic.

Heretic automatise tout ce processus, éliminant le besoin d'heures de réglage manuel par des chercheurs humains. Il calcule d'abord la direction de refus comme une différence précise de moyennes entre les activations de prompts nuisibles et inoffensives. Ensuite, un optimiseur de paramètres spécialisé, alimenté par la bibliothèque Optuna, recherche les paramètres d'ablation optimaux pour modifier précisément les poids du modèle.

De manière cruciale, cet optimiseur minimise deux objectifs : éliminer les refus et maintenir une divergence KL minimale par rapport au modèle original. Cette innovation préserve l'intelligence du modèle, une lacune courante d'autres outils d'ablitération qui détruisent les capacités de raisonnement. Sur le modèle Gemma de 12 milliards de paramètres, Heretic a atteint le même taux élevé de suppression des refus que les méthodes manuelles bien connues. Pourtant, sa divergence KL n'était que de 0,16, nettement supérieure au 1,04 de la méthode manuelle, prouvant qu'il infligeait beaucoup moins de dommages à l'intelligence inhérente du modèle.

Un outil pour construire et pour briser

Heretic sert un double objectif : un instrument puissant pour construire et pour briser. Pour les chercheurs, c'est un outil d'interprétabilité critique. Ils cartographient la façon dont des concepts comme le « refus » se manifestent dans l'état interne d'un transformeur, traçant littéralement sa représentation dans le flux résiduel. Heretic est livré avec des fonctionnalités d'analyse intégrées spécifiquement pour tracer et analyser ces vecteurs résiduels, aidant à l'étude de l'ablation directionnelle.

Au-delà de la recherche pure, Heretic soumet les techniques d'alignement actuelles à des tests de résistance. Il expose des méthodes comme le RLHF comme étant des safety filters fragiles et superficiels plutôt que des changements fondamentaux du comportement central d'un modèle. L'outil démontre à quel point ces garde-fous s'effondrent facilement sous la pression, révélant les capacités sous-jacentes non filtrées et prouvant que l'alignement agit souvent comme un mince vernis sur la sortie brute du modèle.

Cependant, les risques immédiats sont frappants et indéniables. Cet outil open-source supprime les filtres de sécurité de modèles populaires comme Llama 3 et Gemma en quelques minutes, sans nécessiter de fine-tuning ni d'effort manuel, permettant ainsi la génération d'instructions nuisibles. Décensurer un modèle de 4B paramètres prend environ 20 minutes sur une RTX 3090, tandis qu'un modèle de 8B prend environ 45 minutes. Plus de 4 000 modèles créés par la communauté sur HuggingFace utilisent déjà Heretic, illustrant son adoption généralisée à des fins légitimes comme illicites. Trouvez plus de détails techniques ici : GitHub - p-e-w/heretic: Fully automatic censorship removal for language models.

Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.

un e-mail par jour · désinscription en deux clics · aucun traqueur tiers

L'« alignement » n'est-il qu'une illusion ?

Heretic force une conversation inconfortable sur les stratégies de AI safety et l'éthique de l'open-source. Son ablation automatisée et sans effort révèle la fragilité inhérente des garde-fous actuels, remettant en question le principe même des modèles open-weight contrôlés. Si la sécurité de n'importe quel modèle open-source peut être supprimée chirurgicalement sans fine-tuning, le concept d'IA open-source « alignée » exige une réévaluation immédiate.

Bien qu'Heretic se targue d'une minimisation impressionnante de la divergence KL, certaines contre-recherches soulèvent des signaux d'alarme. Des études suggèrent que même des méthodes d'ablation précises pourraient induire des off-target effects subtils sur la disposition ou la structure cognitive sous-jacente d'un modèle. Les benchmarks standards passent souvent à côté de ces changements nuancés de comportement ou de biais latents, se concentrant uniquement sur les refus explicites ou les scores d'intelligence générale. Cela implique un impact plus profond et non quantifié.

En fin de compte, Heretic soulève une question difficile : un alignment robuste et permanent est-il un état réalisable, ou simplement une trêve temporaire dans une course aux armements permanente ? Chaque fonctionnalité de sécurité conçue, chaque technique d'alignement déployée, devient une nouvelle cible identifiable. Nous pourrions être enfermés dans un jeu perpétuel du chat et de la souris, où toute sécurité perçue peut finalement être éliminée avec une facilité croissante, modifiant fondamentalement le paysage du développement de l'IA.

Foire aux questions

Qu'est-ce que l'outil d'IA Heretic ?

Heretic est un outil en ligne de commande open-source qui supprime automatiquement les filtres de sécurité et les comportements de refus des modèles de langage IA open-weight avec un minimum d'effort humain.

Comment Heretic évite-t-il d'endommager l'intelligence d'une IA ?

Il utilise un optimiseur de paramètres (Optuna) pour minimiser simultanément les refus et la divergence KL, une métrique qui mesure à quel point le modèle modifié s'écarte des capacités de raisonnement de l'original.

Qu'est-ce que l'ablation directionnelle (Directional Ablation) ?

C'est la technique sous-jacente utilisée par Heretic. Basée sur des recherches récentes, elle identifie que le comportement de refus d'un modèle est contrôlé par une « direction » unique dans ses représentations internes, qui peut ensuite être supprimée chirurgicalement.

L'utilisation d'Heretic est-elle éthique ?

Heretic est un outil à double usage. Bien que les chercheurs l'utilisent pour étudier l'alignement et l'interprétabilité de l'IA, il peut également être facilement détourné pour créer des modèles générant du contenu nuisible ou dangereux, soulevant des préoccupations éthiques importantes.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only