DeepSeek AI fait face à des problèmes de sécurité concernant une prétendue méthode de jailbreak

Un utilisateur du forum aaurait partagé une méthodeconçu pour contourner les restrictions de contenu de DeepSeek AI, mais cette affirmation reste non vérifiée pour le moment. L'utilisateur affirme que l'invite de jailbreak peut aider à générer du contenu restreint. Cela a soulevé de nouvelles inquiétudes quant à la sécurité des modèles d’IA populaires.

DeepSeek est une société chinoise d'intelligence artificielle. Il a attiré l’attention du monde entier grâce à son puissant chatbot. De nombreuses personnes l'utilisent pour diverses tâches. Cependant, comme d’autres systèmes d’IA, il intègre des règles de sécurité.

Ces règles empêchent la génération de contenus préjudiciables ou illégaux. Certains utilisateurs tentent d'enfreindre ces règles. Ils utilisent des invites spéciales appelées « jailbreaks ». Ces invites incitent l’IA à ignorer ses consignes de sécurité.

Comprendre les tentatives de jailbreak et leurs risques

Les tentatives de jailbreak existent depuis un certain temps. De nombreux programmes d’IA ont été confrontés aux mêmes problèmes. Pour trouver un moyen de contourner les filtres, les utilisateurs utilisent diverses techniques de jeu de rôle. Par exemple, les utilisateurs peuvent demander à l’IA d’ignorer les règles d’un certain personnage. Les vulnérabilités des systèmes d’IA constituent un élément clé duinconvénients de l'IA en cybersécurité.

Le personnage proposera alors une réponse sans restriction. Une technique fréquemment applicable consiste à construire un univers fictif. Dans cet univers, il n’y a pas de règles ou de conformité normales, et l’IA commencera à agir comme si elle se trouvait dans ce monde.

Certains experts affirment que les restrictions de sécurité réduisent l’utilité de l’IA. Ils affirment que ces restrictions rendent l’IA moins intelligente. Cependant, DeepSeek a reconnu les risques.

La société a déclaré que les modèles d’IA peuvent être utilisés à mauvais escient. Ils ont également mis en garde contre les « hallucinations ». C’est à ce moment-là que l’IA génère des informations incorrectes. DeepSeek a admis qu'il ne pouvait garantir que ses modèles n'hallucineraient jamais.

DeepSeek a pris des mesures pour résoudre les problèmes de sécurité. La société ajoute désormais des étiquettes au contenu généré par l’IA. Ils ont également publié un document expliquant la formation de leur modèle. Ce document décrit comment l'IA apprend et génère des réponses.

De plus, DeepSeek a déclaré filtrer les données de formation. Ils suppriment les contenus contenant des discours de haine et de violence. Ils s’efforcent également de réduire les biais dans leurs données.

Les mesures de sécurité et les vulnérabilités de DeepSeek

DeepSeek affirme prendre la sécurité très au sérieux. Cependant, les chercheurs en sécurité ont découvert des faiblesses ; par exemple, certains ont découvert que les versions officielles de DeepSeek 2.1.0 et 2.1.1 présentaient une vulnérabilité. Les attaquants pourraient utiliser une invite basée sur les rôles pour désactiver toutes les restrictions. Le modèle fournirait alors du code malveillant et des informations dangereuses. La société a ensuite corrigé ces versions.

Il existe également un rapport officiel de la communauté DeepSeek. Le rapport répertorie plusieurs problèmes de sécurité non résolus depuis mai de cette année. Certains de ces problèmes impliquent des jailbreaks. Un rapport mentionne un « jailbreak NetError ». Il s’agit d’une méthode d’injection rapide basée sur les rôles. Le rapport indique que ce problème n’est toujours pas résolu. Un autre problème concerne le mode de réflexion. Les attaquants peuvent utiliser ce mode pour créer de fausses informations d'identification. Cela montre que même les chaînes officielles reconnaissent les problèmes persistants.

Quelques développeurs conçoivent des versions non censurées de DeepSeek. Ils ont modifié le modèle original et supprimé ses dispositifs de sécurité. Par exemple, ils ont créé le « DeepSeek-V4-Flash-DSpark-Abliterated » spécifiquement pour contourner presque toutes les mesures de sécurité.

Selon son créateur, cette version modifiée présente un taux de contournement de refus de 100 % ; ainsi, l'IA acceptera de faire n'importe quoi. Ces versions modifiées ne doivent être utilisées qu’à des fins de recherche. Néanmoins, cela prouve qu’il est si simple de supprimer les mesures de sécurité intégrées.

D’autres problèmes de sécurité entourent DeepSeek

La revendication de jailbreak n’est pas le seul problème auquel DeepSeek est confronté. Les experts en sécurité ont découvert d'autres faiblesses dans le système. Un problème majeur concerne une nouvelle méthode d’attaque appelée « interruption du raisonnement ». Cette attaque oblige l’IA à arrêter son processus de réflexion. En conséquence, le modèle produit des réponses vides ou inutiles. Les chercheurs ont découvert que cette faille affecte le modèle officiel DeepSeek-R1.

Une autre vulnérabilité est apparue en juillet. Celui-ci implique le serveur DeepSeek MCP, un outil destiné aux développeurs. Le problème permet aux attaquants de prendre le contrôle des conversations des utilisateurs. Ils peuvent voler des identifiants de session et accéder à des discussions privées. La société a publié un correctif pour résoudre ce problème, mais la vulnérabilité avait un score de gravité élevé de 8,6 sur 10. Cela montre que le risque était important.

En outre, un rapport communautaire de mai de cette année a répertorié plusieurs problèmes de sécurité non résolus. Il s’agit notamment du « jailbreak NetError », qui reste non corrigé. Les attaquants peuvent également exploiter le « mode réflexion » de l’IA pour créer de fausses informations d’identification. Le rapport note que les menaces proviennent désormais de trois niveaux. Il s'agit du modèle lui-même, des applications Web et de l'infrastructure. Cela signifie que l’ensemble du système de DeepSeek est confronté à des risques.

Le débat plus large sur la sécurité et la censure de l’IA

L’information est apparue au milieu d’un débat continu autour de l’IA. Les gouvernements du monde entier évaluent les logiciels d’intelligence artificielle – par exemple, la Chine analyse la sensibilité politique des modèles d’IA.

Ces partis recherchent des contributions positives des modèles d’IA aux principes clés des valeurs socialistes. Les États-Unis ont également souligné les défis. L'un des rapports américains a révélé que DeepSeek empêche de nombreuses réponses liées à des questions telles que les droits de l'homme et la démocratie.

Huawei a même créé une version sécurisée de DeepSeek. Cette version répond aux normes du gouvernement chinois. Il ne générera pas de contenu politiquement sensible. L'entreprise l'a développé avec l'Université du Zhejiang. Ils ont utilisé les propres puces de Huawei pour le projet. Cela montre une pression pour des modèles d’IA qui s’alignent sur les réglementations gouvernementales.

La technique de jailbreak revendiquée n’est qu’un cas parmi tant d’autres. Cela prouve la guerre en cours entre les créateurs d’IA et ses utilisateurs. Des développeurs comme DeepSeek tentent de mettre fin à l’utilisation abusive de la technologie.

Cependant, les utilisateurs réfléchissent constamment à différentes méthodes pour briser les limites de la technologie. Le rapport de la communauté montre que la zone d’attaque ne cesse de s’étendre. Les couches de modèles, les applications Web et l'infrastructure créent aujourd'hui des menaces. Cela signifie que tout le système est susceptible.