La sécurité des LLM ne se patche pas, elle s'immunise
Ce que vous allez apprendre
La sécurité d'un LLM peut-elle être définitivement assurée ? Non. Un LLM sécurisé à un instant t ne l'est plus dès qu'une nouvelle technique d'attaque émerge. L'ANSSI et le NIST le confirment : les défenses sont empiriques, les attaquants adaptatifs contournent 90% des garde-fous récents. La sécurité LLM est une vigilance continue, pas un état stable.
Notre LLM est sécurisé : la phrase rassure les comités de pilotage et expose les organisations. Derrière elle se cache une confusion fondamentale entre le patch logiciel, une correction ponctuelle sur une ligne coupable, et l'immunité biologique, qui ne se décrète pas mais s'entretient face à un adversaire qui mute en permanence. Selon dac.consulting, traiter la sécurité des LLM comme un projet à clore plutôt que comme un métabolisme vivant est l'erreur la plus coûteuse que commettent aujourd'hui les directions techniques et les comités de gouvernance IA. Dans cet essai, vous découvrirez pourquoi Edward Jenner éclaire mieux la sécurité LLM que n'importe quel framework de patch management, ce que les études de 2025-2026 révèlent sur la vitesse à laquelle les défenses deviennent obsolètes, et les quatre gestes concrets qu'un praticien applique pour passer d'une posture réactive à une vigilance immunitaire durable.
« On a sécurisé notre LLM »
La phrase revient à chaque comité de pilotage, prononcée avec le soulagement de qui a classé un dossier. On a passé le red-team, corrigé les prompts fautifs, verrouillé les garde-fous. Le sujet est clos.
Il ne l'est pas. La sécurité des LLM n'est pas un état qu'on atteint, c'est un métabolisme qu'on entretient. Dire « on a sécurisé notre LLM » revient à dire « j'ai attrapé la grippe une fois, je suis donc immunisé contre toutes les grippes à venir ».
Le virus mute. L'attaquant aussi. Et le modèle qui résistait hier n'est pas le même monde que celui qu'il affronte demain — non parce que ses poids ont changé, mais parce que l'écosystème des attaques, lui, a muté.
Edward Jenner n'a pas réparé un bug
En 1796, le médecin anglais Edward Jenner inocule à un enfant du pus de vaccine — la variole des vaches, bénigne chez l'homme. Puis il l'expose à la variole humaine, mortelle. L'enfant ne tombe pas malade. La vaccination est née, du latin vacca, la vache.
Ce que Jenner comprend, et que Pasteur formalisera un siècle plus tard, n'est pas une logique de réparation. On ne « corrige » pas le corps comme on colmate une fuite. On l'entraîne : on lui présente une menace atténuée pour qu'il apprenne à la reconnaître et à la neutraliser avant qu'elle ne frappe pour de bon.
C'est exactement la grammaire de l'adversarial training. On expose le modèle à des attaques connues — jailbreaks, injections, empoisonnements simulés — pour qu'il apprenne à les déjouer. Mais un système immunitaire efficace n'est jamais un stock de réponses figées : c'est une capacité adaptative permanente et coûteuse, maintenue en vigilance.
Et c'est là que la biologie devient féroce. Le biologiste Paul Ewald a montré, dans ses travaux sur l'évolution de la virulence, que la relation hôte-parasite n'est pas une guerre qu'on gagne mais une coévolution sans fin : chaque défense sélectionne les pathogènes capables de la contourner. Immuniser un hôte, c'est involontairement dessiner la prochaine mutation du parasite.
Ce que décrivent l'ANSSI et le NIST en 2026
Le détour n'est pas une coquetterie. Les institutions qui font autorité décrivent précisément cette dynamique.
Dans sa synthèse L'IA générative face aux attaques informatiques, publiée début 2026, l'ANSSI insiste sur la nécessité d'une réévaluation régulière de la menace, les techniques de contournement des garde-fous évoluant « constamment ». L'agence rappelle qu'un LLM peut être attaqué à l'entraînement, à l'intégration ou à l'interrogation — empoisonnement de données, portes dérobées, injection d'informations fausses, exfiltration.
Deux chiffres cités frappent. Une étude conjointe aurait montré qu'environ 250 documents malveillants suffiraient à empoisonner un modèle, indépendamment de sa taille. Et l'agence rapporte la compromission de plus de 100 000 comptes ChatGPT entre 2022 et 2023.
Le NIST va plus loin dans la théorie. Sa taxonomie Adversarial Machine Learning martèle que les défenses sont empiriques et incomplètes : sans garantie théorique, elles peuvent céder face à des techniques inédites. Surtout, une évaluation ne mesure la robustesse qu'à un instant t — elle expire dès qu'une nouvelle attaque, une nouvelle donnée ou une nouvelle capacité du modèle apparaît.
Voici le passage de l'anatomie à l'épidémiologie. Une faille logicielle classique se loge dans un composant identifiable, qu'on patche. Une vulnérabilité de LLM naît de l'interaction entre modèle, données, contexte, interface, outils et comportement de l'adversaire. On n'y désigne pas de ligne coupable — j'ai creusé ailleurs pourquoi l'on ne patche pas un poids. Ici, le problème n'est plus statique : il est temporel.
L'attaquant joue en second
La démonstration la plus brutale vient d'une étude de 2025, The Attacker Moves Second. Les auteurs reprochent aux évaluations de sécurité de tester les modèles contre des jeux fixes de jailbreaks connus — l'équivalent d'un vaccin contre la souche de l'an dernier.
Contre des attaquants adaptatifs, qui ajustent leur stratégie selon les réponses du système, ils contournent 12 défenses récentes avec un taux de réussite supérieur à 90 % dans la majorité des cas — là où les travaux initiaux annonçaient des taux proches de zéro.
La méthode est explicitement évolutionnaire. Un générateur propose des variantes d'attaque, les teste, conserve les plus prometteuses, les mute à nouveau. C'est la sélection naturelle appliquée au prompt malveillant. Le défenseur entraîne sur le connu ; l'attaquant mute vers l'inconnu.
Quatre gestes d'un praticien qui a cessé de croire au one-shot
Sur mes propres déploiements — agents connectés à des outils, pipelines RAG exposés à des documents externes — j'ai renoncé à l'illusion du système « sécurisé ». Je raisonne en termes de vigilance immunitaire. Quatre gestes structurent ce travail.
Le red-teaming est continu, pas ponctuel. Un audit annuel mesure une résistance à une date. Entre deux audits, l'écosystème a muté. Je programme des campagnes récurrentes, avec des attaquants qui s'adaptent à mes défenses précédentes.
Je surveille la dérive de la distribution des attaques. Comme un épidémiologiste traque l'émergence d'un variant, j'observe les tentatives réelles contre mes systèmes. Un nouveau motif d'injection qui apparaît est un signal, pas un incident isolé.
Le budget de sécurité est récurrent, jamais amorti. C'est le point le plus dur à faire accepter en comité. Un système immunitaire consomme de l'énergie en permanence, même sans infection. Provisionner la sécurité LLM comme une dépense one-shot est un contresens biologique.
La veille sur les incidents et les CVE est un réflexe. Les variants circulent vite dans la communauté offensive. La contamination d'un agent par un simple document téléchargé illustre cette porosité : j'ai détaillé la revalidation continue du contexte d'un agent comme antidote à l'illusion du contrôle unique.
La meilleure immunité est parfois l'absence d'exposition
La coévolution a un enseignement sombre : aucun hôte ne gagne définitivement. La reine Rouge court sans jamais atteindre l'arrivée. Prétendre immuniser totalement un LLM exposé à toutes les surfaces d'attaque, c'est promettre une victoire que la biologie refuse.
D'où l'honnêteté qui guide notre pratique du conseil en IA : la bonne réponse n'est pas toujours de mieux défendre. Elle est parfois de ne pas exposer le modèle à certaines surfaces — ne pas lui donner accès à tel outil, ne pas le brancher sur telle base, segmenter plutôt qu'ouvrir. Un organisme confiné à un environnement contrôlé n'a pas besoin de combattre tous les pathogènes de la planète.
Jenner n'a pas éradiqué la maladie en réparant un corps. Il a appris au corps à anticiper. La sécurité des LLM suit la même loi : on n'y patche pas une faille une fois pour toutes, on y entretient une vigilance qui mute aussi vite que ce qu'elle affronte. Le jour où un dirigeant me dira « notre LLM est définitivement sécurisé », je saurai qu'il a confondu l'immunité avec l'oubli.
Tableau de synthèse
| Section | Messages clés |
|---|---|
| Le contresens temporel | « On a sécurisé notre LLM » suppose un état figé. Or l'écosystème des attaques mute : la sécurité est un métabolisme, pas un dossier clos. |
| Le détour : Jenner et Ewald | La vaccination n'est pas une réparation mais un entraînement du système immunitaire. La coévolution hôte-parasite (Paul Ewald) montre que chaque défense sélectionne le prochain variant. |
| Ce que disent ANSSI et NIST | ANSSI : réévaluation régulière, ~250 documents suffisent à empoisonner un modèle, 100 000 comptes ChatGPT compromis. NIST : défenses empiriques et incomplètes, évaluation valable à un instant t seulement. |
| De l'anatomie à l'épidémiologie | Une faille logicielle a un composant coupable ; une vulnérabilité LLM naît d'une interaction dynamique. L'étude « The Attacker Moves Second » contourne 12 défenses à plus de 90 % via des attaques évolutionnaires. |
| 4 gestes de praticien | Red-teaming continu, surveillance de la dérive des attaques, budget de sécurité récurrent, veille sur incidents et CVE. |
| Honnêteté dac.consulting | La meilleure défense est parfois de ne pas exposer le modèle à certaines surfaces d'attaque plutôt que de prétendre l'immuniser totalement. |