← édition du 2026-06-30
Signal Tech2026-06-30 · Lecture 1 min

La sécurité des LLM est un château de cartes

Le fait Deux chercheurs indépendants, Charles Ye et Jasmine Cui, avec Dylan Hadfield-Menell, professeur associé au MIT, ont publié un papier pour ICML 2026 qui démontre que les "rôles" (system/user/assistant) utilisés pour sécuriser les LLM ne survivent pas dans les représentations internes du modèle. Les tags de rôles étaient "une astuce de formatage devenue architecture de sécurité" (The Register).

Et alors, lundi matin Si tu construis des produits IA qui touchent des données sensibles, les guardrails par prompt ne suffisent pas. Valide les sorties côté code, pas côté modèle. Chaque input utilisateur est un vecteur d'attaque potentiel. Pense validation applicative, pas consigne system.

— Le papier, pas la panique. Lis-le si tu ship des agents.

Sourcé Source

Le contexte Ce signal vient de l'édition du 2026-06-30, où il est remis dans la sélection du jour.

Signal Tech - propulsé par Nuvo ReachRecevoir le Brief →