Le fait Fernando Irarrazaval a lance un defi public : hacker son assistant IA (OpenClaw, base sur Opus 4.6). 2 000 participants, 6 000 tentatives, 500 dollars de tokens. Personne n'a reussi a extraire les secrets. Les labs ont clairement progresse sur la resistance a l'injection de prompt (source).
Et alors, lundi matin Bonne nouvelle pour la securite des assistants IA en facade client. Mais Simon Willison le dit lui-meme : 6 000 echecs ne garantissent rien contre une attaque plus sophistiquee. Ne mets toujours pas de donnees irreversibles derriere un prompt.
pour les cas critiques. OK pour du support client standard.
Sourcé Source
Le contexte Ce signal vient de l'édition du 2026-06-27, où il est remis dans la sélection du jour.