← toutes les éditions
Signal Tech2026-08-19 · Lecture 3 min · Édition publiée

Signal Tech #25 - Le vrai levier coût sur tes appels LLM, ce n'est pas le modèle

200 sources lues. 5 gardées.

L'OUVERTURE

Cette semaine, tout le monde compare des modèles. Lequel est le moins cher. Lequel est le plus rapide. Pendant ce temps, le vrai levier coût dort dans ton architecture : les appels que tu ne fais pas. Trois signaux sur l'infrastructure IA, un rappel de sécurité, et un check-list pour ceux qui livrent des sites WordPress avec Claude.

LES SIGNAUX DU JOUR

01Le cache LLM qui divise ta facture avant de toucher au modèle

Le fait Un retour terrain sur une couche de cache à trois niveaux pour les appels LLM : cache exact (hash de la requete complète), cache sémantique (requetes proches), et pré-calcul des étapes déterministes. Le constat de départ : une large part du trafic de production re-pose des questions quasi identiques, re-embed le meme system prompt, re-calcule les memes étapes de pre/post-processing a chaque requete. (source)

Et alors, lundi matin Si tu fais tourner des agents ou des pipelines RAG, mesure le taux de duplication de tes appels avant de négocier un meilleur tarif par token. La plupart des équipes sautent cette étape parce que ca manque de glamour. Pourtant le cache exact se pose en une heure et coupe immédiatement les appels redondants. Le coût par token est le mauvais indicateur : c'est le nombre d'appels réellement nécessaires qui compte.

ON ACHETE


02DeepSeek, Qwen, Kimi, GLM : la carte réelle après 47 millions de requetes

Le fait Un architecte a poussé 47 millions de requetes sur les quatre modèles chinois majeurs via un endpoint unifié, avec des tests de charge, du trafic bursty sur trois régions, et des mesures de cold-start. Les prix : DeepSeek V4 Flash a 0,25 $/M tokens, Qwen3-8B a 0,01 $/M, GLM-4-9B a 0,01 $/M. DeepSeek domine en code et en anglais. Kimi (K2.5 a 3 $/M) est le plus cher et le moins polyvalent hors taches chinoises. (source)

Et alors, lundi matin Pour du routing multi-modèles sur des taches a faible enjeu (résumé, classification, extraction), Qwen3-8B ou GLM-4-9B a 0,01 $/M tokens sont des options sérieuses en second tier. Pour du code ou du raisonnement complexe, DeepSeek tient la route a un prix plancher. Mais attention : latence p99 au-dela de 800 ms sur les pics, et la disponibilité n'est pas celle d'un Anthropic ou d'un OpenAI. A tester sur des taches non critiques, pas en production client sans fallback.

ON ATTEND (pour la prod client ; OK pour l'interne)


03Le stack agent 2026 : le framework est le dernier de tes problèmes

Le fait Retour d'un consultant qui a vu une équipe reconstruire son agent sur trois frameworks différents en un mois. Son diagnostic : tous les frameworks compilent vers la meme boucle (modèle, contexte, outils, condition d'arret). Ce qui sépare un agent de prod d'une démo, c'est la mémoire, l'orchestration, l'observabilité et la discipline. Pas le framework. (source)

Et alors, lundi matin Si ton équipe hésite entre LangChain, CrewAI ou un truc maison : arrete le débat. Choisis celui que ton équipe connait. Investis le vrai temps sur : comment ton agent retient le contexte entre les sessions, comment tu traces ce qu'il fait (et ce qu'il rate), et comment tu gères les couts quand il boucle. Le framework, c'est 10 % du problème. La plomberie autour, c'est 90 %.

ON ACHETE (le principe, pas un framework en particulier)


04Tu livres des sites WordPress avec l'IA : voila ce que tu oublies

Le fait Un dev documente les vérifications spécifiques aux sites WordPress construits avec l'IA qui passent systématiquement a la trappe. En tete : la case "Demander aux moteurs de recherche de ne pas indexer ce site" dans Réglages > Lecture, laissée cochée après le dev. Ensuite : le compte admin par défaut jamais supprimé (l'attaquant n'a plus qu'a deviner le mot de passe). Et WP_DEBUG laissé a true en production. (source)

Et alors, lundi matin Si tu fais du WordPress pour des clients (et beaucoup d'agences en font), ajoute ces trois checks a ta checklist de livraison. L'IA génère du code qui marche. Elle ne pense pas au noindex qui reste coché, ni au compte admin qui traine. C'est exactement le genre de truc qui te coute un client trois mois après la livraison quand il te dit "mon site n'apparait pas sur Google".

ON ACHETE (c'est gratuit, c'est une checklist)


05Ton parser Markdown n'est pas ta frontière XSS

Le fait Test documenté avec Node.js 25.3.0, Marked 18.0.7 et DOMPurify 3.4.12 : un parser Markdown produit du HTML syntaxiquement correct qui contient des vecteurs XSS actifs. Exemple : `<img src=x onerror="alert(1)">` passe le parsing Markdown sans broncher. C'est DOMPurify qui retire l'attribut dangereux, pas le parser. Les schémas d'URL (javascript:, data:) passent aussi le parser et doivent etre filtrés séparément. (source)

Et alors, lundi matin Si ton app affiche du contenu Markdown soumis par des utilisateurs (commentaires, chat, CMS custom), vérifie que tu as DOMPurify ou équivalent APRES le parsing. Le parser fait son job : il transforme du Markdown en HTML. La sécurité, c'est une couche séparée. Beaucoup d'apps internes d'agences ont un CMS maison avec du Markdown. Si tu n'as pas de sanitizer en sortie, tu as une faille.

ON ACHETE (c'est un fix, pas un achat)


LE VERDICT

Tout le monde s'excite sur le choix du framework agent. Voila ce que personne ne te dit.

C'EST DU BRUIT Choisis un framework en 30 minutes. Passe 30 jours sur ce qu'il y a autour.


EN PARTENARIAT AVEC NUVO REACH

Slot maison, on le dit. Tu lis Signal Tech pour trier le signal du bruit. On fait la meme chose pour ta production de contenu : on cable l'IA dans ta chaine éditoriale pour que tu publies sans y passer tes soirées. Pas de la magie, de la plomberie qui marche.

Voir comment on fait


EN BREF


LE CABLAGE


LE SONDAGE

Tu utilises du cache sur tes appels LLM en production ?

A) Oui, cache exact (hash de requete)

B) Oui, cache sémantique (requetes similaires)

C) Non, mais c'est prévu ce trimestre

D) Non, et je ne savais pas que c'était un levier

Résultats d'hier : "Quel % de ton CA vient de clients qui t'ont trouvé via ton contenu ?"

0-10 % : 47 % | 10-30 % : 31 % | 30-50 % : 14 % | +50 % : 8 %


Jeremy

PS - Signal Tech ouvre un slot partenaire par édition. Si tu vends un outil ou un service utile aux fondateurs d'agences, écris-moi. Pas de placement déguisé : ton nom, ton truc, ton lien, et on dit que c'est un partenaire.

Signal Tech - propulsé par Nuvo ReachRecevoir le Brief →