← toutes les éditions
Signal Tech2026-07-05 · Lecture 3 min · Édition publiée

Tu paies ton GPU ou tu paies ta RAM — choisis ton camp

L'IDÉE DU JOUR

Le benchmark de la semaine met un chiffre sur un truc que tout le monde sent sans le mesurer : vLLM écrase llama.cpp en throughput (3.9x à 5.4x en concurrence 8) tant que le modèle tient dans la VRAM. Mais dès qu'il déborde, vLLM plante. Point. OOM à 22.1 GB utilisés.

Ce que personne ne dit : c'est un choix d'architecture business, pas un bug.

Si tu montes un service IA interne pour ton agence, tu as deux routes. Route A : tu restes dans les 24 GB, tu prends vLLM, tu sers 8 requêtes en parallèle, ton coût par token est ridicule. Route B : tu veux un modèle plus gros (parce que le client le demande, parce que la qualité l'exige), tu bascules sur llama.cpp, tu acceptes du single-digit tok/s, et tu compenses par du batching asynchrone.

Le piège : croire qu'un modèle MoE de 106B "passe" parce que ses paramètres actifs sont légers. Il passe. À 3 tok/s. Ton utilisateur attend 45 secondes.

La vraie question pour toi lundi matin : quel modèle est assez bon pour ton use case ET tient dans ta VRAM disponible ? Pas quel modèle est le plus impressionnant sur un leaderboard.

LE RESTE DU SIGNAL

01Les agents coding "gratuits" arrivent en masse

Le fait Codeably : agent terminal autonome, boucle Observe-Think-Act-Verify, 7 providers dont Groq (Llama 3.3 70B, 14 400 requêtes/jour gratuites) et Gemini Flash (1 500 req/jour gratuites). Un `npx codeably "ta tâche"` et ça tourne.

Et alors Le prix plancher des outils de code IA converge vers zéro. La valeur se déplace du modèle vers l'orchestration (qualité de la boucle, gestion du contexte, rollback). Si tu paies encore 20$/mois pour un outil qui fait la même chose qu'un script open-source + une clé API gratuite, pose-toi la question.

— Fonctionne pour du scripting simple. Pour du code critique, la boucle autonome sans supervision reste risquée.


02Apple augmente ses prix, Meta attaque sans Ray-Ban

Le fait Apple relève ses tarifs en réaction à la pénurie de composants et pointe les fabricants de RAM. Meta lance des lunettes "Meta Glasses" sans la marque Ray-Ban pour élargir sa distribution (https://www.numerama.com/tech/2286537-nouveaux-prix-apple-lunettes-meta-glasses-et-avenir-dapple-pay-en-france-le-recap-tech-de-la-semaine.html).

Et alors Deux signaux opposés. Apple transfère le coût supply chain au client final. Meta absorbe le coût de marque pour baisser le prix d'entrée. Si tu vends du hardware ou du service lié à un écosystème, la question n'est plus "quel est le meilleur produit" mais "qui peut tenir ses prix 18 mois".

— Sauf si tu dépends d'un parc Apple pour tes équipes. Là, budgétise +10-15% sur le prochain renouvellement.


03Le context engineering comme discipline

Le fait Deux articles convergent sur le même constat : plus de contexte ne veut pas dire meilleur résultat. Au-delà d'un seuil, le modèle oublie, hallucine, ou ignore. La recommandation : traiter sa consommation d'info IA comme une architecture logicielle. Filtrer en amont, pas en aval.

Et alors Si tu bourres 50 fichiers dans ton prompt "pour être sûr", tu paies plus cher ET tu obtiens un résultat pire. Le vrai skill 2026 : savoir quoi ne PAS donner au modèle.

— Applique ça dès lundi. Moins de contexte, mieux ciblé, meilleur output.

LE SONDAGE

Tu fais tourner des modèles en local pour ton business ?

LE MOT DE LA FIN

Le filtre, c'est le produit. Pas le modèle, pas le GPU, pas le framework. Le filtre.

Si cette edition t'a fait gagner 20 minutes de veille, forwarde-la a un fondateur qui scrolle encore Twitter pour "rester a jour".


SOURCES UTILISÉES :

[S1] https://dev.to/sikamikanikobg/vllm-vs-llamacpp-vs-ollama-what-happens-when-your-model-doesnt-fit-in-24gb-vram-56eb

[S2] https://dev.to/adamya_singhshengar_998/i-built-a-free-autonomous-coding-agent-for-your-terminal-bring-your-own-api-key-g0e

[S3] https://dev.to/nextbigcreative/cutting-the-hype-an-engineering-protocol-for-tracking-llm-innovations-fbi

[S4] https://dev.to/fazal_mansuri_/ai-context-engineering-part-2-tokens-context-windows-memory-why-more-context-isnt-always-453e

[S5] https://dev.to/machinecodingmaster/java-ai-what-developers-need-to-know-1en0

[S6] https://www.numerama.com/tech/2286537-nouveaux-prix-apple-lunettes-meta-glasses-et-avenir-dapple-pay-en-france-le-recap-tech-de-la-semaine.html

Signal Tech - propulsé par Nuvo ReachRecevoir le Brief →