Le fait Un architecte a poussé 47 millions de requetes sur les quatre modèles chinois majeurs via un endpoint unifié, avec des tests de charge, du trafic bursty sur trois régions, et des mesures de cold-start. Les prix : DeepSeek V4 Flash a 0,25 $/M tokens, Qwen3-8B a 0,01 $/M, GLM-4-9B a 0,01 $/M. DeepSeek domine en code et en anglais. Kimi (K2.5 a 3 $/M) est le plus cher et le moins polyvalent hors taches chinoises. (source)
Et alors, lundi matin Pour du routing multi-modèles sur des taches a faible enjeu (résumé, classification, extraction), Qwen3-8B ou GLM-4-9B a 0,01 $/M tokens sont des options sérieuses en second tier. Pour du code ou du raisonnement complexe, DeepSeek tient la route a un prix plancher. Mais attention : latence p99 au-dela de 800 ms sur les pics, et la disponibilité n'est pas celle d'un Anthropic ou d'un OpenAI. A tester sur des taches non critiques, pas en production client sans fallback.
ON ATTEND (pour la prod client ; OK pour l'interne)
Sourcé Source
Le contexte Ce signal vient de l'édition du 2026-08-19, où il est remis dans la sélection du jour.