Tencent et plusieurs universités chinoises viennent de publier un survey paper qui pose le diagnostic que tout le monde évite (source). L'IA ne sera pas un vrai collègue tant qu'elle se contentera de répondre au lieu de finir le boulot.
Lis bien : le problème n'est pas l'intelligence. C'est la persistance.
Ton chatbot génère une réponse, puis il oublie tout. Pas d'espace de travail. Pas de mémoire d'une tache à l'autre. Pas de compétences réutilisables. Il recommence à zéro à chaque prompt. C'est comme embaucher un stagiaire brillant qui perd la mémoire toutes les 30 secondes.
La conclusion des chercheurs : le vrai levier, c'est la combinaison d'un environnement persistant et de skills réutilisables. Pas un modèle plus gros. Pas un benchmark plus haut.
Pour toi, lundi matin, ça veut dire une chose. Arrête d'évaluer les outils IA sur leur capacité à répondre. Evalue-les sur leur capacité à terminer. Est-ce que l'outil garde le contexte entre les étapes ? Est-ce qu'il sait reprendre là où il s'est arrêté ? Est-ce qu'il accumule des compétences ?
Si la réponse est non trois fois, tu paies pour un perroquet très cher.
Les agents qui persistent, qui enchainent les taches dans un vrai workspace, qui capitalisent sur ce qu'ils ont appris : c'est ça le prochain palier. Le reste, c'est de la démo.
Le fait Brian Armstrong bascule Coinbase sur des modèles chinois (GLM 5.2, Kimi 2.7). Un routeur automatique choisit le meilleur modèle par tache et par prix. Le taux de cache est passé de 5 à 60%. Résultat : facture divisée par deux, volume de tokens en hausse (source).
Et alors Le multi-modèle n'est plus un luxe d'ingénieur. C'est de la gestion de marge. Si tu paies un seul fournisseur IA au prix fort pour tout, tu fais la même erreur que ceux qui mettaient tout chez un seul hébergeur en 2015. Le routing intelligent + le cache agressif, c'est le combo qui compte. Pas le nom du modèle.
Le fait Princeton a créé CEO-Bench : 500 jours simulés à la tête d'une boite de software. Sur tous les modèles testés, trois seulement finissent au-dessus du capital de départ. Un simple algorithme à règles, sans IA, bat presque tout le monde (source).
Et alors Chaque fois que quelqu'un te vend un "CEO IA" ou un "agent autonome qui gère ton business", montre-lui ce benchmark. L'IA excelle sur des taches précises et encadrées. Sur la gestion globale avec des décisions enchainées sur la durée, elle crève. Exactement le point du signal du jour : sans persistance et sans accumulation, ça s'effondre.
Le fait Le gouvernement américain autorise Anthropic à remettre Claude Mythos 5 en service pour les organisations gérant des infrastructures critiques. L'accès grand public et le retour de Fable 5 restent en négociation, sans calendrier (source).
Et alors Deux choses. Un : les modèles les plus puissants vont d'abord aux gros. Deux : le régulateur américain commence à traiter les modèles IA comme des actifs stratégiques avec des niveaux d'accès. Si tu dépends d'un modèle spécifique pour ton business, c'est un risque fournisseur réel. Diversifie.
Le fait VibeThinker-3B, sorti par Sina Weibo, matche DeepSeek V3.2 et Kimi K2.5 sur les benchmarks maths et code. Ces modèles sont jusqu'à 333 fois plus gros. Le levier : du post-training multi-étapes. L'hypothèse des chercheurs : le raisonnement logique se compresse bien dans un petit modèle, la connaissance factuelle non (source).
Et alors Traduction directe : pour les taches de logique, de code, de calcul, tu n'as bientôt plus besoin de payer un gros modèle. Un modèle léger bien entrainé suffit. Pour la connaissance métier, les données terrain, le contexte : c'est toujours toi qui fournis. Le modèle ne remplace pas ta base de données. Il raisonne dessus.
Le fait Gina Raimondo, ex-secrétaire au Commerce US, lance "Raise Us", un programme d'un milliard de dollars pour préparer les travailleurs américains aux changements liés à l'IA. Financé par Amazon, Anthropic, Microsoft et la fondation OpenAI (source).
Et alors Quand le pompier pyromane finance les extincteurs, pose-toi la question de l'indépendance. Mais au-delà du cynisme : ces boites savent ce qui arrive. Elles anticipent le backlash politique. Si elles mettent un milliard sur la table maintenant, c'est que le calendrier de l'automatisation est plus serré que ce qu'elles disent en public.
Quand tu choisis un outil IA pour ton équipe, quel critère pèse le plus dans ta décision ?
200 sources lues. 6 gardées. Le reste, c'est du bruit que tu n'as pas eu à trier.
Si cette édition t'a fait gagner du temps, transfère-la à un fondateur qui scrolle encore Twitter pour sa veille tech.
SOURCES UTILISÉES :
[S1] https://the-decoder.com/ai-wont-become-a-real-coworker-until-it-stops-answering-and-starts-finishing-tasks/
[S2] https://the-decoder.com/coinbase-joins-the-rush-to-chinese-ai-models-as-western-labs-face-a-pricing-stress-test/
[S3] https://the-decoder.com/only-three-ai-models-finished-above-starting-capital-in-a-500-day-startup-survival-test/
[S4] https://the-decoder.com/anthropic-gets-us-approval-to-bring-back-claude-mythos-5/
[S5] https://the-decoder.com/sinas-open-model-vibethinker-3b-aims-to-show-reasoning-compresses-well-but-factual-knowledge-doesnt/
[S6] https://the-decoder.com/the-companies-most-likely-to-automate-your-job-are-now-funding-a-1-billion-program-to-retrain-you/