La Chine dépasse 500 trillions d’appels de jetons d’IA par jour
Les acteurs du secteur attribuent cette hausse aux flux d’agents et à des cycles de mise à jour plus courts, Tencent rapporte un bond de 68 fois pour Hunyuan 3.
Ces pointes se cumulent avec l’usage industriel continu pour expliquer pourquoi le total quotidien a franchi le seuil des 500 trillions.
Le chiffre relevé en juin 2026 compte les jetons traités par les modèles, et non le nombre d’utilisateurs ni le nombre de modèles. Une même interaction peut mobiliser des milliers de jetons selon la longueur du contexte et la fréquence des appels, et ces consommations s’additionnent à l’échelle nationale.
La généralisation des grands modèles à des usages industriels variés alourdit la charge. Les flux de travail fondés sur des agents multiplient les étapes d’une interaction : récupération d’information, lecture d’un contexte étendu, appel d’outils externes, traitement des retours. Ces opérations se répètent au fil d’une session et entre services, ce qui entraîne des appels de jetons successifs.
Dans la pratique, cela signifie que des outils intégrés en entreprise peuvent enchaîner des requêtes au sein d’une même tâche : l’agent relit le contexte, interroge une base, appelle un service externe, puis ajuste sa réponse en fonction du retour. La longueur du contexte joue un rôle : plus elle est importante, plus chaque requête consomme de jetons. À l’échelle nationale, ces usages combinés font rapidement grimper le compteur journalier.
Des représentants de l’industrie indiquent que les cycles de mise à jour, qui duraient environ trois mois auparavant, sont désormais passés à quatre à six semaines. L’accélération des itérations provoque des vagues d’activité lors des déploiements et des expérimentations, car les équipes publient plus souvent de nouvelles versions et affinent leurs modèles en production. Ces vagues, cumulées aux usages continus, créent des pics et élèvent la moyenne quotidienne enregistrée en juin 2026.
Les lancements de versions majeures renforcent ces effets. Tencent indique que Hunyuan 3 a enregistré 68 fois plus d’appels de jetons que Hunyuan 2 au cours de sa première semaine, un exemple de pic ponctuel superposé à l’usage industriel permanent. Ces pointes se cumulent avec l’usage industriel continu pour expliquer pourquoi le total quotidien a franchi le seuil des 500 trillions.
L’inférence est devenue le centre opérationnel des déploiements d’IA. Plus de sessions actives, des contextes plus longs et des itérations plus fréquentes accroissent la demande de calcul. L’effet combiné des sessions prolongées et des mises à jour accélérées a ainsi contribué à la hausse observée en juin 2026. Ces tendances augmentent la charge sur les infrastructures de calcul dédiées à l’inférence.
Chiffres clés
Questions fréquentes
Que mesure exactement le chiffre des 500 trillions ?
Le chiffre mesure le volume agrégé de jetons traités par les modèles, pas le nombre d’utilisateurs ni le nombre de modèles.
Pourquoi le volume d’appels de jetons a-t-il augmenté ?
La généralisation des grands modèles à des usages industriels et les flux d’agents qui multiplient les requêtes et les appels d’outils ont élevé la demande d’inférence.
Les modèles sont-ils mis à jour plus souvent ?
Oui, des représentants de l’industrie indiquent que les cycles de mise à jour sont passés d’environ trois mois à quatre à six semaines.
Un lancement produit peut-il provoquer un pic d’appels de jetons ?
Oui, Tencent indique que Hunyuan 3 a généré 68 fois plus d’appels de jetons que Hunyuan 2 durant sa première semaine.
Source : TechNode