Le laboratoire Hunyuan de Tencent a publié deux modèles majeurs à poids ouverts en moins de deux mois : Hy3 début juillet et Hy4 preview le 28 août 2026. Les deux utilisent une architecture Mixture-of-Experts (MoE), les deux sont sous licence Apache 2.0, et les deux ciblent le codage agentic et le travail de productivité à long contexte. Ces publications sont importantes car elles offrent aux entreprises une alternative sous licence permissive aux API contrôlées par les États-Unis, à une fraction du coût d’inférence — à condition de pouvoir gérer la réalité matérielle.
Ce que sont réellement les deux modèles
Hy3 est un MoE de 295 milliards de paramètres avec 21 milliards de paramètres actifs par token, une fenêtre de contexte de 256K tokens et une couche de prédiction multi-token (MTP) de 3,8 milliards pour le décodage spéculatif. Hy4 preview atteint 770 milliards de paramètres au total avec 49 milliards actifs et porte le contexte au-delà d’un million de tokens. Tencent positionne Hy3 comme un « rival des modèles phares à l’échelle du trillion » car l’activation creuse permet à un modèle d’environ 300 milliards de paramètres de frapper comme un empilement dense bien plus grand sur les benchmarks agentic, sans activer chaque poids [2].
Les deux modèles sont disponibles sur Hugging Face et ModelScope dès le premier jour. La fenêtre d’API gratuite de Hy3 sur OpenRouter (tencent/hy3:free) a duré deux semaines au lancement ; Hy4 preview bénéficie du même niveau gratuit de deux semaines sur WorkBuddy, CodeBuddy et OpenRouter [3]. AtlasCloud propose Hy3 à 0,20 $ par million de tokens d’entrée et 0,80 $ par million de tokens de sortie avec le contexte complet de 256K — le plaçant parmi les options hébergées les plus efficaces en termes de coût [4].
Comment ils se positionnent face à GLM, DeepSeek et les API fermées
L’évaluation interne en aveugle de Tencent a vu 163 experts attribuer à Hy4 preview une note de 2,99/4,00 sur 203 tâches d’ingénierie, devançant GLM-5.3 (2,92) et Kimi K3 (2,94) [3]. Hy3 a obtenu 78 % sur SWE-bench Verified et 90,4 % sur GPQA Diamond [2]. Le modèle de base Hy3 preview rivalisait déjà avec Kimi-K2 Base (1 043B), DeepSeek-V3 Base (671B) et GLM-4.5 Base (355B) tout en n’activant que 21 milliards de paramètres contre leurs 32–37 milliards [4].
La différence pratique : à cette échelle, la licence Apache 2.0 signifie que les entreprises qui ne peuvent pas utiliser les API contrôlées par les exportations américaines disposent d’une alternative sous licence permissive pour les agents de codage non réglementés [2]. Nous Research l’a présenté comme « axé sur l’utilisation agentic rentable, et particulièrement fort en codage, fiabilité des appels d’outils, raisonnement et tâches de long contexte de 256K » [2].
Les exécuter vous-même : API, auto-hébergement et quantification
Si vous souhaitez auto-héberger Hy3 avec une fidélité totale, Tencent précise un parallélisme tensoriel GPU 8× utilisant des GPU H20-3e ou de classe H200 [2]. Il s’agit d’un cluster, pas d’une station de travail. Cependant, les quantifications GGUF 1-bit et 4-bit pour llama.cpp avec prise en charge MTP sont arrivées le 14 juillet, permettant l’inférence sur des rigs à un seul GPU de 128 Go — aucun cluster 8× H20 requis [2]. Des recettes de service officielles existent pour vLLM et SGLang [2].
Les 49 milliards de paramètres actifs et le contexte de 1M+ de Hy4 preview élèveront davantage la barre ; Tencent n’a pas encore publié les spécifications minimales d’auto-hébergement pour celui-ci. Pour l’instant, les fenêtres d’API gratuites et les hôtes tiers (OpenRouter, Tencent Cloud TokenHub, AtlasCloud) sont les points d’entrée les moins contraignants [3][4].
Où ils apparaissent déjà dans les flux de travail réels
Hy3 alimente les assistants de codage WorkBuddy/CodeBuddy de Tencent, l’assistant consommateur Yuanbao (qui a acquis une fonction Agent gratuite générant PowerPoint, Word, Excel, PDF et HTML à partir du langage naturel), l’assistant Marvis au niveau du système d’exploitation, l’outil de connaissance ima, le service client IA des comptes officiels Weixin/WeChat, et l’assistant Advent de Path of Exile sur WeGame [4]. Les utilisateurs de WorkBuddy ayant activement sélectionné Hy3 ont augmenté six fois depuis la preview [4].
Hy4 preview étend cela : une compréhension, une planification, un débogage et une validation plus solides pour le développement à long contexte ; une analyse financière améliorée et une collaboration inter-documents ; des prototypes de jeux jouables à partir de requêtes en langage naturel uniques ; et des gains notables en R&D IA, dynamique moléculaire, physique de la matière condensée et mathématiques fondamentales [3]. Il a également participé à son propre développement — proposant des optimisations d’entraînement, exécutant des expériences et itérant en fonction des résultats, établissant ainsi une boucle précoce d’amélioration automatique récursive [3]. Le débit d’inférence s’est amélioré de 31,8 % grâce à la fusion autonome des opérateurs et à l’optimisation de la communication [3].
Ce qu’il faut peser avant de changer
La licence Apache 2.0 est commercialement conviviale [5]. Les chiffres de référence sont compétitifs. Mais deux contraintes pratiques demeurent : l’auto-hébergement du poids complet exige un investissement GPU sérieux, et les modèles datent de quelques semaines à quelques mois — la stabilité à long terme, les outils communautaires et les pistes d’audit de sécurité sont encore en cours de formation. Si votre charge de travail correspond au niveau d’API gratuit ou aux tarifs hébergés, l’argument coût est solide. Si vous avez besoin d’un déploiement isolé à fidélité totale, prévoyez un budget pour le cluster 8× H200-class. Le chemin quantifié à un seul GPU de 128 GB existe pour Hy3 ; l’équivalent pour Hy4 n’est pas encore documenté.
Sources
- Tencent Hy3 : MoE ouvert de 295B pour le codage agentic | Blog explainx.ai
- Tencent publie et ouvre le code source de la preview Hy4 de Tencent
- Tencent publie Hy3 : modèle MoE open-source de 295B - datanorth.ai
- Tencent Hunyuan publie officiellement Hy3, faisant progresser les capacités agentic …
- Le nouveau modèle d’IA open-source de Tencent en Chine pour le codage, la recherche …