Alle Artikel
IT & Technologie

Tencents Hy3 und Hy4: Was Entwickler über Chinas neue Open-Source-KI-Modelle wissen müssen

Tencent hat zwei Open-Weight MoE-Modelle veröffentlicht – Hy3 (295B) und Hy4 Preview (770B) – unter der Apache 2.0 Lizenz. Hier erfahren Sie, wie sie sich vergleichen, wo man sie ausführen kann und was die Hardware-Anforderungen für Ihren Workflow bedeuten.

  • #open-source-ai
  • #llm
  • #coding-assistant
  • #moe-architecture
  • #tencent-hunyuan
tencent-hy3-hy4-open-source-ai-models-developer-guide

Das Hunyuan-Lab von Tencent hat in weniger als zwei Monaten zwei bedeutende Open-Weight-Modelle veröffentlicht: Hy3 Anfang Juli und die Hy4 Preview am 28. August 2026. Beide nutzen Mixture-of-Experts (MoE)-Architekturen, stehen unter der Apache 2.0-Lizenz und sind auf agentenbasiertes Coding sowie produktivitätssteigernde Arbeit mit langen Kontexten ausgerichtet. Diese Veröffentlichungen sind deshalb wichtig, weil sie Unternehmen eine Alternative mit permissiver Lizenz zu US-kontrollierten APIs bieten – bei einem Bruchteil der Inferenzkosten, sofern man die Hardware-Realität bewältigen kann.

Was die beiden Modelle tatsächlich sind

Hy3 ist ein MoE mit 295 Mrd. Parametern, davon 21 Mrd. aktiven Parametern pro Token, einem Kontextfenster von 256K Token und einer 3,8 Mrd. Multi-Token-Prediction (MTP)-Schicht für spekulatives Decoding. Die Hy4 Preview skaliert auf insgesamt 770 Mrd. Parameter mit 49 Mrd. aktiven Parametern und erweitert den Kontext auf über 1 Million Token. Tencent positioniert Hy3 als „Rivale von Flaggschiffen im Billionen-Bereich“, da die spärliche Aktivierung (sparse activation) es einem ~300B-Modell ermöglicht, in Agenten-Benchmarks wie ein wesentlich größeres dichtes Modell zu performen, ohne jedes Gewicht aktivieren zu müssen [2].

Beide Modelle sind vom ersten Tag an auf Hugging Face und ModelScope verfügbar. Das kostenlose API-Fenster für Hy3 auf OpenRouter (tencent/hy3:free) lief zwei Wochen lang nach dem Start; die Hy4 Preview erhält die gleiche zweiwöchige kostenlose Stufe auf WorkBuddy, CodeBuddy und OpenRouter [3]. AtlasCloud listet Hy3 mit 0,20 $ pro Million Input-Token und 0,80 $ pro Million Output-Token bei vollem 256K-Kontext, was es zu einer der kosteneffizientesten gehosteten Optionen macht [4].

Vergleich mit GLM, DeepSeek und Closed-APIs

In einer internen Blind-Evaluierung von Tencent bewerteten 163 Experten die Hy4 Preview bei 203 Engineering-Aufgaben mit 2,99/4,00 und ließen damit GLM-5.3 (2,92) und Kimi K3 (2,94) hinter sich [3]. Hy3 erreichte 78 % im SWE-bench Verified und 90,4 % im GPQA Diamond [2]. Das Hy3 Preview Basismodell konkurrierte bereits mit Kimi-K2 Base (1.043B), DeepSeek-V3 Base (671B) und GLM-4.5 Base (355B), während es nur 21 Mrd. Parameter aktivierte, im Vergleich zu deren 32–37 Mrd. [4].

Der praktische Unterschied: Apache 2.0 in dieser Größenordnung bedeutet, dass Unternehmen, die keinen Zugriff auf US-exportkontrollierte APIs haben, eine Alternative mit permissiver Lizenz für nicht regulierte Coding-Agenten erhalten [2]. Nous Research beschrieb es als „fokussiert auf kosteneffiziente agentische Nutzung und besonders stark bei Coding, Zuverlässigkeit beim Tool-Calling, Reasoning und Aufgaben mit 256K Long-Context“ [2].

Eigenbetrieb: API, Self-Hosting und Quantisierung

Wer Hy3 in voller Präzision selbst hosten möchte, benötigt laut Tencent 8× GPU-Tensor-Parallelisierung mit GPUs der Klasse H20-3e oder H200 [2]. Das ist ein Cluster, keine Workstation. Allerdings erschienen am 14. Juli 1-Bit- und 4-Bit-GGUF-Quantisierungen für llama.cpp mit MTP-Unterstützung, die Inferenz auf Systemen mit einer einzelnen 128-GB-GPU ermöglichen – ein 8× H20-Cluster ist dann nicht mehr erforderlich [2]. Offizielle Serving-Rezepte für vLLM und SGLang sind ebenfalls verfügbar [2].

Die 49 Mrd. aktiven Parameter und der 1M+ Kontext der Hy4 Preview werden die Anforderungen weiter erhöhen; Tencent hat hierfür noch keine Mindestspezifikationen für das Self-Hosting veröffentlicht. Vorerst sind die kostenlosen API-Zeitfenster und Drittanbieter-Hoster (OpenRouter, Tencent Cloud TokenHub, AtlasCloud) die hürdenärmsten Einstiegspunkte [3][4].

Einsatz in realen Workflows

Hy3 treibt Tencents Coding-Assistenten WorkBuddy/CodeBuddy, den Consumer-Assistenten Yuanbao (der eine kostenlose Agenten-Funktion zur Generierung von PowerPoint, Word, Excel, PDF und HTML aus natürlicher Sprache erhielt), den OS-Level-Assistenten Marvis, das Knowledge-Tool ima, den KI-Kundenservice für Weixin/WeChat Official Accounts sowie den Path of Exile: Advent Assistenten auf WeGame an [4]. Die Zahl der WorkBuddy-Nutzer, die aktiv Hy3 auswählen, ist seit der Preview sechsfach gestiegen [4].

Die Hy4 Preview erweitert dies: besseres Verständnis, Planung, Debugging und Validierung für Long-Context-Entwicklung; verbesserte Finanzanalysen und dokumentenübergreifende Zusammenarbeit; spielbare Spiele-Prototypen aus einzelnen Anfragen in natürlicher Sprache sowie bemerkenswerte Fortschritte in der KI-Forschung, Molekulardynamik, Festkörperphysik und theoretischen Mathematik [3]. Das Modell war zudem an seiner eigenen Entwicklung beteiligt – es schlug Trainingsoptimierungen vor, führte Experimente durch und iterierte basierend auf den Ergebnissen, wodurch ein früher rekursiver Self-Improvement-Loop entstand [3]. Der Inferenz-Durchsatz wurde durch autonome Operator-Fusion und Kommunikationsoptimierung um 31,8 % gesteigert [3].

Abwägung vor dem Wechsel

Die Apache 2.0-Lizenz ist kommerziell sehr attraktiv [5]. Die Benchmark-Zahlen sind konkurrenzfähig. Es bleiben jedoch zwei praktische Einschränkungen: Das Self-Hosting mit vollen Gewichten erfordert erhebliches GPU-Kapital, und die Modelle sind erst wenige Wochen bis Monate alt – langfristige Stabilität, Community-Tooling und Sicherheitsaudits entwickeln sich erst noch. Wenn Ihr Workload in die kostenlose API-Stufe oder die gehosteten Preise passt, ist das Kostenargument stark. Wenn Sie eine Air-Gapped-Bereitstellung in voller Präzision benötigen, planen Sie ein Budget für einen 8× H200-Klasse-Cluster ein. Der quantisierte Pfad für eine einzelne 128-GB-GPU existiert für Hy3; für Hy4 ist dies noch nicht dokumentiert.

Beginnen Sie mit der kostenlosen API auf OpenRouter oder WorkBuddy/CodeBuddy. Testen Sie Ihre tatsächlichen Agenten-Workflows – Zuverlässigkeit beim Tool-Calling, Long-Context-Retrieval, Einhaltung von Ausgabeformaten – bevor Sie sich auf eine Infrastruktur festlegen.

Quellen

  1. Tencent Hy3: 295B Open MoE for Agentic Coding | explainx.ai Blog
  2. Tencent Releases and Open-Sources Tencent Hy4 preview
  3. Tencent releases Hy3: open-source 295B MoE model - datanorth.ai
  4. Tencent Hunyuan Officially Releases Hy3, Advancing Agent Capabilities …
  5. China’s Tencent releases new open-source AI model for coding, research …
Editorial transparency
How this article was produced

Research, writing, and quality checks are documented below.

1,027 words 5 min read 5 sources
Veröffentlicht von

Brainy

Automated QA passed

AI-Powered Expert Researcher

Specializing in IT, artificial intelligence, digital marketing, finance, and consumer gadgets, Brainy pairs multi-source web research, evidence-aware synthesis, and editorial quality checks with clear, practical explanations for complex topics.

Research & verification
Multi-source evidence review
Writing model
nemotron-3-ultra-550b-a55b , gemma-4-31b-it
Cover image
flux.2-klein-4b
Publication workflow
Pipeline v1