Todos os artigos
Tecnologia & TI

Hy3 e Hy4 da Tencent: O que os desenvolvedores precisam saber sobre os novos modelos de IA de código aberto da China

A Tencent lançou dois modelos MoE de pesos abertos — Hy3 (295B) e Hy4 preview (770B) — sob licença Apache 2.0. Veja como eles se comparam, onde executá-los e o que os requisitos de hardware realmente significam para o seu fluxo de trabalho.

  • #open-source-ai
  • #llm
  • #coding-assistant
  • #moe-architecture
  • #tencent-hunyuan
tencent-hy3-hy4-open-source-ai-models-developer-guide

O laboratório Hunyuan da Tencent lançou dois modelos de pesos abertos importantes em menos de dois meses: Hy3 no início de julho e Hy4 preview em 28 de agosto de 2026. Ambos utilizam arquiteturas Mixture-of-Experts (MoE), ambos possuem licença Apache 2.0 e ambos visam codificação agente e produtividade de longo contexto. Os lançamentos são importantes porque oferecem às empresas uma alternativa com licença permissiva às APIs controladas pelos EUA a uma fração do custo de inferência — se você puder lidar com a realidade do hardware.

O que os dois modelos realmente são

Hy3 é um MoE de 295B parâmetros com 21B de parâmetros ativos por token, uma janela de contexto de 256K tokens e uma camada de previsão de múltiplos tokens (MTP) de 3,8B para decodificação especulativa. O Hy4 preview escala para 770B parâmetros totais com 49B ativos e leva o contexto além de 1 milhão de tokens. A Tencent posiciona o Hy3 como “rivais de flagships de escala trilionária” porque a ativação esparsa permite que um modelo de ~300B tenha desempenho semelhante a um stack denso muito maior em benchmarks de agentes, sem ativar cada peso [2].

Ambos os modelos estão disponíveis no Hugging Face e no ModelScope desde o primeiro dia. A janela gratuita da API do Hy3 no OpenRouter (tencent/hy3:free) funcionou por duas semanas no lançamento; o Hy4 preview recebe o mesmo nível gratuito de duas semanas no WorkBuddy, CodeBuddy e OpenRouter [3]. O AtlasCloud lista o Hy3 a US$ 0,20 por milhão de tokens de entrada e US$ 0,80 por milhão de tokens de saída com o contexto completo de 256K — colocando-o entre as opções hospedadas mais eficientes em termos de custo [4].

Como eles se comparam ao GLM, DeepSeek e APIs fechadas

A avaliação interna às cegas da Tencent fez com que 163 especialistas atribuíssem ao Hy4 preview uma pontuação de 2,99/4,00 em 203 tarefas de engenharia, superando levemente o GLM-5.3 (2,92) e o Kimi K3 (2,94) [3]. O Hy3 obteve 78% no SWE-bench Verified e 90,4% no GPQA Diamond [2]. O modelo base preview do Hy3 já competia com o Kimi-K2 Base (1.043B), o DeepSeek-V3 Base (671B) e o GLM-4.5 Base (355B), ativando apenas 21B de parâmetros frente aos 32B–37B deles [4].

A diferença prática: a licença Apache 2.0 nessa escala significa que empresas que não podem usar APIs controladas pelas exportações dos EUA obtêm uma alternativa com licença permissiva para agentes de codificação não regulamentados [2]. A Nous Research o descreveu como “focado em uso agente de custo eficaz, e particularmente forte em codificação, confiabilidade de chamada de ferramentas, raciocínio e tarefas de longo contexto de 256K” [2].

Executando-os você mesmo: API, auto-hospedagem e quantização

Se você quiser auto-hospedar o Hy3 com fidelidade total, a Tencent especifica paralela de tensor de 8× GPU usando GPUs H20-3e ou da classe H200 [2]. Isso é um cluster, não uma estação de trabalho. Entretanto, as quantizações GGUF de 1-bit e 4-bit para llama.cpp com suporte a MTP chegaram em 14 de julho, permitindo inferência em rigs de GPU única de 128 GB — sem necessidade de um cluster de 8× H20 [2]. Receitas oficiais de serviço existem para vLLM e SGLang [2].

Os 49B de parâmetros ativos e o contexto de 1M+ do Hy4 preview elevarão ainda mais o patamar; a Tencent ainda não publicou especificações mínimas de auto-hospedagem para ele. Por enquanto, as janelas de API gratuita e os hosts de terceiros (OpenRouter, Tencent Cloud TokenHub, AtlasCloud) são os pontos de entrada com menor atrito [3][4].

Onde eles já estão aparecendo em fluxos de trabalho reais

O Hy3 alimenta os assistentes de codificação WorkBuddy/CodeBuddy da Tencent, o assistente ao consumidor Yuanbao (que ganhou uma função Agent gratuita que gera PowerPoint, Word, Excel, PDF e HTML a partir de linguagem natural), o assistente Marvis de nível de SO, a ferramenta de conhecimento ima, o serviço de atendimento ao cliente AI das Contas Oficiais do Weixin/WeChat e o assistente Advent de Path of Exile no WeGame [4]. Os usuários do WorkBuddy que selecionam ativamente o Hy3 cresceram seis vezes desde o preview [4].

O Hy4 preview estende isso: compreensão, planejamento, depuração e validação mais fortes para desenvolvimento de longo contexto; análise financeira aprimorada e colaboração entre documentos; protótipos de jogos jogáveis a partir de solicitações únicas de linguagem natural; e ganhos notáveis em P&D de IA, dinâmica molecular, física da matéria condensada e matemática fundamental [3]. Ele também participou de seu próprio desenvolvimento — propondo otimizações de treinamento, executando experimentos e iterando com base nos resultados, estabelecendo um loop inicial de autoaperfeiçoamento recursivo [3]. A taxa de throughput de inferência melhorou 31,8% devido à fusão autônoma de operadores e otimização de comunicação [3].

O que considerar antes de mudar

A licença Apache 2.0 é comercialmente amigável [5]. Os números de benchmark são competitivos. Porém, duas restrições práticas permanecem: a auto-hospedagem de peso total exige investimento significativo em GPUs, e os modelos têm semanas a meses de idade — a estabilidade a longo prazo, as ferramentas da comunidade e as trilhas de auditoria de segurança ainda estão se formando. Se sua carga de trabalho se encaixar no nível gratuito da API ou nos preços hospedados, o argumento de custo é forte. Se você precisar de implantação isolada (air-gapped) com fidelidade total, orce o cluster de 8× GPUs da classe H200. O caminho quantizado de GPU única de 128 GB existe para o Hy3; o equivalente para o Hy4 ainda não está documentado.

Comece com a API gratuita no OpenRouter ou no WorkBuddy/CodeBuddy. Teste com estresse seus fluxos de trabalho reais de agentes — confiabilidade de chamada de ferramentas, recuperação de longo contexto e aderência ao formato de saída — antes de se comprometer com a infraestrutura.

Fontes

  1. Tencent Hy3: MoE aberto de 295B para codificação agente | Blog explainx.ai
  2. Tencent lança e disponibiliza como open-source o preview do Hy4
  3. Tencent lança o Hy3: modelo MoE de 295B open-source - datanorth.ai
  4. Tencent Hunyuan lança oficialmente o Hy3, avançando as capacidades de agente …
  5. A Tencent da China lança novo modelo de IA de código aberto para codificação, pesquisa …
Editorial transparency
How this article was produced

Research, writing, and quality checks are documented below.

1,273 words 6 min read 5 sources
Publicado por

Brainy

Automated QA passed

AI-Powered Expert Researcher

Specializing in IT, artificial intelligence, digital marketing, finance, and consumer gadgets, Brainy pairs multi-source web research, evidence-aware synthesis, and editorial quality checks with clear, practical explanations for complex topics.

Research & verification
Multi-source evidence review
Writing model
nemotron-3-ultra-550b-a55b , nemotron-3-super-120b-a12b
Cover image
flux.2-klein-4b
Publication workflow
Pipeline v1