← Artigos

Português

Z.ai revela Ox Alpha como GLM-5.3-Flash

O modelo que apareceu sem fabricante agora ganha nome, preço e uma rota oficial para entrar em ferramentas de programação.

Página oficial do modelo Z.ai GLM-5.3-Flash no OpenRouter
OpenRouter

Notícia

A Z.ai confirmou nesta quarta-feira, 26 de agosto, que estava por trás do Ox Alpha, modelo de inteligência artificial que apareceu seis dias antes no OpenRouter sem revelar o fabricante. A página do serviço agora liga o codinome ao GLM-5.3-Flash, versão multimodal voltada a programação e tarefas longas executadas por agentes de IA.

A revelação encerra a parte principal do mistério, mas não transforma em fato todas as especulações feitas durante a prévia. Bloomberg e TechCrunch receberam da empresa a confirmação de que o Ox Alpha pertence à família GLM; a identificação mais específica como GLM-5.3-Flash aparece agora nas páginas oficiais do OpenRouter para o modelo antigo e para a versão comercial.

A página do Ox Alpha agora identifica a Z.ai como desenvolvedora e aponta o GLM-5.3-Flash como o modelo revelado. A ficha comercial do GLM-5.3-Flash confirma a estreia em 26 de agosto, a janela de 1 milhão de tokens e os preços da rota.

A Bloomberg recebeu da Z.ai a confirmação de que o Ox Alpha pertence à série GLM. O TechCrunch publicou a confirmação às 14h19 UTC e registrou a promessa de liberação dos pesos.

O nome aparece depois de seis dias

O Ox Alpha entrou no catálogo do OpenRouter em 20 de agosto com o identificador stealth/ox-alpha. Stealth, neste caso, indica uma prévia em que o criador permanece anônimo, enquanto o OpenRouter apenas encaminha os pedidos ao fornecedor que executa o modelo.

Esse arranjo produziu uma estreia incomum: desenvolvedores podiam testar o sistema, mas não sabiam qual empresa receberia o código e os demais dados enviados. A ficha dizia que as solicitações e respostas seriam retidas pelo fornecedor e não usadas para treinamento, sem informar quem era esse fornecedor durante o período anônimo.

Na página atualizada do Ox Alpha, o OpenRouter diz que o modelo foi desenvolvido e operado pela Z.ai e aponta o GLM-5.3-Flash como a identidade revelada. A ficha separada da versão comercial também inclui uma pergunta específica sobre a ligação entre os dois nomes, além de registrar o lançamento em 26 de agosto.

A confirmação dada pela Z.ai à Bloomberg foi mais cautelosa: a empresa descreveu o Ox Alpha como uma nova versão da série GLM e prometeu liberar os pesos do modelo na noite de quarta-feira. Pesos são os arquivos numéricos aprendidos durante o treinamento e, quando publicados sob uma licença adequada, permitem que terceiros executem o sistema em infraestrutura própria.

Até o instante desta publicação, a página oficial do GLM-5.3-Flash no OpenRouter oferecia acesso pela interface de programação, mas não exibia um repositório com esses arquivos. Portanto, a autoria e o nome comercial estão confirmados, enquanto a disponibilidade dos pesos ainda depende da publicação prometida pela Z.ai.

Flash aceita texto, imagem e vídeo

O GLM-5.3-Flash é descrito pelo OpenRouter como um modelo multimodal nativo, isto é, capaz de receber mais de um tipo de conteúdo sem depender apenas de texto. A ficha lista texto, imagem e vídeo como entradas e texto como saída, combinação que permite pedir a análise de uma captura de tela ou de uma gravação junto com instruções escritas.

A janela de contexto chega a cerca de 1 milhão de tokens. Token é um fragmento usado pelo modelo para processar palavras e sinais; uma janela maior deixa o sistema receber mais código, documentação e histórico na mesma solicitação, mas não garante que ele encontre a informação certa nem que mantenha a mesma precisão em qualquer extensão.

A fabricante posiciona a versão Flash para programação eficiente e trabalhos prolongados conduzidos por agentes, programas que dividem uma tarefa em etapas e usam ferramentas para executá-la. Na prática, esse perfil inclui examinar um projeto, alterar arquivos, rodar testes e corrigir falhas, desde que o aplicativo conectado dê ao modelo as permissões e ferramentas necessárias.

Segundo a descrição publicada no OpenRouter, a arquitetura mistura atenção esparsa e atenção linear. Atenção é o mecanismo que relaciona partes da entrada; as duas técnicas procuram reduzir o custo de processar sequências grandes, mas a alegação de que a combinação preserva a precisão em contextos longos vem do material do fornecedor e ainda precisa de avaliações independentes específicas para o Flash.

A página mostra uso público por aplicativos como Claude Code, ZCode e Hermes Agent. A presença nessa lista indica que chamadas ao modelo foram identificadas nesses serviços, não que Anthropic, Nous Research ou os responsáveis por cada aplicativo tenham validado a qualidade anunciada pela Z.ai.

Preço substitui a prévia gratuita

Durante a fase anônima, o Ox Alpha foi oferecido sem cobrança por tokens no OpenRouter. A ficha do GLM-5.3-Flash passa a mostrar preço de tabela de US$ 0,15 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída, com desconto temporário de 50% concedido pela Z.ai.

Com a promoção, os valores caem para US$ 0,075 na entrada e US$ 0,25 na saída por milhão de tokens. O OpenRouter informa que a condição termina em 9 de setembro de 2026, às 16h UTC; não há preço em real nem anúncio específico para o mercado brasileiro.

Entrada é tudo o que o aplicativo envia ao modelo, como instruções, arquivos e conversas anteriores, enquanto saída é o texto gerado em resposta. Uma tarefa de agente pode fazer várias chamadas e reenviar parte do histórico, por isso o custo final depende do aplicativo, do uso de cache e da quantidade de tentativas, não apenas do tamanho da primeira pergunta.

O serviço lista a própria Z.ai como única provedora dessa rota. Isso elimina a escolha automática entre empresas diferentes para o mesmo modelo, embora o pedido continue passando pelo OpenRouter antes de chegar à infraestrutura da fabricante.

A ficha também registrava 33 tokens por segundo de vazão e 4,89 segundos de latência mediana no momento consultado. São medidas operacionais atualizadas continuamente pelo OpenRouter, sujeitas a distância do servidor, lotação e tamanho da resposta, e não uma promessa fixa da Z.ai para toda chamada.

GLM-5.3 e Flash não são a mesma ficha

O nome pode causar confusão porque a Z.ai já havia apresentado o GLM-5.3 em 14 de agosto. Esse modelo anterior usa a mesma base do GLM-5.2 e, de acordo com a empresa, recebeu ganhos por pós-treinamento, etapa em que o sistema aprende a seguir instruções e resolver tarefas depois do treinamento principal.

No anúncio do GLM-5.3, a Z.ai destacou programação, trabalho de agentes e segurança cibernética, além de prometer os pesos depois de duas semanas de avaliações de segurança. A fabricante atribuiu ao modelo avanços em testes próprios e públicos, mas esses números não devem ser transferidos automaticamente ao GLM-5.3-Flash, cuja ficha tem capacidades multimodais e preços diferentes.

A reportagem do The New Stack sobre o GLM-5.3 observou que comparações entre testes podem mudar conforme o programa usado para conduzir cada modelo. Para o Flash, a cautela é ainda mais importante: a revelação de autoria é nova, e o catálogo oficial consultado não apresenta uma tabela própria de resultados que permita comparar a versão revelada nas mesmas condições.

Também não está demonstrado que toda resposta produzida durante a fase Ox Alpha será idêntica à da rota comercial. Preço, limite, configuração de raciocínio e infraestrutura podem mudar entre uma prévia gratuita e um produto identificado, mesmo quando as páginas confirmam que os dois nomes pertencem ao mesmo modelo.

A identidade melhora a decisão sobre dados

Saber que a Z.ai opera o modelo permite que equipes verifiquem a empresa e suas condições antes de enviar um repositório privado. Isso não substitui a leitura das políticas do OpenRouter e da provedora, nem dispensa controles de acesso, remoção de segredos e revisão humana das mudanças propostas.

A antiga ficha do Ox Alpha avisava que o fornecedor retinha solicitações e respostas, ainda que não as utilizasse para treinamento. Código pode conter chaves, dados de clientes e regras internas, então a promessa de não treinar com o conteúdo resolve apenas uma parte da análise de privacidade.

A publicação dos pesos, se ocorrer com documentação e licença claras, abrirá outra opção: executar o modelo fora da rota hospedada. Esse caminho exige máquinas capazes de suportar o sistema, configuração de segurança e manutenção, requisitos que não desaparecerão apenas porque os arquivos podem ser baixados.

Quem abriu um projeto no Ox Alpha encontra agora o mesmo modelo com fabricante e preço visíveis. O nome saiu do esconderijo, mas código privado ainda pede uma pausa para conferir retenção, permissões e custo antes do envio.