O Google apresentou em 27 de agosto de 2026 o Gemini Omni 1.1 Flash, atualização do modelo de inteligência artificial voltado à criação e à edição de vídeo. A versão chega à interface para programadores com controles para prolongar cenas, definir o começo e o fim de um movimento, produzir rascunhos em baixa resolução e ampliar o resultado para 4K.
A empresa diz que a atualização está pronta para uso profissional por meio da Gemini API no Google AI Studio, ambiente no navegador usado para testar e integrar seus modelos. O anúncio também informa uma distribuição gradual, por isso a presença do recurso pode variar entre contas e produtos nos primeiros dias.
O lançamento interessa a quem desenvolve editores, ferramentas de roteiro visual e aplicativos que transformam instruções em vídeo. Em vez de gerar uma cena isolada e recomeçar a cada ajuste, o sistema mantém o trabalho anterior como contexto e recebe novos pedidos em linguagem comum.
A reportagem do FoneArena publicada em 28 de agosto confirmou os mesmos recursos e canais de acesso descritos pelo Google. A publicação, porém, não apresentou um teste próprio de qualidade, velocidade ou custo, portanto os números de desempenho continuam sendo alegações da fabricante.
O anúncio do Google detalha a extensão de cenas, os quadros inicial e final, os rascunhos em 360p, a ampliação para 4K e as referências em vídeo. A documentação da Gemini API explica como as interações preservam o histórico usado nas edições seguintes.
O FoneArena confirmou em 28 de agosto os recursos e a chegada ao Google AI Studio, ao Flow e à plataforma empresarial. A publicação não realizou medições próprias, por isso velocidade, custo relativo e consistência permanecem atribuídos ao Google.
A cena continua por mais dez segundos
O recurso de extensão recebe um vídeo existente e tenta continuar a ação a partir do ponto em que ele terminou. Segundo o Google, o Omni 1.1 analisa até dez segundos anteriores, enquanto versões precedentes consultavam apenas o segundo final da cena.
Esse histórico maior serve para preservar personagem, cenário e direção do movimento durante a continuação. A empresa afirma que cada pedido acrescenta dez segundos e que as extensões podem chegar a uma duração acumulada de 40 segundos.
Na demonstração oficial, uma sequência passa de um corredor com pilares para outros ambientes sem interromper o movimento da câmera. Outro exemplo mantém uma conversa entre personagens enquanto o enquadramento se afasta, o que mostra a intenção do recurso, mas não mede a frequência de erros em projetos diferentes.
Para usar a extensão, o exemplo em Python enviado pelo Google cria uma nova interação e aponta para o identificador da geração anterior. Interação é o registro de uma etapa na API, a conexão que permite a outro programa enviar dados ao modelo e receber o vídeo produzido.
O código identifica a versão como gemini-omni-1.1-flash e envia uma instrução como "Continue a cena". Esse nome técnico precisa ser conferido na conta e na documentação antes de entrar em um aplicativo, pois uma distribuição gradual pode deixar regiões ou projetos em momentos diferentes.
Dois quadros guiam a câmera
Outro controle permite fornecer o primeiro e o último quadro, as imagens que devem abrir e encerrar uma tomada. O modelo cria o movimento entre os dois pontos e pode ser orientado a fazer uma aproximação, uma volta ao redor do assunto ou uma passagem contínua entre ambientes.
Esse formato ajuda quando a equipe já sabe onde a câmera precisa começar e terminar, mas ainda não produziu os segundos intermediários. Também pode servir para criar um vídeo em repetição, desde que as imagens das extremidades e o comando sejam compatíveis.
O Google mostra uma bateria em um salão e pede que a câmera revele um saxofonista e uma bailarina na mesma tomada. Em outro exemplo, o enquadramento entra na tela de uma televisão e volta à situação inicial para formar uma repetição visual.
As demonstrações foram escolhidas pela própria empresa e não garantem o mesmo resultado com qualquer par de imagens. Movimentos complexos, objetos parcialmente escondidos e personagens vistos de ângulos diferentes ainda exigem revisão quadro a quadro.
Rascunho em 360p antes do acabamento
A resolução de 360p passa a funcionar como modo de rascunho, com uma imagem menor destinada a testar composição, movimento e duração. O Google afirma que essa geração pode ser até 60% mais rápida e custar um terço do modo padrão em 720p.
O rascunho também não substitui a visualização final. Textos, contornos finos, pele e objetos pequenos podem parecer aceitáveis em 360p e revelar defeitos quando a imagem é ampliada, por isso a escolha de uma versão deve considerar o resultado em resolução maior.
A proposta é gerar algumas variações baratas, mudar um elemento por vez e comparar os vídeos lado a lado. Depois de escolher o movimento, a equipe pode produzir uma versão em 720p e solicitar a ampliação para 1080p ou 4K.
O 4K citado no anúncio é uma saída obtida por ampliação, processo que aumenta a quantidade de pixels da imagem. Isso não significa que todos os detalhes existiam na cena original, nem transforma automaticamente um rascunho em material sem falhas para cinema ou publicidade.
O texto oficial chama os resultados de prontos para produção profissional, mas não divulga testes independentes de nitidez, estabilidade temporal ou fidelidade a referências. Para uma entrega comercial, ainda é necessário conferir rostos, mãos, marcas, letreiros e mudanças inesperadas entre quadros.
Um vídeo curto vira referência
O Omni 1.1 aceita até três segundos de outro vídeo como parte da instrução multimodal, nome dado à entrada que combina texto, imagem, áudio ou vídeo. A referência pode mostrar um movimento ou uma aparência que o sistema tentará levar para a nova cena.
Na demonstração do Google, clipes de danças orientam os movimentos de personagens fornecidos em imagens separadas. O pedido distribui um estilo para cada personagem e solicita que todos apareçam juntos, em um plano contínuo e sem cortes.
Direitos autorais e autorização de imagem continuam fora da tarefa técnica do modelo. A capacidade de imitar um movimento não concede licença sobre o clipe usado como referência, nem permite usar o rosto de uma pessoa sem consentimento.
O acesso passa por produtos diferentes
Para programadores, o anúncio aponta o Google AI Studio e a Gemini API. Empresas também podem usar o Gemini Enterprise Agent Platform, plataforma que organiza agentes e integrações de inteligência artificial em sistemas corporativos.
O Google Flow recebeu o Omni 1.1 para assinantes Google AI Plus, Pro e Ultra em todo o mundo, segundo a companhia. O Flow é a ferramenta visual da empresa para criar e organizar vídeos, enquanto a API permite incorporar a geração a um aplicativo próprio.
A extensão de cenas também começou a chegar ao aplicativo Gemini para os mesmos planos. Isso não quer dizer que todo controle apresentado na documentação para programadores apareça com os mesmos campos ou opções no aplicativo de conversa.
Uma ferramenta precisa mostrar espera e falha
Gerar vídeo exige mais tempo e processamento que produzir uma resposta de texto. A interface deve informar que o pedido continua em andamento, permitir tentar novamente após uma falha e impedir que um clique repetido crie cobranças duplicadas.
Uma implementação útil separa rascunho, versão escolhida e exportação final. Assim, a pessoa entende quando está gastando menos para experimentar e quando iniciou uma geração em resolução maior, que pode levar mais tempo e consumir mais créditos.
Também convém exibir o limite de 40 segundos antes que a sequência chegue ao fim. Sem esse aviso, alguém pode planejar uma cena longa, produzir vários trechos e descobrir tarde que precisará montar partes separadas em outro editor.
A promessa ainda precisa de testes
O anúncio reúne avanços concretos de controle e disponibilidade, mas quase todas as comparações vêm do Google. O FoneArena confirma a apresentação e organiza as especificações, sem substituir uma avaliação independente de qualidade ou custo.
A afirmação de consistência melhor descreve o objetivo do contexto de dez segundos, não uma garantia de que personagem e cenário ficarão idênticos. A mesma cautela vale para a expressão "qualidade de estúdio", usada pela empresa para apresentar a saída ampliada.
Para avaliar o modelo, vale repetir o mesmo roteiro, as mesmas imagens e a mesma duração em várias tentativas. A comparação deve observar continuidade, obediência ao primeiro e ao último quadro, tempo total, créditos consumidos e defeitos que só aparecem depois da ampliação.
A equipe pode experimentar o movimento em 360p e reservar a exportação maior para a versão escolhida. Antes de entregar o vídeo, rostos, objetos e transições ainda precisam passar pela tela de revisão.
