top of page

Os modelos de voz de IA da Microsoft levam a corrida dos agentes de voz de demonstrações à latência

há 6 dias
15 min de leitura

A Microsoft lançou três modelos de voz de Microsoft AI voltados aos atrasos e lacunas linguísticas que ainda fazem muitos agentes de voz parecerem artificiais. A linha inclui o primeiro modelo de transcrição em streaming da empresa, além de dois geradores de fala multilíngue. Uma variante pode começar a retornar texto provisório pouco mais de 100 milissegundos após receber áudio.

O lançamento importa porque a Microsoft não está apresentando mais uma demonstração isolada de fala. Ela está reunindo modelos de escuta e fala como partes complementares de um pipeline de agentes de voz. Isso pressiona OpenAI, ElevenLabs, Deepgram e outros provedores que competem para fornecer toda a pilha conversacional.

A Microsoft afirma que seu novo modelo de transcrição lidera um benchmark independente. No entanto, classificações em benchmarks não resolvem questões sobre confiabilidade em produção, cobertura linguística, interrupções, segurança ou desempenho em condições confusas do mundo real. A verdadeira disputa ocorrerá em chamadas de clientes, reuniões, salas de aula e serviços multilíngues.

A Microsoft transforma fala em streaming em uma linha de produtos

A mudança central é a decisão da Microsoft de competir nas duas pontas de uma conversa por voz.

A Microsoft anunciou MAI-Transcribe-2-Streaming, MAI-Voice-2.1 e MAI-Voice-2.1-Flash em 1º de outubro de 2026. Os três vêm da família interna de modelos MAI da Microsoft AI.

MAI-Transcribe-2-Streaming converte fala ao vivo em texto em 60 idiomas. Ele também realiza detecção automática e contínua de idioma, o que significa que uma aplicação não precisa conhecer o idioma do falante antes de iniciar o processamento.

A transcrição em streaming é diferente do processamento de uma gravação concluída. O modelo consome o áudio recebido e produz palavras provisórias, chamadas de transcrições parciais, antes que o falante conclua uma enunciação. Em seguida, revisa essas palavras à medida que chega contexto adicional e confirma uma versão estável.

Segundo o anúncio do modelo, os primeiros resultados parciais chegam pouco mais de 100 milissegundos depois que o áudio atinge o sistema. A Microsoft também afirma que suas avaliações internas mostraram palavras surgindo duas vezes mais rapidamente do que com seu concorrente mais próximo em cenários de ditado e legendagem.

Essas declarações descrevem medições separadas. O tempo até o primeiro resultado parcial indica quão rapidamente uma interface pode exibir ou processar uma hipótese inicial. A afirmação de que as palavras aparecem duas vezes mais rápido diz respeito à comparação interna da Microsoft. Nenhum dos números, isoladamente, descreve o atraso total antes que um agente forneça uma resposta útil.

O modelo de transcrição oferece suporte a várias aplicações imediatas. Legendas ao vivo podem ser atualizadas enquanto uma pessoa fala. Um agente de atendimento ao cliente pode começar a classificar uma solicitação antes que a pessoa conclua. Uma ferramenta de reuniões pode preparar notas ou recuperar informações relevantes enquanto a conversa continua.

Os dois modelos de geração de fala tratam do caminho de retorno. MAI-Voice-2.1 oferece suporte a 23 idiomas e 26 localidades. A Microsoft afirma que uma única voz gerada pode transitar entre idiomas compatíveis, mantendo sua identidade reconhecível e adotando um sotaque nativo.

Essa distinção é importante para produtos internacionais. Muitos sistemas conseguem falar vários idiomas, mas podem exigir vozes separadas para cada mercado. Um tutor, assistente de suporte ou personagem de mídia pode soar como uma pessoa diferente sempre que o idioma muda.

O MAI-Voice-2.1 busca, em vez disso, preservar a identidade do falante. Uma aplicação de tutoria poderia passar do inglês ao mandarim sem substituir o professor aparente. Um agente de serviço poderia responder a clientes em diferentes idiomas sem perder a voz de marca escolhida por seu operador.

MAI-Voice-2.1-Flash oferece suporte aos mesmos idiomas e ao comportamento de falante entre idiomas. A Microsoft projetou a variante para cargas de trabalho em que o volume de saída e o tempo de resposta importam mais. A empresa afirma que ela pode gerar 45 segundos de áudio com 150 milissegundos de latência ponta a ponta.

A Microsoft também afirma que Flash oferece inferência de modelo 55 por cento mais rápida do que alternativas comparáveis. Essas continuam sendo medições reportadas pela empresa, portanto desenvolvedores precisarão testá-las com seus próprios prompts, regiões, formatos de áudio e padrões de tráfego.

Os três modelos estão disponíveis por meio do Microsoft Foundry e do MAI Playground. Os modelos de voz também têm distribuição pelo OpenRouter, enquanto a Microsoft lista Vercel, Azure Voice Live e uma futura integração com LiveKit entre as rotas de acesso.

O lançamento expande uma linha que a Microsoft iniciou no começo de 2026. MAI-Transcribe-1 processava fala pré-gravada em 25 idiomas, mas seu cartão de modelo excluía explicitamente a transcrição em tempo real. O novo modelo de streaming transforma essa capacidade planejada em um serviço comercialmente acessível.

Por que os modelos de voz de IA da Microsoft visam todo o orçamento de latência

Um agente de voz convincente depende do atraso combinado de escutar, raciocinar, usar ferramentas e falar.

Um agente de voz opera como um ciclo. Ele recebe áudio, determina o que foi dito, decide o que fazer, possivelmente chama uma ferramenta e converte o resultado em fala. O atraso introduzido em qualquer ponto dessa sequência passa a fazer parte da espera do usuário.

É por isso que um número rápido de transcrição não consegue, por si só, sustentar a experiência. Um modelo pode exibir palavras parciais rapidamente e ainda levar mais tempo para finalizar uma frase. O sistema de raciocínio pode então esperar por um turno completo. Uma consulta lenta a banco de dados ou um gerador de fala pode eliminar cada milissegundo economizado antes.

A estratégia da Microsoft é reduzir o atraso em ambas as fronteiras de áudio. MAI-Transcribe-2-Streaming fornece texto antes que um usuário termine de falar. MAI-Voice-2.1-Flash começa a gerar a resposta com um atraso ponta a ponta relatado de 150 milissegundos.

Esse design dá mais tempo à camada de raciocínio. Um agente pode começar a identificar a intenção, preparar uma busca ou selecionar uma ferramenta a partir de uma transcrição inicial. Ele nem sempre precisa esperar por uma gravação de áudio completa.

Considere uma pessoa pedindo a uma companhia aérea para remarcar um voo para sexta-feira de manhã. Um sistema de streaming pode reconhecer o destino, a data e a ação solicitada à medida que chegam. Ele pode começar a verificar campos relevantes antes que a pessoa conclua a frase.

O agente ainda precisa de contenção. Agir com base em texto parcial instável pode produzir erros caros. “Cancele meu voo” e “não cancele meu voo” mostram por que uma transcrição provisória não pode acionar automaticamente toda chamada de ferramenta.

Portanto, desenvolvedores precisam de políticas que diferenciem preparação reversível de ação consequente. Buscar um registro de reserva pode ser seguro durante uma transcrição parcial. Cancelar essa reserva deve esperar por linguagem estável e confirmação explícita.

A documentação do modelo de streaming fornece aos desenvolvedores os detalhes operacionais necessários para conectar fluxos de áudio e receber resultados em evolução. Ainda assim, o desenho da implementação continua tão importante quanto a velocidade bruta do modelo.

A detecção de turno cria outro desafio. Uma pausa pode significar que o falante terminou ou que está pensando. Se um agente responde rápido demais, ele interrompe. Se espera demais, a troca parece lenta.

O melhor sistema, portanto, equilibra várias medidas: tempo até o primeiro resultado parcial, tempo até uma transcrição estável, detecção de fim de fala, atraso de raciocínio, duração da chamada de ferramenta e tempo até a primeira saída audível. Otimizar uma medição pode piorar outra.

A precisão também altera o valor da velocidade. Uma transcrição parcial rápida, mas instável, pode levar uma aplicação a preparar a ação errada. Uma transcrição mais lenta ainda pode produzir uma experiência total melhor se reduzir correções e tarefas malsucedidas.

A Microsoft afirma que MAI-Transcribe-2-Streaming alcançou a primeira posição em precisão de transcrições finais e parciais no Artificial Analysis. Também afirma que o modelo está na fronteira de Pareto entre precisão e latência, onde melhorar uma dimensão exigiria sacrificar a outra.

Esse é um enquadramento útil, mas os usuários devem distinguir um ranking independente de uma auditoria independente de cada afirmação da Microsoft. Entradas de benchmark, distribuição de idiomas, ruído, microfones e regras de pontuação podem diferir de uma implantação específica.

Equipes de produção devem medir o ciclo completo. Testes úteis incluem fala com sotaques, alternância de código, nomes próprios, interrupções, conversas ao fundo, áudio telefônico de baixa qualidade, pausas longas e mudanças rápidas de assunto.

Equipes que trabalham com reuniões gravadas também precisam de mais do que palavras ao vivo em uma tela. Elas precisam conectar transcrições a notas, decisões e material de referência. Um fluxo de trabalho que combine gravação gratuita com conhecimento pesquisável pode tornar a transcrição útil depois que a chamada termina.

A principal pressão recai sobre a pilha de voz integrada da OpenAI

A Microsoft está desafiando a ideia de que um único modelo integrado de fala para fala é a única rota para uma interação por voz natural.

A OpenAI tem direcionado desenvolvedores para uma arquitetura em tempo real fortemente integrada. Sua Realtime API pode trocar áudio diretamente com um modelo multimodal, reduzindo as transferências necessárias em um pipeline tradicional de transcrição, raciocínio e fala.

Em maio de 2026, a OpenAI apresentou GPT-Realtime-2, GPT-Realtime-Translate e GPT-Realtime-Whisper. A empresa descreveu GPT-Realtime-Whisper como um modelo de transcrição em streaming que processa a fala enquanto uma pessoa fala.

O lançamento dos modelos de voz da OpenAI posicionou a voz como uma interface capaz de compreender contexto, raciocinar, traduzir, usar ferramentas e agir durante uma conversa. Os novos modelos da Microsoft entram nesse mesmo mercado com uma abordagem mais visivelmente modular.

A competição não é simplesmente Microsoft contra OpenAI. É também uma disputa entre desenhos de pipeline.

Um modelo integrado de fala para fala pode reter tom, ritmo, emoção e sinais conversacionais que podem desaparecer quando a fala se torna texto simples. Ele também pode reduzir o trabalho de orquestração porque um modelo cuida de uma parcela maior da troca.

Um sistema modular dá aos desenvolvedores maior controle sobre cada etapa. Eles podem inspecionar transcrições, selecionar um modelo de raciocínio separado, definir barreiras de aprovação, armazenar registros textuais e substituir componentes individuais sem reconstruir tudo.

O lançamento da Microsoft reforça o argumento modular. Seus modelos de transcrição e voz podem funcionar juntos, mas continuam sendo serviços distintos. O modelo de raciocínio e a lógica de negócios podem ficar entre eles.

Essa estrutura pode atrair compradores empresariais. Transcrições de texto fornecem uma camada auditável para revisão de qualidade, verificações de conformidade, recuperação de informações e supervisão humana. As equipes também podem encaminhar diferentes conversas para diferentes modelos de raciocínio.

A modularidade traz custos. Cada fronteira entre serviços introduz outra conexão, modo de falha e fonte de latência. Desenvolvedores precisam gerenciar o estado da sessão e determinar quando o texto provisório se torna confiável o suficiente para ações posteriores.

Sistemas integrados têm seus próprios riscos. Eles podem ser mais difíceis de inspecionar quando o modelo passa diretamente da entrada de áudio para a saída de áudio. Depurar por que um agente entendeu mal uma pessoa pode exigir rastros mais ricos do que uma transcrição limpa fornece.

A posição da Microsoft é mais forte quando compradores desejam escolha de componentes em um ambiente Azure já existente. Foundry já atua como camada de catálogo e implantação para modelos da Microsoft e de provedores externos. Os novos serviços MAI dão à Microsoft mais controle sobre os modelos que ela oferece ali.

O lançamento também reduz a dependência da Microsoft de um único parceiro para recursos de voz. A OpenAI continua sendo uma fornecedora de destaque no Foundry, mas a Microsoft agora pode oferecer um modelo interno de transcrição em streaming ao lado de opções de parceiros e terceiros.

Isso não significa que a Microsoft tenha substituído a stack de tempo real mais ampla da OpenAI. O anúncio da Microsoft se concentra em entrada e saída de áudio. Ele não estabelece que os modelos MAI igualem o raciocínio, a compreensão emocional ou o tratamento de interrupções de um sistema integrado.

Em vez disso, a Microsoft está dando aos desenvolvedores outra escolha arquitetural. Eles podem montar um agente de voz cujas camadas de escuta e fala venham da Microsoft, enquanto selecionam um modelo de raciocínio com base na qualidade da tarefa, governança ou requisitos operacionais.

Para os compradores, isso muda a pergunta de avaliação. A questão já não é se um fornecedor tem uma demonstração de voz. É se seus componentes produzem conversas confiáveis e mensuráveis quando conectados a ferramentas empresariais.

Vozes Multilíngues Elevam a Competição

A cobertura de idiomas está se tornando um problema de sistemas, não um item de checklist em uma ficha técnica de modelo.

MAI-Transcribe-2-Streaming oferece suporte a 60 idiomas, enquanto os dois novos modelos de voz oferecem suporte a 23 idiomas e 26 localidades. Essa diferença define a primeira limitação importante do pacote da Microsoft.

Um sistema pode compreender um usuário em um idioma que a voz MAI selecionada não consegue falar. Os desenvolvedores precisam mapear a interseção entre a cobertura de entrada e saída e, então, decidir o que acontece fora dela.

O desafio aumenta quando uma conversa contém mais de um idioma. A Microsoft afirma que seu modelo de transcrição detecta continuamente mudanças de idioma. Seus modelos de voz podem manter uma única identidade de locutor enquanto alternam entre idiomas compatíveis.

Essa combinação é valiosa para a alternância de códigos linguísticos, em que os falantes transitam entre idiomas dentro de uma conversa. Ela também pode apoiar o atendimento ao cliente em regiões onde os usuários costumam misturar um idioma local com inglês.

A identidade vocal acrescenta outra camada. A Microsoft afirma que os novos modelos de fala podem clonar uma voz em todos os idiomas compatíveis a partir de alguns segundos de áudio de referência. A documentação de voz associada descreve como os desenvolvedores podem acessar MAI-Voice-2.1 e sua variante Flash.

Uma voz clonada pode manter um aplicativo reconhecível em diferentes mercados. Também pode criar riscos de personificação. A exigência de uma referência curta reduz a barreira prática tanto para o uso legítimo por marcas quanto para cópias não autorizadas.

A Microsoft afirma que os modelos incluem proteções de consentimento destinadas a evitar uso indevido. O anúncio não fornece evidências públicas suficientes para concluir como essas proteções se comportam diante de amostras editadas, contas comprometidas ou tentativas de engenharia social.

Implantações empresariais precisarão de controles além de uma salvaguarda no nível do modelo. Eles podem incluir consentimento documentado, acesso limitado aos ativos de voz, divulgação de saída, registros de auditoria e procedimentos para remover uma voz quando a autorização mudar.

A qualidade multilíngue também exige revisão humana. Sotaque nativo não é o mesmo que adequação cultural. Pronúncia, formalidade, vocabulário regional, ritmo e tom emocional podem determinar se uma voz gerada parece crível.

Os concorrentes já estabelecem um padrão elevado para a Microsoft. A ElevenLabs afirma que seu modelo Scribe v2 Realtime oferece suporte a mais de 90 idiomas, produz transcrições parciais e confirmadas e oferece recursos como carimbos de tempo e detecção de entidades. Sua documentação de transcrição lista aproximadamente 150 milissegundos de latência para o modelo em tempo real.

A Deepgram aborda o mercado por meio do reconhecimento de fala conversacional e da gestão de turnos. Sua documentação do Flux destaca detecção integrada de fim de turno, comportamento conversacional configurável e padrões de resposta abaixo de um segundo para agentes de voz.

Esses produtos não oferecem conjuntos de recursos idênticos. Um fornecedor pode liderar em número de idiomas, mas diferir em precisão para determinado idioma. Outro pode lidar melhor com áudio telefônico, detectar turnos com mais confiabilidade ou fornecer controles mais úteis.

A cobertura de transcrição em 60 idiomas da Microsoft é mais ampla que a do modelo anterior MAI-Transcribe-1, com 25 idiomas. No entanto, totais públicos de idiomas não devem substituir testes por idioma.

Uma média de benchmark pode ocultar desempenho fraco no mercado mais importante para um comprador. Mesmo um modelo forte pode ter dificuldades com dialetos, nomes, termos especializados ou falantes cujas condições de áudio diferem dos dados de teste.

A mesma cautela vale para a qualidade de voz. Uma amostra de fala pode soar convincente em uma demonstração preparada, mas se tornar repetitiva durante sessões longas. Pode pronunciar endereços incorretamente, mudar de sotaque inesperadamente ou achatar os sinais emocionais necessários em chamadas de suporte sensíveis.

As empresas devem testar jornadas multilíngues completas. Isso significa verificar o que o sistema ouve, qual idioma detecta, como representa a transcrição, o que a camada de raciocínio decide e como a resposta soa.

O agente de voz internacional mais útil não será aquele com a lista mais longa de idiomas. Será aquele que lida com alternâncias, incertezas, nomes, consentimento e escalonamento sem confundir o usuário.

Transcrição Mais Rápida Não Elimina o Risco de Produção

As alegações de desempenho da Microsoft são promissoras, mas implantações reais exporão condições que os rankings não conseguem reproduzir plenamente.

A primeira incerteza diz respeito à transferência de benchmarks. A Artificial Analysis oferece aos compradores um ponto de comparação independente, mas cada carga de trabalho tem sua própria distribuição. Um modelo testado em amostras limpas de benchmark pode se comportar de forma diferente em chamadas telefônicas comprimidas ou salas de conferência lotadas.

A qualidade das transcrições parciais merece atenção especial. Sistemas de streaming revisam sua saída à medida que mais áudio chega. Esse comportamento melhora a precisão final, mas pode fazer o texto piscar na tela ou acionar trabalho posterior a partir de uma frase que depois muda.

Os aplicativos devem acompanhar a estabilidade da transcrição em vez de tratar cada token como definitivo. Também devem separar a detecção provisória de intenção de ações irreversíveis.

Conversas longas introduzem problemas de memória. Um sistema pode precisar preservar nomes, compromissos e identidades dos falantes durante uma hora. Esse requisito é diferente de decodificar com precisão uma frase curta.

Pesquisadores da Microsoft exploraram desafios relacionados com VibeVoice-ASR-Streaming. O relatório técnico descreve uma abordagem de ponta a ponta que transcreve fala e atribui palavras aos falantes à medida que o áudio chega.

Os pesquisadores lançaram variantes com 1,5 bilhão e 7 bilhões de parâmetros. Sua avaliação encontrou fortes resultados de reconhecimento e atribuição de falantes em benchmarks de reuniões e nove idiomas.

O relatório também documenta limitações. O desempenho se degrada durante fala sobreposta prolongada porque o decodificador precisa serializar múltiplos falantes em um único fluxo de saída. Esse é um alerta relevante para reuniões, debates e ambientes de suporte movimentados.

MAI-Transcribe-2-Streaming é um modelo comercial separado, portanto as descobertas do VibeVoice não devem ser atribuídas diretamente a ele. Ainda assim, a pesquisa ilustra por que a avaliação de fala ao vivo deve incluir falantes sobrepostos e identidade persistente.

A privacidade cria outro risco. Sistemas de voz ao vivo podem processar conversas que contêm informações pessoais, financeiras, médicas ou corporativas. Um modelo de baixa latência não responde onde o áudio é armazenado, como os registros são mantidos ou quem pode acessar as transcrições.

As organizações devem revisar a configuração de serviço disponível em sua região. Também devem determinar se seu caso de uso exige avisos de consentimento, retenção limitada, ocultação de dados, revisão humana ou restrições a decisões automatizadas.

As equipes de segurança precisarão considerar injeção de prompt por meio da fala. Um interlocutor pode instruir um agente a ignorar políticas ou revelar dados. O áudio de fundo pode conter comandos que o sistema trata equivocadamente como entrada autorizada.

A clonagem de voz aumenta a superfície de ataque. Mesmo quando um modelo aplica verificações de consentimento, o aplicativo ao redor precisa autenticar quem pode criar, gerenciar e implantar uma voz clonada.

A confiabilidade durante problemas de rede também importa. Sistemas de streaming dependem de conexões persistentes e da entrega ordenada de áudio. Perda de pacotes, conectividade móvel ou interrupções regionais de serviço podem afetar o timing e a completude das transcrições.

Os desenvolvedores devem definir comportamentos de contingência. Um aplicativo pode mudar para um menu de voz mais simples, solicitar entrada de texto, tentar novamente uma chamada de ferramenta ou transferir a conversa para uma pessoa.

A incerteza final é a aceitação pelos usuários. Um sistema rápido ainda pode falhar se as pessoas não confiarem nele. Os usuários precisam saber quando estão falando com um agente automatizado, quando uma transcrição está sendo criada e como falar com uma pessoa.

O lançamento da Microsoft melhora os ingredientes técnicos. Não elimina o trabalho operacional necessário para tornar esses ingredientes seguros e confiáveis.

O Que Observar à Medida que os Modelos de Voz da Microsoft Chegam a Cargas de Trabalho Reais

A próxima etapa será medida por evidências de produção, não por outra amostra de fala polida.

O primeiro sinal é o teste independente em diferentes idiomas e condições acústicas. A posição de topo da Microsoft em benchmarks dá credibilidade ao lançamento, mas os compradores precisam de resultados para seu áudio real.

Avaliações úteis devem incluir chamadas de baixa largura de banda, falantes com sotaque, ruído de fundo, interrupções, alternância de códigos linguísticos, nomes próprios e vocabulário setorial. Elas devem informar tanto a precisão final quanto a estabilidade das transcrições parciais.

Se MAI-Transcribe-2-Streaming mantiver sua classificação nessas condições, a alegação da Microsoft de um equilíbrio favorável entre precisão e latência se fortalecerá. Se o desempenho variar muito por idioma ou tipo de áudio, o lançamento parecerá mais especializado.

O segundo sinal é a adoção por meio de Foundry, Azure Voice Live, Vercel, OpenRouter e do suporte planejado ao LiveKit. A distribuição importa porque agentes de voz exigem mais do que um endpoint de modelo.

Os desenvolvedores precisam de autenticação, observabilidade, disponibilidade regional, gestão de sessões, integração com ferramentas e comportamento previsível sob carga. Um modelo que se encaixa em uma infraestrutura estabelecida tem vantagem sobre outro que apresenta bom desempenho, mas cria atrito operacional.

Observe implantações detalhadas de clientes em vez de projetos de demonstração. Um caso de produção deve explicar volume de chamadas, conclusão de tarefas, taxas de escalonamento, correções de transcrição e satisfação dos usuários.

O terceiro sinal é a resposta competitiva. A OpenAI pode aprofundar a integração entre transcrição, raciocínio, tradução e fala. A ElevenLabs pode ampliar suas ferramentas de transcrição e voz, enquanto a Deepgram pode continuar enfatizando a detecção de turnos e controles específicos para agentes.

Essa resposta revelará se a Microsoft mudou o mercado. Se os rivais concentrarem novos lançamentos no orçamento combinado de latência, identidade vocal entre idiomas ou implantação modular, estarão respondendo ao enquadramento da Microsoft.

Aplicações de trabalho do conhecimento oferecem um teste especialmente prático. A transcrição rápida se torna mais valiosa quando as palavras resultantes se conectam a documentos, reuniões anteriores, decisões e tarefas. Sistemas que oferecem suporte à combinação de conhecimento podem transformar uma transcrição ao vivo em contexto, em vez de outro arquivo isolado.

Os desenvolvedores devem resistir à escolha de um fornecedor com base em um único número de latência. Crie um conjunto de testes representativo, meça todo o ciclo conversacional e examine as falhas com usuários reais.

Compradores empresariais devem perguntar se o sistema espera antes de ações consequentes, lida com mudanças de idioma, protege vozes clonadas, preserva registros de auditoria e transfere de forma fluida para humanos. Essas respostas importarão mais do que a primeira resposta de uma demonstração.

Os modelos de voz com IA da Microsoft agora oferecem à empresa uma plataforma confiável de compreensão e fala. A próxima questão é saber se as equipes conseguem transformar essa velocidade em conversas que permaneçam precisas, seguras e úteis quando pessoas reais deixam de seguir o roteiro.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page