top of page

NVIDIA NemotronLabs VoiceChat 11B desafia o pipeline de IA de voz

A NVIDIA NemotronLabs lançou o VoiceChat 11B, um modelo de fala com pesos abertos que reporta alternância de turnos em 448 milissegundos e chamadas de ferramentas ao vivo dentro de uma conversa full-duplex.

O lançamento desafia o pipeline padrão de agentes de voz, que conecta reconhecimento automático de fala, um modelo de linguagem e serviços de conversão de texto em fala. Em vez disso, o VoiceChat processa a compreensão e a geração de fala em streaming dentro de uma única rede coordenada. Ele consegue ouvir enquanto fala, ceder quando é interrompido e preparar chamadas de ferramentas sem encerrar a conversa.

Essa combinação importa mais do que apenas a manchete sobre latência. Modelos de voz abertos têm aprendido cada vez mais a soar naturais, mas sistemas de produção também precisam executar ações enquanto usuários hesitam, interrompem ou revisam pedidos. O NVIDIA VoiceChat 11B reúne esses problemas em um único modelo baixável, embora seus resultados de benchmark mostrem que fala fluida não garante execução confiável.

NVIDIA NemotronLabs combina escuta, fala e ação

O lançamento transforma várias funções de agentes de voz em um único sistema de streaming, tornando o timing conversacional parte do modelo, e não um problema de orquestração externa.

A NVIDIA publicou o VoiceChat 11B em 3 de agosto de 2026. A empresa o descreve como um modelo de fala de ponta a ponta, com 11 bilhões de parâmetros, projetado para interação full-duplex em tempo real. Full duplex significa que ambos os lados podem falar e ouvir simultaneamente, em vez de esperar uma passagem de turno rígida.

O modelo aceita áudio de 16 kHz junto com um prompt de sistema em texto. Ele produz texto do agente, fala sintetizada em 22,05 kHz e uma transcrição contínua do usuário. O cartão do modelo público inclui pesos, resultados de benchmark, conversas de exemplo e instruções de implantação.

Sua arquitetura combina quatro componentes principais. Um codificador Fast Conformer converte a fala recebida em representações de áudio. Uma base de modelo de linguagem Nemotron Nano V2 9B prevê um fluxo temporizado de tokens de texto. Um decodificador de texto em fala converte esses tokens em códigos de áudio, e um codec reconstrói a saída falada.

A NVIDIA descreve o design geral como uma arquitetura híbrida Mamba e Transformer. Mamba é uma abordagem de modelagem de sequências voltada ao processamento eficiente de fluxos longos, enquanto Transformers oferecem os mecanismos de atenção comuns em modelos de linguagem modernos.

Um canal de saída separado prevê scripts de chamada de ferramentas. Essa separação permite que o modelo continue gerenciando a saída falada enquanto uma aplicação lê uma solicitação estruturada de função. A aplicação continua responsável por executar a função e devolver seu resultado.

Esse design não elimina literalmente todos os componentes encontrados em uma stack de voz. Codificação de fala, raciocínio, síntese e decodificação ainda existem. A mudança importante é que eles operam em uma linha do tempo compartilhada e alinhada por quadros, em vez de repassar saídas concluídas por vários serviços independentes.

Essa linha do tempo compartilhada dá ao modelo acesso à fala parcial enquanto o usuário ainda está falando. Ele pode decidir se uma pausa representa o fim de um turno, uma hesitação ou uma interrupção temporária. Também pode monitorar novas entradas enquanto produz sua própria resposta.

Cascatas tradicionais normalmente precisam de uma lógica de detecção de fim de fala separada para tomar essas decisões. Um serviço de reconhecimento automático de fala primeiro determina o que o usuário disse. Em seguida, um modelo de linguagem gera texto, e um serviço de fala converte essa resposta em áudio.

Cada etapa pode ser otimizada de forma independente, o que continua sendo uma grande vantagem. No entanto, cada passagem introduz buffering, tráfego de rede e mais um ponto onde o timing conversacional pode falhar.

O VoiceChat transfere mais dessa coordenação para o modelo. Essa mudança cria a questão central do lançamento: se um sistema de fala unificado pode preservar baixa latência e, ao mesmo tempo, manter precisão suficiente para realizar ações reais.

O resultado de 448 milissegundos muda a referência de interação

O resultado mais convincente do VoiceChat diz respeito ao timing conversacional, mas a medição descreve uma condição de benchmark, não todas as aplicações implantadas.

No Full-Duplex-Bench 1.0, a NVIDIA reporta latência de alternância de turnos suave de 448 milissegundos. O modelo recebeu uma taxa de sobreposição de tomada de turno, ou TOR, de 0,82 para essa tarefa. A TOR mede se um modelo toma ou cede o espaço da conversa no momento apropriado.

Para interrupções do usuário, o modelo registrou TOR de 1,00 e latência de 480 milissegundos. Esse resultado indica que ele cedeu de forma consistente nos cenários de interrupção avaliados. A NVIDIA também reporta valores de TOR para tratamento de pausas de 0,153 em dados sintéticos e 0,255 no conjunto de dados conversacional Candor, em que valores menores são melhores.

O benchmark full-duplex subjacente avalia comportamentos que benchmarks comuns de linguagem frequentemente ignoram. Eles incluem sinais de acompanhamento, pausas, interrupções e transições suaves entre interlocutores.

Esses comportamentos determinam se um agente de voz parece responsivo, mesmo quando sua resposta factual permanece inalterada. Um sistema pode gerar uma excelente resposta e ainda parecer defeituoso se fala por cima do usuário ou interpreta toda pausa como conclusão.

Ainda assim, o número de 448 milissegundos deve ser interpretado com cuidado. A NVIDIA testou o modelo com sua própria configuração de runtime em uma GPU H100. A latência da aplicação também inclui transporte do microfone, buffering de áudio, execução de ferramentas, condições de rede e reprodução.

A política de detecção de fim de fala também pode alterar a velocidade percebida. Um sistema agressivo começa a falar rapidamente, mas corre o risco de interromper usuários durante pausas naturais. Um sistema conservador evita essas interrupções, mas introduz silêncio antes de cada resposta.

A modelagem full-duplex busca substituir essa troca fixa por uma decisão contínua. O modelo escuta evidências semânticas e acústicas de que um turno terminou. Ele também continua processando novo áudio depois de começar a falar.

Essa capacidade é útil em atendimento ao cliente, agendamento, sistemas de acessibilidade e personagens interativos. Um cliente pode corrigir um número de conta no meio de uma resposta. Um usuário pode interromper uma explicação longa. Um personagem de jogo pode reagir enquanto o diálogo ainda se desenrola.

No entanto, o timing de benchmark é apenas uma parte dessas experiências. O modelo também precisa transcrever nomes com precisão, reter detalhes anteriores, chamar funções permitidas e evitar realizar ações com base em solicitações incompletas.

A NVIDIA afirma que a mistura de treinamento contém aproximadamente 550.000 horas de áudio real e sintético. As fontes listadas no cartão do modelo incluem fala Fisher, LibriVox, LibriTTS, HiFi-TTS, gravações internas e fala sintetizada a partir de corpus de texto.

A amplitude dessa mistura ajuda a explicar o foco conversacional do modelo. Ela também deixa em aberto questões sobre desempenho em diferentes sotaques, ambientes ruidosos, vocabulário especializado e idiomas além do inglês.

Atualmente, o VoiceChat é voltado para interação em inglês. Seus prompts de sistema e respostas de ferramentas também têm uma restrição operacional incomum: precisam usar texto ASCII. A NVIDIA aconselha desenvolvedores a remover emojis, pontuação Unicode, símbolos de grau e caracteres semelhantes antes de enviar resultados de ferramentas para a síntese de fala.

Essa limitação é administrável em uma demonstração controlada. Ela se torna mais difícil em aplicações que leem nomes internacionais, endereços, moedas ou registros multilíngues.

Portanto, o resultado de latência estabelece uma referência útil, não um veredito completo de implantação. Ele mostra que um modelo com pesos abertos pode coordenar escuta e fala em uma escala de tempo conversacional. Não mostra que toda aplicação construída em torno dele responderá em 448 milissegundos.

Chamadas de ferramentas ao vivo são o verdadeiro teste para o NVIDIA VoiceChat 11B

O canal de função separado é o recurso mais consequente do lançamento porque conecta a conversa natural a ações externas sem exigir silêncio completo.

Um modelo de voz que responde apenas a partir de seu conhecimento interno continua sendo uma interface falante. Um agente de voz se torna operacional quando consegue verificar um pedido, recuperar uma agenda, atualizar um registro ou invocar outro serviço.

A NVIDIA afirma que o VoiceChat é o primeiro modelo open full-duplex que oferece suporte a chamadas de ferramentas enquanto mantém a interação falada durante a execução. A alegação se aplica especificamente a sistemas open full-duplex, não a todos os serviços comerciais de voz.

O modelo recebe definições de ferramentas por meio de seu prompt de sistema. Quando detecta uma solicitação correspondente, o canal de função dedicado emite um nome de ferramenta estruturado e seus argumentos. A aplicação ao redor valida essa saída, chama a API externa e devolve o resultado.

O VoiceChat pode transmitir uma mensagem de “aguarde” definida pelo operador assim que prevê a chamada de função. Um assistente meteorológico pode dizer que está verificando a previsão. Um agente de suporte pode informar ao cliente que está recuperando um pedido.

Esse pequeno comportamento aborda um problema recorrente de interfaces de voz. Chamadas de API não terminam instantaneamente, e o silêncio sem explicação faz os usuários se perguntarem se o sistema parou de escutar.

A frase de espera não reduz a latência da API. Ela mascara parte da espera enquanto preserva a continuidade da conversa. Desenvolvedores podem configurar uma frase diferente para cada ferramenta, o que permite controlar o que o agente diz antes de existir um resultado.

Esse mecanismo também separa dois tipos de incerteza. O agente pode reconhecer a ação solicitada sem fingir que já sabe o resultado. Ele fala o resultado real somente depois que a aplicação devolve os dados.

O contêiner interativo da NVIDIA expõe uma interface WebSocket bidirecional para esse fluxo de trabalho. WebSockets mantêm uma conexão aberta para que quadros de áudio, saída do modelo, solicitações de função e resultados possam se mover nos dois sentidos sem estabelecer uma nova solicitação a cada vez.

O código de implantação público empacota componentes CUDA, Triton e vLLM. A NVIDIA fornece caminhos separados para testes offline e streaming interativo.

A distinção importa. Exemplos offline de chamada de funções não invocam ferramentas ao vivo. Eles leem uma resposta JSON preparada de um arquivo, permitindo que pesquisadores verifiquem se o modelo gera a solicitação de função esperada.

Somente o caminho de streaming interativo conclui o ciclo ao vivo completo. Portanto, desenvolvedores não podem tratar um exemplo offline bem-sucedido como evidência de que sua aplicação conectada à rede lida corretamente com timeouts, argumentos malformados, falhas de autorização e respostas tardias.

Uma aplicação de produção também precisa de uma máquina de estados explícita ao redor do modelo. Ela deve saber quando uma chamada de ferramenta começa, a qual turno de conversa ela pertence, se o usuário a cancelou e qual resposta deve ser falada.

O full duplex torna esse gerenciamento de estado mais complicado. Um usuário pode revisar a solicitação depois de ouvir a mensagem de espera. A aplicação então precisa decidir se cancela a chamada original, inicia outra ou pede confirmação.

Considere um assistente de viagens solicitado a remarcar um voo. O usuário pode interromper com uma nova data enquanto a primeira solicitação de disponibilidade está em execução. A fala de baixa latência torna a correção natural, mas o sistema de reservas precisa garantir que apenas o itinerário pretendido chegue à confirmação.

Essa é a principal pressão que a NVIDIA impõe às stacks tradicionais de voz. Sistemas em cascata fornecem limites claros entre reconhecimento, raciocínio e síntese. O VoiceChat oferece um timing mais preciso, mas os desenvolvedores ainda precisam de limites confiáveis ao redor das ações.

O lançamento, portanto, transfere parte da carga de engenharia. As equipes dedicam menos esforço à coordenação de componentes de áudio conversacional, mas passam a investir mais na validação da saída estruturada do modelo durante fala contínua.

Conversa Fluida Não Significa Execução Confiável de Ferramentas

O VoiceChat lida melhor com a escolha de uma ferramenta do que com seus argumentos, expondo uma lacuna entre confiança conversacional e correção operacional.

A NVIDIA relata uma pontuação média de 56,1% na versão em áudio do harness Berkeley Function Calling Leaderboard v3. Os resultados variam significativamente conforme a estrutura da tarefa.

O modelo obteve 58,5% em chamadas simples e 62,5% em cenários com várias ferramentas disponíveis. A pontuação caiu para 42,5% em chamadas paralelas e 27,5% em chamadas paralelas envolvendo várias ferramentas.

Ele teve desempenho substancialmente melhor na detecção de irrelevância, com 89,6%. Esse teste avalia se o modelo evita chamar uma ferramenta quando a solicitação não exige uma.

Uma segunda avaliação, Full-Duplex-Bench v3, aplica condições naturais de fala e uso de ferramentas em múltiplas etapas. A NVIDIA relata 82,5% de precisão na seleção de ferramentas, 42,2% de precisão nos argumentos e um resultado Pass@1 de 33%.

Esses números revelam a principal troca. O modelo frequentemente identifica a função adequada, mas é muito menos confiável ao construir os valores de que essa função precisa.

Uma solicitação por voz sobre o clima pode ilustrar a diferença. Selecionar uma função meteorológica é relativamente simples. Extrair corretamente uma cidade após uma hesitação, correção ou interrupção é mais difícil.

O risco aumenta em operações de maior consequência. Um sistema de suporte pode escolher a ferramenta correta de reembolso, mas associar o número de pedido errado. Um assistente de calendário pode selecionar a função de agendamento enquanto interpreta incorretamente uma data revisada.

Pass@1 mede se a primeira tentativa de chamada é bem-sucedida segundo os critérios do benchmark. Uma pontuação de 33% não é adequada como evidência de confiabilidade operacional sem supervisão.

Esses resultados não anulam a contribuição arquitetural. Eles esclarecem o que os desenvolvedores precisam testar antes da implantação. Qualidade da conversa, seleção de ferramentas, extração de argumentos e conclusão bem-sucedida são métricas distintas.

As aplicações devem validar nomes de funções e parâmetros com base em esquemas rígidos. Devem rejeitar valores ausentes, limitar faixas aceitáveis e solicitar confirmação antes de ações irreversíveis.

O prompt de sistema publicado com o VoiceChat instrui o modelo a não adivinhar argumentos obrigatórios ausentes. Também orienta o agente a chamar apenas as ferramentas explicitamente listadas no prompt.

As instruções no prompt são úteis, mas não são controles de segurança. A aplicação hospedeira deve impor permissões de forma independente. Também deve tratar a saída do modelo como entrada não confiável antes de encaminhar qualquer coisa para outro sistema.

Conversas longas introduzem outra incerteza. Trabalhos independentes de implantação da Pipecat observam que a NVIDIA treinou o modelo com janelas de contexto de áudio de no máximo dois minutos. Informações além dessa janela podem não permanecer confiáveis.

A implementação da Pipecat também lista conhecimento, raciocínio, transcrição e seleção de ferramentas entre as áreas que exigem avaliação cuidadosa. Seus mantenedores identificam a degradação em sessões longas como uma área em aberto para testes.

A síntese de voz cria riscos adicionais que benchmarks de texto não capturam. Um modelo pode gerar a chamada estruturada correta enquanto fala um resumo impreciso. Também pode emitir uma mensagem de espera depois que o usuário já retirou a solicitação.

A avaliação deve, portanto, comparar pelo menos três registros: a transcrição do usuário, a carga útil da função e a resposta falada. Qualquer divergência pode mudar a compreensão do usuário sobre o que o sistema fez.

Os desenvolvedores também precisam testar interrupções em momentos adversariais. Isso inclui correções durante a coleta de argumentos, fala chegando enquanto o resultado de uma ferramenta é retornado e várias funções enfileiradas terminando fora de ordem.

A NVIDIA chama o VoiceChat de modelo Labs e o direciona a pesquisadores, desenvolvedores e profissionais de voz. Seu model card recomenda testes específicos para cada caso de uso antes da integração a um sistema de IA.

Os pesos usam a licença NVIDIA Open Model Development and Weight, versão 1.1. “Pesos abertos” é uma descrição mais precisa do que presumir termos open source sem restrições, pois o uso continua regido por essa licença.

O model card não apresenta o VoiceChat como uma API de produção hospedada. O Hugging Face também não mostrava nenhum provedor de inferência servindo o modelo no momento da publicação. As equipes precisam operar o modelo por conta própria ou usar uma implementação mantida separadamente.

Esse limite é importante para compradores corporativos. O lançamento fornece pesos e código inspecionáveis, mas não um acordo de nível de serviço gerenciado, sistema de monitoramento, pacote de conformidade ou camada de suporte à produção.

Pesos Abertos Ainda Têm um Alto Custo de Implantação

O modelo pode ser baixado, mas seu runtime de referência mantém a experimentação full-duplex concentrada entre equipes com hardware NVIDIA de alta memória.

A NVIDIA lista as famílias de hardware A100, H100, H200, B100, B200 e RTX 6000 como compatíveis. Sua avaliação publicada usou uma H100, e o perfil de referência do vLLM-Omni especifica uma H100 com 80 GB de memória.

A receita do vLLM-Omni divide a inferência em três estágios. Um thinker produz uma linha do tempo de texto alinhada a frames, um talker gera pilhas de códigos de áudio e um decoder reconstrói o áudio em forma de onda.

Essa implementação processa áudio em uma linha do tempo de 12,5 Hz, correspondente a um frame de 80 milissegundos. O perfil padrão usa execução em precisão total nos estágios principais para reproduzir o comportamento de referência da NVIDIA.

Segundo a receita, apenas o thinker em precisão total tem aproximadamente 43 GB de pesos. Os mantenedores afirmam que placas de 48 GB não conseguem executar essa configuração padrão. Eles recomendam uma opção de precisão reduzida abaixo da classe de 80 GB.

Essa exigência restringe o acesso imediato. Muitos desenvolvedores conseguem baixar um modelo de texto de 11 bilhões de parâmetros em hardware de consumo. A geração de fala em tempo real adiciona codificadores, componentes de síntese, codecs de áudio e estado persistente de streaming.

A comunidade já está contornando essa restrição. A Pipecat publicou uma versão quantizada projetada para rodar em um único DGX Spark. Sua conversão usa pesos de precisão reduzida e patches de runtime para sustentar interação em tempo real.

Esse esforço demonstra o valor de liberar os pesos. Equipes independentes podem inspecionar a arquitetura, modificar o código de serving e explorar perfis menores de implantação sem esperar por uma API de fornecedor.

Também demonstra por que o lançamento original não é um produto pronto para uso. A configuração da Pipecat baixa aproximadamente 65 GiB, exige pelo menos 90 GiB de armazenamento livre e constrói um contêiner CUDA local. A inicialização leva vários minutos na configuração documentada.

O caminho de referência da NVIDIA também exige Linux, uma GPU NVIDIA, componentes CUDA, dependências Python e um branch específico do repositório Speech. A implantação interativa adiciona Triton, vLLM e infraestrutura WebSocket.

Nenhum desses requisitos é incomum para inferência de pesquisa. Juntos, criam um limiar operacional mais alto do que um serviço de voz baseado em API.

A hospedagem própria oferece vantagens significativas. O áudio pode permanecer no ambiente controlado de uma organização, sujeito ao seu desenho de implantação. As equipes podem inspecionar os artefatos do modelo, modificar a camada de serving e evitar depender de um endpoint hospedado.

A hospedagem própria também transfere responsabilidades. Os operadores precisam lidar com escalabilidade, disponibilidade de GPU, recuperação de conexões, observabilidade, retenção de dados e patches de segurança. Precisam decidir como o áudio e as transcrições das conversas entram nos logs.

Uma sessão full-duplex mantém o modelo ativo durante todo o diálogo. Portanto, o planejamento de capacidade depende de sessões simultâneas ao vivo, e não apenas do número de prompts concluídos. Chamadas longas podem ocupar recursos mesmo quando os usuários fazem pausas.

A execução de ferramentas introduz outra dimensão de capacidade. O modelo de voz pode permanecer residente enquanto serviços externos respondem. Uma aplicação eficiente precisa gerenciar essas esperas sem permitir que chamadas travadas consumam recursos ilimitados de sessão.

A NVIDIA não anunciou uma API hospedada do VoiceChat. Desenvolvedores que buscam implantação imediata precisam comparar o controle da hospedagem própria com o trabalho de engenharia necessário para operar um serviço de GPU com streaming.

É nesse ponto que as cascatas convencionais mantêm vantagem. As equipes podem escolher um reconhecedor de fala gerenciado, um modelo de linguagem hospedado e um mecanismo de fala separado. Podem substituir um componente sem retreinar os demais.

Uma cascata também pode encaminhar solicitações simples para modelos menores ou serviços especializados. Essa flexibilidade ajuda a controlar os requisitos operacionais e permite que as equipes selecionem fornecedores diferentes para cada estágio.

O timing unificado do VoiceChat é mais difícil de reproduzir entre APIs independentes. Seu custo é um acoplamento mais estreito entre qualidade da fala, comportamento de raciocínio, chamadas de ferramentas e a pilha de hardware compatível.

Nenhuma das abordagens vence em toda implantação. O NVIDIA NemotronLabs torna a rota unificada suficientemente inspecionável para que desenvolvedores meçam diretamente essa troca.

Três Sinais Mostrarão se o Modelo Sai do Laboratório

A próxima fase depende de resultados independentes de latência, melhor conclusão de chamadas de ferramentas e implantação prática em hardware menor.

O primeiro sinal é o teste ponta a ponta por terceiros. Os desenvolvedores devem medir a latência de microfone a áudio em conexões WebSocket reais, e não apenas o benchmark de tomada de turno do modelo.

Testes úteis devem incluir ruído de fundo, falantes sobrepostos, pausas longas, correções e redes fracas. Devem relatar falsas interrupções junto com a velocidade de resposta. Um sistema mais rápido não é melhor se interrompe repetidamente os usuários.

Comparações independentes também precisam de hardware e políticas de endpointing consistentes. Caso contrário, números de latência publicados podem descrever partes diferentes da interação e parecer comparáveis quando não são.

O segundo sinal é a confiabilidade de chamadas de ferramentas sob fala disfluente. O resultado de 82,5% do VoiceChat na seleção é encorajador, mas seus 42,2% de precisão nos argumentos e 33% em Pass@1 expõem o problema mais difícil.

Versões futuras precisam de extração de argumentos, tratamento de cancelamento e execução em múltiplas etapas mais robustos. As avaliações devem testar usuários que revisam datas, nomes, quantidades ou locais no meio de uma solicitação.

Pilotos de produção também devem publicar taxas de conclusão de tarefas após validação de esquema e esclarecimento. A precisão bruta do modelo não revela se uma aplicação consegue se recuperar com segurança de uma chamada incerta.

O terceiro sinal é um suporte de hardware mais amplo. A quantização da comunidade já mostra que o modelo pode ir além do perfil de referência de 80 GB, embora a precisão reduzida introduza outra variável a ser avaliada.

Observe configurações reproduzíveis em sistemas de 48 GB e menores, juntamente com medições de qualidade de fala, comportamento de interrupção e precisão de funções. Uma pegada de memória menor só importa se os benefícios conversacionais sobreviverem à compressão.

A disponibilidade hospedada seria outra parte desse sinal. Um endpoint de inferência com suporte poderia permitir que mais equipes testassem o NVIDIA VoiceChat 11B sem manter infraestrutura de CUDA, Triton e streaming.

Por enquanto, o lançamento é melhor entendido como um marco arquitetural. Ele mostra que modelos de fala com pesos abertos podem ouvir, falar, ceder a vez e iniciar ações dentro de uma única interação contínua.

Também torna a fraqueza restante excepcionalmente visível. Um timing semelhante ao humano pode fazer um agente parecer mais competente do que seus argumentos de ferramentas justificam. Os desenvolvedores precisam impedir que essa percepção se transforme em autoridade.

O teste decisivo não é se o NVIDIA NemotronLabs consegue começar a falar em 448 milissegundos. É se as aplicações conseguem preservar essa capacidade de resposta enquanto executam a ação correta, com os valores corretos, depois que usuários reais interrompem e mudam de ideia.

As equipes que avaliam o modelo devem registrar sessões completas, comparar a fala com chamadas estruturadas e testar a recuperação antes de conectar ferramentas com consequências relevantes. Essas evidências mostrarão se sistemas full-duplex unificados podem substituir pipelines de voz modulares ou se continuam sendo uma rota de pesquisa promissora, com um trabalho operacional significativo pela frente.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page