top of page

MineExplorer mostra agentes multimodais vacilando à medida que a profundidade das tarefas aumenta

Claude Opus 4.6, da Anthropic, liderou o MineExplorer, mas sua taxa de sucesso caiu de 77% em tarefas de um salto para 12% em tarefas de quatro saltos. No total, o modelo concluiu apenas 41% do benchmark, segundo resultados publicados pela equipe LongCat, da Meituan.

Esse colapso é a verdadeira história do Anthropic MineExplorer. Claude teve bom desempenho quando o objetivo exigia uma etapa direta. Teve dificuldades quando o sucesso dependia de descobrir e coordenar vários pré-requisitos não declarados dentro de um mundo em constante mudança.

O MineExplorer mede essa lacuna por meio de 813 cenários de Minecraft verificados por humanos, com duração de até três minutos. Ele testa 18 modelos multimodais de oito famílias de modelos, incluindo sistemas Claude, GPT e Gemini. Os autores do benchmark disponibilizaram seu código, conjunto de dados, fluxo de geração de tarefas e ambiente de avaliação.

O resultado questiona uma suposição comum sobre agentes multimodais. Reconhecer uma ameaça, um objeto ou um recurso não significa que um modelo consiga manter um plano útil enquanto o ambiente muda. O MineExplorer transforma essa distinção em uma curva mensurável de falhas.

Benchmarks anteriores de Minecraft examinaram planejamento, seguimento de instruções, construção ou conhecimento do jogo. O MineExplorer, por sua vez, elimina muitas tarefas que dependem fortemente de regras específicas de Minecraft. Seu objetivo declarado é mais amplo: exploração que combina percepção, raciocínio e ação ao longo de uma trajetória sustentada.

O benchmark ainda é um preprint, e Minecraft não pode representar todos os ambientes físicos. Ainda assim, os resultados exercem pressão imediata sobre alegações de que visão mais robusta e contexto mais longo produzem automaticamente agentes autônomos confiáveis.

MineExplorer transforma três minutos em um teste sério para agentes

MineExplorer muda o alvo da avaliação: de reconhecer uma cena para sobreviver a uma sequência de decisões interdependentes.

A equipe LongCat apresentou o MineExplorer em um preprint de maio de 2026. Uma segunda versão foi lançada em 12 de junho, enquanto a equipe técnica da Meituan publicou um resumo detalhado dos resultados em julho.

Cada episódio pode durar 1.800 etapas do ambiente. Uma etapa representa 0,1 segundo, totalizando três minutos de interação contínua. O mundo é atualizado após cada ação, portanto o modelo precisa reconsiderar repetidamente o que vê e o que deve fazer em seguida.

Essa duração parece curta para padrões humanos. Para um agente que precisa observar imagens, manter estado, selecionar ações e se recuperar de erros ao longo de centenas de interações, ela é longa.

As tarefas são divididas por contagem de saltos. Uma tarefa de um salto apresenta um objetivo que não exige que o agente infira uma subtarefa não declarada. Cenários de dois a quatro saltos adicionam pré-requisitos ocultos que precisam ser descobertos por meio do ambiente.

Considere um agente instruído a chegar a um local protegido. A rota imediata pode estar bloqueada, a ferramenta necessária pode estar em outro lugar, e entidades hostis podem restringir o movimento. A instrução nomeia o destino, mas não todas as ações necessárias para alcançá-lo.

O MineExplorer representa cada tarefa composta com um estado inicial, uma instrução em linguagem natural, um grafo de dependências e marcos baseados em regras. O grafo de dependências registra a estrutura oculta da tarefa. O modelo nunca recebe esse grafo completo.

Os marcos permitem que o avaliador meça o progresso parcial sem pedir a outro modelo de linguagem que julgue toda a trajetória. Um marco pode detectar se o agente encontrou um objeto, entrou em uma área ou concluiu uma ação intermediária obrigatória.

Os autores compararam esses resultados automatizados com avaliações humanas das trajetórias de Claude Opus 4.6. Conjuntos de marcos concluídos receberam pontuações médias humanas próximas de quatro em uma escala de cinco pontos. Conjuntos totalmente fracassados permaneceram abaixo de três.

Essa concordância não torna o avaliador perfeito. Mas fornece evidências de que a conclusão de marcos captura progresso significativo, em vez de eventos arbitrários do jogo.

A equipe também tentou separar exploração de conhecimento memorizado de Minecraft. Tarefas atômicas candidatas foram avaliadas quanto à dependência de convenções específicas do jogo. Tarefas dominadas por conhecimento especializado foram removidas.

Essa escolha de design importa porque um agente pode falhar em um objetivo de Minecraft por dois motivos muito diferentes. Ele pode não conhecer uma receita da wiki do jogo ou pode falhar em conectar evidências visíveis a um plano viável.

O MineExplorer busca enfatizar o segundo problema. Suas 14 categorias de capacidades abrangem percepção, raciocínio e ação. Elas incluem percepção espacial e temporal, rastreamento de entidades, consciência de recursos, raciocínio causal, movimentação, coleta, posicionamento, criação e combate.

Os 813 exemplos disponibilizados abrangem dependências de um a quatro saltos. O conjunto de dados aberto inclui texto das tarefas, comandos de configuração de cena, tarefas atômicas selecionadas, marcos, grafos de dependências e notas de design.

Isso é mais do que um conjunto estático de perguntas. Pesquisadores podem inspecionar como as cenas foram construídas, reexecutar avaliações, criar variantes mais difíceis ou usar o ambiente para treinamento.

Essa abertura dá ao benchmark a chance de influenciar o desenvolvimento de agentes. Também torna suas premissas mais fáceis de contestar, um recurso importante para um benchmark que faz alegações amplas sobre exploração.

Por que a liderança da Anthropic no MineExplorer ainda é um alerta

Claude Opus 4.6 venceu a comparação, mas sua liderança revela o quanto todos os modelos testados ainda estão distantes de um comportamento confiável em horizontes longos.

O benchmark avaliou 18 modelos multimodais avançados de oito famílias. Claude Opus 4.6 alcançou a maior taxa geral de sucesso em tarefas, chegando a 41%.

Um resultado de 41% pode parecer respeitável quando visto apenas como posição em um ranking. Ele parece muito mais fraco quando separado pela profundidade das tarefas.

Claude Opus 4.6 concluiu 77% das tarefas de um salto. Sua taxa de sucesso caiu para 12% nas tarefas de quatro saltos. A queda de 65 pontos mostra que dependências adicionais fazem mais do que apenas acrescentar um pouco de dificuldade.

Cada pré-requisito oculto cria outra oportunidade de perder o plano. O modelo precisa perceber evidências relevantes, inferir um objetivo intermediário, executá-lo corretamente e preservar sua relação com o objetivo final.

Um erro inicial pode se propagar pelo episódio. Passar por um recurso necessário impede a próxima ação. Escolher a rota errada consome etapas e altera a visão do agente. Uma observação posterior pode então ser interpretada a partir de um estado interno já incorreto.

É por isso que o resultado do Anthropic MineExplorer pressiona mais do que a Anthropic. Claude foi o modelo mais forte no teste. Sua curva de falhas, portanto, atua como um limite superior para essa configuração específica, não como evidência de uma fraqueza isolada de Claude.

Os resultados também complicam a narrativa padrão de escalonamento de modelos. O artigo relata que modelos maiores e modos dedicados de raciocínio não melhoraram o desempenho de forma consistente.

Mais parâmetros podem fortalecer a percepção ou o raciocínio em um prompt delimitado. Um ambiente dinâmico exige outra capacidade: manter um alinhamento útil entre memória, observações atuais e objetivos em mudança.

Um contexto mais longo não garante esse alinhamento. Ele pode preservar imagens antigas que já não descrevem a cena atual. Essas observações podem competir com evidências mais recentes, em vez de ajudar o modelo.

Os autores testaram esse problema aumentando o número de quadros visuais históricos. O desempenho acabou caindo quando observações desatualizadas interferiram na compreensão do modelo sobre o estado atual.

Eles também examinaram se os modelos simplesmente precisavam de mais tempo. Agentes malsucedidos continuaram falhando mesmo quando os episódios permitiam até 1.800 etapas. Tarefas solucionáveis tendiam a ser concluídas mais cedo, enquanto interações extras não resgatavam muitas trajetórias quebradas.

Esses resultados enfraquecem duas soluções fáceis. Dar a um agente mais contexto não equivale a dar-lhe uma memória melhor. Dar-lhe mais ações não equivale a dar-lhe um plano melhor.

A pressão se estende a desenvolvedores que constroem agentes de uso de computador, sistemas de robótica e ferramentas automatizadas de pesquisa. Esses produtos operam fora de uma captura de tela fixa. Seus ambientes mudam em resposta tanto ao agente quanto a eventos externos.

Um agente de navegador pode precisar localizar um registro, alterar um filtro, interpretar a página atualizada e verificar o envio final. Um robô de armazém pode precisar redirecionar sua rota após encontrar um corredor bloqueado. Um agente de pesquisa pode precisar revisar sua busca após descobrir evidências contraditórias.

Em cada caso, o objetivo visível esconde decisões pré-requisito. Um modelo pode executar corretamente cada ação isolada e ainda assim falhar no trabalho completo.

O MineExplorer não prova que as taxas de falha serão transferidas diretamente para navegadores ou robôs. Ele mostra que o sucesso em testes multimodais curtos oferece garantias limitadas quando dependências ocultas se acumulam.

Essa distinção deve afetar decisões de aquisição e implantação. Compradores devem perguntar como um agente se comporta em fluxos de trabalho concluídos, não apenas se seu modelo reconhece telas ou gera próximas ações plausíveis.

O verdadeiro problema é a navegação, não o reconhecimento visual

Quase 60% das falhas de Claude Opus 4.6 foram atribuídas à navegação, tornando o movimento com estado o gargalo mais evidente do benchmark.

A análise de falhas da equipe LongCat separa erros de navegação de problemas como interação com objetos ou raciocínio sobre tarefas. A navegação respondeu por quase 60% das falhas analisadas.

Esse número não significa que o modelo simplesmente não tinha orientações. Navegação em um mundo aberto combina memória espacial, reconhecimento visual, controle de ações e gestão de objetivos.

O agente precisa saber onde está, lembrar onde esteve e determinar se o movimento produziu o resultado pretendido. Também precisa decidir quando abandonar uma rota ou explorar uma alternativa.

Um teste de visão estática isola apenas parte desse ciclo. O modelo vê uma imagem e responde a uma pergunta. A cena não muda por causa de sua resposta, e uma resposta errada não distorce a próxima observação.

Minecraft cria feedback. Se o agente vira na direção errada, sua próxima imagem contém evidências diferentes. Se fica preso diante de um obstáculo, comandos repetidos de movimento consomem tempo sem avançar a tarefa.

O modelo então precisa diagnosticar se a rota falhou, se a ação falhou ou se seu plano original estava errado. Essa distinção é difícil quando as observações chegam como quadros separados, em vez de um mapa interno estável.

As pontuações de capacidade do MineExplorer reforçam essa interpretação. Claude Opus 4.6 recebeu uma pontuação de percepção de 61,91 e uma pontuação de raciocínio de 54,71. Na maioria dos modelos avaliados, a percepção superou a ação, enquanto a ação superou o raciocínio.

Os modelos frequentemente conseguiam identificar detalhes relevantes. Tinham mais dificuldade em transformar esses detalhes em uma estratégia coordenada que resistisse à mudança ambiental.

Isso cria uma inversão importante na forma como o progresso multimodal costuma ser apresentado. Uma melhor compreensão de imagens amplia o que um agente pode notar, mas também expõe a fraqueza do sistema de planejamento que consome essas observações.

Um modelo que detecta dez objetos relevantes ainda precisa decidir qual deles importa agora. Ele deve conectar essa escolha ao objetivo final e manter essa conexão depois que o ponto de vista muda.

O benchmark se baseia na abordagem ReAct, que intercala raciocínio com ações e novas observações. O framework ReAct original foi projetado para permitir que os modelos revisem seu raciocínio por meio do feedback ambiental.

MineExplorer mostra onde esse ciclo pode se romper ao longo de trajetórias mais longas. O raciocínio se desvincula do estado atual, as ações deixam de servir ao objetivo original, ou novas observações não acionam uma revisão necessária.

A navegação amplifica os três problemas. Um agente mal posicionado vê as evidências erradas, constrói uma estimativa incorreta do estado e escolhe novas ações a partir de uma posição degradada.

Este é um problema mais difícil do que gerar uma cadeia de raciocínio mais longa. Um agente precisa de uma representação estruturada de entidades persistentes, locais, marcos concluídos, rotas que falharam e dependências não resolvidas.

O histórico visual bruto é um substituto fraco. Ele armazena o que a câmera viu, não o que o agente deveria recordar.

A mesma distinção se aplica a agentes empresariais. Uma transcrição de todas as telas anteriores não produz automaticamente um estado de fluxo de trabalho confiável. O agente precisa saber qual formulário foi enviado, qual filtro continua ativo e qual requisito ainda não foi resolvido.

Para sistemas incorporados, a navegação se torna tanto um teste físico quanto cognitivo. O modelo precisa mover-se pelo espaço enquanto preserva a estrutura lógica da tarefa.

A participação de 60% das falhas atribuída ao MineExplorer, portanto, aponta para trabalho em nível de sistema. Controladores locais melhores, mapas explícitos, memória causal, monitoramento de progresso e políticas de recuperação podem importar tanto quanto um modelo-base mais forte.

O que o Benchmark Mede — e o que Não Mede

MineExplorer oferece um teste de estresse útil, mas seus resultados continuam limitados a um mundo simulado e a uma distribuição de tarefas definida por pesquisadores.

O argumento cético mais forte diz respeito à validade externa. Minecraft oferece um mundo 3D dinâmico com regras consistentes, mas não reproduz todas as dificuldades encontradas em casas, fábricas, escritórios ou espaços públicos.

Robôs reais enfrentam física incerta, ruído de sensores, danos físicos e restrições de segurança. Agentes de uso de computador encontram estados ocultos de aplicações, barreiras de autenticação, pop-ups e interfaces em mudança.

Minecraft elimina muitas dessas complicações. Seus objetos são discretos, sua física é repetível e seu ambiente pode ser reiniciado exatamente.

Esse controle também é uma vantagem. Pesquisadores podem comparar modelos em condições idênticas e rastrear falhas sem colocar equipamentos ou usuários em risco.

O ponto-chave é tratar o MineExplorer como um instrumento de diagnóstico, não como uma pontuação universal de inteligência incorporada. Um resultado de 41% não significa que Claude concluiria 41% de fluxos de trabalho reais não relacionados.

A filtragem de conhecimento do benchmark também exige análise cuidadosa. Os autores usam julgamentos de modelos de linguagem para classificar se tarefas atômicas dependem principalmente de conhecimento geral ou de convenções específicas do Minecraft.

Esse processo reduz fatores de confusão evidentes ligados ao conhecimento do jogo. Ele não pode garantir que todas as tarefas mantidas estejam livres de efeitos de familiaridade.

Modelos treinados com vídeos, guias ou discussões sobre jogabilidade de Minecraft ainda podem reconhecer layouts e comportamentos comuns. Diferentes famílias de modelos podem ter encontrado quantidades diferentes desse material.

O próprio benchmark continua sendo um trabalho em andamento, segundo seu registro no arXiv. Revisões futuras podem alterar tarefas, prompts, controladores ou procedimentos de avaliação.

O design do controlador é particularmente importante. Um modelo multimodal raramente manipula um jogo apenas por meio de raciocínio abstrato. O sistema de agente ao redor converte as saídas do modelo em comandos de movimento e interação.

Portanto, o desempenho reflete tanto o modelo subjacente quanto sua estrutura de suporte. Um sistema de mapeamento ou controlador de baixo nível melhor pode aprimorar os resultados sem alterar o modelo.

Os autores do benchmark reconhecem outra limitação. Atualmente, o MineExplorer se concentra em avaliação empírica, embora sua infraestrutura também possa apoiar treinamento.

Treinar no ambiente do benchmark cria seu próprio risco. Quando desenvolvedores otimizam diretamente para tarefas públicas, os ganhos no ranking podem refletir especialização no benchmark, e não exploração geral.

O código do MineExplorer, totalmente aberto, facilita a replicação e a extensão. Também torna mais importantes as questões de contaminação e sobreajuste para lançamentos futuros de modelos.

Avaliações independentes devem preservar cenários de teste ocultos. Elas também devem variar layouts de cena, estruturas de dependência, implementações de controladores e formatos de prompt.

O contexto histórico reforça essa cautela. O MinePlanner lançou anteriormente 45 tarefas de Minecraft para planejamento de longo horizonte e constatou que planejadores consolidados tinham dificuldades em ambientes grandes com muitos objetos.

O benchmark MinePlanner concentrou-se em planejamento proposicional e numérico, em vez de exploração multimodal interativa. Seus resultados ainda mostraram que Minecraft pode expor problemas de escalabilidade ocultos por domínios de planejamento menores.

Outros sistemas examinaram o seguimento de instruções, a construção, a memória e habilidades abertas. Esses projetos usam o mesmo jogo para questões diferentes, portanto suas pontuações de destaque não devem ser comparadas diretamente.

A contribuição específica do MineExplorer é a combinação de interação visual contínua, pré-requisitos ocultos, construção de tarefas em múltiplos saltos e avaliação de marcos baseada em regras.

Sua alegação de ser o “primeiro” deve ser lida dentro dessa definição. Minecraft já hospedou pesquisas de longo horizonte antes do MineExplorer. A alegação de novidade da equipe refere-se à exploração multimodal de mundo aberto em escala de minutos, sob sua estrutura específica de avaliação.

Outra limitação é a falta de uma ampla reação independente tão pouco tempo após o lançamento. A maior parte da interpretação detalhada atualmente vem dos autores e de seus canais técnicos afiliados.

Os resultados medidos estão disponíveis para inspeção, mas as explicações causais continuam sendo parcialmente interpretativas. A grande participação das falhas de navegação, por exemplo, não isola completamente se a causa raiz foi mapeamento, memória, planejamento ou execução de ações.

Essas incertezas não eliminam a descoberta central. O sucesso cai acentuadamente à medida que pré-requisitos ocultos se acumulam. Elas definem o que experimentos futuros precisam separar.

O Código Aberto Faz do MineExplorer Mais do que um Ranking

O lançamento importa porque pesquisadores podem testar se melhores memórias, controladores ou métodos de treinamento reduzem a curva de falha de longo horizonte.

A equipe usou um fluxo de trabalho multiagente para construir instâncias do benchmark. Cinco agentes especializados colaboram sob um orquestrador que controla sua sequência.

O fluxo de trabalho começa com um rascunho inicial de tarefa. Agentes especialistas e de validação então debatem o design, identificam inconsistências e revisam a cena, o grafo de dependências e os avaliadores de marcos.

Segundo a avaliação humana dos autores, esse processo aumentou a validade das instâncias em cerca de 30 pontos percentuais em relação a uma linha de base de agente único. Também elevou as pontuações de qualidade em cerca de 0,5 ponto, com o maior benefício em tarefas de quatro saltos.

O lançamento final contém 813 instâncias verificadas por humanos. Um subconjunto separado e mais difícil oferece 100 cenários selecionados por sua maior dificuldade.

Esse pipeline de geração aborda um problema persistente de benchmarks. Construir manualmente centenas de ambientes interativos é lento, enquanto tarefas geradas por modelos sem restrições frequentemente contêm objetivos impossíveis ou avaliações defeituosas.

Combinar síntese automatizada com verificação humana oferece um caminho intermediário. A abordagem pode produzir mais tarefas preservando uma barreira de qualidade.

O mesmo método pode gerar cenários de treinamento, não apenas casos de teste. Pesquisadores podem criar grafos de dependências, instanciar cenas em sandbox e anexar verificações determinísticas de marcos.

Isso importa porque agentes de longo horizonte precisam praticar com falhas que se desenrolam ao longo do tempo. Conjuntos de dados visuais estáticos não podem ensinar a recuperação após uma escolha errada de caminho ou um pré-requisito ignorado.

A infraestrutura aberta também convida a alternativas ao escalonamento de modelos de ponta a ponta. Uma equipe pode manter o modelo-base constante e testar mapas espaciais explícitos, memória episódica, grafos causais ou planejadores hierárquicos.

Outro experimento pode separar o planejamento de alto nível do movimento de baixo nível. O modelo poderia selecionar objetivos enquanto um controlador especializado lida com a evasão de obstáculos e a execução de rotas.

Pesquisadores podem então perguntar se as falhas de navegação refletem inteligência fraca, controle motor fraco ou uma interface instável entre os dois.

O benchmark também pode apoiar o design de currículos. Agentes poderiam começar com tarefas de um salto e então avançar para grafos de dependência mais profundos à medida que sua taxa de conclusão se estabiliza.

No entanto, os conjuntos de treinamento e avaliação devem permanecer distintos. Reutilizar cenários públicos transformaria o MineExplorer em um teste de memorização.

O resultado futuro mais informativo não será um pequeno ganho no ranking. Será uma queda mais suave entre tarefas de um e quatro saltos.

Um sistema que eleva o sucesso geral preservando a mesma curva de colapso melhorou a competência local. Um sistema que mantém o desempenho à medida que as dependências se aprofundam melhorou a coordenação de longo horizonte.

Essa distinção deve orientar relatos futuros. A taxa geral de sucesso em tarefas comprime vários comportamentos em um único número. O desempenho específico por salto revela onde o agente deixa de funcionar de forma confiável.

O lançamento aberto dá a equipes externas as ferramentas para testar essas alegações. Também permite que proponham avaliações mais difíceis sem reconstruir toda a infraestrutura do Minecraft.

O que Observar Após o Resultado de Anthropic no MineExplorer

A próxima fase deve se concentrar em replicação independente, sistemas de navegação aprimorados e desempenho estável em tarefas multi-hop inéditas.

O primeiro sinal é a reprodução independente da pontuação geral de 41% e da queda de 77% para 12%. Pesquisadores devem executar novamente Claude Opus 4.6 e outros modelos sob configurações documentadas de controlador, prompt e ambiente.

Uma reprodução próxima fortaleceria a alegação de que pré-requisitos ocultos impulsionam um padrão geral de falha. Grandes diferenças sugeririam que a estrutura de suporte dos agentes contribui mais do que o ranking inicial indica.

O segundo sinal é se sistemas explícitos de estado e navegação reduzem a categoria de falha dominante. Experimentos úteis devem comparar o histórico bruto de quadros com mapas, memória estruturada, grafos causais de tarefas e políticas de recuperação de rotas.

Uma melhoria significativa reduziria falhas de navegação sem sacrificar o desempenho de raciocínio ou ação. Simplesmente aumentar a janela de contexto não responderia à crítica central do benchmark.

O terceiro sinal é o desempenho de modelos mais novos em cenários de quatro saltos mantidos fora do treinamento. Desenvolvedores devem relatar o sucesso em tarefas por número de saltos, não apenas uma média geral.

Um modelo que obtém pontuações mais altas em tarefas de um salto enquanto permanece próximo de 12% em tarefas de quatro saltos não fechou a lacuna de longo horizonte. Resultados mais fortes em estruturas de dependência inéditas forneceriam evidências melhores de exploração geral.

Os leitores também devem observar se desenvolvedores de modelos adotam o MineExplorer ou avaliações relacionadas em cartões oficiais de sistema. A inclusão sinalizaria que a interação multimodal de longa duração está se tornando um alvo padrão de capacidade.

Para desenvolvedores, a lição prática já está clara. Não avalie um agente apenas por meio de ações isoladas ou demonstrações bem-acabadas.

Teste fluxos de trabalho completos com pré-requisitos ocultos, estado em mudança e oportunidades de recuperação. Meça onde o agente perde o controle de seu objetivo e diferencie erros de percepção de falhas de navegação, raciocínio e controle.

Compradores empresariais devem exigir as mesmas evidências. A classificação de um modelo em benchmarks diz pouco sobre se um agente integrado consegue concluir um processo de múltiplas etapas de forma consistente.

O MineExplorer não resolve o debate sobre IA incorporada. Ele fornece uma forma reproduzível de tornar uma fraqueza mais difícil de ignorar.

O resultado de Anthropic no MineExplorer é especialmente revelador porque Claude Opus 4.6 terminou em primeiro lugar. O modelo mais forte testado ainda perdeu 65 pontos percentuais à medida que a profundidade da tarefa aumentou de um salto para quatro.

Essa é a inversão central do benchmark. Modelos multimodais atuais muitas vezes conseguem descrever um mundo que não conseguem navegar de forma confiável.

Portanto, o próximo marco confiável para os agentes não é mais uma resposta perfeita para uma captura de tela. É o progresso contínuo em um ambiente desconhecido, incluindo a capacidade de perceber um caminho errado e se recuperar antes que a tarefa termine.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

​Adicione uma barra de pesquisa ao seu cérebro

É só perguntar ao remio

Lembre-se de tudo

Não organize nada

bottom of page