top of page

Agente de Busca do Amazon SageMaker Melhora com RL Multi-Turno, mas um Benchmark Recua

há 5 dias
15 min de leitura

A Amazon informou que seu agente de busca do Amazon SageMaker melhorou a qualidade de recuperação em 23,7% em um benchmark após uma única época de treinamento. O agente Qwen3.6-27B ajustado também reduziu sua taxa de falhas nesse teste de 22,89% para 0,68%. No entanto, ele não melhorou em todas as avaliações.

Esse resultado misto importa mais do que uma pontuação perfeita importaria. A AWS está testando se as empresas podem ensinar um modelo menor a navegar por suas ferramentas de busca em vez de repetir prompts para um modelo de fronteira. O sucesso deslocaria parte da competição entre agentes do tamanho do modelo para o treinamento específico de cada ambiente.

O experimento também expõe os limites desse argumento. A AWS comparou o modelo ajustado com seu próprio modelo-base não ajustado, e não com um modelo de fronteira atual. Seus benchmarks mediram o comportamento de recuperação em uma configuração controlada, e não precisão, latência e custo operacional em uma implantação empresarial real.

A AWS Apresentou Números Concretos para o Treinamento de Agentes Multi-Turno

A mudança significativa não é que o SageMaker possa ajustar um modelo, mas que a AWS avaliou um agente em trajetórias completas de busca.

A AWS publicou o experimento em 2 de outubro de 2026, vários meses após lançar o aprendizado por reforço multi-turno do SageMaker AI. A empresa usou o serviço para personalizar um modelo Qwen3.6-27B para recuperação no estilo empresarial.

O agente tinha acesso a dois métodos de busca. O BM25, um método de recuperação lexical, encontra documentos por meio de termos exatos e padrões de frequência de palavras. A busca vetorial converte consultas e documentos em representações numéricas, ajudando a relacionar conceitos expressos com palavras diferentes.

Escolher entre essas ferramentas é apenas uma parte da tarefa. O agente também precisa reescrever consultas fracas, inspecionar o material recuperado, decidir se outra busca é útil e parar antes de esgotar seus limites. Cada escolha altera o contexto disponível para a próxima.

Essa dependência explica por que a AWS usou aprendizado por reforço multi-turno, ou MTRL. A técnica pontua o comportamento ao longo de uma sequência de ações, em vez de tratar cada resposta do modelo como um evento isolado. A documentação de MTRL do SageMaker descreve o objetivo como maximizar a recompensa cumulativa em toda a sequência.

Neste experimento, a recompensa foi nDCG@10. O Ganho Cumulativo Descontado Normalizado na posição 10 mede se documentos relevantes aparecem perto do topo dos primeiros dez resultados. Uma pontuação de 1 representa uma classificação ideal, enquanto zero significa que o sistema não recuperou nenhum documento relevante.

A AWS aplicou essa pontuação após o agente concluir sua trajetória de busca. Também atribuiu uma recompensa de menos um quando o agente excedia seu limite de turnos ou o orçamento de tokens de um único turno. Essa penalidade tornou a conclusão eficiente parte do objetivo de aprendizado.

A empresa reuniu material de treinamento de FRAMES, BRIGHT, Enterprise RAG, ESCI, Musique e MLQA. Esses conjuntos de dados abrangem perguntas multi-hop, recuperação intensiva em raciocínio, documentos empresariais, busca de produtos e compreensão multilíngue.

O benchmark Enterprise RAG contém mais de 500.000 documentos empresariais sintéticos e 500 perguntas. A AWS reservou 5% de cada conjunto de dados de treinamento para validação.

Os testes usaram quatro conjuntos de dados separados. WixQA abrange perguntas de suporte baseadas na documentação do Wix. Wands avalia a relevância da busca de produtos, enquanto FreshStack se concentra em perguntas recentes de desenvolvedores. BrowseComp-Plus testa consultas de pesquisa difíceis contra cerca de 100.000 documentos da web verificados por humanos.

Essa separação é importante porque reduz a chance de que a avaliação apenas recompense exemplos de treinamento memorizados. Ela não elimina todas as formas de contaminação de benchmark ou sobreposição de distribuição. Ainda assim, conjuntos de dados reservados tornam os ganhos relatados mais significativos do que pontuações de treinamento isoladas.

A AWS alterou apenas três configurações expostas em relação aos valores padrão. Executou uma época, usou um tamanho global de lote de 128 e permitiu 32 rollouts simultâneos. Um rollout é uma tentativa amostrada do agente de concluir uma tarefa com várias etapas.

O serviço mais amplo gerencia a coleta de trajetórias, checkpoints e atualizações de modelos. Também registra recompensas e rastreamentos por turno por meio do MLflow gerenciado. Segundo o experimento original do agente de busca, as recompensas de treinamento e validação aumentaram antes de se estabilizarem perto do fim.

Esse é o evento por trás da manchete. A AWS agora tem um exemplo público em que seu serviço gerenciado de MTRL alterou tanto a classificação de recuperação quanto o comportamento de falha em conjuntos de dados não vistos. A questão mais relevante é o que esse resultado faz com a estratégia padrão para construir agentes.

O Padrão dos Modelos de Fronteira Está Agora Sob Pressão

A AWS está contestando a suposição de que a confiabilidade precisa vir da chamada ao modelo de uso geral mais capaz disponível.

Um modelo de fronteira frequentemente lida melhor com ferramentas desconhecidas do que um modelo menor porque suas capacidades gerais de raciocínio e de seguir instruções são mais fortes. Essa vantagem pode torná-lo o ponto de partida mais seguro para protótipos. Ela também pode ocultar fraquezas no design do ambiente do agente.

Um modelo maior ainda não entende inerentemente os índices de busca, filtros, permissões, metadados ou regras de parada de uma empresa. As equipes normalmente descrevem esses detalhes por meio de prompts e esquemas de ferramentas. Em seguida, pagam para que o modelo interprete essa orientação durante cada tarefa.

A AWS propõe uma divisão de trabalho diferente. A organização define o ambiente e a métrica de sucesso, enquanto o aprendizado por reforço transforma a interação repetida em comportamento do modelo. O modelo resultante torna-se mais especializado e menos dependente de extensas instruções em tempo de execução.

Essa abordagem pressiona a rota de “prompt mais modelo de fronteira”. A disputa muda de qual modelo sabe mais para qual sistema aprende a sequência certa de ações locais. Na busca empresarial, essas ações podem ser restritas mesmo quando as perguntas subjacentes são variadas.

Um agente de busca de suporte, por exemplo, pode precisar reconhecer códigos de erro, preferir primeiro a correspondência exata, ampliar a consulta quando os resultados são escassos e parar após localizar um procedimento autorizado. Um modelo geral pode inferir essa política. Um modelo especializado pode codificá-la por meio do treinamento.

O argumento econômico continua sendo uma alegação, e não um resultado desta avaliação específica. A AWS afirma que modelos menores e especializados podem oferecer menor latência e menor custo de inferência. No entanto, a tabela publicada não contém medições de latência, totais de tokens, custos de implantação ou comparação direta com modelos de fronteira.

O próprio serviço tornou-se amplamente disponível como uma capacidade serverless de personalização do SageMaker em 3 de junho de 2026. A AWS afirmou que o lançamento abrangia orquestração de rollouts, coleta de trajetórias, treinamento, gerenciamento de checkpoints e avaliação. Seu anúncio de lançamento também listou Qwen3.6-27B, Nova Lite 2.0, GPT-OSS-20B e Gemma-4-31B-it entre os modelos e regiões compatíveis.

O treinamento serverless reduz a barreira de infraestrutura, mas não elimina o trabalho de aplicação. As equipes ainda precisam de um ambiente de agente que possa ser chamado, tarefas representativas, verdade fundamental confiável e uma recompensa que reflita o sucesso real. Recompensas mal escolhidas podem ensinar um modelo a otimizar a pontuação sem atingir o objetivo de negócio.

Esse requisito favorece organizações com fluxos de trabalho mensuráveis. A qualidade de busca funciona bem porque as equipes podem rotular documentos relevantes e calcular métricas de classificação. Suporte ao cliente, execução de código e operações estruturadas também podem produzir resultados verificáveis.

A pesquisa aberta é mais difícil. Uma resposta plausível pode estar incompleta, sem suporte ou baseada em uma fonte enganosa. Uma única pontuação final pode não capturar essas distinções.

A pressão prática, portanto, recai sobre dois grupos. Os provedores de modelos precisam mostrar por que um modelo geral maior continua valendo a pena para tarefas repetidas e delimitadas. As equipes de IA empresarial precisam decidir se suas cargas de trabalho são estáveis o suficiente para justificar o treinamento de uma política especializada.

Para equipes que constroem sistemas internos pesquisáveis, essa decisão começa pela qualidade dos dados, e não pela seleção do modelo. Uma base de conhecimento de engenharia confiável ainda precisa de documentos atualizados, propriedade clara e fontes rastreáveis. O treinamento não consegue recuperar informações que a camada de recuperação não contém.

Como o Agente de Busca do Amazon SageMaker Aprendeu Toda a Trajetória

O mecanismo funciona porque o SageMaker recompensa o resultado final da busca enquanto preserva a cadeia de decisões que o produziu.

O ajuste supervisionado ensina um modelo a imitar exemplos. Para um agente de busca multi-turno, esses exemplos precisam mostrar trajetórias completas e de alta qualidade. Especialistas teriam de demonstrar consultas úteis, escolhas sensatas de ferramentas, inspeção de evidências, recuperação diante de resultados fracos e um ponto de parada apropriado.

Essas demonstrações são caras de produzir. Elas também são específicas de cada ambiente. Uma trajetória criada para um índice de documentos pode ser inadequada para outro sistema com metadados, ferramentas de recuperação ou controles de acesso diferentes.

O aprendizado por reforço de turno único evita alguns custos de demonstração, mas cria outro desalinhamento. Pontuar uma saída de cada vez não consegue capturar plenamente decisões cujo valor só se torna visível vários turnos depois.

Uma consulta vetorial ampla pode parecer inicialmente improdutiva. Seus resultados podem revelar um identificador exato de produto que torna a próxima consulta BM25 bem-sucedida. Penalizar a primeira ação de forma independente ignoraria sua contribuição para a busca concluída.

O MTRL mantém essa relação intacta. O agente interage com o ambiente, recebe resultados de busca, atualiza seu contexto e escolhe outra ação. O SageMaker coleta a trajetória resultante e usa a recompensa final para ajustar a política por trás dessas decisões.

O design de recompensa da AWS combinou qualidade de recuperação com prevenção explícita de falhas. O nDCG@10 valorizou a classificação do conjunto final de documentos. A recompensa negativa desestimulou trajetórias que excediam seus turnos ou tokens permitidos.

Essa combinação parece central para o maior resultado de confiabilidade. No BrowseComp-Plus, o agente-base falhou em 22,89% de 830 perguntas. A versão ajustada falhou em 0,68%.

O resultado sugere que o modelo aprendeu quando concluir, e não apenas como recuperar uma classificação melhor. A média de turnos também caiu de 7,0 para 6,3 nesse benchmark. Menos turnos podem indicar maior eficiência, embora a avaliação publicada não converta essa redução em latência ou custo.

O mesmo padrão não apareceu em todos os casos. No WixQA, a média de turnos subiu de 4,3 para 4,5. Wands aumentou de 2,2 para 2,9. FreshStack caiu de 3,1 para 2,8.

Essas diferenças mostram por que “menos turnos” não é uma medida universal de melhor comportamento de agentes. Uma consulta extra pode melhorar a cobertura de evidências, enquanto uma parada antecipada pode produzir uma resposta fraca. A medida correta precisa conectar a contagem de turnos à qualidade de recuperação e à conclusão da tarefa.

O SageMaker executa rollouts e atualizações de gradiente de forma assíncrona. A obsolescência off-policy limitada restringe o quanto os exemplos de treinamento podem se afastar da versão do modelo atualmente otimizada. A plataforma também oferece suporte a perdas PPO, CISPO e de amostragem por importância, com vários estimadores de vantagem.

A AWS deixou essas escolhas em seus padrões neste experimento. Isso facilita a reprodução da configuração, mas também obscurece quais decisões algorítmicas geraram os ganhos. Os usuários recebem um caminho gerenciado, não uma ablação detalhada de cada componente de treinamento.

A direção subjacente tem respaldo além desta única publicação de blog. O artigo revisado por pares WebAgent-R1, escrito por pesquisadores da Amazon e de instituições acadêmicas, treinou agentes por meio de interação multi-turno de ponta a ponta.

No WebArena-Lite, esse trabalho elevou o sucesso em tarefas do Qwen2.5-3B de 6,1 por cento para 33,9 por cento. Também elevou o Llama-3.1-8B de 8,5 por cento para 44,8 por cento. Os autores também concluíram que o aquecimento por clonagem de comportamento afetou os resultados, o que complica alegações de que o aprendizado por reforço, por si só, resolve o treinamento de agentes.

O experimento do SageMaker é mais restrito do que o WebAgent-R1. Ele se concentra na recuperação de documentos, e não em ações em sites em constante mudança. Ainda assim, ambos apontam para o mesmo mecanismo: o modelo melhora quando o treinamento preserva interações entre ações, observações e resultados tardios.

Maior Confiabilidade Não Significou Ganhos Universais de Recuperação

As evidências mais fortes sustentam uma especialização aprimorada, não a alegação generalizada de que RL multi-turno torna toda tarefa de busca melhor.

O modelo ajustado melhorou o nDCG@10 em três dos quatro benchmarks mantidos para teste. O BrowseComp-Plus subiu de 0.5136 para 0.6354, um ganho relativo de 23,7 por cento. O WixQA aumentou de 0.5725 para 0.6781, um ganho de 18,4 por cento.

O Wands passou de 0.5762 para 0.6112, uma melhora de 6 por cento. O FreshStack seguiu na direção oposta, caindo de 0.4112 para 0.4089.

Essa regressão é pequena, mas analiticamente importante. Ela impede que o experimento sustente uma conclusão simplista de que “o treinamento torna a busca melhor”. O modelo aprendeu uma política que se transferiu de forma desigual entre domínios.

O FreshStack contém perguntas recentes de desenvolvedores derivadas do Stack Overflow e de documentação técnica. Essas consultas podem depender de terminologia específica de versões e de fatos que mudam rapidamente. Uma política treinada em conjuntos de dados mais amplos de recuperação pode não melhorar essa distribuição.

A AWS não publicou uma análise de erros explicando a regressão. Permanece incerto se o problema veio da seleção de ferramentas, da reescrita de consultas, de material-fonte desatualizado, do alinhamento de recompensas ou de variação comum na avaliação.

Os quatro testes também diferiam substancialmente em tamanho. Eles incluíam 147 perguntas do Wands, 400 perguntas do WixQA, 672 perguntas do FreshStack e 830 perguntas do BrowseComp-Plus. A AWS não relatou intervalos de confiança nem significância estatística.

Essa omissão não invalida as medições. Ela limita o grau de confiança com que os leitores podem generalizar as diferenças menores, especialmente o ganho de 6 por cento no Wands e a leve queda no FreshStack.

A avaliação também combina tarefas fracassadas com qualidade de recuperação ao atribuir às execuções malsucedidas uma pontuação nDCG@10 de zero. Esse tratamento é defensável porque um agente que falha não produz nenhuma saída classificada útil. No entanto, isso significa que parte do aumento de pontuação no BrowseComp-Plus vem da prevenção de falhas.

A distinção importa para compradores. Um sistema que deixa de travar é claramente mais útil, mesmo que suas buscas bem-sucedidas classifiquem documentos de forma semelhante. Ainda assim, melhoria de confiabilidade e melhoria de relevância descrevem resultados de engenharia diferentes.

Nenhuma parte independente reproduziu esses resultados exatos do SageMaker. A AWS projetou a configuração, executou a avaliação e publicou a análise. O relatório fornece valores detalhados dos benchmarks, mas não libera todos os artefatos de treinamento ou trajetórias necessários para uma auditoria completa.

Também não há comparação com ajuste fino supervisionado, um modelo de fronteira guiado por prompts ou outra plataforma gerenciada de MTRL. O agente base Qwen3.6-27B é a única referência direta. Portanto, a alegação mais ampla da AWS sobre confiabilidade em nível de modelos de fronteira permanece não testada aqui.

Pesquisas relacionadas da Amazon oferecem mais evidências para a abordagem geral, mas não confirmação independente. Em um conjunto separado de experimentos, pesquisadores da Amazon relataram que o aprendizado por reforço elevou um agente de assistente pessoal Qwen2.5-32B de 39,20 por cento para 72 por cento de conclusão de tarefas.

O mesmo estudo de personalização de agentes relatou ganhos para modelos menores de recuperação no Natural Questions e no Musique. Esses resultados reforçam a tese de que a interação com o ambiente pode melhorar agentes. Ainda assim, eles vêm de trabalhos afiliados à Amazon e usam modelos, dados e tarefas diferentes.

Segurança e governança criam outra incerteza. Durante o treinamento, o agente chama repetidamente ferramentas reais ou simuladas. Um ambiente mal isolado poderia expor dados sensíveis, disparar ações não intencionais ou recompensar atalhos que seriam inaceitáveis em produção.

Os sistemas de busca também mudam. Documentos são adicionados, serviços de classificação são atualizados e esquemas de ferramentas evoluem. Uma política ajustada para um ambiente pode perder precisão após essas mudanças, mesmo quando o checkpoint do modelo permanece inalterado.

As organizações precisarão de testes de regressão para o sistema completo de agentes. A avaliação do modelo, por si só, não detectará todas as falhas criadas por um índice modificado, uma regra de permissão ou uma resposta de ferramenta.

As evidências, portanto, sustentam uma conclusão delimitada. O RL multi-turno melhorou a confiabilidade deste agente e a maioria das pontuações de recuperação na avaliação da AWS. Ele não estabeleceu transferência universal, paridade com modelos de fronteira nem economia garantida.

A Competição entre Agentes Está se Voltando para Ambientes e Recompensas

O ativo estratégico está se tornando o ambiente de treinamento capaz de informar a um agente quando uma tarefa inteira foi concluída com sucesso.

Os modelos de base continuam importantes porque determinam a qualidade dos rollouts iniciais. Um modelo base fraco pode não descobrir trajetórias bem-sucedidas suficientes para que o aprendizado por reforço as reforce.

A própria pesquisa da AWS observa esse efeito. Modelos base mais capazes podem gerar comportamentos candidatos melhores, criando sinais de treinamento mais fortes. A especialização não elimina o valor da capacidade geral do modelo.

No entanto, um modelo sozinho não define um agente empresarial. O sistema também inclui ferramentas, índices, permissões, estado, limites de tarefa e regras de avaliação. O MTRL transforma esses componentes ao redor em parte do ciclo de treinamento.

Essa mudança altera onde as empresas podem construir desempenho defensável. Duas organizações podem começar com o mesmo modelo aberto e, ainda assim, produzir agentes diferentes porque seus ambientes e funções de recompensa codificam conhecimentos operacionais distintos.

A busca é um campo de prova especialmente adequado. Julgamentos de relevância fornecem feedback mensurável, e documentos recuperados podem ser comparados com respostas conhecidas. A busca também obriga o agente a equilibrar correspondência exata, recuperação semântica, reformulação de consultas e comportamento de encerramento.

Outros fluxos de trabalho são menos cooperativos. Pesquisas de vendas podem ter várias saídas aceitáveis. Investigações podem revelar evidências válidas que estavam ausentes de um benchmark. O trabalho do conhecimento costuma valorizar novidade, nuance e procedência, além da conclusão de tarefas.

Uma única recompensa terminal pode comprimir essas qualidades de forma excessiva. As equipes podem precisar de avaliações compostas que meçam separadamente a qualidade das evidências, a precisão das citações, a conformidade com políticas e a eficiência das ações.

A corrida por infraestrutura, portanto, envolverá mais do que treinamento gerenciado. Os fornecedores precisarão ajudar clientes a construir ambientes seguros, depurar trajetórias, comparar checkpoints e detectar manipulação de recompensas.

A integração do SageMaker com o MLflow atende parte dessa necessidade ao expor rastros e recompensas em nível de turno. Trabalhos retomáveis também ajudam porque rollouts multi-turno podem levar mais tempo do que o ajuste fino convencional. A AWS afirma que o limite padrão de seus trabalhos é de 24 horas, embora os usuários possam ajustá-lo e retomar a partir de checkpoints.

O suporte a modelos e a disponibilidade regional continuam sendo restrições. No momento do experimento, o Qwen3.6-27B tinha suporte para MTRL na região US West, Oregon. Uma empresa com requisitos de residência de dados ou um modelo sem suporte pode precisar de um plano de implantação diferente.

A interface serverless também cria dependência da plataforma. A AWS gerencia a orquestração de rollouts e detalhes de otimização que uma equipe auto-hospedada controlaria de outra forma. Essa troca pode acelerar a implantação, ao mesmo tempo em que torna a experimentação de baixo nível mais difícil.

A pesquisa aberta continua a desenvolver alternativas. Frameworks como o WebAgent-R1 expõem mais do desenho de treinamento, incluindo rollouts paralelos e compressão de contexto. Serviços gerenciados empacotam ideias semelhantes para organizações que não querem operar infraestrutura distribuída de aprendizado por reforço.

A provável divisão não é entre gerenciado e aberto em termos absolutos. As empresas escolherão com base na sensibilidade da carga de trabalho, nos requisitos de modelo, na capacidade de engenharia e no valor de controlar cada componente do treinamento.

A vantagem da AWS é a integração. As equipes podem conectar agentes hospedados por vários serviços da AWS, treinar por meio do SageMaker, inspecionar rastros e implantar o modelo resultante em endpoints do SageMaker ou no Amazon Bedrock.

Seu desafio restante é a comprovação. Os compradores precisam de evidências de que o caminho gerenciado produz melhorias repetíveis em suas próprias tarefas e permanece estável após mudanças no ambiente.

Três Sinais Testarão a Tese da AWS sobre Agentes Menores

A próxima fase deve ser avaliada por meio de reprodução externa, economia de produção e estabilidade entre ambientes.

O primeiro sinal é a replicação independente. Outra equipe precisa reproduzir os ganhos de recuperação usando conjuntos de dados divulgados, uma referência comparável do Qwen3.6-27B e os mesmos limites de tarefa. Reproduzir o resultado de confiabilidade no BrowseComp-Plus fortaleceria a alegação central da AWS.

Uma reprodução deve separar ganhos de classificação da prevenção de falhas. Também deve incluir estimativas de incerteza e execuções repetidas. Se a melhoria desaparecer sob esses controles, o resultado atual parecerá mais específico à configuração de avaliação da AWS.

O segundo sinal é uma comparação direta em produção com um modelo de fronteira. As equipes devem medir qualidade das respostas, relevância de recuperação, latência ponta a ponta, tokens consumidos e taxas de intervenção na mesma carga de trabalho. A despesa de treinamento deve ser incluída junto ao comportamento de inferência.

Se um modelo especializado igualar o modelo maior usando menos recursos na implantação, o argumento econômico se tornará concreto. Se as equipes precisarem retreinar com frequência ou manter uma infraestrutura complexa de recompensas, parte da economia esperada migrará para outros pontos da pilha.

O terceiro sinal é o desempenho depois que o ambiente muda. Um teste útil modificaria o corpus de documentos, atualizaria um esquema de ferramenta ou introduziria um novo filtro de busca. Os avaliadores poderiam então medir se o agente se adapta por meio de prompts ou exige outro ciclo de treinamento.

Um desempenho estável sustentaria a alegação da AWS de que o MTRL ensina comportamento de busca transferível. Uma queda acentuada mostraria que o modelo aprendeu uma política de interface estreita, fortemente vinculada ao seu ambiente original.

Os desenvolvedores também devem observar a regressão do FreshStack. Experimentos futuros precisam explicar por que uma política que ajudou três conjuntos de dados prejudicou levemente este. Uma análise de erros direcionada revelaria se atualidade, vocabulário técnico ou estratégia de consulta causaram a diferença.

Compradores empresariais não precisam escolher entre modelos de fronteira e agentes especializados para todas as tarefas. Uma arquitetura prática pode direcionar buscas comuns e mensuráveis a um modelo ajustado e escalar trabalhos desconhecidos para um modelo mais amplo.

Essa abordagem híbrida preserva a flexibilidade enquanto testa se a especialização produz economia confiável. Ela também limita o risco de impor uma única política a cada necessidade de informação.

O resultado do agente de busca do Amazon SageMaker torna esse experimento válido. Ele mostra uma redução mensurável de falhas e melhor classificação na maioria dos testes mantidos para teste. Também deixa incerteza suficiente para exigir avaliação com base nos próprios documentos e fluxos de trabalho de cada organização.

Para as equipes que consideram essa abordagem, a próxima ação adequada não é a implantação imediata. Crie um conjunto de testes representativo, defina com precisão o que constitui uma falha e compare o agente ajustado com a melhor referência existente. Em seguida, verifique se a melhoria se mantém diante de novos documentos, ferramentas modificadas e casos-limite difíceis.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page