top of page

Dados da Anthropic e a16z Dizem que Agentes Superam Humanos, mas o Benchmark Esconde uma Realidade Mais Difícil

28 de ago.
14 min de leitura

Dados da Anthropic e da a16z agora colocam Claude Fable 5 em 85% no OSWorld-Verified, acima de uma pontuação humana de 72,36% amplamente citada. Um ano antes, a melhor pontuação reportada por um agente ficava perto de 42%. Essa alta sugere que os agentes de uso de computador cruzaram um limiar que até recentemente parecia distante.

A comparação também traz uma ressalva importante. A pontuação humana veio do estudo original do OSWorld, enquanto o resultado de 85% usa a avaliação revisada OSWorld-Verified. Esses números descrevem testes relacionados, mas não estabelecem uma competição controlada entre Claude Fable 5 e pessoas.

A distinção importa porque agentes de computador estão passando de demonstrações para fluxos de trabalho em que erros têm consequências. OpenAI, Google, Anthropic e desenvolvedores especializados querem que agentes operem navegadores, aplicativos de desktop e sistemas empresariais. Uma pontuação alta muda as expectativas dos compradores, mesmo quando não resolve se esses sistemas conseguem lidar com uma jornada de trabalho comum.

Dados da Anthropic e a16z Mostram uma Notável Evolução em Um Ano

A mudança mais importante não é que um modelo alcançou 85%. É que um benchmark difícil de uso de computador melhorou de cerca de 42% para 85% em aproximadamente um ano.

O placar de agentes de computador destacado pela a16z acompanha uma alta acentuada no OSWorld-Verified. Claude Fable 5 lidera os resultados reportados com 85%. O gráfico apresenta a interação com computadores como uma das áreas de melhoria mais rápida na IA aplicada.

O OSWorld testa se um agente consegue concluir tarefas em ambientes de software reais. Em vez de responder a uma pergunta, o agente precisa inspecionar uma tela e decidir o que fazer. Em seguida, realiza ações por interfaces que se assemelham a controles de mouse e teclado.

Uma tarefa pode exigir a edição de um documento, a alteração de uma configuração de aplicativo, o gerenciamento de arquivos ou a transferência de informações entre programas. O sucesso depende de mais do que geração de linguagem. O agente precisa identificar elementos da interface, preservar o estado, planejar várias etapas e reconhecer se suas ações funcionaram.

O benchmark OSWorld original continha 369 tarefas envolvendo aplicativos como Chromium, LibreOffice, Thunderbird, GIMP, VLC e Visual Studio Code. Oito tarefas do Google Drive podiam ser excluídas porque exigiam configuração manual, resultando em uma avaliação de 361 tarefas.

Os pesquisadores reportaram uma taxa de sucesso de 12,24% para o melhor modelo quando apresentaram o benchmark em 2024. Participantes humanos não familiarizados com o software concluíram 72,36% das tarefas. Essa enorme diferença tornou o OSWorld um teste útil porque expunha fraquezas ocultas por benchmarks conversacionais.

Os agentes tiveram dificuldades com o aterramento em interfaces gráficas de usuário, isto é, conectar um alvo visual à posição correta na tela. Eles também não tinham conhecimento operacional sobre como os aplicativos se comportam. Um modelo podia entender a instrução e ainda assim clicar no controle errado ou perder o acompanhamento de uma caixa de diálogo.

O esforço posterior OSWorld-Verified tratou de tarefas defeituosas ou instáveis na coleção original. A manutenção de benchmarks importa porque sites mudam, aplicativos são atualizados e scripts de avaliação podem interpretar incorretamente resultados válidos. Um teste mais limpo pode medir agentes com mais consistência.

No entanto, mudar um benchmark também muda o significado de suas pontuações. Remover tarefas com problemas melhora a validade, mas impede uma comparação histórica simples, a menos que cada sistema anterior seja executado novamente sob condições idênticas. As configurações dos agentes, os limites de ações, a resolução de tela e os mecanismos de avaliação também precisam corresponder.

Por isso, a linha de 42% para 85% é melhor entendida como um sinal de progresso rápido. Ela não é uma estimativa controlada de que os agentes se tornaram exatamente duas vezes mais capazes. A tendência é forte, enquanto sua magnitude precisa permanece incerta.

O número de 85% ainda é consequente. Sistemas de uso de computador precisam traduzir repetidamente observações visuais em ações, de modo que erros se acumulam ao longo de uma trajetória. Elevar as taxas de conclusão exige melhorias em percepção, raciocínio, memória e recuperação.

Isso torna o resultado mais amplo do que uma atualização de qualidade de modelo. Ele indica que desenvolvedores estão melhorando a montagem de todo o ciclo de execução. Modelos melhores ajudam, mas prompts, representações de tela, etapas de reflexão e componentes especializados de aterramento também influenciam o resultado.

A comparação entre Anthropic e a16z, portanto, captura uma mudança real. Agentes de uso de computador já não falham quase automaticamente em tarefas comuns de desktop. A questão mais difícil é se passar em um benchmark agora prevê trabalho confiável fora de seu ambiente controlado.

A Manchete sobre Desempenho em Nível Humano Combina Dois Testes Diferentes

Claude Fable 5 parece superar uma referência humana famosa, mas as evidências disponíveis não estabelecem uma comparação equivalente entre humanos e agentes.

O número de 72,36% vem de testes com humanos conduzidos para o artigo original do OSWorld. O número de 85% está associado ao OSWorld-Verified, um conjunto de tarefas e processo de avaliação revisados. Tratá-los como intercambiáveis elimina o contexto metodológico por trás dos dois números.

Até a palavra “humano” precisa de qualificação. O estudo original testou pessoas que não conheciam o software. Sua pontuação não era um limite teórico para o desempenho humano. Usuários experientes, mais tempo ou uma integração inicial mais clara poderiam produzir outro resultado.

A pontuação do agente também depende de suas condições operacionais. Avaliações de uso de computador podem variar conforme a resolução de tela, o histórico de ações disponível, o número máximo de etapas, a política de tentativas e o orçamento de raciocínio. Um agente com permissão para realizar mais inferências ou reflexões pode concluir mais tarefas, consumindo mais tempo e recursos computacionais.

As taxas de aprovação também podem ser reportadas a partir de uma tentativa ou de várias tentativas. Um sistema que tem sucesso uma vez em várias execuções oferece uma experiência de produto diferente daquela de um sistema que tem sucesso de forma confiável na primeira tentativa. A automação empresarial normalmente exige o segundo comportamento.

Outra questão são os dados de trajetória. Tarefas de benchmark e rastros de interação bem-sucedidos podem influenciar o treinamento posterior de modelos ou o design de agentes. A exposição não invalida automaticamente um resultado, mas enfraquece a alegação de que uma pontuação mede competência geral no uso de computadores.

A equipe original do OSWorld constatou que um histórico mais longo de trajetória baseado em texto melhorava o desempenho. Esse histórico dava aos agentes mais informações sobre decisões anteriores. No entanto, também criava desafios de eficiência à medida que o contexto de raciocínio aumentava.

A resolução da tela também importava. Capturas de tela com maior resolução geralmente melhoravam os resultados porque os modelos conseguiam localizar pequenos controles com mais precisão. A constatação mostra por que duas avaliações nominalmente semelhantes podem produzir pontuações diferentes quando seus ambientes não estão alinhados.

Uma pontuação de 85% também deixa uma taxa de falha significativa. Em 361 tarefas, uma taxa de falha de 15% corresponderia a cerca de 54 tarefas malsucedidas se todas tivessem o mesmo peso. Essa estimativa ilustra a lacuna operacional, embora os protocolos de benchmark reportados possam agregar execuções de forma diferente.

Para um experimento de consumo, uma falha ocasional pode ser tolerável. Para folha de pagamento, conformidade, administração de contas ou registros de clientes, falhar em uma de cada sete tarefas é uma restrição de implantação. O custo depende de o sistema parar com segurança ou deixar um estado incorreto para trás.

Isso não torna o benchmark sem sentido. O OSWorld-Verified mede algo importante: se um agente consegue executar uma instrução delimitada em um ambiente de computador configurado. Ele oferece um desafio mais realista do que responder a perguntas estáticas.

O problema começa quando o sucesso nesse teste se transforma em uma alegação sobre autonomia geral no ambiente de trabalho. O trabalho real contém solicitações pouco claras, sessões interrompidas, permissões em mudança, informações ausentes e consequências que não podem ser redefinidas com uma máquina virtual nova.

As pessoas também sabem quando instruções entram em conflito com o contexto. Elas pedem esclarecimentos, percebem mudanças suspeitas e trazem conhecimento externo para uma tarefa. Agentes de computador frequentemente otimizam para concluir a instrução aparente, mesmo quando a ação correta é pausar.

A manchete da Anthropic e a16z é, portanto, útil em termos direcionais, mas frágil numericamente. Ela mostra que Claude Fable 5 e seu sistema de agentes ao redor conseguem concluir muitas tarefas padronizadas de desktop. Não mostra que o sistema é mais capaz do que um funcionário experiente em fluxos de trabalho reais.

Uma alegação mais sólida de desempenho em nível humano exigiria que humanos e agentes tentassem as mesmas tarefas verificadas sob limites comparáveis. Pesquisadores precisariam reportar conclusão, tempo, tentativas, intervenções e erros prejudiciais. Sem esses controles, 85% contra 72,36% continua sendo uma comparação chamativa entre medições relacionadas.

Agentes de Computador Agora Pressionam Todas as Estratégias de Automação

A pontuação pressiona empresas que construíram automação em torno de APIs, scripts e fluxos de trabalho fixos porque agentes em nível de interface podem alcançar softwares que esses métodos não conseguem.

A automação tradicional funciona melhor quando um sistema expõe interfaces estruturadas. Desenvolvedores conectam uma interface de programação de aplicativos, ou API, a outro serviço. Ferramentas de automação robótica de processos, por sua vez, seguem etapas e regras predefinidas da interface.

Ambas as abordagens podem ser eficazes, mas o trabalho de integração cria atrito. Algumas ferramentas internas não têm APIs. Softwares mais antigos podem expor interfaces incompletas, enquanto pequenas mudanças no fluxo de trabalho podem exigir que um desenvolvedor ou consultor reconstrua a automação.

Um agente de uso de computador oferece outra rota. Ele interpreta as mesmas telas que uma pessoa vê e depois atua pela interface existente. Em teoria, isso permite que uma organização automatize softwares sem esperar que cada fornecedor ofereça uma integração dedicada.

A Anthropic introduziu sua capacidade de uso de computador em torno dessa ideia. Sua documentação de uso de computador descreve um ciclo em que um aplicativo fornece capturas de tela e executa ações solicitadas de mouse ou teclado. O modelo observa cada novo estado antes de escolher outra ação.

Essa estrutura é atraente porque separa o raciocínio da execução. Uma empresa pode colocar o modelo em um ambiente controlado e decidir quais ações permitir. O agente não precisa de acesso irrestrito ao computador físico de um funcionário.

A pontuação mais forte no OSWorld-Verified eleva o retorno esperado da construção dessa infraestrutura. Um sistema que tem sucesso em menos da metade das tarefas exige supervisão constante. Com 85%, implantações direcionadas começam a parecer mais plausíveis, especialmente quando as falhas são fáceis de detectar.

Essa mudança pressiona vários grupos.

Fornecedores de software empresarial precisam decidir se agentes devem operar suas interfaces gráficas ou usar APIs compatíveis. O acesso pela interface amplia a cobertura, mas pode criar carga imprevisível e contornar fluxos de produto projetados para revisão humana.

Fornecedores de automação precisam mostrar por que fluxos de trabalho determinísticos continuam valiosos. Sua vantagem está na repetibilidade, na auditabilidade e em regras explícitas. Agentes de computador competem ao lidar com variação e instruções não estruturadas.

Provedores de modelos enfrentam pressão para melhorar mais do que a precisão em benchmarks. Clientes precisam de controles de identidade, registros de ações, limites de permissão e formas confiáveis de interromper a execução. Um modelo que enxerga o botão certo é apenas um componente de um agente implantável.

OpenAI e Google também competem nessa área. Seus sistemas usam diferentes combinações de modelos visuais, navegadores, ferramentas e ambientes de execução. As classificações em benchmarks importam, mas o alcance de um produto depende de quão seguramente esses componentes trabalham em conjunto.

Desenvolvedores de agentes especializados ainda podem superar um modelo geral ao restringir o ambiente. Um sistema projetado para uma única aplicação pode incluir analisadores personalizados, regras de recuperação e verificações de validação. O uso geral de computadores abrange mais tarefas, enquanto a automação especializada pode oferecer maior previsibilidade.

Essa troca moldará a adoção. Um agente geral pode redigir um e-mail, atualizar uma planilha e enviar um arquivo durante uma única sessão. Um sistema especializado pode lidar com um processo específico de sinistros, com verificações mais rigorosas e responsabilidades mais claras.

As empresas devem esperar designs híbridos. Um agente pode interpretar uma solicitação e navegar por estados desconhecidos, enquanto APIs executam transações sensíveis. Validadores determinísticos podem inspecionar o resultado antes que ocorra qualquer ação irreversível.

Esse design limita a importância de um único ranking. A questão comercial útil não é se o uso de computador da Anthropic atingiu 85%. É se um sistema configurado consegue concluir a distribuição de tarefas de uma empresa dentro de sua tolerância a riscos.

As organizações também precisam de acesso ao contexto relevante. Um agente que opera software precisa saber qual arquivo, registro de cliente, política ou mensagem se aplica. Uma base de conhecimento de IA pesquisável pode ajudar as pessoas a organizar esse contexto, embora não elimine a necessidade de controles de execução.

O novo resultado de benchmark muda a premissa inicial. Os compradores já não precisam perguntar se a automação em nível de interface funciona. Eles precisam identificar onde ela funciona de forma consistente, onde precisa de aprovação e onde uma API continua sendo mais segura.

O que a Pontuação de 85% Não Mede

A evidência mais forte contra a autonomia ampla vem de tarefas mais longas, nas quais os agentes ainda perdem contexto, deixam passar mudanças e não verificam seu próprio trabalho.

As tarefas originais do OSWorld geralmente envolviam cerca de 30 ações. Isso é suficiente para expor falhas de grounding, mas ainda é muito menos do que muitos fluxos de trabalho profissionais. Atribuições reais podem abranger várias aplicações, documentos, contas e pontos de decisão.

O OSWorld 2.0 foi projetado para testar esse cenário mais difícil. Seu benchmark de longo horizonte contém 108 fluxos de trabalho em domínios profissionais e cotidianos. Uma pessoa qualificada precisa de uma mediana de cerca de 1,6 hora para concluir uma tarefa.

Os fluxos incluem pesquisa, engenharia, produção criativa, finanças, operações, administração, conformidade e saúde. Cerca de 69,6% exigem mais de uma hora de um usuário qualificado. Eles incluem informações dinâmicas, estado oculto e fatos distribuídos entre fontes.

Um exemplo envolve o envio de um pedido de reembolso. O agente precisa ler um tutorial, examinar recibos, verificar registros bancários e de e-mail, lidar com uma nova mensagem, recuperar informações de funcionários e resolver uma inconsistência. Clicar corretamente é apenas o começo.

No OSWorld 2.0, o melhor sistema reportado concluiu 20,6% das tarefas sob a métrica binária principal. Sua pontuação parcial chegou a 54,8%, o que significa que ele frequentemente avançou sem concluir corretamente todo o fluxo de trabalho.

Esse resultado cria a inversão central. Agentes de computador podem parecer sobre-humanos em tarefas verificadas mais curtas, enquanto continuam muito abaixo de um desempenho confiável em atribuições profissionais longas. Ambas as conclusões podem ser verdadeiras porque medem horizontes diferentes.

O desempenho caiu acentuadamente à medida que as tarefas se tornaram mais longas. Para fluxos que duravam entre 137 e 163 minutos humanos, nenhum modelo testado superou 10% de conclusão binária. Além de 163 minutos, os modelos mantidos não concluíram nenhuma tarefa.

O padrão de falha também mudou. Os agentes não falharam principalmente por não conseguirem operar um controle básico. Eles perderam o controle das restrições, ignoraram novas informações, adivinharam em vez de fazer perguntas e pularam a verificação final.

Essas são falhas graves no ambiente de trabalho. Um funcionário muitas vezes consegue corrigir imediatamente um clique fora do lugar. Um sistema que esquece uma condição de política ou ignora um e-mail atualizado pode produzir um resultado que parece completo, mas está substantivamente errado.

A eficiência acrescenta outra lacuna. O estudo OSWorld-Human examinou quantas etapas os agentes precisavam executar em comparação com trajetórias projetadas por humanos. Ele constatou que os principais sistemas usavam substancialmente mais ações do que o necessário.

Os pesquisadores também identificaram chamadas ao modelo para planejamento, reflexão e avaliação como grandes fontes de latência. Etapas sucessivas podiam levar três vezes mais tempo que as etapas iniciais à medida que as trajetórias se expandiam. Mais raciocínio melhorou algumas decisões, mas tornou o fluxo de trabalho mais lento.

Em um exemplo, alterar dois parágrafos para espaçamento duplo levou 12 minutos para um agente. Uma pessoa com experiência básica em computadores poderia concluir a mesma ação em menos de 30 segundos. A conclusão por si só não captava a diferença prática.

O estudo relatou que 23% dos erros analisados vieram de grounding visual deficiente. Esses erros podiam adicionar até 30 etapas desnecessárias a uma tarefa. O comportamento de recuperação frequentemente consumia recursos sem garantir um resultado correto.

Isso complica a narrativa da Anthropic a16z de uma forma produtiva. A pontuação de 85% reflete progresso genuíno na execução de curto horizonte. As evidências mais recentes identificam o limite em que esse progresso deixa de se transferir.

O custo continua sendo outra dimensão ausente. Um agente pode melhorar a conclusão usando mais tokens de saída, mais tentativas ou reflexão mais profunda. O OSWorld 2.0 encontrou uma clara troca entre eficiência de tokens e conclusão máxima.

A configuração do Claude com maior pontuação usou um orçamento de saída muito maior do que um sistema GPT mais eficiente. Os compradores precisam das duas medições porque a melhor pontuação de benchmark pode não oferecer o melhor resultado econômico em escala.

A segurança também não é capturada por uma simples porcentagem de conclusão. Um agente pode tecnicamente terminar uma tarefa enquanto toma uma ação inaceitável durante o processo. Ele pode expor informações sensíveis, aceitar um prompt inesperado ou fazer uma alteração irreversível sem aprovação.

Ambientes de benchmark também começam de estados controlados. Computadores em produção acumulam notificações, extensões, sessões em cache, solicitações de permissão e variações de interface. Pequenas diferenças podem quebrar uma estratégia de execução que funcionou em uma máquina virtual padrão.

O conteúdo da web introduz riscos adversariais. Uma página pode conter texto que tenta redirecionar o agente ou solicitar credenciais. Os sistemas precisam de uma distinção confiável entre a instrução do usuário e conteúdo não confiável exibido durante a tarefa.

Agentes de uso de computador, portanto, precisam de defesas em camadas. As organizações podem isolar sessões, restringir domínios, limitar permissões, exigir confirmação e validar resultados por sistemas separados. Esses controles reduzem o risco, mas também restringem o significado de operação autônoma.

Uma pontuação de benchmark deve orientar os limites de implantação, e não eliminá-los. Os casos de uso mais fortes no curto prazo são delimitados, reversíveis e fáceis de inspecionar. Ações de alto impacto ainda devem passar por verificações determinísticas ou aprovação humana.

Três Sinais Mostrarão se o Resultado se Transfere

A próxima etapa será decidida pela conclusão de tarefas longas, pela confiabilidade na primeira tentativa e pela adoção mensurável em produção, e não por outro recorde isolado em rankings.

O primeiro sinal é o desempenho no OSWorld 2.0 ou em outro benchmark comparável de longo horizonte. O resultado de 85% no OSWorld-Verified do Claude Fable 5 se torna muito mais convincente se o mesmo modelo melhorar a fronteira de 20,6% de conclusão em fluxos de trabalho estendidos.

O progresso parcial não será suficiente. Uma tarefa profissional frequentemente cria valor apenas quando cada etapa exigida está concluída e verificada. Pesquisadores devem reportar conjuntamente conclusão binária, crédito parcial, uso de tokens, contagem de ações e frequência de intervenções.

Um grande ganho em tarefas longas reforçaria o argumento de que os modelos conseguem preservar objetivos e restrições em ambientes em mudança. Um ganho pequeno sugeriria que o resultado de 85% depende principalmente de interações mais curtas e delimitadas.

O segundo sinal é a confiabilidade na primeira tentativa sob condições padronizadas. Os provedores devem publicar o número de execuções, limites de ação, configurações de raciocínio e estruturas de avaliação por trás de suas pontuações. Reexecuções independentes tornariam as comparações entre modelos mais confiáveis.

A variância importa porque os usuários não vivenciam o desempenho médio de benchmark. Eles vivenciam uma execução por vez. Um sistema que alterna entre sucesso e falha cria custos de supervisão, mesmo quando seu resultado médio parece forte.

Os relatórios também devem separar o desempenho direto do modelo das melhorias trazidas por frameworks de agentes. Um planejador, um componente de grounding visual, um mecanismo de repetição e um verificador podem elevar a pontuação final. Os compradores precisam saber quais componentes produziram o ganho e se conseguem reproduzi-lo.

Resultados consistentes de aprovação na primeira tentativa reforçariam o argumento de desempenho em nível humano. Pontuações que exigem tentativas repetidas ou orçamentos de raciocínio excepcionalmente grandes o enfraqueceriam para implantação comum.

O terceiro sinal são evidências de produção em fluxos de trabalho empresariais delimitados. Relatórios úteis incluiriam taxas de conclusão, tempo médio de execução, frequência de escalonamento e a proporção de resultados corrigidos por pessoas.

As implantações mais informativas envolverão software sem APIs convenientes. É aí que agentes em nível de interface oferecem a vantagem mais clara sobre a integração convencional. Também é onde mudanças na interface podem expor sua fragilidade.

Observe se as organizações expandem os agentes da observação para a ação. Um sistema que coleta informações e prepara um rascunho traz menos risco do que um que envia pagamentos, modifica permissões ou contata clientes.

A expansão para ações de maior impacto indicaria uma confiança crescente na tecnologia e em seus controles. A restrição contínua a rascunhos e tarefas somente de leitura mostraria que o progresso em benchmarks não eliminou as preocupações operacionais.

Os dados da Anthropic a16z merecem atenção porque os agentes de uso de computador melhoraram muito mais rapidamente do que os resultados originais do OSWorld sugeriam. A pontuação reportada de 85% do Claude Fable 5 marca uma mudança crível na capacidade de curto horizonte.

Isso não estabelece que os agentes agora superam as pessoas no uso de computadores em geral. Essa conclusão exige testes equivalentes, execução eficiente, primeiras tentativas estáveis e sucesso em fluxos de trabalho longos.

Para desenvolvedores e compradores, a resposta prática não é nem a rejeição nem a autonomia imediata. Teste agentes em tarefas representativas, meça cada intervenção e separe ações reversíveis das consequentes. Em seguida, faça a pergunta que importa: o resultado da Anthropic a16z resiste ao contato com seu trabalho real?

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page