Holo4: Impulsionando Agentes Generalistas de Uso de Computador, mas a Lacuna nos Benchmarks Ainda Importa
Holo4 chegou em 28 de setembro com dois modelos, quatro modos de interação e um desafio direto aos sistemas especializados de uso de computador. A H Company descreve Holo4: impulsionando agentes generalistas de uso de computador como uma família de modelos capaz de navegar por telas, executar código e chamar ferramentas de software.
O lançamento importa porque a automação de computadores raramente permanece dentro de uma única interface. Um processo empresarial pode começar em um navegador, continuar por uma API e terminar em um software de desktop sem integrações modernas. A maioria dos sistemas de agentes lida com essa transição combinando modelos, ferramentas e ciclos de controle distintos.
O Holo4 propõe uma rota mais simples. O mesmo modelo pode escolher entre interfaces gráficas, código, ferramentas do Model Context Protocol e APIs. MCP é um padrão que permite que sistemas de IA acessem ferramentas e dados externos por meio de conexões estruturadas.
Essa proposta coloca o Holo4 diante de uma arquitetura especializada, e não apenas de outro fornecedor de modelos. A abordagem especializada atribui modelos ou políticas diferentes à navegação visual, à programação e às chamadas de ferramentas. A H Company argumenta que um único generalista treinado pode coordenar essas superfícies com mais eficiência.
A empresa também disponibilizou milhares de trajetórias de benchmark para inspeção. Essa transparência dá aos desenvolvedores mais evidências do que uma pontuação em leaderboard isolada. Ela não resolve questões sobre confiabilidade, segurança ou desempenho dentro de organizações reais.
Holo4: Impulsionando Agentes Generalistas de Uso de Computador em Quatro Interfaces
A mudança central é arquitetural: o Holo4 trata a interface como uma escolha dentro da tarefa, em vez de uma fronteira fixa ao redor do agente.
Segundo o lançamento do Holo4, a família inclui um modelo denso de 27 bilhões de parâmetros e um modelo mixture-of-experts de 35 bilhões de parâmetros. Este último ativa cerca de três bilhões de parâmetros a cada etapa de inferência.
Um modelo mixture-of-experts direciona as entradas por componentes internos selecionados, em vez de ativar todos os parâmetros. Esse design pode reduzir a computação, embora a velocidade real dependa de hardware, software e escolhas de implantação.
Ambos os modelos Holo4 podem interagir com interfaces gráficas de usuário, escrever e executar código e chamar ferramentas MCP ou APIs. A H Company afirma que o mesmo modelo pode operar em desktops, sites, dispositivos Android, sandboxes de programação e sistemas empresariais.
Isso difere de um agente que apenas prevê cliques do mouse a partir de capturas de tela. Também difere de um modelo de chamadas de ferramentas que se torna ineficaz quando um aplicativo não tem API. O Holo4 foi projetado para alternar métodos à medida que um fluxo de trabalho muda.
Considere uma operação financeira rotineira. Um agente poderia extrair campos de um documento, normalizá-los com código, enviá-los por uma API e verificar o resultado na tela. Softwares empresariais mais antigos poderiam forçar outra transição para o controle por mouse e teclado.
Um modelo generalista poderia preservar um único processo de decisão por todas essas etapas. Uma pilha de especialistas normalmente direcionaria cada etapa a um modelo, política ou serviço separado. Esse roteamento pode melhorar o controle, mas também introduz mais transferências e pontos de falha.
A H Company afirma ter treinado o Holo4 por aprendizado supervisionado e aprendizado por reforço em ambientes interativos gerados. Sua fábrica interna de tarefas teria criado cerca de 10.000 tarefas cobrindo aplicações web, desktops, servidores MCP e ambientes híbridos.
Essas tarefas geradas são importantes porque exemplos estáticos não conseguem reproduzir as consequências das ações de um agente. Um ambiente interativo pode testar se um clique alterou o estado, se um código foi executado ou se uma chamada de API produziu o registro pretendido.
A abordagem também permite à H Company gerar tarefas a partir de documentação e capturas de tela. Isso poderia ampliar a cobertura de treinamento sem projetar manualmente cada fluxo de trabalho. No entanto, ambientes gerados ainda podem diferir de sistemas de produção desorganizados, com permissões, atrasos e estados inesperados.
O lançamento inclui um modelo Holotron4 Nano atualizado ao lado das duas variantes principais do Holo4. Ele também oferece pesos dos modelos em diversos formatos, incluindo BF16, FP8, NVFP4 e GGUF de quatro bits.
A disponibilidade nesses formatos oferece aos desenvolvedores várias opções de implantação. Ainda assim, a alegação mais relevante permanece sendo a de que um modelo pode coordenar múltiplas interfaces sem uma camada externa de seleção de modelos.
Isso faz de Holo4: impulsionando agentes generalistas de uso de computador um teste para saber se a generalidade de interface pode reduzir a complexidade do sistema sem sacrificar a precisão oferecida por agentes especialistas.
Por Que Fluxos de Trabalho Longos Pressionam Pilhas de Agentes Especialistas
O Holo4 pressiona pilhas especializadas porque fluxos de trabalho longos multiplicam o custo de cada decisão de roteamento, transferência de contexto e etapa de recuperação.
Uma tarefa curta no navegador pode ocultar fraquezas arquiteturais. Um agente pode abrir uma página, inserir um valor e enviar um formulário. Até mesmo um sistema frágil às vezes conclui essa sequência.
O trabalho profissional é diferente. Ele envolve diversos aplicativos, estado persistente, instruções ambíguas e informações que surgem durante a execução. Um agente precisa se lembrar de restrições anteriores enquanto se adapta a eventos posteriores.
O OSWorld 2.0 foi projetado em torno desse cenário mais difícil. Seus pesquisadores reuniram 108 fluxos de trabalho de longo horizonte, abrangendo atividades cotidianas e profissionais. Um humano qualificado leva uma mediana de cerca de 1,6 hora para concluir cada tarefa.
O benchmark relata que os principais agentes podem ter, em média, mais de 300 etapas por fluxo de trabalho. As tarefas do OSWorld 1.0 exigiam cerca de 30 etapas, tornando o benchmark mais recente um teste muito mais rigoroso de gestão de contexto.
As falhas também vão além de cliques imprecisos. Os pesquisadores observaram agentes perdendo restrições, ignorando informações recebidas, supondo respostas quando era necessário pedir esclarecimentos e pulando a verificação. Essas fragilidades podem se acumular em um processo extenso.
A H Company afirma ter reconstruído o harness de agentes do Holo4 em resposta a esses problemas. Um harness é o ciclo de execução que fornece observações, gerencia o contexto, executa ações e devolve resultados ao modelo.
Suas duas adições mais notáveis foram memória persistente para centenas de etapas e um shell executado na máquina desktop. O shell oferece ao agente uma rota baseada em código quando a interação direta pela GUI se torna ineficiente.
É aqui que o design generalista se torna mais do que uma lista de recursos. O modelo pode decidir que analisar um arquivo local com código é preferível a lê-lo visualmente. Em seguida, pode retornar à interface para ações que exigem confirmação visual.
Uma pilha especializada pode realizar a mesma sequência. No entanto, precisa decidir quando transferir o controle e quanto contexto acompanha cada transferência. Uma escolha de roteamento incorreta pode desperdiçar etapas ou descartar informações.
O Holo4 tenta colocar essa decisão dentro do modelo treinado. Se a abordagem funcionar de forma consistente, os desenvolvedores poderão reduzir a lógica necessária para coordenar controle de navegador, controle de desktop, execução de código e ferramentas estruturadas.
Isso não elimina a orquestração. Sistemas de produção ainda precisam de gestão de credenciais, sandboxing, tentativas novamente, registros e etapas de aprovação. Também precisam de uma forma confiável de interromper um agente antes que uma ação incerta cause danos.
A mudança é mais limitada, mas ainda significativa. Os desenvolvedores poderiam dedicar menos esforço a decidir qual modelo deve lidar com cada interface. Poderiam se concentrar mais em definir permissões, validar resultados e medir fluxos de trabalho completos.
Essa distinção importa para equipes que estão construindo uma base de conhecimento pesquisável. Seus fluxos de trabalho frequentemente atravessam documentos locais, pesquisa interna, ferramentas de navegador e sistemas empresariais estruturados.
O Holo4 não prova que generalistas substituirão todos os especialistas. Ele torna o roteamento especializado uma escolha de design que os desenvolvedores precisam justificar, em vez de uma base inevitável.
Um Modelo de Agente é Mais Simples, mas Especialistas Ainda Definem o Padrão de Confiabilidade
A disputa principal é entre um único modelo generalista e uma pilha coordenada de especialistas, com a confiabilidade decidindo qual arquitetura vence.
Os especialistas oferecem uma vantagem intuitiva. Um modelo treinado de forma restrita para grounding visual pode se concentrar em localizar controles. Um modelo de programação pode se concentrar em sintaxe, execução e depuração sem interpretar cada captura de tela.
Modelos de chamadas de ferramentas também se beneficiam de esquemas estruturados. Uma API expõe ações permitidas e campos previsíveis. Uma interface gráfica oferece mais flexibilidade, mas seus botões, layouts e estados transitórios criam ambiguidade.
A abordagem especializada permite que engenheiros selecionem o melhor modelo para cada superfície. Ela também pode isolar capacidades arriscadas. Um agente visual pode receber acesso à tela sem obter execução arbitrária de shell.
No entanto, a especialização desloca a complexidade para o sistema ao redor. Um roteador precisa classificar cada etapa, escolher um componente e preservar a intenção do usuário durante as transferências. A pilha deve reconciliar diferentes formatos de contexto e sinais de falha.
A rota generalista do Holo4 leva parte dessa coordenação para dentro do modelo. O agente pode olhar para uma tela, reconhecer que a manipulação direta é ineficiente e usar código ou uma ferramenta estruturada em seu lugar.
A H Company ilustra essa abordagem com tarefas em software profissional. Em um exemplo, o Holo4 27B teria usado 68 chamadas e 2,4 milhões de tokens para criar um jogo autônomo no Godot. Sua base Qwen usou 197 chamadas e 11,4 milhões de tokens sob o mesmo prompt e harness.
Esses números vêm da própria avaliação da H Company, não de um laboratório independente. Eles descrevem uma tarefa, e não o desempenho médio em produção. Ainda assim, mostram o tipo de eficiência que a empresa pretende que o Holo4 ofereça.
Outros exemplos envolvem construir objetos detalhados no FreeCAD. Esses fluxos de trabalho combinam interpretação espacial, controle de software e geração de código. Eles são mais exigentes do que preencher um único formulário web.
Os exemplos também revelam uma limitação. A tarefa da Torre Eiffel do Holo4 teria exigido 84 chamadas e 1,3 milhão de tokens. Sessões longas de uso de computador podem continuar computacionalmente pesadas mesmo quando o resultado final é bem-sucedido.
Os especialistas mantêm outra vantagem quando o fluxo de trabalho é previsível. Um script determinístico ou uma integração estreita com API pode ser mais rápido e mais fácil de auditar do que um agente escolhendo entre várias ações possíveis.
O argumento a favor do generalista se fortalece quando os fluxos de trabalho variam, as interfaces mudam ou sistemas legados não têm integrações. O argumento a favor de especialistas continua mais forte quando as organizações precisam de repetibilidade e conseguem definir o processo com precisão.
Isso significa que o Holo4 provavelmente não eliminará a automação convencional. Em vez disso, ele compete pelo terreno intermediário incerto, no qual scripts fixos falham, mas agentes de fronteira irrestritos continuam caros ou difíceis de governar.
Portanto, os desenvolvedores devem avaliar tarefas completas, e não cliques isolados. A questão relevante é se o Holo4 reduz falhas e sobrecarga de engenharia em fluxos de trabalho reais.
Um modelo que alcança o estado final correto com menos transferências pode justificar menor precisão bruta em uma habilidade restrita. Um generalista que muda de método de forma imprevisível pode criar uma carga maior de depuração.
O resultado dependerá da qualidade das trajetórias, da reprodutibilidade e do comportamento de recuperação. Esses fatores importam mais do que uma arquitetura parecer mais limpa em um diagrama.
Os Resultados de Benchmark do Holo4 Precisam de seus Harnesses e Notas de Rodapé
Os resultados do Holo4 são notáveis, mas o próprio lançamento explica por que várias comparações de destaque não são diretamente equivalentes.
A H Company informa que o Holo4 27B obteve 61,7% no OSWorld 2.0. Seu modelo 35B-A3B alcançou 30,9%. A empresa compara esses resultados com os 81,8% do Opus 5.5.
A diferença de 20,1 pontos entre o Holo4 27B e o Opus 5.5 é substancial. O Holo4 não supera o modelo fechado mais forte nessa métrica reportada. Seu argumento se concentra no tamanho do modelo, na flexibilidade de implantação e no custo estimado por tarefa.
A H Company também cita pontuações de 70,2% para o Opus 5 e 66,2% para o GPT-5.6 Sol. Essas referências usam recompensas parciais de esforço máximo em um conjunto offline do OSWorld 2.0 datado de 8 de agosto de 2026.
O lançamento alerta que versões de modelos, harnesses e subconjuntos de tarefas variam. Esse aviso deve acompanhar todas as comparações. O desempenho de agentes depende de muito mais do que o checkpoint do modelo.
O harness controla memória, acesso a ferramentas, formatação de observações, comportamento de repetição e número máximo de etapas. Alterar qualquer uma dessas variáveis pode modificar o resultado, mesmo quando o modelo subjacente permanece inalterado.
Os gráficos de custo exigem cuidado semelhante. A H Company estimou despesas a partir dos tokens de entrada e saída usados durante cada execução. Ela precificou o Holo4 usando suas próprias tarifas de API e utilizou preços de tabela externos para outros modelos.
Essas estimativas podem apoiar o planejamento interno, mas não são medições econômicas controladas. Premissas de cache, infraestrutura de inferência, repetições e descontos por volume podem alterar os custos reais de implantação.
O AutomationBench introduz outra questão de comparabilidade. A H Company avaliou o Holo4 e suas linhas de base Qwen usando a versão 1.0.6 em seu harness interno. As pontuações de outros modelos vieram do conjunto público do benchmark.
Os valores de custo citados para outros modelos vieram de um leaderboard que executa um conjunto privado. A H Company afirma que planeja reportar o Holo4 nessa avaliação privada após a realização dos testes.
Até lá, os leitores não devem tratar todos os pontos do AutomationBench como resultados de um único experimento controlado. Eles representam medições relacionadas produzidas sob condições diferentes.
Até as definições dos benchmarks podem moldar uma narrativa. O OSWorld 2.0 oferece suporte a conclusão binária e pontuação por crédito parcial. Um modelo pode receber crédito parcial significativo sem conseguir entregar um fluxo de trabalho concluído.
Isso não torna a pontuação parcial inútil. Ela pode identificar avanços em tarefas longas nas quais o sucesso binário esconderia melhorias. Ainda assim, compradores se importam se o registro, arquivo ou transação final está correto.
Eficiência também exige mais do que contagens de tokens. Pesquisas sobre eficiência de agentes descobriram que os principais agentes de uso de computador realizaram entre 1,4 e 2,7 vezes mais etapas do que o necessário em sua avaliação.
A mesma pesquisa constatou que etapas posteriores podem levar muito mais tempo do que as iniciais. Chamadas de planejamento e reflexão responderam por grande parte da latência. Portanto, um longo rastro de agente pode ampliar atrasos além de sua contagem visível de ações.
Essas descobertas reforçam o foco da H Company em memória e acesso ao shell. Elas também mostram por que uma pontuação bem-sucedida em benchmark não produz automaticamente uma experiência de usuário aceitável.
A leitura justa não é nem rejeição nem aceitação. O Holo4 apresenta um resultado competitivo reportado pela empresa para um modelo relativamente compacto, embora fique atrás do principal sistema fechado.
O teste prático é saber se esses resultados persistem em harnesses independentes, avaliações privadas e fluxos de trabalho que contenham permissões e dados específicos de organizações.
Trajetórias Abertas Melhoram a Verificação, Não a Segurança
A medida de maior credibilidade da H Company é divulgar os rastros por trás de suas pontuações, embora um comportamento inspecionável não seja automaticamente um comportamento seguro.
O conjunto de dados de trajetórias contém 7.366 execuções do Holo4 27B e do Holo4 35B-A3B. Cada rastro pode incluir a tarefa, o raciocínio, as ações, os resultados das ferramentas, capturas de tela, duração, etapas e pontuação final.
A coleção inclui mais de 2.100 execuções do OSWorld entre os dois modelos. Ela também contém 212 execuções do OSWorld 2.0 e quase 3.200 execuções do AutomationBench.
Rastros adicionais abrangem AndroidWorld, PinchBench e Agents’ Last Exam. A H Company permite que usuários baixem o conjunto de dados ou reproduzam rastros por meio de um visualizador dedicado.
Essa divulgação oferece aos pesquisadores várias maneiras de contestar as conclusões da empresa. Eles podem inspecionar se uma execução bem-sucedida seguiu um caminho razoável, repetiu ações desnecessárias ou se beneficiou de atalhos específicos da tarefa.
Eles também podem examinar padrões de falha. Uma pontuação agregada não consegue mostrar se o agente interpretou mal a instrução, clicou no alvo errado, perdeu o contexto ou parou antes da verificação.
Trajetórias abertas podem revelar se as melhorias de desempenho vêm de um raciocínio melhor ou de um harness mais permissivo. Elas também podem ajudar equipes a estimar com que frequência a intervenção humana pode ser necessária.
No entanto, transparência após a execução é diferente de controle antes da execução. Um rastro ajuda investigadores a entender o que aconteceu. Ele não impede um agente de enviar dados, excluir arquivos ou seguir instruções maliciosas.
Agentes de uso de computador enfrentam riscos que sistemas de chat convencionais evitam. Eles operam em ambientes que contêm conteúdo não confiável e credenciais valiosas. Uma página da web pode inserir texto adversarial diretamente na observação do modelo.
O benchmark OS-Harm testa uso indevido deliberado, injeção de prompt e comportamento não intencional do modelo em 150 tarefas. Seus pesquisadores encontraram comportamentos inseguros significativos em vários sistemas de fronteira.
Esse estudo não avaliou o Holo4, portanto seus resultados não podem estabelecer a segurança do Holo4. Ele demonstra que controle competente de computadores e controle seguro de computadores são problemas de avaliação distintos.
O risco se torna mais evidente quando um modelo tem amplo acesso a interfaces. Um generalista pode passar da leitura de uma página da web à execução de código ou à chamada de uma API. Essa flexibilidade aumenta a utilidade e o possível impacto de um erro.
As empresas precisarão de controles em camadas independentemente das pontuações em benchmarks. Esses controles incluem credenciais com escopo limitado, execução isolada, acesso restrito à rede, ações reversíveis e aprovação humana para etapas consequentes.
Elas também precisarão de logs que conectem cada ação à instrução do usuário e ao estado observado naquele momento. O formato de trajetória do Holo4 oferece um modelo útil para esses registros de auditoria.
O licenciamento também merece atenção. Pesos abertos não garantem direitos comerciais idênticos em todos os checkpoints ou componentes. As equipes devem revisar cada card de modelo e dependência antes da implantação.
O mesmo se aplica à governança de dados. Capturas de tela e rastros de agentes podem registrar informações pessoais, registros de clientes ou documentos confidenciais. Registrar tudo pode melhorar a depuração, ao mesmo tempo em que cria outro conjunto de dados sensível.
A H Company afirma que credenciais, hosts internos e dados pessoais foram mascarados em sua divulgação pública de trajetórias. Operadores de produção devem criar controles equivalentes de redação e retenção para seus próprios rastros.
O conjunto de dados aberto eleva o padrão para lançamentos futuros. Fornecedores que afirmam oferecer desempenho superior em uso de computador agora têm um exemplo mais claro de como podem ser evidências reproduzíveis.
Ainda assim, o trabalho externo mais valioso envolverá reprodução adversarial, pontuação independente e testes fora do harness da H Company. A transparência inicia esse processo; ela não o conclui.
Três Sinais Mostrarão se a Aposta Generalista do Holo4 se Sustenta
A próxima fase deve ser julgada por meio de reprodução independente, resultados de benchmarks privados e evidências de fluxos de trabalho em produção.
O primeiro sinal é a reprodução independente do desempenho do Holo4 no OSWorld 2.0. Pesquisadores precisam executar os pesos divulgados com infraestrutura, prompts, limites de etapas e regras de pontuação documentados.
Igualar os 61,7% reportados reforçaria a alegação da H Company de que o próprio modelo carrega essa capacidade. Diferenças grandes sugeririam que o harness da empresa contribui mais do que a manchete indica.
A reprodução também deve comparar conclusão binária, crédito parcial, etapas, latência e taxas de intervenção. Uma única pontuação não consegue capturar se um agente alcança um resultado utilizável dentro de limites práticos.
As trajetórias divulgadas tornam esse trabalho mais viável. Pesquisadores podem partir de execuções conhecidas, examinar limites de falha e comparar harnesses alternativos nas mesmas tarefas.
O segundo sinal é o resultado privado do Holo4 no AutomationBench. O lançamento reconhece que suas pontuações atuais vêm de uma execução interna no conjunto público, enquanto os custos de comparação fazem referência a um leaderboard de conjunto privado.
Uma avaliação privada criaria uma comparação mais limpa e reduziria preocupações sobre ajuste em relação a tarefas visíveis. Ela também testaria se o Holo4 se generaliza em fluxos de trabalho de API desconhecidos.
O resultado deve incluir mais do que uma taxa de sucesso. Desenvolvedores precisam de custos, uso de tokens, repetições, latência e categorias de falha sob uma configuração de avaliação documentada.
O terceiro sinal são evidências confiáveis de produção provenientes de fluxos de trabalho com interfaces mistas. Os melhores casos envolveriam tarefas que realmente exigem GUIs, código e ferramentas estruturadas em uma única sessão.
Relatos úteis mostrariam conclusão sem correção humana, recuperação após mudanças na interface e desempenho sob permissões restritas. Também deveriam contabilizar erros irreversíveis, não apenas execuções bem-sucedidas.
Um fluxo de processamento de despesas oferece um teste representativo. O agente precisa ler documentos, validar campos, interagir com software empresarial e confirmar que os registros chegaram ao estado pretendido.
Outro teste forte envolveria operações de engenharia entre arquivos locais, rastreadores de issues, consoles de navegador e ferramentas de linha de comando. Esses fluxos de trabalho revelam se o contexto compartilhado é uma vantagem ou uma fonte de comportamento descontrolado.
Atualizações de modelos fornecerão um sinal relacionado. A H Company afirma que checkpoints de redatores otimizados estão planejados para acelerar a inferência. Reduções medidas de latência fortaleceriam o argumento econômico da arquitetura generalista.
As respostas dos concorrentes também importam, mas permanecem como evidência complementar. Fornecedores de modelos fechados podem melhorar o uso de computador, enquanto desenvolvedores de modelos abertos podem adicionar treinamento mais amplo em ferramentas aos seus próprios lançamentos.
A questão central não é se o Holo4 permanece à frente de todas as alternativas. É se um único modelo generalista oferece uma melhor relação entre confiabilidade e complexidade do que uma pilha de especialistas.
Para desenvolvedores, a oportunidade imediata é a avaliação controlada. Use tarefas representativas, credenciais restritas e ambientes reversíveis. Meça resultados concluídos, em vez de ações isoladas do modelo.
Para compradores empresariais, a questão de aquisição deve incluir o harness. Pergunte qual componente gerencia memória, aprovações, repetições, segredos, logs de auditoria e recuperação após execução parcial.
Para trabalhadores do conhecimento, o lançamento sugere que agentes cruzarão mais fronteiras entre aplicações. Essa conveniência também torna mais importantes o design de permissões e a confirmação visível.
Holo4: impulsionando agentes generalistas de uso de computador é, portanto, menos uma declaração de vitória do que um desafio arquitetural concreto. A H Company forneceu modelos, alegações e rastros incomumente detalhados.
O próximo movimento pertence a avaliadores independentes e equipes de implantação. O Holo4 consegue reproduzir seus resultados reportados, sobreviver a tarefas desconhecidas e concluir trabalho real sem ampliar o risco operacional?
Esses três testes determinarão se agentes generalistas de uso de computador simplificam a automação ou apenas transferem seus problemas mais difíceis.



