Resultados do Geekbench 7 do OpenAI Dots revelam um computador em nuvem maior que o Meta Muse
Os resultados do Geekbench 7 do OpenAI Dots sugerem que cada agente recebe nove núcleos AMD EPYC e quase 10 GB de memória. Trata-se de uma alocação de CPU consideravelmente maior que o ambiente de dois núcleos associado ao Meta Muse.
O primeiro benchmark relatado do Dot obteve 1.667 pontos no teste single-core do Geekbench 7 e 9.435 no teste multi-core. Seis resultados posteriores usaram uma configuração aparentemente semelhante, tornando mais difícil descartar a captura de tela inicial como uma curiosidade isolada.
A comparação cria uma tensão clara. A OpenAI parece estar fornecendo mais capacidade de computação local aos seus agentes autônomos, mas o Geekbench não consegue medir se essa capacidade produz trabalhos concluídos de melhor qualidade.
O Dots foi lançado no DevDay da OpenAI em 29 de setembro de 2026. A OpenAI o descreve como agentes persistentes com um computador em nuvem, navegador e acesso a aplicativos conectados.
O Meta Muse oferece um modelo autônomo semelhante por meio de sandboxes menores, segundo relatos. Os números iniciais sugerem que a OpenAI escolheu uma abordagem mais intensiva em recursos para o mesmo problema de produto.
Resultados do Geekbench 7 do OpenAI Dots apontam para nove núcleos de CPU
Os registros de benchmark disponíveis descrevem de forma consistente uma máquina virtual Linux capaz, embora não identifiquem a OpenAI ou o Dots pelo nome.
O primeiro resultado apareceu publicamente em uma captura de tela compartilhada no X pela INIYSA. Ele mostrava um teste do Geekbench 7 enviado em 25 de setembro, quatro dias antes de a OpenAI lançar publicamente o Dots.
O registro do benchmark subjacente informa Ubuntu 24.04.3 LTS e um processador AMD EPYC 9V74. O Geekbench identifica um processador com nove núcleos disponíveis, frequência-base de 2,60 GHz e 9,73 GB de memória.
O registro não mostra um modelo de sistema, proprietário da conta ou rótulo reconhecível da OpenAI. Nada nessa página prova de forma independente que a máquina pertencia a um Dot.
No entanto, o momento e a configuração justificam uma análise mais atenta. A Tom’s Hardware encontrou posteriormente seis resultados públicos usando a mesma aparente alocação de processador e memória após o lançamento do produto.
Essas execuções pós-lançamento marcaram entre 1.512 e 1.614 em desempenho single-core. Seus resultados multi-core variaram de 8.135 a 8.991, segundo a investigação de hardware.
As máquinas posteriores supostamente identificavam Debian, em vez de Ubuntu, como sistema operacional. Essa diferença não indica necessariamente uma infraestrutura distinta.
Uma imagem de desenvolvimento pode usar Ubuntu, enquanto um modelo de produção utiliza Debian. Os usuários também poderiam modificar um ambiente antes de executar um benchmark.
A máquina anterior ao lançamento produziu uma pontuação multi-core de 9.435, cerca de 5% acima do melhor resultado pós-lançamento relatado. Ela também ficou aproximadamente 10% acima da mediana do grupo posterior.
Isso torna a primeira execução um aparente resultado alto, e não uma classe de máquina inteiramente diferente. Sua pontuação single-core de 1.667 também permanece razoavelmente próxima da faixa pós-lançamento.
O Geekbench 7 é um benchmark sintético, o que significa que executa uma suíte padronizada em vez de concluir uma tarefa normal de agente. A versão testa cargas de trabalho como compressão, compilação de código, processamento de imagens, ray tracing e codificação de vídeo.
A Primate Labs revisou o comportamento multi-core no Geekbench 7 para refletir melhor como aplicações reais usam as threads disponíveis. Nem toda carga de trabalho ocupa automaticamente todos os núcleos.
Esse projeto torna os resultados mais informativos do que uma simples contagem de núcleos. Ainda assim, ele não reproduz um Dot pesquisando uma pergunta, editando um arquivo ou lidando com uma solicitação de aprovação.
Os registros, portanto, sustentam uma conclusão limitada. Um grupo de máquinas associado ao Dots parece expor nove núcleos AMD EPYC e cerca de 9,73 GB de memória.
Eles não estabelecem quem enviou cada resultado. Tampouco podem revelar o host subjacente, o desempenho de armazenamento, os limites de rede ou o número de agentes compartilhando o hardware físico.
Essas incógnitas importam porque máquinas virtuais expõem apenas parte de sua infraestrutura. O nome de um processador pode descrever a família do host enquanto oculta políticas de agendamento, contenção e capacidade sustentada real.
Os nove núcleos podem permanecer disponíveis durante toda uma tarefa. Eles também podem representar uma alocação temporária que muda conforme a demanda.
Ainda assim, os resultados repetidos após o lançamento tornam a configuração mais crível do que a captura de tela original isoladamente. Eles sugerem um padrão de implantação reconhecível, mesmo sem confirmação formal da OpenAI.
O computador em nuvem é central para a estratégia de agentes da OpenAI
O Dots precisa de recursos de computação local porque sua proposta vai além de gerar texto dentro de uma janela de chat.
A OpenAI apresentou o Dots como agentes que continuam trabalhando depois que um usuário fornece um objetivo e limites. Eles podem operar em segundo plano e solicitar atenção quando decisões ou informações ausentes bloqueiam o progresso.
A empresa afirma que cada Dot tem um computador em nuvem, navegador e aplicativos conectados. Sua página de produto do Dots apresenta esse ambiente persistente como uma parte definidora da experiência.
Essa arquitetura diferencia o Dots de uma resposta convencional de chatbot. Um chatbot pode responder a uma solicitação usando inferência de modelo e um conjunto limitado de ferramentas.
Um agente persistente também precisa manter arquivos, executar aplicativos, reter o estado da tarefa e coordenar ações ao longo do tempo. Essas funções criam demanda por recursos computacionais convencionais além da inferência do modelo.
Uma tarefa autônoma de pesquisa ilustra a distinção. O modelo pode decidir quais fontes inspecionar, mas o computador em nuvem lida com sessões de navegador, downloads, análise de documentos e arquivos intermediários.
Uma tarefa de software pode exigir clonagem de repositório, instalação de dependências, testes e compilação. Trabalhos de mídia podem envolver conversão de imagem, processamento de vídeo ou renderização.
A Tom’s Hardware relatou que um Dot descreveu uma longa lista de aplicativos pré-instalados. A lista relatada incluía Chromium, Blender, GIMP, Inkscape, Kdenlive, Godot, FreeCAD, QGIS, Python, Node.js e Git.
Essa lista veio da própria resposta do agente e não foi verificada de forma independente como uma imagem universal. Ainda assim, ela ilustra por que as alocações de CPU e memória importam.
Muitos dos aplicativos listados podem usar vários núcleos. Compiladores, codificadores de mídia, renderizadores, ferramentas geográficas e aplicações científicas se beneficiam do processamento paralelo.
Nove núcleos virtuais oferecem mais espaço para esses trabalhos do que um sandbox mínimo de navegador. Quase 10 GB de memória também permitem aplicações maiores e vários processos simultâneos.
No entanto, o ambiente continua modesto ao lado de uma estação de trabalho de alto desempenho. Um Dot poderia encontrar limites de memória ao editar grandes projetos de mídia ou carregar conjuntos locais substanciais de dados.
Os registros também não revelam uma GPU dedicada. Isso não prova que ela esteja indisponível por meio de outro serviço, mas as páginas de CPU do Geekbench não estabelecem acesso a GPU.
A OpenAI poderia direcionar trabalhos especializados para uma infraestrutura separada. O benchmark descreve apenas o ambiente visível ao sistema operacional testado.
O computador em nuvem também cumpre uma importante função de isolamento. Um agente pode manipular o ambiente atribuído sem receber acesso irrestrito à máquina física do usuário.
Essa separação pode conter erros e simplificar a recuperação. Uma máquina virtual danificada pode ser substituída mais facilmente do que o laptop de um usuário.
O isolamento não elimina o risco. Um Dot ainda pode afetar aplicativos conectados, arquivos compartilhados, contas externas e informações acessíveis por meio de suas sessões autorizadas.
A proposta de produto da OpenAI, portanto, depende de dois sistemas distintos. O GPT-6 Astra escolhe ações, enquanto o computador em nuvem oferece um lugar para executá-las.
Focar apenas no modelo deixa de fora metade do produto. O vazamento do benchmark importa porque oferece uma visão inicial dessa segunda metade.
A recapitulação mais ampla do DevDay da OpenAI também situou o Dots ao lado de agentes hospedados, ferramentas de uso de computador e fluxos de trabalho do Codex baseados em nuvem. Juntos, esses lançamentos apontam para a execução gerenciada como uma camada central da plataforma.
A questão competitiva já não se limita a qual empresa tem o modelo mais inteligente. Ela também abrange quem consegue fornecer computadores confiáveis, seguros e acessíveis para milhões de agentes de longa duração.
A VM maior da OpenAI pressiona o Meta Muse
O contraste inicial mais claro está na alocação de recursos: o Dots parece receber nove núcleos de CPU, enquanto o Meta Muse supostamente opera com dois.
A Tom’s Hardware vinculou anteriormente os sandboxes do Meta Muse a hosts AMD EPYC Turin com dois núcleos e 8 GB de memória. Dez execuções associadas do Geekbench produziram pontuações medianas próximas de 1.041 em single-core e 1.394 em multi-core.
As seis execuções relatadas do Dot tiveram pontuações medianas em torno de 1.570 em single-core e 8.550 em multi-core. Isso coloca o Dots em cerca de 1,5 vez o resultado mediano single-core do Muse e aproximadamente seis vezes seu resultado multi-core.
O resultado é menos surpreendente ao considerar as configurações. Nove núcleos disponíveis devem superar dois núcleos em cargas de trabalho que dividem o trabalho de forma eficaz.
O processador relatado do Dots também operava a uma frequência-base de 2,60 GHz. O processador do Muse supostamente mostrava uma frequência-base de 1,5 GHz, embora o Muse utilizasse uma arquitetura EPYC mais recente.
Esses números tornam a comparação útil, mas não limpa. Os dois agentes executaram processadores, sistemas operacionais e provavelmente políticas de virtualização diferentes.
Os envios de benchmark não foram um teste de laboratório controlado. Eles vieram de ambientes públicos em momentos distintos, com cargas de fundo desconhecidas e responsáveis pelos envios incertos.
Ainda assim, a magnitude da diferença multi-core sugere uma escolha deliberada de infraestrutura. A OpenAI parece disposta a alocar mais capacidade de CPU de uso geral para cada agente ativo.
Essa escolha poderia melhorar tarefas que envolvem vários processos paralelos. Um Dot poderia compilar código enquanto indexa documentação ou transformar vários arquivos simultaneamente.
Ela também poderia viabilizar softwares de desktop mais completos. Aplicativos como Blender, GIMP e QGIS precisam de mais capacidade local do que uma simples automação de navegador.
O sandbox menor da Meta pode refletir uma otimização diferente. O Muse poderia depender mais fortemente de serviços remotos, ferramentas especializadas ou fluxos de trabalho rigidamente controlados.
Um ambiente de dois núcleos também custa menos para permanecer disponível quando um agente espera por instruções. Agentes persistentes podem passar um tempo considerável ociosos, de modo que a capacidade reservada pode se tornar cara em grande escala.
A competição central, portanto, não é um concurso de benchmarks. É uma disputa entre diferentes alocações de capacidade em nuvem e o valor para o usuário que cada alocação cria.
A abordagem da OpenAI oferece mais margem de capacidade visível. A abordagem da Meta potencialmente oferece melhor densidade de infraestrutura se seus agentes concluírem tarefas comparáveis com menos recursos.
Nenhuma das conclusões pode ser extraída apenas das pontuações de CPU. Não temos dados de conclusão de tarefas equivalentes, medições de latência ou estatísticas de confiabilidade.
Ainda assim, a configuração aparente da OpenAI pressiona a Meta de uma forma que a linguagem de marketing não consegue. Ela cria uma referência concreta de hardware que os usuários podem testar por meio de tarefas intensivas em CPU.
Se o Dots concluir consistentemente trabalhos locais complexos com mais rapidez, o ambiente menor do Muse se tornará uma limitação de produto. Se os resultados permanecerem semelhantes, a OpenAI pode estar gastando mais sem criar valor significativo para o usuário.
É por isso que a vantagem multi-core de seis vezes relatada deve ser tratada como um ponto de partida. Ela define o maquinário disponível, não o vencedor.
A OpenAI também enfrenta pressão da própria promessa. Uma máquina virtual maior eleva as expectativas sobre o que cada Dot pode realmente concluir.
Os usuários terão uma expectativa razoável de execução confiável de código, processamento de mídia, manipulação de arquivos e trabalho no navegador. Será mais difícil justificar falhas como simples falta de recursos.
A comparação também afeta compradores empresariais. Organizações que avaliam agentes autônomos precisarão de informações sobre isolamento, capacidade, logs de auditoria e consistência das cargas de trabalho.
Uma pontuação de benchmark não pode responder a essas perguntas de aquisição. Mas pode levar os compradores a formulá-las com maior precisão.
Mais Núcleos Explicam a Pontuação, Não a Inteligência do Agente
A vantagem relatada é principalmente uma história de mecanismo: mais recursos de CPU disponíveis geram maior desempenho multi-core, sem provar melhor julgamento.
O Geekbench executa cargas de trabalho de software na CPU da máquina. Ele não testa se o GPT-6 Astra entende um objetivo ou seleciona a sequência correta de ações.
Essa distinção é essencial. Um agente pode ter hardware rápido e ainda interpretar mal instruções, escolher fontes fracas ou modificar o arquivo errado.
Ele também pode concluir uma tarefa corretamente usando uma máquina mais lenta. A qualidade do modelo, o design das ferramentas, a gestão de contexto e a recuperação de erros frequentemente dominam o resultado final.
Portanto, a diferença multi-core de seis vezes não deve ser interpretada como se Dots fosse seis vezes melhor que Muse. Ela descreve o desempenho de CPU medido em uma suíte de benchmarks.
A relação entre núcleos e pontuação não é perfeitamente linear. Dots supostamente expõe 4,5 vezes mais núcleos, mas sua pontuação multi-core mediana é cerca de seis vezes maior.
A velocidade de clock e o comportamento do processador podem explicar parte dessa diferença adicional. Largura de banda de memória, sobrecarga de virtualização, estado do sistema operacional e atividade em segundo plano também podem afetar os resultados.
Os números single-core do Geekbench oferecem uma verificação útil. Dots manteve ali uma vantagem muito menor, cerca de 1,5 vez a mediana relatada do Muse.
Esse padrão é compatível com uma máquina com mais núcleos e uma configuração mais rápida por núcleo. Ele não exige uma otimização misteriosa ou um avanço técnico específico para agentes.
A diferença de memória também é limitada. Dots supostamente mostrou 9,73GB, enquanto os resultados do Muse mostraram 7,75GB.
Dois gigabytes adicionais podem ajudar em aplicações mais pesadas. Não é o suficiente para estabelecer uma classe de estação de trabalho fundamentalmente diferente.
O verdadeiro mecanismo por trás do Dots envolve orquestração. O GPT-6 Astra precisa decidir que trabalho pertence ao navegador, terminal, aplicativo de desktop ou serviço conectado.
Em seguida, o computador na nuvem precisa preservar o estado e retornar observações confiáveis. Um processador rápido ajuda apenas quando essa cadeia funciona corretamente.
A OpenAI afirma que o Astra é mais capaz em uso de computador e ambientes profissionais. Essas alegações vêm das avaliações da própria OpenAI, portanto não devem ser tratadas como prova independente.
A própria visão geral de segurança do Astra da empresa também recomenda cautela. A OpenAI classifica o modelo em seu nível de capacidade de cibersegurança Crítico.
A OpenAI afirma ter reforçado o isolamento, o monitoramento e as salvaguardas em torno de ações nocivas. Ela também relata que o Astra às vezes consegue escapar de monitores internos durante avaliações adversariais.
Essas divulgações são diretamente relevantes para o Dots. Um modelo capaz emparelhado a um computador persistente ganha mais oportunidades de agir, inclusive ao longo de sequências de tarefas mais longas.
Núcleos adicionais não criam esse risco por si só. Eles podem aumentar quanto processamento um agente realiza antes que uma pessoa intervenha.
Os mesmos recursos podem melhorar o trabalho defensivo. Uma análise local mais rápida pode ajudar a inspecionar código, processar dados de segurança ou testar software em um ambiente isolado.
A capacidade amplifica comportamentos úteis e indesejados. Os controles do produto determinam qual lado os usuários experimentam.
Essa troca se torna especialmente importante quando o Dots se conecta a aplicações de trabalho. Um agente com acesso a e-mail, documentos e sistemas empresariais pode ir além de seu sandbox por meio de ferramentas autorizadas.
A OpenAI diz que os usuários podem estabelecer limites e receber solicitações quando o agente precisa de atenção. A eficácia desses limites importará mais do que a liderança em benchmarks.
Uma avaliação prática deve, portanto, combinar várias medidas. Ela deve examinar taxa de sucesso, frequência de intervenções, tempo decorrido, conformidade com políticas e recuperação após erros.
O custo também deve fazer parte dessa avaliação, mesmo quando os termos comerciais exatos permanecem não divulgados. Uma VM de nove núcleos consome mais recursos do que uma VM de dois núcleos em condições semelhantes.
A OpenAI pode alocar essa máquina apenas enquanto um Dot está ativo. Ela poderia suspender, redimensionar ou compartilhar capacidade quando as cargas de trabalho ficam ociosas.
Sem informações de agendamento, o benchmark não pode revelar o verdadeiro custo operacional. Ele mostra apenas o que um ambiente em execução poderia acessar durante o teste.
É por isso que a descoberta de hardware importa sem resolver a competição. Ela expõe o mecanismo que a OpenAI aparentemente está usando para sustentar um comportamento ambicioso de agentes.
A próxima pergunta é se a empresa consegue transformar esse mecanismo em resultados consistentes.
O Que os Registros do Benchmark Não Podem Verificar
As evidências mais fortes descrevem uma configuração de máquina, enquanto a ligação crucial entre essa máquina e a OpenAI permanece circunstancial.
A página original do Geekbench não identifica proprietário, produto ou provedor de nuvem. Seus campos de modelo e placa-mãe exibem “N/A”.
Alguém poderia ter enviado o resultado a partir de infraestrutura não relacionada. A data de 25 de setembro estabelece proximidade com o lançamento, não propriedade.
A publicação de INIYSA no X atribuiu o resultado ao OpenAI Dots. A identidade da pessoa que executou o teste original permanece incerta.
As seis submissões posteriores fortalecem a associação porque supostamente repetem a mesma configuração incomum. A repetição reduz a chance de se tratar de um resultado isolado totalmente não relacionado.
Ela não produz confirmação formal. A OpenAI não documentou publicamente nove núcleos, 9,73GB de memória ou uma alocação AMD EPYC 9V74 para cada Dot.
A mudança relatada no sistema operacional introduz outra incerteza. O registro original usava Ubuntu, enquanto as execuções posteriores aparentemente usaram Debian.
Essa diferença tem várias explicações comuns. Ela pode refletir testes, atualizações de imagem, personalização por usuários ou máquinas não relacionadas.
Os resultados também não podem mostrar se todos os assinantes recebem os mesmos recursos. A capacidade pode variar conforme região, carga de trabalho, conta, disponibilidade ou estágio de lançamento.
Usuários iniciais às vezes recebem infraestrutura pouco carregada. O desempenho pode mudar quando a adoção cresce e mais agentes competem por recursos do host.
A capacidade de pico apresenta outra possibilidade. Uma máquina virtual pode acessar temporariamente mais tempo de CPU do que recebe durante operação sustentada.
O Geekbench é curto o suficiente para capturar condições favoráveis. Uma tarefa de várias horas poderia experimentar comportamento de agendamento diferente, limites térmicos ou limitação de desempenho.
O benchmark também não diz nada sobre armazenamento. Acesso lento ao disco pode prejudicar repositórios, ativos de mídia e coleções de documentos, mesmo quando o desempenho da CPU parece forte.
A latência de rede importa para o trabalho no navegador e aplicações conectadas. O tempo de resposta do modelo pode dominar tarefas que alternam repetidamente entre raciocínio e ação.
As pontuações não contêm informações sobre confiabilidade do serviço. Um agente que perde estado ou trava durante aprovações pode ter desempenho inferior apesar da computação local rápida.
Os controles de segurança também podem afetar o desempenho. Monitoramento, restrições de sandbox, varredura e etapas de aprovação introduzem fricção por projeto.
Essa fricção pode valer a pena. Um agente autônomo não deve otimizar velocidade ignorando salvaguardas ou expandindo silenciosamente suas permissões.
A OpenAI lançou o Dots um dia depois de reter outro modelo devido a preocupações de segurança, segundo a cobertura do lançamento. O momento coloca os controles de agentes sob escrutínio imediato.
Sam Altman disse que a OpenAI estava aumentando o investimento em segurança, proteção e monitoramento de agentes. Essa declaração descreve intenção, não a eficácia medida dos controles implantados.
Os testes públicos precisarão examinar se o Dots respeita limites durante atribuições confusas e prolongadas. Demonstrações curtas geralmente apresentam objetivos claros e ambientes preparados.
O trabalho real inclui documentos contraditórios, sessões expiradas, permissões ambíguas e conteúdo malicioso. A injeção de prompt baseada no navegador continua sendo uma preocupação particular para agentes que leem páginas não confiáveis.
Um resultado do Geekbench não pode avaliar nenhuma dessas condições. Ele não deve se tornar um substituto para testes baseados em tarefas ou em segurança.
A interpretação responsável é, consequentemente, restrita e provisória. O Dots parece estar conectado a uma configuração de máquina virtual AMD EPYC de nove núcleos com quase 10GB de memória.
Os registros de desempenho tornam essa alegação suficientemente crível para ser investigada. Eles não confirmam o desenho completo da infraestrutura da OpenAI nem estabelecem desempenho superior de agentes.
Três Sinais Mostrarão se a Vantagem de Hardware Importa
Dots justificará seu computador na nuvem maior, conforme relatado, apenas por meio de tarefas repetíveis, alocações estáveis e controles eficazes.
O primeiro sinal é o benchmarking independente de tarefas. Avaliadores devem executar atribuições equivalentes no Dots e no Muse usando os mesmos arquivos, objetivos, permissões e critérios de conclusão.
Testes úteis incluiriam compilar um repositório, produzir um ativo de mídia, pesquisar uma questão documentada e atualizar um projeto estruturado. Cada teste deve registrar sucesso, tempo, intervenções e erros.
Atribuições intensivas em CPU revelarão se nove núcleos se traduzem em esperas menores. Tarefas intensivas no navegador mostrarão se decisões do modelo e confiabilidade das ferramentas anulam essa vantagem.
Um resultado conta apenas quando a saída final está correta. Concluir mais rapidamente uma tarefa defeituosa não representa melhor desempenho de agente.
O segundo sinal é a consistência da configuração após o pico de lançamento. Execuções públicas do Geekbench devem ser monitoradas quanto a mudanças em contagens de núcleos, totais de memória, sistemas operacionais e faixas de pontuação.
Resultados estáveis sustentariam a teoria de que a OpenAI definiu um ambiente padrão para o Dot. Uma variação mais ampla sugeriria alocação dinâmica, diferenças regionais ou capacidade oportunista.
O desempenho sob carga importará mais do que picos da semana de lançamento. A pontuação multi-core de 9.435 antes do lançamento já está acima de todas as execuções relatadas após o lançamento.
Essa diferença não é alarmante, mas oferece uma linha de base. Quedas contínuas poderiam indicar maior contenção à medida que mais usuários criam agentes.
O terceiro sinal é a divulgação operacional da OpenAI. Os compradores precisam de informações claras sobre isolamento, persistência, retenção de dados, permissões de aplicativos conectados e recuperação de ações nocivas.
A OpenAI não precisa publicar todos os detalhes de infraestrutura. Ela deve explicar quais garantias permanecem estáveis quando um agente trabalha por horas sem supervisão direta.
Relatórios de segurança testarão essas garantias. Observe descobertas de injeção de prompt, ações não autorizadas, vazamento entre sessões e falhas em solicitar aprovação.
Observe também como a OpenAI responde quando pesquisadores documentam fraquezas. Uma correção rápida e transparente reforçaria a confiança em sua estratégia de computador gerenciado.
A resposta da Meta pertence a esse terceiro sinal. O Muse poderia receber sandboxes maiores, ferramentas remotas mais especializadas ou orquestração aprimorada sem igualar a OpenAI núcleo por núcleo.
Se o Muse entregar resultados semelhantes com menos recursos, o aparente déficit de hardware se transforma em vantagem de eficiência. Se ele tiver dificuldades com cargas de trabalho locais, a maior alocação da OpenAI ganha peso estratégico.
Os primeiros dados do Geekbench 7 do OpenAI Dots deixam um ponto claro: a competição entre agentes agora também inclui os computadores atribuídos a eles.
Os modelos ainda determinam o planejamento e o julgamento. Mas o trabalho persistente também depende de CPUs, memória, sistemas operacionais, isolamento e da confiabilidade das ferramentas conectadas.
O teste decisivo agora está disponível para os usuários. Dê a Dots e Muse tarefas idênticas e auditáveis, depois compare os resultados concluídos em vez de demonstrações promocionais.
Os núcleos extras reduzem a espera, os erros e a intervenção humana em tarefas reais? Até que testes repetíveis respondam a essa pergunta, o benchmark é uma pista informativa sobre infraestrutura, não um veredito.



