top of page

Google Research Quer Que Computadores Quânticos Aprendam com Erros Sem Parar

O Google Research usou aprendizado por reforço para estabilizar um processador quântico com correção de erros enquanto ele opera, desafiando uma limitação básica dos cálculos quânticos de longa duração. O sistema aprende com sinais de erro e ajusta milhares de parâmetros de controle sem exigir que cientistas interrompam o cálculo para recalibrá-lo.

Essa distinção importa porque algoritmos quânticos úteis talvez precisem funcionar continuamente por dias ou meses. Os processadores atuais continuam sensíveis a variações nas frequências, amplitudes e fases que controlam seus qubits. Os operadores normalmente separam a computação da calibração, obrigando a máquina a pausar antes que essas configurações possam ser corrigidas.

O novo trabalho, publicado na Nature em 8 de julho e detalhado pelo Google em 22 de julho, reformula esse problema de manutenção. Em vez de tratar erros quânticos apenas como danos a serem decodificados, o controlador os usa como feedback sobre o próprio processador. O Google testou a abordagem no Willow, seu processador quântico supercondutor, após introduzir deliberadamente desvios de controle.

O resultado não é um computador autorreparável e tolerante a falhas, pronto para cargas de trabalho comerciais. Trata-se de um mecanismo para manter um sistema com correção de erros mais próximo de sua meta operacional. A tensão agora está entre a calibração estática, orientada por modelos, e o controle adaptativo que aprende enquanto uma computação continua.

Google Research Transforma Detecção de Erros em Sinal de Controle

A mudança importante é que os dados de erro agora cumprem duas funções: reparar informações lógicas e ensinar o controlador do processador a reduzir erros futuros.

O hardware quântico não executa instruções por meio de interruptores perfeitamente digitais. Ele depende de sinais analógicos cuidadosamente moldados que manipulam estados quânticos frágeis. Pequenas mudanças de temperatura, eletrônica, materiais ou do ambiente ao redor podem afastar um processador de seu ponto operacional calibrado.

Esse movimento é chamado de deriva. Ele pode afetar a frequência, a amplitude ou a fase de um sinal de controle, alterando a precisão com que a máquina realiza operações quânticas. Mesmo um processador bem calibrado pode sofrer deriva à medida que um cálculo longo avança.

A correção de erros quânticos, ou QEC, protege informações ao codificar um qubit lógico em vários qubits físicos. Verificações de paridade repetidas revelam padrões associados a erros sem ler diretamente o estado quântico protegido. Uma medição direta colapsaria a superposição da qual a computação depende.

Um decodificador então analisa esses eventos de detecção e estima a correção necessária para preservar a informação lógica. O Google já explorou decodificadores aprendidos por meio da pesquisa AlphaQubit, que aplica redes neurais a dados de decodificação de erros.

A decodificação não identifica por que o processador gerou um padrão específico. Alguns erros surgem da interação inevitável com o ambiente, um processo conhecido como decoerência. Outros refletem calibração imperfeita ou deriva do hardware, que o software de controle pode resolver.

O novo sistema de controle adaptativo envia os mesmos eventos de detecção de QEC para um agente de aprendizado por reforço. O aprendizado por reforço treina um agente por meio do feedback de suas ações, em vez de uma lista fixa de respostas programadas.

À medida que a computação é executada, o agente observa mudanças no fluxo de detecção de erros. Em seguida, ele ajusta os controles analógicos para compensar a deriva inferida. O decodificador continua lidando com as correções lógicas, enquanto o controlador tenta impedir a formação de erros adicionais.

Essa divisão é central para a correção de erros quânticos do Google. O decodificador protege as informações depois que os erros físicos ocorrem. O controlador de aprendizado por reforço altera as condições operacionais para que erros controláveis ocorram com menos frequência.

O Google descreve isso como afinar uma orquestra enquanto ela continua tocando. A comparação capta a mudança operacional, embora o feedback subjacente seja menos direto. Um evento de QEC identifica um erro em uma região delimitada do circuito, não um componente defeituoso específico.

Portanto, o agente precisa aprender associações entre padrões distribuídos de erro e configurações de controle. Ele não recebe uma mensagem simples informando que um qubit se deslocou para uma frequência ruim conhecida. Ele busca ajustes que melhorem o desempenho lógico em todo o sistema.

Isso cria o conflito central do artigo. A calibração tradicional depende de modelos de física, experimentos controlados e intervenção de especialistas antes do início de uma carga de trabalho. A calibração adaptativa trata dados de erros em tempo real como uma fonte contínua de informações sobre o hardware.

Por Que a Calibração Contínua se Tornou o Verdadeiro Gargalo

Cálculos longos não podem entregar resultados úteis se o processador precisar descartar repetidamente seu estado para que técnicos o reajustem.

Processadores quânticos são máquinas analógicas que operam sob tolerâncias incomumente rigorosas. Seu comportamento depende da eletrônica de controle, das condições criogênicas, das diferenças de fabricação e das interações entre componentes próximos. Essas variáveis se tornam mais difíceis de representar à medida que o processador cresce.

Uma rotina convencional de calibração mede respostas selecionadas do hardware, ajusta-as a um modelo e atualiza as configurações de controle. Cientistas podem aplicar intuição física quando procedimentos automatizados encontram um caso incomum. Esse processo funciona bem o suficiente para preparar experimentos, mas continua separado da computação.

Essa separação se torna cara quando um cálculo precisa preservar um estado lógico por um período prolongado. A recalibração pode exigir a interrupção da computação porque medições diagnósticas comuns perturbariam a informação quântica codificada. A próxima execução precisa recomeçar depois que novas configurações forem aplicadas.

O Google Research argumenta que futuros algoritmos úteis precisarão de operação ininterrupta por dias ou meses. Ainda é incerto se toda carga de trabalho valiosa chegará a essa duração. No entanto, qualquer arquitetura tolerante a falhas precisa manter operações lógicas estáveis por muito mais tempo do que as demonstrações curtas de hoje.

A pressão recai primeiro sobre sistemas supercondutores que escalam por meio de grandes quantidades de componentes controlados. Cada qubit exige pulsos calibrados, comportamento de leitura e interações com qubits vizinhos. Um processador maior cria mais parâmetros e mais oportunidades para deriva local.

Melhorias de hardware não eliminam automaticamente esse fardo de controle. Uma fabricação melhor pode reduzir defeitos evidentes e diminuir as taxas médias de erro. Quando esses problemas diminuem, efeitos residuais complexos podem se tornar a fonte dominante de falhas.

Esses efeitos podem incluir crosstalk, mudanças lentas de parâmetros e interações que modelos físicos simplificados não capturam com precisão. Adicionar mais equações nem sempre resolve o problema. Um modelo detalhado pode se tornar caro de atualizar e ainda deixar de captar comportamentos únicos de um dispositivo.

Um controlador de aprendizado oferece outra rota. Ele pode otimizar em relação a resultados medidos sem exigir que engenheiros especifiquem antecipadamente todas as relações causais. A abordagem se assemelha a aplicações de aprendizado de máquina nas quais políticas aprendidas superam regras construídas manualmente em ambientes com muitas variáveis interagindo.

Ainda assim, o controle adaptativo não substitui a física quântica. Pesquisadores continuam precisando de modelos físicos para projetar o processador, selecionar ações seguras, interpretar falhas e impor restrições ao agente. O aprendizado por reforço aborda a parte do sistema em que descrições construídas manualmente se tornam difíceis de manter.

É por isso que o experimento importa para além das melhorias relatadas na taxa de erro. Ele conecta a inteligência de máquina diretamente ao ciclo operacional de hardware quântico com correção de erros. O agente não está analisando resultados após um experimento concluído. Ele está influenciando o processador enquanto as informações protegidas permanecem ativas.

Esse arranjo também muda o objetivo de engenharia. As equipes não precisam mais apenas de um processador com baixa taxa de erro no início de um benchmark. Elas precisam de uma pilha completa de controle capaz de manter o desempenho lógico estável durante toda uma carga de trabalho.

Para desenvolvedores, o impacto imediato continua indireto. O trabalho não oferece uma nova interface de programação nem torna os serviços quânticos existentes tolerantes a falhas. Sua importância está abaixo dessa camada, onde a calibração determina se aplicações futuras poderão funcionar por tempo suficiente para produzir respostas confiáveis.

Aprendizado por Reforço Superou a Calibração de Especialistas no Willow

O Google afirma que o aprendizado por reforço melhorou o desempenho lógico mesmo depois de cientistas já terem ajustado o Willow por meio de uma calibração intensiva conduzida por humanos.

A equipe avaliou o controlador no chip Willow do Google, um processador supercondutor apresentado em 2024. Os pesquisadores injetaram deliberadamente deriva em seus parâmetros de controle, criando um teste para verificar se o agente conseguiria restaurar uma operação estável.

Segundo o Google, o controle por aprendizado por reforço melhorou em 3,5 vezes a estabilidade lógica do código de correção de erros sob essa deriva artificial. A melhoria ampliou o tempo durante o qual o processador se comportou como uma memória quântica confiável, o que significa que preservou informações codificadas em vez de executar uma aplicação completa.

Os pesquisadores também testaram se o sistema oferecia valor após a calibração por especialistas. Especialistas humanos já haviam ajustado o processador usando conhecimento físico e intervenção manual em casos difíceis. O Google afirma que o ajuste fino posterior com aprendizado por reforço reduziu a taxa de erro lógico em mais 20%.

Esse segundo resultado é possivelmente mais revelador do que a recuperação após a deriva injetada. Um controlador que repara configurações intencionalmente degradadas demonstra que pode buscar parâmetros melhores. Um controlador que melhora um sistema ajustado por especialistas sugere que ele pode encontrar relações que operadores experientes ou modelos existentes não perceberam.

O experimento combinado produziu menos de um erro lógico por mil ciclos de correção de erros para o código de superfície. Um código de superfície organiza qubits físicos de modo que verificações locais repetidas possam proteger informações lógicas. O Google relatou um erro lógico por cem ciclos para o código de cor usado no experimento.

Esses números exigem interpretação cuidadosa. Eles descrevem testes de memória quântica sob condições experimentais definidas, não um computador tolerante a falhas de uso geral executando meses de algoritmos úteis. Códigos, operações, layouts de dispositivos e cargas de trabalho diferentes podem produzir resultados diferentes.

O artigo na Nature, revisado por pares, fornece a base técnica para o relato da empresa. Sua publicação oferece a pesquisadores externos um método e um conjunto de dados definidos com os quais podem avaliar as alegações. A reprodução independente em outros processadores continua sendo uma etapa separada.

A abordagem também complementa os decodificadores, em vez de competir com eles. AlphaQubit e sistemas algorítmicos como a decodificação Tesseract estimam correções a partir de eventos de detecção. O agente de aprendizado por reforço usa esses eventos para modificar controles que influenciam as taxas de erro futuras.

Essa combinação cria um sistema de feedback em camadas. Os qubits físicos geram eventos de detecção. Um decodificador protege o estado lógico, enquanto o controlador atualiza os parâmetros de hardware. O ciclo seguinte então produz novas evidências sobre se essas mudanças ajudaram.

Um sistema de calibração convencional também pode usar feedback. A distinção está em como a política conecta observações a ajustes. O agente do Google aprende esse mapeamento por meio da experiência, em vez de depender apenas de um modelo físico explicitamente programado.

O experimento não significa que o computador quântico entende seus próprios erros. O sistema otimiza um objetivo de controle a partir de sinais estatísticos. A expressão “aprende com seus erros” descreve um processo adaptativo de feedback, não raciocínio ou autoconsciência.

Mesmo com essa ressalva, o mecanismo representa uma mudança significativa. A correção de erros geralmente é vista como uma defesa contra hardware ruidoso. Aqui, o fluxo de erros também se torna um canal de diagnóstico que ajuda o hardware a operar com maior precisão.

O Controle Adaptativo Desafia Modelos Físicos Estáticos

A principal disputa não é entre o Google e outra empresa de computação quântica. É entre controle adaptativo orientado por dados e uma calibração que permanece fixa durante uma computação.

A calibração baseada em física começa com uma vantagem. Pesquisadores entendem o comportamento pretendido de portas quânticas, ressonadores, acopladores e sistemas de leitura. Os modelos podem codificar esse conhecimento de forma eficiente e impor limites de segurança que um agente de aprendizado não deveria descobrir por tentativa e erro irrestrita.

Modelos estáticos se tornam menos confiáveis quando efeitos não modelados se acumulam. Um pulso que funciona em um qubit pode influenciar outro. Um parâmetro pode variar lentamente durante a operação. Variações de fabricação podem fazer componentes nominalmente idênticos se comportarem de maneira diferente.

Especialistas humanos frequentemente resolvem esses casos extremos por meio de experimentos direcionados. Sua intuição é valiosa porque eles conseguem relacionar um sinal incomum a uma causa física plausível. No entanto, um especialista não consegue monitorar e ajustar manualmente dezenas de milhares de parâmetros interativos ao longo de cada computação longa.

O aprendizado por reforço muda esse equilíbrio ao transformar o controle em um problema contínuo de otimização. O agente pode acompanhar evidências locais e atualizar parâmetros selecionados enquanto a máquina opera. Ele não precisa de uma explicação completa para cada padrão antes de agir.

O Google testou a questão de escalabilidade por meio de simulações numéricas envolvendo centenas de qubits e dezenas de milhares de parâmetros de controle. A empresa informa que o número de iterações de treinamento não aumentou com o tamanho do sistema nessas simulações.

A razão proposta é a localidade. Os eventos de detecção da QEC respondem mais fortemente a erros próximos, portanto o agente não precisa inferir uma relação global que cubra todo o processador. O feedback local pode orientar ajustes de controle locais mesmo à medida que o sistema completo cresce.

Se essa propriedade se mantiver em hardware maior, ela aborda uma preocupação séria sobre a calibração aprendida. Um método que exige exponencialmente mais treinamento à medida que os qubits aumentam teria pouco valor prático. Contagens de iteração independentes do tamanho tornariam a abordagem mais plausível para processadores maiores.

Resultados de simulação não equivalem a escalabilidade física. Processadores reais incluem latência, ruído correlacionado, comportamento inesperado do hardware e limites para a rapidez com que as configurações de controle podem mudar. Uma política que converge com eficiência em um ambiente numérico pode encontrar restrições diferentes dentro de um sistema criogênico.

O ciclo de aprendizado por reforço também precisa de comunicação rápida. Os eventos de detecção devem passar do processador quântico para o hardware de computação clássico. O agente deve avaliá-los e retornar controles atualizados antes que a deriva cause danos maiores.

O Google reconhece que uma integração mais estreita e uma comunicação mais rápida são necessárias para capturar o benefício completo do método. Isso torna a pilha de controle clássico parte do problema de escalabilidade quântica. Processadores especializados, conexões de baixa latência e atualizações cuidadosamente programadas podem importar tanto quanto o algoritmo de aprendizado.

Plataformas quânticas concorrentes enfrentam questões relacionadas de estabilidade, embora seu hardware produza desafios de controle diferentes. Sistemas de íons aprisionados, átomos neutros, fotônicos e outros não compartilham os requisitos exatos de calibração do Willow. Uma política validada em hardware supercondutor não pode ser transferida automaticamente para eles.

Isso limita a utilidade de uma simples comparação empresa contra empresa. A competição mais ampla diz respeito a qual arquitetura consegue combinar qubits físicos, correção de erros, decodificação, calibração e controle clássico em um sistema confiável.

O resultado do Google fortalece o lado do controle adaptativo nessa disputa. Ele sugere que o aprendizado de máquina pode complementar a modelagem física quando o comportamento do processador se torna complexo demais para procedimentos fixos. Não estabelece que o controle aprendido substituirá a calibração convencional em todas as camadas.

Um sistema híbrido continua sendo a direção mais crível. A física fornece arquitetura, restrições e calibração inicial. Especialistas humanos diagnosticam falhas desconhecidas. Agentes aprendidos otimizam continuamente os parâmetros dentro de uma faixa operacional aprovada.

Esse arranjo reflete como muitos sistemas de engenharia complexos usam automação. O controlador lida com ajustes rápidos e repetitivos, enquanto as pessoas definem objetivos e investigam condições fora de sua experiência de treinamento. O hardware quântico eleva os riscos porque uma ação mal escolhida pode corromper um estado lógico insubstituível.

O Que o Experimento Ainda Não Prova

Um experimento bem-sucedido de memória sob deriva induzida não estabelece controle contínuo para um grande computador tolerante a falhas executando um algoritmo útil.

A primeira incerteza é a complexidade da carga de trabalho. Preservar informações lógicas em uma memória quântica é fundamental, mas a computação também exige portas lógicas, preparação de estados, medição e coordenação entre qubits codificados. Cada operação pode introduzir novos erros e interações de controle.

Um controlador que estabiliza ciclos de memória pode exigir modificações significativas durante operações lógicas ativas. A distribuição de erros pode mudar à medida que portas são executadas, qubits interagem e os cronogramas de controle se tornam mais densos. O Google não afirmou que o experimento atual resolve todas essas condições.

A segunda incerteza é a escala em hardware físico. As simulações usaram centenas de qubits e dezenas de milhares de parâmetros, enquanto o comportamento de escalabilidade relatado se baseou em condições modeladas. Dispositivos reais maiores podem gerar efeitos correlacionados que violam pressupostos sobre localidade.

Erros correlacionados merecem atenção especial porque a correção de erros funciona melhor quando as falhas permanecem suficientemente raras e independentes. Uma ação de controle que melhora uma métrica local pode influenciar vários componentes próximos. O agente deve evitar trocar uma redução visível de erros por uma falha correlacionada menos evidente.

A terceira incerteza é a velocidade de adaptação. A deriva não espera por um pipeline de software. Se a detecção, a inferência e as atualizações de controle demorarem demais, o processador poderá mudar novamente antes que a resposta do agente chegue.

O Google identifica a velocidade de comunicação como uma área que requer melhorias. Isso não é um detalhe menor de implementação. O processamento clássico de baixa latência precisa operar ao lado da decodificação, do agendamento e da leitura sem interferir na carga de trabalho quântica.

A quarta incerteza diz respeito à exploração segura. O aprendizado por reforço normalmente melhora ao testar ações e observar seus efeitos. Uma computação quântica de produção não pode tolerar experimentação ampla que desestabilize seu estado codificado.

Portanto, o sistema precisa de ações restritas, regras conservadoras de atualização ou uma política confiável treinada antes da implantação. Os pesquisadores devem mostrar que a adaptação pode responder a uma deriva desconhecida sem introduzir uma fonte igualmente grave de instabilidade.

A quinta questão é a portabilidade. Uma política pode aprender comportamentos específicos de um dispositivo, o que é uma das atrações da abordagem. Essa especialização também pode dificultar a transferência quando o hardware é substituído, reparado ou operado sob novas condições.

O retreinamento pode ser rotineiro se ocorrer de forma rápida e segura. Pode se tornar caro se cada processador exigir ampla coleta de dados sob condições cuidadosamente controladas. A contagem de iterações independente do tamanho relatada é encorajadora, mas não responde a todas as questões de implantação.

Há também um problema de medição. O agente aprende com eventos de detecção da QEC, que contêm informações incompletas sobre falhas físicas subjacentes. Um controlador útil deve separar a deriva persistente do ruído ambiental aleatório e dos erros causados pela própria computação.

Agir com base em ruído aleatório poderia produzir ajustes desnecessários. Ignorar um padrão sutil de deriva poderia permitir que o desempenho lógico se deteriorasse. Os pesquisadores precisarão de avaliações que mostrem como a política se comporta sob múltiplas fontes de ruído, não apenas sob mudanças de parâmetros deliberadamente injetadas.

A replicação independente fortaleceria o argumento. A publicação na Nature permite que outros pesquisadores inspecionem o método, mas a replicação em outro processador testaria se seus ganhos dependem do projeto do Willow ou da infraestrutura do Google ao redor dele.

Nenhuma dessas limitações torna o experimento trivial. Elas identificam a distância entre uma demonstração controlada e um sistema operacional tolerante a falhas. O Google Research mostrou um mecanismo de controle crível, enquanto os testes mais difíceis de integração de sistemas ainda estão por vir.

Três Sinais Que Mostrarão se o Google Research Pode Escalá-lo

As próximas evidências precisam avançar de uma memória quântica melhor para computações mais longas, sistemas físicos maiores e controle em circuito fechado mais rápido.

O primeiro sinal é uma demonstração durante computação lógica, não apenas preservação de memória. Pesquisadores devem mostrar a calibração adaptativa funcionando enquanto portas codificadas são executadas em múltiplos qubits lógicos. Um desempenho estável sob cronogramas de portas em mudança fortaleceria a alegação do Google de que o controlador pode dar suporte a cargas de trabalho úteis.

A incapacidade de manter sua vantagem durante operações lógicas restringiria o resultado. Isso sugeriria que a política atual lida melhor com ciclos estáveis de memória do que com computações dinâmicas. Esse resultado ainda ajudaria o armazenamento quântico, mas enfraqueceria o argumento mais amplo sobre computação contínua.

O segundo sinal é a escalabilidade física além do experimento atual. Um processador maior deve manter a eficiência de aprendizado relatada enquanto controla mais parâmetros e lida com mais interações. Os resultados devem separar ganhos provenientes de melhorias de hardware, mudanças no decodificador e aprendizado por reforço.

A métrica-chave não é simplesmente a contagem de qubits físicos. Os pesquisadores precisam de taxas de erro lógico medidas em execuções mais longas, com e sem controle adaptativo, sob condições comparáveis. Evidências de que a carga de treinamento permanece administrável apoiariam os resultados da simulação.

O terceiro sinal é uma integração mais estreita entre o hardware quântico e o controlador clássico. O Google já identificou a velocidade de comunicação como um limite. Demonstrações futuras devem informar com que rapidez o ciclo detecta a deriva, seleciona um ajuste e o aplica.

Menor latência tornaria a adaptação mais útil contra mudanças mais rápidas. Também mostraria que o aprendizado por reforço pode coexistir com a decodificação e outras tarefas de controle em tempo real. Se o ciclo clássico se tornar um gargalo, o processador quântico não poderá se beneficiar de uma política melhor com rapidez suficiente.

Esses sinais importam para mais do que especialistas em computação quântica. Desenvolvedores e compradores corporativos devem observar se os fornecedores começam a reportar operações lógicas sustentadas, em vez de benchmarks isolados de qubits físicos. A confiabilidade ao longo do tempo determinará quando os sistemas quânticos se tornarão adequados para trabalhos científicos e industriais exigentes.

Os profissionais do conhecimento que acompanham este campo também enfrentam um problema crescente de evidências. Os anúncios sobre computação quântica combinam métricas de dispositivos, resultados específicos de códigos, simulações e interpretações das empresas. Manter os artigos subjacentes ao lado de notas técnicas em uma base de conhecimento pesquisável pode tornar comparações posteriores mais rigorosas.

O Google Research transformou a detecção de erros em um canal de feedback para controle contínuo. A próxima pergunta é concreta: esse ciclo consegue permanecer seguro, rápido e eficaz enquanto uma máquina maior executa operações lógicas por dias, em vez de apenas preservar memória em um teste controlado?

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

​Adicione uma barra de pesquisa ao seu cérebro

É só perguntar ao remio

Lembre-se de tudo

Não organize nada

bottom of page