top of page

BDH-CQ desafia o raciocínio de IA token a token com memória latente recorrente

O BDH-CQ alcançou 29,5% de pass@2 no ARC-AGI-1 com 150 milhões de parâmetros, apesar de nunca verbalizar seu raciocínio intermediário. Pesquisadores da Pathway apresentaram o sistema em 10 de agosto de 2026, por meio de um preprint que combina memória recorrente com computação latente iterativa. O resultado desafia uma premissa comum dos modelos modernos de raciocínio: problemas mais difíceis exigem sequências mais longas de tokens de raciocínio gerados.

A pontuação reportada não torna o BDH-CQ o solucionador de ARC mais preciso. Sua relevância vem da forma como o modelo aprende cada tarefa de teste e da pouca computação que os autores relatam utilizar. As demonstrações atualizam uma memória interna durante a inferência, enquanto parâmetros fixos do modelo processam a consulta repetidamente dentro de um espaço de trabalho contínuo.

Essa abordagem posiciona o BDH-CQ contra o raciocínio token a token, e não contra uma empresa ou modelo principal específico. Sistemas de cadeia de pensamento transformam a computação intermediária em linguagem antes de ler esses tokens de volta. O BDH-CQ mantém essa computação interna, potencialmente evitando a latência e a sobrecarga de decodificação associadas a longos rastros de raciocínio.

As evidências permanecem mais limitadas do que a manchete sugere. A avaliação cobre transformações de grades visuais, não linguagem aberta, programação ou pesquisa científica. Detalhes arquiteturais importantes também continuam proprietários, limitando a reprodução e o escrutínio independentes.

BDH-CQ aprende uma tarefa sem atualizar seus parâmetros

O BDH-CQ transforma demonstrações em uma memória recorrente temporária e, em seguida, usa essa memória para resolver uma nova consulta.

A equipe liderada pela Pathway apresentou o BDH-CQ em um preprint de agosto. Entre os autores estão pesquisadores da Pathway, Bielik AI e New York University. O artigo descreve o BDH-CQ como uma extensão da família arquitetural Dragon Hatchling.

Cada tarefa de avaliação fornece vários exemplos de entrada e saída e uma nova entrada que exige uma resposta. O BDH-CQ processa essas demonstrações sequencialmente. Cada exemplo altera um estado recorrente que carrega contexto para entradas posteriores.

Em seguida, o modelo codifica a consulta junto com esse estado acumulado. Ele transforma repetidamente um espaço de trabalho latente de alta dimensão, isto é, uma representação interna contínua usada para computação. Apenas a resposta candidata final é decodificada.

Nenhuma atualização de gradiente ocorre durante esse processo. Os parâmetros treinados do modelo permanecem fixos, enquanto seu estado recorrente muda conforme as evidências fornecidas. Essa distinção separa a memória em tempo de inferência do ajuste fino convencional.

Os pesquisadores também afirmam que identificadores de tarefas de avaliação e pares de demonstração da avaliação foram excluídos do treinamento. Em vez disso, o modelo foi treinado com uma mistura de fontes no estilo ARC e exemplos selecionados de forma privada. As fontes públicas incluíam dados de treinamento do ARC-AGI-1, RE-ARC, ConceptARC, ARC-Heavy e ARC-GEN100K.

Essa configuração importa porque muitos sistemas ARC compactos se adaptam diretamente a cada quebra-cabeça de avaliação. Eles otimizam componentes do modelo, usam identidades específicas de cada quebra-cabeça ou votam entre versões aumentadas. O BDH-CQ afirma inferir a transformação apenas a partir das demonstrações.

O ambiente de teste foi a divisão pública de avaliação do ARC-AGI-1. As tarefas ARC usam pequenas grades coloridas para expressar transformações envolvendo objetos, simetria, contagem, topologia e relações espaciais. Um solucionador deve inferir uma regra não declarada a partir de alguns exemplos.

A divisão pública contém 400 tarefas. O BDH-CQ resolveu 97 em seu primeiro candidato classificado e 118 quando qualquer um de dois candidatos podia contar. Esses resultados correspondem a 24,25% de pass@1 e 29,5% de pass@2.

Em 419 pares de teste individuais, alcançou 25,78% de pass@1 e 31,03% de pass@2. A precisão por tarefa é mais rigorosa porque toda saída de teste exigida deve estar correta. Uma única grade errada faz com que a tarefa inteira fracasse.

Os pesquisadores calcularam a inferência a partir do tempo medido de GPU H200. Sua configuração padrão usou aproximadamente 0,85 segundos de GPU H200 por tarefa. Eles argumentam que esse resultado ultrapassa a fronteira de custo-precisão do ARC-AGI-1 reportada anteriormente.

Essa alegação de eficiência é o principal valor jornalístico do acontecimento. O BDH-CQ não vence por produzir a maior pontuação agregada. Ele afirma um novo ponto operacional no qual desempenho significativo exige uma quantidade incomumente pequena de computação de inferência.

O artigo também relata uma auditoria de caixa-preta realizada por coautores afiliados à Bielik AI e à New York University. Eles reproduziram a pontuação de 29,5% sem acesso aos pesos do modelo. Isso oferece uma verificação útil do serviço implantado, embora não seja equivalente a uma replicação por pessoas sem afiliação.

Mais importante, o resultado une memória, adaptação e inferência em um único processo recorrente. O sistema não precisa de um otimizador separado para cada quebra-cabeça. Também evita transformar cada estado intermediário em uma frase.

Por que o raciocínio token a token está sob pressão

O BDH-CQ mira o formato computacional do raciocínio em cadeia de pensamento, não apenas sua precisão em benchmarks.

Modelos grandes de raciocínio costumam alocar mais computação ao gerar mais tokens. Esses tokens podem documentar deduções parciais, testar alternativas e corrigir erros anteriores. Eles também forçam o trabalho interno a passar por um vocabulário discreto.

Cada token de raciocínio gerado exige outra etapa de decodificação autorregressiva. O modelo precisa projetar seu estado oculto em probabilidades de vocabulário, selecionar um token e consumir esse token novamente. Rastros mais longos, portanto, aumentam a computação e a latência.

O raciocínio verbal continua útil porque as pessoas podem inspecioná-lo. Ele também pode apoiar chamadas de ferramentas, colaboração e verificação explícita. No entanto, a linguagem se torna uma restrição de largura de banda quando o estado intermediário não precisa de interpretação humana.

O BDH-CQ testa outro mecanismo de alocação. Em vez de estender uma transcrição visível, ele adiciona transformações recorrentes dentro de um estado contínuo. Um estado interno pode codificar várias possibilidades parciais sem expressar cada uma separadamente.

Essa diferença se assemelha ao trabalho paralelo versus serial. Um rastro verbal normalmente seleciona um token em cada posição. Um estado de alta dimensão pode preservar múltiplos recursos ativos e transformá-los em conjunto.

A ideia não é exclusiva do BDH-CQ. A pesquisa Coconut da Meta realimenta estados ocultos contínuos em um Transformer, permitindo o raciocínio sem decodificar cada etapa intermediária. Modelos de profundidade recorrente também reutilizam blocos de computação em múltiplas iterações internas.

O BDH-CQ acrescenta um elemento distinto: demonstrações modificam continuamente a memória recorrente da tarefa. A consulta então usa essa memória durante a iteração latente. Assim, o sistema conecta adaptação em contexto e raciocínio não verbal dentro de uma única arquitetura.

Essa conexão pressiona duas rotas estabelecidas. A primeira é a cadeia de pensamento convencional, em que exemplos especificam a tarefa e tokens fornecem o espaço de trabalho. A segunda é a otimização específica da tarefa, em que um solucionador compacto se adapta separadamente a cada quebra-cabeça.

O sistema da Pathway afirma preservar a flexibilidade da primeira rota sem sua narração obrigatória. Também afirma preservar a computação compacta da segunda rota sem atualizações de parâmetros específicas para cada quebra-cabeça.

O contraste se torna mais nítido no ARC. Os sistemas Hierarchical Reasoning Model e Tiny Recursive Model usam computação latente iterativa, mas seus procedimentos ARC incluem adaptação transdutiva. As demonstrações de avaliação participam da otimização associada a cada quebra-cabeça.

Os autores do BDH-CQ argumentam que uma tarefa nunca vista antes pode entrar pelo contexto. Eles comparam esse arranjo a uma pessoa que aprende uma regra a partir de exemplos e depois a aplica sem reescrever todo o seu mecanismo de raciocínio.

Essa analogia deve permanecer limitada. Atualizações de estado recorrente são operações matemáticas, não evidência de compreensão semelhante à humana. O artigo chama o design de inspirado no cérebro, mas evita explicitamente alegar imitação biológica.

A arquitetura subjacente Dragon Hatchling usa ativações positivas esparsas, comunicação de baixo posto e estado associativo recorrente. Seu repositório de arquitetura público descreve neurônios artificiais que interagem localmente e memória de trabalho no estilo hebbiano.

A memória hebbiana fortalece associações entre recursos coativos. No BDH-CQ, o ponto prático é que o contexto pode modificar um estado interno persistente. O estado não precisa crescer como uma lista explícita de cada chave e valor anteriores.

Essa propriedade pode vir a importar além dos quebra-cabeças visuais. Longos rastros de raciocínio consomem memória, tempo de decodificador e largura de banda de comunicação. Um estado recorrente oferece outra maneira de preservar informações enquanto controla esses custos.

No entanto, remover a linguagem também remove uma superfície conveniente de inspeção. Uma trajetória oculta não pode ser considerada confiável apenas por ser eficiente. Desenvolvedores precisam de outros métodos para testar se o processo interno é estável, enviesado ou vulnerável à manipulação.

A pressão sobre o raciocínio baseado em tokens é, portanto, condicional. O BDH-CQ mostra que texto visível não é o único espaço de trabalho computacional possível. Não mostra que a computação oculta possa substituir a linguagem em todas as tarefas.

Discussão no Horizon MachineLearning aponta para um mecanismo mais profundo

O mecanismo importante não é apenas o raciocínio silencioso; é a separação entre memória contextual e o espaço de trabalho de raciocínio ativo.

Uma discussão amplamente compartilhada no MachineLearning ajudou a trazer o artigo à tona, mas as alegações técnicas subjacentes vêm da própria pesquisa. O BDH-CQ mantém duas estruturas internas com funções diferentes.

O estado contextual recorrente muda enquanto o modelo absorve demonstrações. Ele armazena associações relevantes para a tarefa recém-apresentada. O espaço de trabalho de raciocínio latente começa depois que esses exemplos entram na memória.

Durante a resolução da consulta, o espaço de trabalho muda ao longo de várias etapas de raciocínio. O estado contextual permanece disponível durante essas transformações. Um decodificador converte o espaço de trabalho final em um ou dois candidatos de grade classificados.

Essa divisão impede que um único vetor carregue todas as responsabilidades. A memória responde ao que as demonstrações estabeleceram. O espaço de trabalho lida com a computação que ainda é necessária para a consulta.

Os autores descrevem a atualização da memória em alto nível. Um novo estado depende do estado anterior e da próxima demonstração. Os parâmetros treinados que governam essa atualização não mudam.

Eles descrevem o espaço de trabalho de forma semelhante. Um codificador o inicializa a partir da consulta e do contexto acumulado. Uma função recorrente o atualiza repetidamente antes que um decodificador crie a resposta.

Essa descrição explica o conceito, mas não a implementação completa. O artigo diz que as dimensões exatas, as regras de atualização e os detalhes internos do sistema permanecem proprietários. Também retém a receita completa de treinamento.

O produto avaliado inclui mais do que a arquitetura neural central. Ele usa transformações de entrada, construção de candidatos, classificação e um pipeline de inferência. Esses componentes ao redor podem influenciar tanto a precisão quanto a computação.

Mesmo com essa limitação, experimentos controlados oferecem pistas sobre o que a memória recorrente de fato retém. Um teste criou um novo mapeamento de cores dentro de cada tarefa. As demonstrações definiam como várias cores deveriam mudar.

O BDH-CQ resolveu todas as 96 saídas retidas na primeira posição à medida que os vínculos simultâneos aumentaram de dois para oito. O resultado sugere que a memória contextual pode armazenar e aplicar mapeamentos densos e específicos de cada tarefa.

Outros testes variaram a escala de uma operação demonstrada. A propagação de limites permaneceu correta em todas as 48 saídas reservadas, em distâncias de duas a oito. A cópia de motivos também permaneceu correta em todas as 48 saídas à medida que os alvos aumentavam.

Esses são exemplos favoráveis porque a operação subjacente permanece local e regular. O modelo pode expandir uma ação aprendida sem reconstruir uma ordem de saída complicada.

A ordenação produziu uma curva diferente. O desempenho permaneceu próximo da saturação até cinco objetos, depois caiu em sequências mais longas. Com oito objetos, o BDH-CQ resolveu apenas uma das 24 saídas reservadas sob pass@2.

O padrão de erro foi amplo, e não local. Apenas três saídas nesse comprimento sequer tinham as dimensões corretas. Isso sugere um gargalo de execução na construção do resultado ordenado, e não apenas incerteza sobre a regra.

A contenção aninhada falhou de forma diferente. O desempenho permaneceu forte até a profundidade quatro, depois caiu na profundidade cinco. Essas saídas geralmente mantiveram as dimensões corretas e superaram 99,9% de precisão média por célula em seus melhores candidatos.

Um único erro relacional frequentemente causou a falha. Esse padrão sugere que o modelo quase concluiu a transformação, mas perdeu o controle de uma decisão de contenção. A pontuação por correspondência exata contou corretamente essas saídas como erradas.

Adicionar uma demonstração na complexidade-alvo mudou os resultados. O aninhamento de profundidade cinco passou de 19 de 24 saídas corretas para 24 de 24. A ordenação com comprimento oito melhorou de zero para 13 de 24.

Essa intervenção reforça a alegação de aprendizado em contexto. Entradas de teste idênticas byte a byte tiveram desempenho diferente quando as demonstrações cobriam a complexidade exigida. Os exemplos alteraram o comportamento efetivo do modelo sem atualizações de parâmetros.

A mesma evidência também define um limite. O BDH-CQ não extrapola de forma confiável todas as regras além da complexidade demonstrada. Sua memória pode vincular uma transformação enquanto seu espaço de trabalho ainda tem dificuldade para executar essa transformação em escala maior.

O esforço de raciocínio produziu outro trade-off previsível. A configuração alta alcançou 29,5% de pass@2, enquanto a média atingiu 27%. O esforço baixo chegou a 21%, com os autores relatando computação progressivamente menor.

Essa relação se assemelha ao escalonamento de computação em tempo de teste em outros sistemas de raciocínio. Mais etapas recorrentes melhoram a probabilidade de uma resposta exata. A diferença é que o esforço adicional ocorre em estados contínuos, e não em uma transcrição em expansão.

Esse mecanismo torna o BDH-CQ mais do que um experimento comprimido de cadeia de raciocínio. Ele cria uma memória de tarefa a partir de demonstrações, separa essa memória da computação da consulta e dimensiona o esforço por meio da profundidade recorrente.

As Vitórias no Benchmark Expõem Modos de Falha Claros

As evidências mais fortes do BDH-CQ também mostram que o aprendizado contextual não garante uma execução consistente das regras.

O artigo avalia o BDH-CQ no ConceptARC, que organiza tarefas visuais em 16 famílias de conceitos. O modelo alcançou 59,38% de aprovação estrita por tarefa em pass@2 com identificadores semânticos. Chegou a 60% depois que os identificadores se tornaram opacos e os grupos de conceitos foram misturados.

Essas pontuações semelhantes reduzem uma preocupação óbvia. O modelo não pareceu depender de nomes de tarefas significativos nem de lotes agrupados por conceito. Ambas as versões produziram 374 resultados corretos entre 480 pares de teste individuais.

No entanto, a estabilidade agregada não significou comportamento idêntico. Apenas 276 de 480 listas completas e ordenadas de candidatos coincidiram entre as duas execuções. O contexto da solicitação ou o comportamento interno de busca alterou muitas saídas sem mover a pontuação geral.

Mais importante, a precisão por par de teste atingiu 77,92%, enquanto a precisão estrita por tarefa permaneceu em 59,38%. A diferença de 18,54 pontos mostra que uma resposta correta para uma entrada frequentemente não se transferiu para todas as entradas.

Cinquenta e duas das 160 tarefas do ConceptARC tiveram uma ou duas entradas de teste corretas sem resolver todas as três. Sob uma visão estrita de indução de regras, esses sucessos parciais não demonstram aplicação consistente da regra inferida.

O desempenho também variou acentuadamente por conceito. O sistema resolveu nove de dez tarefas envolvendo distinções entre preenchido e não preenchido. Também resolveu nove de dez tarefas na família TopBottom2D.

Copy e Order alcançaram apenas duas de dez cada. Cada família contém somente dez tarefas, portanto essas contagens não podem estabelecer uma classificação estável. Ainda assim, revelam onde o sistema atual merece testes de pressão mais rigorosos.

A composição criou outra fraqueza importante. O BDH-CQ resolveu rotação e realocação separadamente, depois resolveu sua combinação em todas as 72 saídas reservadas. A reflexão combinada com realocação teve sucesso em 47 de 72.

A troca de cores teve desempenho muito pior. Ela teve sucesso em apenas 26 de 72 saídas como operação isolada nas famílias de motivos agrupadas. Quando combinada com realocação, falhou em todas as 72.

O layout teve grande importância. O modelo aprendeu troca de cores mais prontamente quando os motivos compartilhavam um arranjo fixo. O desempenho quase desapareceu em duas famílias embaralhadas, mesmo antes de a composição entrar no problema.

Esse resultado recomenda cautela ao descrever o sistema como capaz de aprender operadores abstratos sem qualificações. Às vezes, ele vincula uma transformação reutilizável. Em outros casos, o sucesso depende de regularidades representacionais nas demonstrações.

O próprio ARC também limita as conclusões possíveis. Suas grades excluem recuperação factual, ambiguidade de linguagem natural, contexto social, uso de ferramentas e planejamento de longo prazo. Uma forte indução visual não estabelece competência ampla de raciocínio.

O título do artigo enfatiza o aprendizado em contexto com raciocínio latente recorrente. Ele não afirma que o sistema de 150 milhões de parâmetros possa substituir um modelo de linguagem geral. A perspectiva lista raciocínio linguístico e matemático como extensões futuras.

A reprodutibilidade continua sendo a preocupação maior. O sistema completo avaliado não está disponível, enquanto atualizações exatas de memória e detalhes do espaço de trabalho latente permanecem não divulgados. Pesquisadores ainda não podem reproduzir o resultado principal a partir do repositório público Dragon Hatchling.

A auditoria relatada oferece alguma garantia de que o serviço retornou a pontuação declarada. No entanto, seus avaliadores são coautores do artigo e não tiveram acesso aos pesos do modelo. Um teste mais forte envolveria avaliadores não afiliados executando um artefato congelado.

A contaminação de treinamento também exige linguagem cuidadosa. Segundo o artigo, os pesquisadores excluíram demonstrações de avaliação públicas e identificadores de tarefas. Seus dados privados e o processo completo de seleção de checkpoints continuam indisponíveis para inspeção.

O experimento com identificadores opacos elimina um atalho restrito ao lado da solicitação. Ele não prova que padrões relacionados não tenham entrado no treinamento. O próprio artigo reconhece que o ConceptARC não é um benchmark novo.

Comparações de custo também exigem cautela. A estimativa do BDH-CQ vem de tempo de hardware medido sob uma taxa presumida de acelerador. Outras entradas do ranking podem refletir preços de provedores ou estimativas de hardware separadas.

Isso significa que os valores plotados nem sempre medem a mesma quantidade econômica. O curto tempo de execução medido do modelo continua notável, mas o tamanho exato de sua vantagem depende da metodologia de comparação.

O raciocínio silencioso acrescenta um trade-off de governança. Os usuários não podem inspecionar o caminho intermediário porque não existe um caminho linguístico. A resposta final pode ser verificada no ARC, onde cada célula tem um alvo exato.

Muitas aplicações reais não têm essa verificação. Um resumo médico, uma previsão de negócios ou uma síntese de pesquisa raramente dispõem de um oráculo imediato. O raciocínio oculto exigiria calibração de confiança, testes de consistência e verificações de evidências externas.

Esse problema não invalida a computação latente. Cadeias legíveis por humanos também podem conter explicações plausíveis geradas após a decisão subjacente. Raciocínio visível não tem garantia de fidelidade.

A exigência prática é uma avaliação melhor. Um sistema latente precisa de sondagens comportamentais que testem memória, extrapolação, composição, estabilidade e recuperação de falhas. Os experimentos controlados do BDH-CQ são úteis precisamente porque expõem esses limites.

O Raciocínio Latente Recorrente Muda o Debate sobre Custos

O BDH-CQ desloca a atenção apenas do tamanho do modelo para a estrutura da inferência e da adaptação.

Um modelo de 150 milhões de parâmetros é pequeno diante dos sistemas de linguagem de fronteira. Ainda assim, a contagem de parâmetros não explica plenamente sua eficiência relatada. A arquitetura também evita decodificação repetida de linguagem e otimização específica para cada quebra-cabeça.

Isso cria três orçamentos computacionais diferentes. O treinamento desenvolve a capacidade geral de processar tarefas no estilo ARC. As demonstrações atualizam a memória recorrente temporária. As iterações latentes alocam esforço de raciocínio específico para a consulta.

Manter esses orçamentos separados pode dar aos desenvolvedores um controle mais preciso. Um sistema pode processar mais demonstrações sem alterar seus parâmetros. Também pode executar mais iterações internas apenas quando uma consulta precisar delas.

Os modelos de linguagem atuais frequentemente combinam essas funções em um único fluxo de tokens. Os prompts carregam demonstrações, a atenção preserva o contexto e os tokens gerados expandem o raciocínio. A interface resultante é simples, mas computacionalmente serial.

O BDH-CQ oferece uma divisão mais estruturada. A memória registra evidências do contexto, enquanto a profundidade recorrente realiza a busca ativa. O decodificador aparece apenas quando o sistema precisa de uma resposta externa.

Esse design se assemelha à memória de pesos rápidos, em que ativações criam associações temporárias dentro de uma rede fixa. Também se conecta à atenção linear, que pode resumir informações passadas em um estado recorrente.

A questão competitiva mais profunda diz respeito à adaptação. Solucionadores recursivos específicos de tarefas podem ter bom desempenho após otimizar os exemplos de cada quebra-cabeça. Modelos de linguagem gerais adaptam-se por contexto, mas frequentemente gastam muitos tokens raciocinando.

O BDH-CQ busca adaptação contextual sem decodificação verbosa nem otimização por retropropagação. Essa combinação é o principal contraponto aos métodos estabelecidos, mesmo que sua precisão absoluta permaneça abaixo de sistemas mais fortes.

Os desenvolvedores não devem interpretar o resultado como evidência de que tokens estão obsoletos. A linguagem continua sendo uma interface eficaz entre modelos, usuários, ferramentas e auditores. Ela também permite que um sistema comunique incerteza e solicite informações ausentes.

Uma arquitetura futura pode combinar ambos os modos. A recorrência latente poderia lidar com computação interna de alta largura de banda. A decodificação seletiva poderia expor pontos de verificação quando a validação, a colaboração ou o uso de ferramentas exigirem linguagem.

O artigo sobre BDH-CQ aponta para esse híbrido. Ele observa que estados latentes e linguagem podem desempenhar funções diferentes. O texto intermediário não precisa desaparecer em todos os lugares apenas porque é desnecessário em cada etapa.

A abordagem também pode mudar o design de memória. Modelos convencionais de contexto longo retêm históricos crescentes de tokens ou caches comprimidos. A memória recorrente, em vez disso, atualiza um estado de tamanho fixo à medida que novas evidências chegam.

A memória de tamanho fixo introduz seu próprio trade-off. A compressão pode descartar informações, mesclar associações ou sobrescrever evidências anteriores. O teste de vinculação de cores do artigo mostra capacidade dentro de uma faixa controlada, não retenção ilimitada.

A avaliação de longo horizonte deve, portanto, testar interferência. Pesquisadores precisam saber o que acontece quando as demonstrações entram em conflito, chegam em ordens diferentes ou incluem exemplos irrelevantes. Também devem medir a rapidez com que associações antigas decaem.

Testes de segurança importam pelo mesmo motivo. Se as entradas de inferência modificam o estado recorrente, demonstrações maliciosas podem direcionar respostas posteriores. Um ataque à memória latente pode ser mais difícil de diagnosticar porque nenhum rascunho textual registra a transição.

Usos empresariais exigiriam limites de redefinição e isolamento de memória. Um estado temporário de tarefa não deve vazar entre usuários ou trabalhos não relacionados. Os sistemas também precisam de formas de identificar contexto corrompido antes que ele afete consultas posteriores.

Para o trabalho com conhecimento, a ideia subjacente continua atraente. As pessoas raramente narram cada etapa interna enquanto leem notas, comparam evidências e chegam a uma conclusão. Elas constroem um modelo de trabalho, o revisam e então comunicam o raciocínio selecionado.

Softwares que oferecem suporte à combinação de conhecimento já tratam a coleta de contexto e a geração de respostas como processos conectados. BDH-CQ explora uma versão arquitetural, em nível mais baixo, dessa conexão.

O resultado também levanta uma questão de produto. Os usuários deveriam pagar custos computacionais por cadeias legíveis que jamais inspecionam? Para tarefas exatas e verificáveis, a iteração latente e silenciosa pode oferecer um equilíbrio melhor.

Para decisões de grande impacto, a resposta muda. Os usuários podem precisar de evidências citadas, premissas explícitas ou uma derivação passível de revisão. Um núcleo latente precisaria de uma camada externa de relato que comunique esses elementos com fidelidade.

A disputa de longo prazo, portanto, não é entre pensamentos ocultos e pensamentos visíveis. É entre a serialização rígida em tokens e sistemas que escolhem a representação adequada para cada etapa computacional e comunicacional.

BDH-CQ fornece evidências iniciais para esse design mais amplo. Seu resultado compacto no ARC torna a questão mais difícil de descartar. Suas limitações impedem qualquer declaração de que a disputa esteja resolvida.

Três Sinais Determinarão se BDH-CQ Importa

A próxima fase precisa testar reprodutibilidade, domínios mais amplos e escalabilidade antes que BDH-CQ possa sustentar alegações maiores.

O primeiro sinal é um artefato que possa ser executado de forma independente. A Pathway lançou o código de base do Dragon Hatchling, mas não o sistema BDH-CQ completo usado na avaliação reportada.

Um contêiner congelado, checkpoint do modelo ou protocolo de avaliação hospedado permitiria que pesquisadores não afiliados reproduzissem o resultado de 400 tarefas. Isso também esclareceria como a construção e a classificação de candidatos contribuem para a pontuação final.

A avaliação independente deve comparar o tempo de hardware medido sob condições consistentes. Ela deve separar a inferência neural do pré-processamento, da ampliação de dados, da classificação de candidatos e da sobrecarga de serviço. Uma contabilização comparável fortaleceria ou enfraqueceria a alegação de eficiência.

Pesquisadores também devem verificar os limites de exclusão em torno dos dados de avaliação. Manifestos de conjuntos de dados, hashes e procedimentos de seleção de checkpoints ofereceriam mais confiança do que garantias de alto nível. Exemplos privados não precisam ser publicados se sua procedência puder ser auditada.

Se a reprodutibilidade se confirmar, BDH-CQ se tornará um novo ponto crível na curva de eficiência do ARC. Se falhar, a história se restringirá a uma proposta arquitetural interessante com um resultado de sistema não confirmado.

O segundo sinal é o desempenho fora de grades visuais. O artigo identifica linguagem, matemática, satisfação de restrições e tarefas ARC mais difíceis como direções futuras. Essas avaliações testarão se a arquitetura se transfere além de sua distribuição atual de treinamento.

O raciocínio em linguagem cria requisitos diferentes. Um modelo precisa lidar com ambiguidade, conhecimento factual, respostas longas e instruções que mudam ao longo do tempo. Ele também precisa comunicar evidências, e não apenas emitir uma grade exata.

A matemática proporcionaria uma verificação mais robusta enquanto amplia a estrutura dos problemas. Provas formais, síntese de programas e verificação de teoremas podem testar o raciocínio latente sem depender inteiramente de avaliação subjetiva.

ARC-AGI-2 ofereceria outro desafio útil. Ele foi projetado para resistir a métodos que exploram padrões de tarefas familiares e para exigir uma generalização mais composicional. Um resultado forte nele sustentaria alegações mais amplas sobre adaptação.

O fracasso nesses domínios não apagaria a descoberta atual. Ele mostraria que BDH-CQ é especializado em transformações visuais no estilo ARC. Esse resultado ainda informaria o design de solucionadores eficientes.

O terceiro sinal são evidências transparentes de escalabilidade. O artigo afirma que BDH-CQ pode escalar e menciona experimentos iniciais entre um bilhão e 600 bilhões de parâmetros. Ele não fornece evidências suficientes para avaliar essas alegações.

Os autores também afirmam que a arquitetura poderia oferecer suporte a configurações muito maiores. Os leitores devem tratar isso como uma projeção de engenharia até que curvas de treinamento, orçamentos computacionais e resultados posteriores estejam disponíveis.

A escalabilidade pode melhorar ordenações e composições difíceis. Ela também pode expor instabilidade de memória, problemas de otimização ou retornos decrescentes. O modelo atual de 150 milhões de parâmetros não consegue responder qual resultado predomina.

Uma divulgação particularmente útil colocaria em gráfico o tamanho do modelo em relação à precisão nas tarefas, às iterações de inferência e à capacidade da memória recorrente. Isso revelaria se modelos maiores melhoram a abstração ou apenas memorizam mais regularidades no estilo ARC.

Pesquisadores também devem testar se o esforço de raciocínio escala de forma suave. As configurações baixa, média e alta atuais mostram precisão crescente, mas apenas em três pontos. Curvas mais granulares poderiam identificar saturação e instabilidade.

Esses três sinais devem chegar nessa ordem: reprodutibilidade, expansão de domínio e, depois, escalabilidade. Uma alegação proprietária maior oferece menos valor científico do que um resultado menor que equipes independentes possam examinar.

Os desenvolvedores devem acompanhar um detalhe prático em todo o processo. A memória recorrente melhora a adaptação sem criar novas falhas de isolamento de contexto e segurança? A eficiência, por si só, não pode compensar limites de estado pouco confiáveis.

Por enquanto, BDH-CQ estabelece um resultado específico. Um sistema recorrente compacto aprendeu transformações visuais a partir de demonstrações, raciocinou por meio de estados contínuos e produziu uma pontuação ARC competitiva com baixo custo computacional medido.

Ele também falhou de forma previsível em ordenações longas, execução inconsistente de regras e certas operações compostas. Essas falhas mantêm o trabalho ancorado na realidade. Elas mostram onde demonstrações mais ricas ajudam e onde a execução interna ainda se rompe.

A resposta correta não é nem descartar nem celebrar. Acompanhe o ranking do ARC, examine qualquer artefato de avaliação divulgado e compare os resultados sob uma contabilização consistente.

Em seguida, faça uma pergunta mais precisa a cada modelo de raciocínio: quais etapas realmente precisam de linguagem e quais usam tokens apenas porque as arquiteturas atuais não oferecem um espaço de trabalho melhor?

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page