top of page

Relatório de Custos da Epoch AI Constata que os Preços de IA Caem Mais Rápido que a Lei de Moore

há 4 dias
14 min de leitura

A Epoch AI afirma que o custo para alcançar um nível fixo de desempenho em IA caiu 47% por trimestre desde 2023. O novo relatório de custos da Epoch AI traduz esse ritmo em uma queda anual de 13 vezes, muito mais rápida do que as melhorias históricas no hardware de computação.

Essa descoberta não significa que toda conta de IA caia na mesma proporção. Ela mede a forma mais barata disponível de alcançar uma pontuação definida em cinco benchmarks de matemática, ciência e jogos. A distinção importa porque modelos mais novos podem entregar resultados comparáveis consumindo menos recursos ou usando infraestrutura mais barata.

A comparação com a Lei de Moore ainda é marcante. A computação se tornou gradualmente mais barata ao longo de décadas, ajudando a viabilizar computadores pessoais, smartphones e serviços em nuvem. A Epoch AI argumenta que os preços de IA ajustados por desempenho agora caem seis vezes mais rápido do que a taxa histórica da computação.

Os beneficiários imediatos são desenvolvedores e organizações capazes de mover cargas de trabalho entre modelos. A pressão recai sobre OpenAI, Anthropic, Google e serviços de IA de terceiros que precisam de receita recorrente. Um modelo premium pode estabelecer uma vantagem, mas seu benefício econômico pode desaparecer em poucos meses.

Isso cria a tensão central. Uma inteligência mais barata apoia uma adoção mais ampla, mas o mesmo declínio enfraquece a fidelidade baseada em preço e comprime o valor do acesso bruto aos modelos. O negócio duradouro pode estar acima da camada de modelos, onde os produtos mantêm contexto, integração de fluxos de trabalho, confiança e dados proprietários.

O Que o Relatório de Custos da Epoch AI Realmente Mediu

A Epoch AI mediu o custo de um resultado, não apenas o preço anunciado de um token de IA.

A organização de pesquisa publicou sua análise de custos em 22 de setembro de 2026. Os pesquisadores Luke Emberson e David Roodman examinaram o desempenho e o custo de modelos em cinco benchmarks a partir de 2023.

Os benchmarks abrangem questões difíceis de matemática, ciência em nível de pós-graduação, xadrez e outros jogos de habilidade. A Epoch AI então estimou a rota disponível mais barata para cada nível de desempenho alcançável em diferentes datas.

Esse limite é chamado de fronteira de Pareto. Ele representa os modelos que oferecem o melhor desempenho disponível para um determinado custo. Um modelo fora dessa fronteira custa mais sem entregar um resultado melhor.

O método também considera orçamentos de raciocínio. Um modelo de raciocínio pode gastar mais tokens de saída refletindo sobre um problema, aumentando sua chance de responder corretamente. Portanto, um simples preço por token não revela o custo total de concluir uma tarefa.

A Epoch AI usou transcrições de avaliações para estimar como o desempenho muda sob diferentes limites de orçamento. A abordagem segue trabalhos do Center for AI Standards and Innovation, ou CAISI, do governo federal dos EUA. Ela produz uma curva de custo-desempenho para cada modelo, em vez de reduzir esse modelo a uma única tarifa anunciada.

Essa distinção se torna importante quando dois modelos usam tokens de maneira diferente. Um modelo com tokens mais baratos pode gerar muito mais deles antes de concluir uma tarefa. Sua aparente vantagem de preço pode desaparecer quando medida da pergunta até a resposta correta.

Nos cinco benchmarks, a Epoch AI calculou uma queda média ajustada por desempenho de 47% por trimestre. Isso equivale a uma redução de aproximadamente 13 vezes em um ano, caso a tendência se mantenha composta.

O ritmo variou por domínio. Os preços caíram cerca de 39% a 43% por trimestre em quebra-cabeças baseados em jogos. Os benchmarks de matemática mostraram quedas mais rápidas, de aproximadamente 50% a 52% por trimestre.

Um exemplo ilustra a escala sem depender de preços de lista por token. A Epoch AI comparou dois modelos da OpenAI lançados com menos de 18 meses de diferença. O modelo posterior teria alcançado a mesma pontuação no GPQA Diamond por aproximadamente um setecentos e vinte e cinco avos do custo do modelo anterior.

O GPQA Diamond é um benchmark de múltipla escolha criado em torno de questões de pós-graduação em física, química e biologia. Ele captura um tipo exigente de raciocínio, mas não toda a gama de trabalho útil.

Portanto, o número de destaque é mais bem entendido como um índice de preços para capacidade medida. Ele não descreve custos de treinamento, gastos corporativos ou a fatura de cada cliente. Ele acompanha o quão barato um resultado de benchmark pode ser comprado do modelo disponível mais econômico.

Esse resultado também está alinhado a evidências anteriores. O AI Index de Stanford identificou uma queda de mais de 280 vezes no custo de desempenho no nível do GPT-3.5 entre novembro de 2022 e outubro de 2024.

A conclusão de Stanford usou MMLU, um amplo benchmark de conhecimento, em vez do conjunto completo de curvas de custo-desempenho da Epoch AI. Métodos diferentes produzem taxas diferentes, mas ambos apontam para um declínio excepcionalmente acentuado.

A convergência importa mais do que qualquer estimativa isolada. Conjuntos de dados independentes mostram cada vez mais que a capacidade útil de IA está se tornando mais barata muito mais rápido do que o hardware que a sustenta.

Por Que os Preços de Desempenho de IA Estão Caindo Tão Rápido

O declínio combina algoritmos melhores, modelos menores e capazes, hardware aprimorado e competição agressiva entre fornecedores.

A Lei de Moore descreve a tendência histórica de aumento da densidade de transistores ao longo do tempo. A expressão também é associada à queda dos custos de computação, embora contagens de transistores e preços para clientes não sejam medidas idênticas.

A Epoch AI estima que os preços de computação caíram a uma taxa composta de cerca de 1,51 vez ao ano entre 1940 e 2001. Sua estimativa para a queda no preço do desempenho de IA desde 2023 é de cerca de 13 vezes ao ano.

A diferença existe porque a IA se beneficia de mais do que o progresso dos semicondutores. Desenvolvedores de modelos melhoram simultaneamente arquiteturas, métodos de treinamento, seleção de dados, quantização, software de inferência e utilização de hardware.

A quantização reduz a precisão numérica usada para armazenar e executar um modelo. Quando aplicada com cuidado, ela reduz os requisitos de memória e computação enquanto preserva grande parte do desempenho útil do modelo.

Os sistemas de mixture-of-experts oferecem outra rota. Eles ativam apenas partes selecionadas de um modelo para cada entrada, em vez de usar todos os parâmetros. Esse desenho pode aumentar a capacidade sem exigir a rede completa para cada solicitação.

A destilação transfere comportamentos úteis de um modelo maior para um menor. O modelo menor pode então lidar com tarefas rotineiras com menor latência e uso de recursos. As organizações podem reservar modelos maiores para problemas nos quais sua capacidade adicional muda o resultado.

A competição amplia esses ganhos de engenharia. Os fornecedores lançam repetidamente modelos menores projetados para se aproximar do desempenho de modelos de ponta anteriores. Modelos de pesos abertos também permitem que hosts independentes compitam em eficiência de atendimento.

Um artigo de pesquisa de 2026 chamado The Price of Progress chegou a uma conclusão mais conservadora usando dados da Epoch AI e da Artificial Analysis. Ele estimou quedas anuais de cinco a dez vezes para desempenho comparável em benchmarks.

Os autores atribuíram o declínio à eficiência do hardware, aos ganhos algorítmicos e à competição econômica. Após tentar separar os efeitos de hardware e mercado, estimaram aproximadamente um progresso anual de três vezes vindo da eficiência algorítmica.

Essa estimativa está abaixo da taxa de destaque de 13 vezes da Epoch AI. A diferença não torna nenhuma das análises inútil. Ela mostra o quanto o resultado depende de benchmarks, limites de desempenho, conjuntos de modelos e definições de fronteira.

A métrica da Epoch AI favorece o modelo disponível mais barato em cada nível de capacidade. Essa estrutura pressupõe um comprador altamente ativo, que reavalia regularmente o mercado e migra para o atual líder em custo.

As organizações reais se comportam de maneira diferente. Elas gastam tempo testando modelos, reescrevendo prompts, verificando segurança, atualizando avaliações e renegociando contratos. Esses custos de mudança impedem muitos usuários de capturar todo o declínio teórico.

O estudo também conclui que os preços caem mais rapidamente logo após o surgimento de um nível de desempenho. Em seus cinco benchmarks principais, o desempenho próximo à fronteira se tornou inicialmente 66% mais barato por trimestre.

Dois anos após a estreia de um nível de desempenho, a queda trimestral estimada desacelerou para 32%. Isso ainda representa uma rápida redução anual, mas é menos dramático do que a corrida inicial.

A Epoch AI sugere que uma nova capacidade obtém brevemente um prêmio. Os concorrentes então a reproduzem ou aproximam, enquanto o fornecedor original otimiza os custos de atendimento. O prêmio encolhe à medida que a capacidade se torna comum.

Esse padrão explica por que o declínio agregado pode superar a Lei de Moore. O mercado não espera por uma nova geração de chips. Ele soma melhorias de software, modelos, infraestrutura e competição aos ganhos contínuos de hardware.

Ele também explica por que a tendência pode persistir enquanto as empresas de IA gastam mais em data centers. Treinar o modelo mais forte e atender uma capacidade estabelecida são atividades econômicas diferentes.

Laboratórios de fronteira podem destinar recursos crescentes à pesquisa enquanto clientes pagam menos pelo desempenho de ontem. O setor está simultaneamente tornando a fronteira mais cara de criar e a capacidade existente mais barata de consumir.

Inteligência Mais Barata Coloca os Fornecedores de Modelos Sob Pressão

Quedas rápidas de preço transformam a capacidade bruta dos modelos em um produto depreciável, com uma janela cada vez menor para retornos premium.

OpenAI, Anthropic, Google e outros desenvolvedores de modelos competem para estabelecer a fronteira de desempenho. Essa posição atrai atenção, testes corporativos e desenvolvedores em busca do sistema mais forte disponível.

As conclusões da Epoch AI sugerem que essa liderança perde valor econômico rapidamente. Nos cinco benchmarks, as quedas mais rápidas apareceram em torno de níveis de desempenho recém-alcançados. O prêmio associado a um resultado de ponta então enfraqueceu à medida que os concorrentes se aproximaram.

Isso cria um difícil problema de receita. Um laboratório precisa de investimento substancial para treinar, avaliar, proteger e operar um modelo de fronteira. Ainda assim, o preço que os clientes aceitam por uma capacidade fixa pode cair antes que esse modelo desfrute de uma longa vida comercial.

A análise jornalística original destacou o desafio resultante para a fidelidade dos clientes. Se um modelo comparável se torna mais barato em poucos meses, os compradores têm um motivo para manter alternativas disponíveis.

Serviços de IA de terceiros enfrentam uma versão ainda mais aguda desse problema. Um produto que apenas revende acesso a um modelo pode ser superado em preço por outro serviço que usa um modelo mais novo.

Os clientes também podem questionar um compromisso de longo prazo com qualquer fornecedor único. O modelo preferido de hoje pode perder sua vantagem após o próximo ciclo de lançamentos. Uma arquitetura fixa pode transformar a queda dos custos upstream em pressão para migração.

A resposta do mercado já é visível no design de produtos. Os fornecedores competem cada vez mais por meio de ambientes de programação, agentes, sistemas de arquivos, conectores, memória, controles de segurança e opções de implantação.

Esses recursos criam valor que um benchmark não mede. A troca de modelo se torna mais difícil quando o serviço ao redor entende as permissões, a terminologia, os documentos e o processo de revisão de uma empresa.

A confiabilidade também importa. Uma empresa não se beneficia de uma resposta mais barata quando essa resposta gera mais revisão humana. A métrica útil é o custo total para concluir um trabalho aceitável, incluindo falhas e supervisão.

A latência cria outra distinção. Dois modelos podem alcançar pontuações semelhantes em benchmarks, mas levar tempos diferentes para responder. Produtos interativos frequentemente valorizam velocidade previsível mais do que uma pequena redução nas despesas de inferência.

Privacidade e governança também podem pesar mais do que o preço. Os compradores precisam saber para onde os dados vão, por quanto tempo os provedores os retêm e se os administradores podem aplicar regras de acesso.

Esses fatores dão aos fornecedores estabelecidos defesas contra a concorrência puramente baseada em preço. Interfaces conhecidas, integrações existentes, aprovações de segurança e contexto acumulado dos usuários criam custos práticos de mudança.

No entanto, essas defesas funcionam apenas quando o produto oferece valor além da escolha do modelo. Uma camada superficial com prompts genéricos tem pouca proteção quando substitutos capazes se tornam abundantes.

Os serviços independentes mais fortes provavelmente tratarão os modelos como infraestrutura substituível. Eles podem direcionar tarefas simples para sistemas eficientes e reservar capacidade premium para trabalhos difíceis.

Essa abordagem exige avaliação, não lealdade. Os desenvolvedores precisam de testes representativos para seus próprios casos de uso, incluindo qualidade, latência, taxas de falha e consumo de recursos de ponta a ponta.

Ela também muda a forma como as organizações devem enxergar a aquisição de IA. A questão já não é qual modelo individual vence todos os benchmarks. A questão é qual portfólio entrega resultados aceitáveis em diferentes tarefas.

Produtos intensivos em conhecimento têm outra vantagem. Um sistema que organiza as informações confiáveis de um usuário pode reter valor mesmo quando seu modelo subjacente muda. O contexto acumulado pertence ao fluxo de trabalho, e não a uma geração específica de modelo.

É aqui que uma base de conhecimento de IA pode se tornar mais durável do que o simples acesso a chat. Seu valor vem da recuperação de informações, organização, permissões e continuidade em trabalhos recorrentes.

A queda dos custos dos modelos pode melhorar as margens desses produtos. Eles podem usar modelos mais robustos sem aumentar os custos para o cliente, ou aplicar IA a mais etapas dentro de um fluxo de trabalho.

A mesma queda pode prejudicar serviços que competem principalmente pelo acesso. À medida que a inteligência artificial se torna mais barata, a diferenciação se desloca para contexto proprietário, execução confiável e resultados de negócio mensuráveis.

O Que os Números Não Provam

As quedas de preço ajustadas por benchmark são evidências reais, mas não são uma medida universal de trabalho útil ou confiável.

A Epoch AI declara diretamente várias limitações. Seu conjunto de dados principal cobre cerca de três anos, contém combinações incompletas de modelos e benchmarks e inclui estimativas ruidosas.

Essa é uma janela curta para comparar a IA com tecnologias medidas ao longo de décadas. Computação, baterias, sequenciamento e eletricidade também possuem produtos, mercados e definições de desempenho diferentes.

As comparações ainda oferecem escala histórica. No entanto, uma resposta de benchmark é menos padronizada fisicamente do que uma unidade de eletricidade ou de capacidade de bateria.

A otimização para benchmarks apresenta outra preocupação. Desenvolvedores podem treinar modelos em tarefas semelhantes a avaliações populares, de forma intencional ou indireta. O desempenho pode então melhorar mais rapidamente no teste do que em contextos reais desconhecidos.

A Epoch AI chama esse risco de benchmaxxing. Elementos aleatorizados nos benchmarks podem reduzir reconhecimento e memorização, mas não conseguem eliminar toda forma de contaminação ou otimização direcionada.

Uma pontuação alta também não garante trabalho confiável. O GPQA Diamond mede respostas a perguntas científicas difíceis. Ele não mede se um modelo consegue manter um projeto, seguir a política de uma empresa ou evitar erros dispendiosos.

As orientações de avaliação do NIST enfatizam que comparações entre modelos dependem das configurações de tarefas, ferramentas, prompts, níveis de raciocínio, número de amostras e métodos de pontuação. Pequenas diferenças de configuração podem alterar tanto o desempenho quanto a despesa.

As avaliações da CAISI também mostram por que a medição de ponta a ponta importa. Um modelo com taxas menores por token pode consumir mais tokens, usar mais chamadas de ferramentas ou falhar com mais frequência. Portanto, sua despesa total por tarefa pode superar a de um concorrente aparentemente caro.

Usuários reais também não trocam de modelo com a mesma eficiência que o método de fronteira da Epoch AI pressupõe. A migração exige testes, trabalho de integração, análise de risco e treinamento da equipe.

Uma empresa pode racionalmente manter um provedor mais caro porque ele já atende aos requisitos de segurança. Outra pode valorizar resultados estáveis porque mudanças interromperiam fluxos de trabalho automatizados.

A demanda pode absorver parte da economia. Quando uma tarefa de IA se torna mais barata, os desenvolvedores frequentemente a executam com maior frequência, ampliam o contexto, solicitam mais candidatos ou adicionam etapas de verificação.

Esta é uma versão do efeito Jevons. Maior eficiência reduz o custo de cada unidade, mas o consumo total pode subir o suficiente para manter ou aumentar o gasto geral.

Modelos de raciocínio reforçam esse efeito. Um modelo-base mais eficiente pode gastar computação extra verificando uma resposta ou explorando alternativas. Os usuários obtêm melhores resultados sem necessariamente observar uma queda proporcional em seu uso total.

O relatório também não mostra que o desenvolvimento de modelos de fronteira se tornou barato. Treinar um novo modelo líder exige recursos diferentes daqueles necessários para fornecer uma capacidade já conhecida.

Equipes de pesquisa pagam por experimentos, mão de obra especializada, preparação de dados, avaliação e infraestrutura. Esses custos podem aumentar mesmo enquanto a inferência para tarefas estabelecidas se torna drasticamente mais barata.

Essa distinção resolve uma aparente contradição. Provedores de modelos podem anunciar enormes programas de infraestrutura enquanto o preço ajustado por desempenho de seus resultados continua caindo.

O relatório, portanto, sustenta uma conclusão limitada, mas importante. Uma capacidade comparável e mensurada se tornou muito mais barata na fronteira do mercado.

Ele não prova que toda carga de trabalho melhora no mesmo ritmo. Não garante segurança, confiabilidade, privacidade, latência ou qualidade de integração equivalentes.

Os compradores devem tratar a taxa trimestral de 47% como um sinal de mercado, não como uma previsão orçamentária. A direção parece bem sustentada. O ritmo exato continua sensível às escolhas de medição e ao comportamento dos usuários.

Três Sinais que Testarão a Queda dos Custos de IA

O próximo teste é verificar se as economias nos benchmarks resistem ao contato com cargas de trabalho reais, a economia dos fornecedores e o comportamento cotidiano de mudança.

O primeiro sinal é o custo de tarefas de ponta a ponta medido de forma independente. Mais avaliações devem comparar a despesa total necessária para concluir com sucesso fluxos de trabalho de programação, pesquisa, suporte ao cliente e documentos.

Esses testes precisam de conjuntos de tarefas estáveis, ferramentas controladas e limites claros de qualidade. Eles devem incluir tentativas repetidas, tokens de raciocínio, chamadas de ferramentas, latência e revisão humana.

Se essas medições caírem em um ritmo próximo à estimativa da Epoch AI, as implicações comerciais do relatório se fortalecerão. Uma queda muito mais lenta mostraria que as economias em benchmarks superestimam os ganhos práticos.

O segundo sinal são os preços e o empacotamento de produtos dos fornecedores. Provedores de modelos podem responder à queda nos preços de inferência reduzindo tarifas, ampliando franquias de uso ou incorporando capacidade em assinaturas mais abrangentes.

Eles também podem proteger a receita por meio de plataformas de agentes, controles empresariais, armazenamento e ferramentas proprietárias. Essas adições confirmariam que a concorrência está se deslocando para além do modelo-base.

Observe com que frequência os provedores substituem recursos premium por acesso padrão. Uma rápida migração da exclusividade de produtos principais para modelos menores sustentaria a constatação da Epoch AI sobre prêmios de fronteira passageira.

O terceiro sinal é a mudança de clientes. O cálculo de fronteira pressupõe que os compradores escolham repetidamente o modelo capaz mais barato. Dados reais de adoção mostrarão se eles de fato se comportam dessa maneira.

Os desenvolvedores podem adotar sistemas de roteamento que enviam cada tarefa para um modelo apropriado. Empresas podem exigir cláusulas de portabilidade e avaliações padronizadas antes de assumir compromissos de longo prazo.

Como alternativa, fluxos de trabalho integrados podem manter os clientes com um único fornecedor, apesar de grandes diferenças de preço. Esse resultado enfraqueceria a alegação de que a queda dos preços por desempenho destrói automaticamente a fidelidade aos fornecedores.

Modelos de pesos abertos influenciarão os três sinais. Eles dão a hosts independentes mais liberdade para otimizar a implantação e desafiar provedores fechados em custo. Também transferem mais responsabilidade pela segurança, manutenção e avaliação para o operador.

O resultado provável não é uma corrida uniforme para a menor tarifa. Os mercados de IA se separarão em camadas.

Na camada de modelos, capacidades comparáveis devem continuar enfrentando pressão de preços. Na camada de aplicações, os fornecedores competirão por meio de contexto, propriedade do fluxo de trabalho, confiança e qualidade de execução.

Para desenvolvedores, a resposta prática é preservar a opcionalidade. Mantenham as interfaces de modelos modulares, preservem conjuntos de avaliação e meçam a conclusão bem-sucedida das tarefas, e não apenas o consumo de tokens.

Compradores empresariais também devem reduzir suas premissas sobre estabilidade de custos. Um contrato que parece eficiente hoje pode rapidamente se tornar não competitivo, mesmo quando o serviço subjacente continua capaz.

Profissionais do conhecimento devem esperar que recursos de IA se espalhem por mais produtos. Custos de inferência menores tornam a sumarização, recuperação de informações, redação, classificação e processamento em segundo plano econômicos em mais situações.

O relatório de custos da Epoch AI não resolve quão lucrativo o setor se tornará. Ele mostra que o acesso a um nível fixo de inteligência mensurada está perdendo escassez com uma velocidade incomum.

A pergunta para cada produto de IA agora é concreta: se a capacidade dos modelos se tornar 13 vezes mais barata em um ano, que valor continuará único? Produtos com contexto confiável e fluxos de trabalho confiáveis têm uma resposta. Serviços que vendem pouco além de acesso a modelos ainda precisam de uma.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page