top of page

A avaliação de skills do Amazon Bedrock AgentCore revela o que agentes fluentes escondem

há 1 dia
15 min de leitura

A Amazon lançou a avaliação de skills do Amazon Bedrock AgentCore em 22 de setembro, adicionando três verificações que examinam o comportamento de agentes além de sua resposta final polida. O lançamento mira um ponto cego persistente nos testes. Um agente pode soar correto após escolher a skill errada, pular etapas obrigatórias ou improvisar em torno de um procedimento empresarial.

Os novos avaliadores separam duas perguntas que as equipes frequentemente condensam em uma única pontuação. O agente selecionou uma skill apropriada e a seguiu depois de carregá-la? O Strands Evals adiciona uma terceira verificação determinística para equipes que já sabem qual skill nomeada um teste deve invocar.

Essa distinção pressiona sistemas de avaliação centrados apenas na qualidade da resposta. Utilidade, relevância e correção continuam importantes, mas não conseguem revelar todas as falhas de roteamento ou execução. A verdadeira disputa agora é entre a pontuação da resposta final e evidências no nível da trajetória sobre como um agente chegou àquela resposta.

A avaliação de skills do Amazon Bedrock AgentCore divide uma falha em três

A AWS está transformando o uso de skills em uma sequência mensurável, em vez de tratar a resposta final como evidência suficiente de sucesso.

Uma skill é um pacote reutilizável de instruções que ensina a um agente um procedimento especializado. Normalmente, ela inclui um arquivo SKILL.md contendo sua finalidade, orientações de ativação e etapas obrigatórias. Um harness apresenta as skills disponíveis, enquanto o agente decide qual delas carregar para uma solicitação.

Essa estrutura permite que desenvolvedores retirem procedimentos detalhados de um system prompt em expansão. Uma empresa pode criar skills separadas para reconciliação de faturas, redação de contratos, escalonamento de incidentes ou revisão de pull requests. O agente carrega as instruções relevantes quando necessário, em vez de transportar todos os procedimentos em cada interação.

A portabilidade faz parte do apelo. O formato aberto Agent Skills oferece a ambientes de agentes compatíveis uma forma compartilhada de empacotar instruções especializadas. Assim, uma skill pode servir como um artefato operacional, e não apenas como um fragmento de prompt vinculado a uma chamada de modelo.

No entanto, instruções modulares introduzem uma cadeia de decisões. O agente deve reconhecer a intenção do usuário, encontrar uma skill adequada, invocá-la, ler seu conteúdo e concluir as etapas prescritas. Um bom parágrafo final não prova que essa cadeia funcionou.

A AWS e a equipe do Strands agora dividem essa cadeia entre três avaliadores, segundo o lançamento da avaliação de skills de 22 de setembro.

A Precisão de Seleção de Skills pergunta se cada skill invocada foi apropriada para a tarefa. Ela retorna um resultado binário para cada skill invocada. Isso torna visíveis os erros de roteamento quando um agente carrega instruções destinadas a outro fluxo de trabalho.

O Seguimento de Instruções de Skills examina o quão completamente o agente executou as etapas prescritas de uma skill invocada. Suas cinco classificações são Fully Followed, Mostly Followed, Partially Followed, Minimally Followed e Not Followed. Os valores numéricos documentados vão de 1.0 a 0.0, em incrementos de um quarto de ponto.

Skill Invoked fornece uma asserção mais restrita e determinística no Strands Evals. Ela verifica se o agente carregou com sucesso uma skill nomeada. Ao contrário dos outros dois avaliadores, não pede a um modelo que julgue adequação ou aderência.

Essas medidas respondem a perguntas diferentes. Uma skill obrigatória de folha de pagamento pode nunca ser carregada, gerando uma falha de roteamento. Ela pode ser carregada para uma solicitação de viagem sem relação, gerando uma falha de seleção. Pode ser carregada corretamente, mas omitir uma etapa de aprovação, gerando uma falha de seguimento de instruções.

Essa separação é a mudança central. As equipes não precisam mais interpretar todo resultado fraco como um problema vago de qualidade do agente. Elas podem associar cada padrão a um componente diferente e a uma correção mais focada.

Uma invocação ausente aponta para regras de descoberta, descrições ou lógica de roteamento. Uma invocação inadequada sugere escopos de skills sobrepostos. Uma skill corretamente selecionada com baixa aderência direciona a atenção para suas etapas, estrutura, ferramentas disponíveis ou para o modelo subjacente.

O lançamento não substitui a avaliação de qualidade existente. Ele adiciona outra camada projetada para agentes cujo comportamento depende de procedimentos carregados dinamicamente. A precisão da saída continua essencial, mas passa a ser uma parte de um registro de teste mais amplo.

Respostas fluentes já não são evidência suficiente

O argumento mais forte para a avaliação de trajetória é simples: diferentes falhas internas podem produzir uma prosa igualmente convincente.

Considere um funcionário que pede a um agente para redigir um contrato antes de compartilhá-lo externamente. O agente pode remover nomes óbvios e devolver um documento com aparência limpa. No entanto, a skill aprovada também poderia exigir a verificação de metadados, comentários ocultos, alterações controladas e referências a anexos.

Um revisor que vê apenas o documento final pode não perceber essas verificações ignoradas. A resposta pode parecer competente enquanto viola o procedimento real de tratamento da organização. O Seguimento de Instruções de Skills foi projetado para comparar o comportamento registrado com cada etapa prescrita.

O mesmo problema aparece em operações financeiras. Um agente de reconciliação de faturas pode produzir o total correto após um raciocínio informal. Se a skill exige validar a identidade do fornecedor e a autorização de compra, o resultado continua proceduralmente incompleto.

A conformidade torna essa distinção especialmente importante. As organizações raramente se preocupam apenas se uma resposta acabou sendo aceitável. Elas também precisam de evidências de que controles repetíveis foram aplicados na ordem e no contexto exigidos.

Testes tradicionais de software oferecem expectativas exatas para funções determinísticas. Agentes se comportam de forma diferente porque o mesmo prompt pode levar a linguagem, chamadas de ferramentas e caminhos de raciocínio variados. A AWS já havia argumentado que uma única execução aprovada mostra o que pode acontecer, não o que normalmente acontece.

Essa variabilidade torna tentadoras as pontuações agregadas de resposta. Uma equipe pode calcular a média de correção ou utilidade em um conjunto de dados e acompanhar se o número sobe. Ainda assim, uma média esconde onde um fluxo de trabalho falhou e se a mesma etapa continua desaparecendo.

Resultados por skill oferecem uma unidade de diagnóstico mais útil. Quando um agente invoca várias skills durante uma sessão, os avaliadores retornam resultados para cada invocação. Assim, um agregado fraco pode ser rastreado até a skill específica que o reduziu.

A abordagem também altera a forma como as equipes escrevem skills. Um parágrafo vago pode ser compreensível para um autor humano, mas difícil de avaliar de forma consistente. Etapas numeradas e observáveis fornecem evidências mais claras ao avaliador e tornam omissões mais fáceis de identificar.

Isso não significa que todo pensamento interno se torne disponível. A avaliação depende de trajetórias e traces registrados, incluindo mensagens visíveis, ações de carregamento de skills e chamadas de ferramentas. O raciocínio privado do modelo não é exigido nem exposto.

A evidência relevante é operacional. O agente carregou a skill? Qual skill ele escolheu? As ações registradas mostram que concluiu as verificações prescritas? Essa evidência é mais acionável do que especular sobre raciocínio oculto.

Essa mudança se assemelha à diferença entre verificar um cálculo concluído e auditar os controles em torno dele. Ambas as perspectivas importam, mas respondem a perguntas separadas. Uma mede o artefato, enquanto a outra mede o processo que o produziu.

Para equipes que desenvolvem agentes internos, o processo frequentemente representa o maior risco organizacional. Uma resposta fluente pode satisfazer um usuário uma vez. Uma etapa de aprovação, divulgação ou validação ignorada pode comprometer o fluxo de trabalho sempre que as mesmas condições se repetirem.

Os novos avaliadores tornam essa lacuna processual mais fácil de nomear. Eles também pressionam outras plataformas de agentes a expor trajetórias compatíveis. Sem eventos de skills observáveis, uma equipe não pode distinguir com segurança uma invocação ausente de uma extração malsucedida.

Strands Evals leva as verificações ao desenvolvimento

O Strands Evals oferece aos desenvolvedores uma camada local de testes para roteamento e execução de skills antes que o tráfego de produção se torne o conjunto de testes.

Strands Evals é um framework de código aberto para avaliar agentes e aplicações de modelos de linguagem. Seus recursos publicados incluem pontuação de saída, análise de trajetória, avaliação de ferramentas, simulações, experimentos e avaliação baseada em traces.

O repositório de avaliação do projeto agora documenta as três verificações de skills. Desenvolvedores podem executar Skill Selection Accuracy e Skill Instruction Following em uma sessão registrada ou em uma trajetória bruta de mensagens.

Os avaliadores baseados em julgamento leem a trajetória em vez de executar novamente o agente. Isso permite investigação após uma falha e comparação entre sessões salvas. Também separa a execução dispendiosa do agente da análise repetida do mesmo registro.

Skill Invoked atende a uma necessidade de teste diferente. Se um caso de regressão tem um requisito conhecido de roteamento, desenvolvedores podem afirmar que a skill esperada foi carregada. A verificação é determinística e não exige um modelo avaliador.

Isso a torna adequada para um gate de lançamento. Uma solicitação de suporte ao cliente envolvendo encerramento de conta deve carregar de forma consistente a skill aprovada de encerramento. Se uma descrição revisada impedir a invocação, o teste de regressão pode falhar antes da implantação.

A precisão de seleção continua útil quando mais de uma skill pode se aplicar de forma razoável. Ela pergunta se uma skill invocada se ajusta à tarefa, em vez de comparar apenas com um nome fixo. Essa flexibilidade acomoda catálogos com procedimentos relacionados e variação legítima de roteamento.

O seguimento de instruções então testa a próxima etapa. O avaliador identifica as etapas prescritas na skill carregada e classifica cada uma como coberta, parcial ou ignorada. Ele usa esses julgamentos para produzir a classificação geral de cinco níveis.

A combinação cria uma matriz compacta de testes.

Uma alta pontuação de seleção com fraco seguimento de instruções significa que o roteamento funcionou, mas a execução não. O agente encontrou o procedimento correto e então ignorou ou concluiu apenas parcialmente seus requisitos.

Uma seleção fraca com forte seguimento de instruções significa que o agente seguiu o procedimento carregado, mas esse procedimento era inadequado para a solicitação. Melhorar a redação interna da skill não resolveria esse erro de roteamento.

Uma invocação ausente exige tratamento especial. A AWS observa que os dois avaliadores baseados em julgamento não retornam uma pontuação quando nenhuma skill foi invocada. As equipes devem combiná-los com Skill Invoked quando uma skill nomeada for obrigatória.

Esse comportamento evita um sucesso enganoso. Um avaliador não pode julgar a aderência a instruções que nunca foram carregadas. No entanto, um resultado vazio pode desaparecer em um dashboard, a menos que a suíte de testes trate explicitamente a não invocação como falha.

O Strands também impõe uma carga de instrumentação ao harness. Seu extrator precisa reconhecer as skills disponíveis e selecionadas a partir da trajetória. O projeto oferece suporte a vários ambientes conhecidos, além do padrão genérico de leitura de um arquivo SKILL.md.

Os desenvolvedores devem verificar a extração antes de confiar em uma pontuação. Um harness com sinais de skill não reconhecidos pode produzir resultados vazios mesmo quando o agente usou uma skill. Isso é uma lacuna de observabilidade, não evidência de comportamento correto.

Essa ressalva importa para equipes que integram camadas personalizadas de orquestração. A qualidade da avaliação depende do registro fiel dos eventos. Um atributo de trace ausente pode se parecer com uma ação ausente do agente, a menos que as equipes validem primeiro o contrato de telemetria.

Portanto, o fluxo de trabalho de desenvolvimento tem duas etapas. Primeiro, confirmar que o avaliador consegue ver o catálogo, a invocação, o conteúdo da skill e as ações subsequentes. Segundo, medir se essas ações se adequam à tarefa e cumprem as instruções.

Para equipes de engenharia que mantêm fluxos de trabalho técnicos locais, a mudança também reforça o valor de uma base de conhecimento de engenharia pesquisável. As skills podem codificar procedimentos, enquanto o material-fonte mantido fornece os fatos sobre os quais esses procedimentos operam.

AgentCore Leva a Avaliação de Skills para Rastreios de Produção

O AgentCore estende as mesmas questões de roteamento e aderência, saindo de testes selecionados para sessões em ambiente de preparação e tráfego real amostrado.

O Amazon Bedrock AgentCore Evaluations é um serviço gerenciado para avaliar o comportamento de agentes em desenvolvimento e produção. Ele consome rastreios OpenTelemetry, que registram eventos estruturados como chamadas de modelo, uso de ferramentas e operações de agentes.

O OpenTelemetry é importante porque reduz a dependência de um único framework de agentes. A documentação do AgentCore informa que o serviço oferece suporte a integrações como Strands e LangGraph por meio de instrumentação OpenTelemetry e OpenInference.

Essa arquitetura confere ao lançamento um papel mais amplo do que o de um recurso exclusivo do Strands. O Strands Evals lida com casos de teste e trajetórias de desenvolvimento registradas. O AgentCore pode avaliar rastreios compatíveis de agentes implantados, incluindo sessões produzidas fora do framework Strands.

A AWS oferece três modos de avaliação. A avaliação sob demanda investiga sessões selecionadas ou valida uma alteração recente. A avaliação em lote processa várias sessões armazenadas para estabelecer uma linha de base ou comparar uma revisão de catálogo.

A avaliação online coleta continuamente amostras do tráfego de produção. As equipes escolhem avaliadores, uma fonte de dados, filtros e uma taxa de amostragem. Em seguida, o AgentCore aplica essas avaliações à medida que os rastreios correspondentes chegam.

Os modos de avaliação atendem a diferentes questões operacionais. Um desenvolvedor pode inspecionar uma sessão que falhou, pontuar uma população armazenada ou monitorar comportamentos que só aparecem entre usuários reais.

Essa progressão aborda uma lacuna comum nos testes de agentes. Prompts selecionados refletem o que os projetistas esperam que as pessoas perguntem. Solicitações de produção contêm abreviações, contexto ausente, formulações incomuns e combinações que um autor de testes não antecipou.

Os catálogos de skills também mudam com o tempo. Uma nova skill pode se sobrepor a uma descrição mais antiga, alterando o roteamento mesmo quando as etapas internas de nenhuma das skills mudaram. A AWS descreve isso como deriva de catálogo.

A avaliação online pode revelar essa deriva por meio da queda nos escores de seleção. As equipes podem então inspecionar qual skill começou a atrair solicitações inadequadas. A correção pode envolver restringir uma descrição ou esclarecer os limites entre skills vizinhas.

Sessões longas criam outra preocupação. Um agente pode seguir uma skill de forma confiável no início de uma conversa, mas perder o controle das etapas à medida que o contexto se acumula. Os rastreios de produção expõem essas condições de forma mais natural do que prompts de teste isolados.

O serviço gerenciado também oferece suporte a amostragem direcionada. A documentação da AWS afirma que as equipes podem avaliar uma porcentagem das sessões ou aplicar filtros condicionais. Isso permite que os operadores foquem em fluxos de trabalho sensíveis sem processar todas as interações.

No entanto, a amostragem muda o significado do painel. Uma avaliação de baixo volume ou com filtros restritos pode deixar de detectar falhas raras. As equipes precisam registrar qual tráfego se qualificou e evitar apresentar um escore amostrado como cobertura completa.

O caminho de produção também depende de telemetria correta. O AgentCore organiza interações em sessões, rastreios e spans. Uma sessão contém uma conversa, um rastreio cobre uma troca e os spans representam operações individuais.

A avaliação de skills precisa de informações suficientes para reconstruir o que estava disponível, o que foi carregado e o que aconteceu depois. Se a instrumentação omitir o conteúdo da skill ou o sinal de invocação, o avaliador não terá as evidências necessárias para um resultado defensável.

As orientações do AgentCore da AWS descrevem um formato de rastreio unificado, pontuado com avaliadores baseados em modelos. Essa padronização simplifica as operações, mas não pode recuperar eventos que o aplicativo nunca registrou.

As equipes de segurança também precisarão examinar o conteúdo dos rastreios. O texto das skills pode conter procedimentos internos, e os registros de conversas podem incluir dados sensíveis de usuários. A avaliação amplia o valor da telemetria, ao mesmo tempo que eleva a importância dos controles de acesso e das decisões de retenção.

O resultado é um modelo de ciclo de vida, e não um único teste. Os desenvolvedores podem estabelecer barreiras determinísticas localmente, comparar sessões armazenadas antes do lançamento e observar comportamentos amostrados após a implantação. Cada camada detecta uma classe diferente de falha.

Os Novos Escores Ainda Precisam de Sua Própria Avaliação

Avaliadores baseados em modelos adicionam detalhes diagnósticos, mas não transformam a conformidade procedimental em um fato objetivo.

Skill Selection Accuracy e Skill Instruction Following dependem de um modelo avaliador. O avaliador lê a tarefa, as evidências disponíveis e as instruções da skill antes de produzir uma classificação. Sua saída continua sendo uma interpretação da trajetória registrada.

Essa interpretação pode variar diante de etapas ambíguas. Uma skill pode dizer: “verifique o status do cliente antes de prosseguir”, sem definir evidências de verificação aceitáveis. Um avaliador pode considerar uma consulta ao banco de dados suficiente, enquanto outro espera uma confirmação explícita.

A escala de aderência de cinco níveis oferece nuance, mas também pode criar falsa precisão. Uma classificação de 0,75 parece exata, mesmo quando a distinção subjacente entre Mostly Followed e Partially Followed depende de julgamento.

Portanto, as equipes devem calibrar o avaliador com exemplos revisados por humanos. O objetivo não é obter concordância perfeita em todos os casos-limite. É ter uma rubrica estável que reflita as prioridades procedimentais reais da organização.

As skills devem tornar as etapas importantes observáveis. “Considere a política relevante” é difícil de verificar. “Recupere a política atual, compare a solicitação com três condições de elegibilidade e registre o resultado” cria evidências mais claras.

Casos negativos importam tanto quanto os positivos. Um benchmark de seleção deve incluir solicitações que se assemelham ao domínio de uma skill, mas não deveriam invocá-la. Caso contrário, uma descrição ampla pode obter boa pontuação ao ser ativada em todas as tarefas próximas.

Os testes no nível do catálogo também são essenciais. Avaliar uma skill isoladamente diz pouco sobre o roteamento quando dez opções semelhantes aparecem juntas. O ambiente de teste relevante deve se parecer com o catálogo que os agentes realmente verão.

A verificação determinística Skill Invoked tem sua própria limitação. Ela prova que uma skill nomeada foi carregada, não que esse carregamento foi apropriado ou útil. Uma equipe pode alcançar invocação perfeita e ainda selecionar a skill para as solicitações erradas.

Da mesma forma, um forte seguimento de instruções não garante uma resposta correta. Uma skill defeituosa pode prescrever as etapas erradas. O agente pode executar essas etapas fielmente e ainda produzir um resultado inseguro ou impreciso.

É por isso que a avaliação no nível da resposta deve permanecer ao lado da avaliação de skills. As equipes ainda precisam de verificações de correção, fidelidade, nocividade, parâmetros de ferramentas e validação específica do domínio. A aderência ao procedimento é uma dimensão da confiabilidade.

Os modelos de prompt oficiais tornam a lógica de pontuação inspecionável. Eles mostram que o avaliador de aderência identifica etapas, rotula evidências de suporte e mapeia o resultado para cinco classificações.

A transparência ajuda as equipes a entender o avaliador, mas não substitui a validação. As organizações devem comparar os resultados do avaliador com a revisão de especialistas antes de usar os escores em decisões sensíveis de lançamento.

Custo e latência também moldam o uso em produção. A avaliação baseada em avaliadores requer processamento adicional de modelo após a execução original do agente. Amostragem e filtros podem controlar essa carga, mas também reduzem a cobertura.

As equipes devem evitar condensar todos os avaliadores em um único escore de destaque. Um único número composto recria a ambiguidade que este lançamento foi projetado para eliminar. Seleção, invocação, aderência e qualidade da saída devem permanecer visíveis como sinais separados.

O lançamento também deixa questões de governança fora de seu escopo. Ele não decide quem pode criar uma skill, aprovar uma revisão ou definir um procedimento obrigatório. A avaliação só pode revelar desvios depois que uma organização estabelece uma linha de base autorizada.

Um fluxo de trabalho maduro versionará as skills junto com testes e alterações na rubrica. Caso contrário, as equipes não poderão determinar se um escore mudou porque o agente mudou, as instruções mudaram ou o avaliador mudou.

A Amazon apresenta as verificações como ferramentas de diagnóstico, não como prova independente de conformidade. Esse é o limite adequado. Elas tornam o comportamento dos agentes mais passível de revisão, enquanto a responsabilidade continua com as pessoas que definem e validam o fluxo de trabalho.

Três Sinais Mostrarão se a Avaliação de Skills Funciona

O próximo teste é verificar se as equipes conseguem transformar evidências por skill em lançamentos mais seguros, diagnóstico mais rápido e catálogos de skills melhores.

O primeiro sinal é a adoção de barreiras determinísticas de roteamento no desenvolvimento. As equipes devem identificar fluxos de trabalho nos quais uma skill nomeada é obrigatória e adicionar asserções de Skill Invoked às suítes de regressão.

Se essas barreiras detectarem mudanças no catálogo antes da implantação, o argumento a favor de testes conscientes de skills se fortalecerá. Se problemas de extração produzirem resultados vazios com frequência, a instrumentação continuará sendo o obstáculo imediato.

O segundo sinal é se os escores de seleção em produção revelam deriva de catálogo. Novas skills frequentemente chegam com descrições amplas porque seus autores querem que sejam acionadas de modo confiável. Essas descrições podem desviar solicitações de procedimentos existentes.

Um sistema de produção útil deve mostrar quais invocações se tornaram inadequadas após uma atualização de catálogo. As equipes devem então conseguir relacionar a queda a uma descrição específica, sobreposição ou padrão de solicitação.

Evidências de diagnóstico reproduzível fortaleceriam a alegação central da AWS. Painéis que apenas mostram um agregado menor sem identificar a skill afetada a enfraqueceriam.

O terceiro sinal é a concordância entre Skill Instruction Following e a revisão de especialistas. As organizações precisam comparar os rótulos do avaliador no nível das etapas com os julgamentos de pessoas que entendem o procedimento.

Uma concordância consistente justificaria um uso mais amplo em barreiras de lançamento e monitoramento online. Discordâncias frequentes sugeririam que as etapas da skill, as evidências de rastreio ou a rubrica do avaliador precisam de mais trabalho.

As equipes devem começar com um catálogo pequeno e um conjunto de testes deliberadamente variado. Inclua correspondências claras, casos quase correspondentes, solicitações que não exigem skill e fluxos de trabalho com múltiplas skills. Execute cada cenário mais de uma vez, pois o comportamento dos agentes continua não determinístico.

Registre quatro resultados separadamente: se a skill esperada foi carregada, se cada invocação foi apropriada, se as etapas exigidas foram seguidas e se o resultado final estava correto. Essa estrutura preserva o valor diagnóstico dos novos avaliadores.

Depois, inspecione as discordâncias em vez de eliminá-las por meio de médias. Uma resposta correta com etapas ignoradas pode expor um risco operacional latente. Uma resposta ruim após execução fiel pode revelar uma skill defeituosa, em vez de um modelo fraco.

O monitoramento de produção deve começar com fluxos de trabalho sensíveis ou de alto volume. Use filtros e amostragem deliberadamente e documente o que a população de pontuação exclui. Mantenha a revisão especializada disponível para falhas graves e classificações contestadas.

A avaliação de skills do Amazon Bedrock AgentCore é importante porque altera o que conta como evidência. Uma saída fluente continua valiosa, mas já não resolve se um agente seguiu o procedimento da organização.

A questão prática agora é sua: sua equipe consegue explicar qual skill um agente selecionou, por que essa escolha foi adequada e quais etapas obrigatórias o rastreamento comprova que ele concluiu? Caso contrário, inclua essas evidências no próximo ciclo de testes antes de adicionar mais skills.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page