top of page

Black Forest Labs FLUX 3 Action desafia a Nvidia com pesos abertos para robôs

há 4 horas
14 min de leitura

A Black Forest Labs lançou o FLUX 3 Action em 23 de setembro, colocando um modelo de pesos abertos com 7 bilhões de parâmetros diretamente na disputa pelo controle robótico de propósito geral. A empresa afirma que seu modelo lidera um importante benchmark de simulação, apesar de usar menos parâmetros que a política concorrente Cosmos 3 Nano da Nvidia.

Essa comparação dá relevância ao lançamento. O Black Forest Labs FLUX 3 Action não é apenas um gerador de imagens adaptado para outra demonstração. Ele prevê vídeo e ações de robôs simultaneamente, convertendo observações visuais e instruções em linguagem natural em uma sequência de comandos físicos.

Os resultados iniciais parecem promissores, mas ainda são mais restritos do que um avanço geral em robótica. A pontuação líder vem de tarefas simuladas sobre mesas, enquanto um pequeno teste externo de hardware usou apenas 30 tentativas. Os pesos abertos também incluem condições de licença, exigências computacionais substanciais e responsabilidades explícitas de segurança para quem os implantar.

Black Forest Labs FLUX 3 Action muda a disputa na robótica

A mudança importante é que um desenvolvedor de destaque em IA visual lançou tanto pesos utilizáveis para robôs quanto o código necessário para adaptá-los.

FLUX 3 Action é um modelo de ação do mundo, ou WAM, que prevê estados visuais futuros e comandos de robôs dentro de uma única arquitetura. Ele recebe quadros de câmera, o estado atual do robô e uma instrução de texto. Em seguida, produz o próximo bloco de ações junto com quadros de vídeo previstos.

A Black Forest Labs lançou três componentes principais. O repositório base contém o modelo pré-treinado em ações e codificadores compartilhados. Checkpoints separados para DROID e SO-101 fornecem políticas adaptadas a duas configurações robóticas estabelecidas.

DROID é um grande conjunto de dados de manipulação robótica construído a partir de demonstrações do mundo real em diversos ambientes. A política DROID lançada é voltada a uma configuração de robô Franka com três visualizações de câmera. A versão SO-101 é voltada a um braço robótico menor e de menor custo, comumente usado com o framework LeRobot da Hugging Face.

O modelo tem 7 bilhões de parâmetros. Segundo a documentação do modelo publicada, uma chamada de inferência DROID retorna 32 ações que cobrem cerca de dois segundos de movimento.

Esse horizonte de ação importa porque controladores robóticos precisam observar, planejar e agir repetidamente. Uma janela de previsão útil mais longa pode reduzir a frequência com que o modelo completo precisa ser executado. No entanto, blocos de ação mais longos também podem amplificar erros quando o ambiente muda após o início de um plano.

O lançamento inclui ferramentas de ajuste fino completo, adaptação eficiente em parâmetros, inferência, conversão de checkpoints e avaliação. Desenvolvedores podem começar pelo modelo base, adaptá-lo a outro robô ou executar uma das políticas preparadas.

Isso vai além de publicar um cartão de modelo e um vídeo de demonstração. O repositório de inferência público inclui preparação de dados, treinamento distribuído, gerenciamento de checkpoints, ferramentas de exportação e exemplos específicos para robôs.

A empresa desenvolveu o lançamento com Nvidia e Hugging Face. Essa cooperação complica o enquadramento competitivo. A Nvidia ajudou a viabilizar o modelo e fornece grande parte da pilha de hardware, mas sua política Cosmos também é a rival aberta mais importante no benchmark.

FLUX 3 Action surgiu do programa FLUX 3 mais amplo. A Black Forest Labs construiu originalmente sua reputação em torno da geração de imagens. Sua arquitetura mais recente estende essa base visual para a previsão de vídeo, áudio e ações.

A conexão não é superficial. Um modelo de vídeo precisa estimar como objetos se movem, colidem, se deformam e respondem ao longo do tempo. Uma política robótica precisa de informações relacionadas, mas também deve selecionar comandos que produzam o resultado desejado.

A Black Forest Labs aposta que esses dois problemas pertencem a um único modelo compartilhado. Essa aposta agora conta com pesos para download, checkpoints funcionais e resultados de benchmark que outras equipes podem testar.

Um modelo menor agora lidera o RoboLab-120

A principal alegação inicial do FLUX 3 Action é uma taxa de sucesso de 42,92 por cento no RoboLab-120, em comparação com 36,8 por cento para o Cosmos3-Nano-Policy maior da Nvidia.

RoboLab-120 é um benchmark de simulação que contém 120 tarefas de manipulação sobre mesas. Cada política enfrenta desafios visuais, procedurais e relacionais em vários níveis de dificuldade.

Os exemplos incluem identificar o objeto correto, compreender relações espaciais e concluir instruções em múltiplas etapas. O benchmark é executado no Nvidia Isaac Sim, em uma configuração de robô Franka no estilo DROID.

O artigo do RoboLab descreve um sistema para gerar cenas e tarefas realistas sem vincular o teste a uma única arquitetura de modelo. O RoboLab-120 usa dez tentativas por tarefa, produzindo um conjunto de avaliação maior que uma curta sequência de demonstrações.

A Black Forest Labs informa que seu modelo ajustado para DROID alcançou 42,92 por cento de sucesso geral. O OASIS WAM teria obtido 39,0 por cento, enquanto o Cosmos3-Nano-Policy da Nvidia registrou 36,8 por cento sob a configuração padrão de linguagem.

O π0.5 da Physical Intelligence alcançou 28,0 por cento na mesma comparação. O DreamZero obteve 25,7 por cento, enquanto o Cosmos3-Edge-Policy menor da Nvidia chegou a 22,9 por cento.

Esses números tornam o FLUX 3 Action o líder atual na comparação publicada. Eles não significam que ele conclui a maioria das tarefas com confiabilidade. Uma taxa de sucesso de 42,92 por cento ainda representa falha em mais da metade das tentativas avaliadas.

A comparação de parâmetros também é digna de nota. O FLUX 3 Action usa 7 bilhões de parâmetros, enquanto o Cosmos 3 Nano usa 16 bilhões. Isso dá à Black Forest Labs um modelo menor com uma liderança de 6,12 pontos percentuais no placar divulgado.

A contagem de parâmetros não é uma medida direta de custo, latência ou inteligência. Arquitetura, precisão, movimentação de memória, etapas de amostragem e sobrecarga dos codificadores afetam o desempenho real na implantação.

A Black Forest Labs também oferece diversas variantes de inferência. A política base usa quatro etapas de remoção de ruído com orientação. Outro checkpoint remove a orientação externa, enquanto uma versão destilada por etapas produz resultados em uma única etapa.

A empresa relata inferência mais rápida que o Cosmos 3 Nano nas configurações de hardware testadas. A vantagem precisa varia conforme o checkpoint, a precisão numérica e a GPU.

Essas otimizações respondem a uma restrição real da robótica. Um modelo que planeja ações impressionantes, mas responde devagar demais, não consegue se recuperar de movimentos, interferências ou erros de percepção.

Ainda assim, o benchmark de destaque exige contexto. O RoboLab avalia manipulação simulada, não trabalho imprevisível próximo a pessoas. A simulação pode padronizar comparações, mas não consegue representar todos os erros de sensor, falhas mecânicas, colisões ou mudanças ambientais.

O benchmark também surgiu da pilha de pesquisa em robótica da Nvidia. Isso não invalida os resultados, mas torna a reprodução independente particularmente valiosa.

Uma questão pública relacionada ao Cosmos relatou anteriormente dificuldade para reproduzir alguns resultados publicados do RoboLab. O relatório do Cosmos subjacente apresenta pontuações em diferentes níveis de especificidade das instruções, ilustrando como os resultados de benchmark dependem da configuração do teste.

Para compradores e desenvolvedores, a interpretação correta é restrita, mas significativa. O FLUX 3 Action estabeleceu uma posição crível em benchmark usando um modelo menor. Equipes independentes agora precisam determinar se essa vantagem se mantém em diferentes hardwares, instruções e ambientes físicos.

Por que a previsão conjunta de vídeo e ação importa

A Black Forest Labs trata o controle robótico como um problema de previsão visual, com ações incorporadas à mesma cena em evolução.

Modelos tradicionais de visão-linguagem-ação conectam entradas visuais e instruções de linguagem diretamente a comandos robóticos. Um modelo de ação do mundo acrescenta uma previsão explícita de como o mundo observado deve mudar.

O FLUX 3 Action remove ruído conjuntamente de tokens de vídeo e ação. Remover ruído significa que o sistema começa com saídas candidatas ruidosas e as refina iterativamente em uma previsão coerente.

O modelo usa um transformador de difusão com dois fluxos de saída sincronizados. Um fluxo representa quadros visuais futuros. O outro representa ações robóticas associadas a esses momentos.

Ambos os fluxos compartilham o mesmo nível de ruído em cada amostra de treinamento. Esse design incentiva o modelo a conectar um movimento comandado à sua consequência visual esperada.

Um autoencoder de vídeo congelado converte quadros em uma representação compacta. Um codificador Qwen3-VL-4B congelado processa a instrução de texto. O modelo de ação treinável combina esses sinais com o estado do robô.

Para a política DROID, três visualizações de câmera são organizadas em uma tela visual. O sistema também recebe posições das articulações e o estado da garra. Ele retorna 32 comandos, cada um contendo sete alvos de articulação e um valor para a garra.

Isso é diferente de gerar um vídeo e pedir a um controlador separado que o imite. As sequências de vídeo e ação surgem da mesma passagem pelo modelo e permanecem alinhadas temporalmente.

O mecanismo oferece à Black Forest Labs uma rota plausível da mídia generativa para a IA física. O treinamento em vídeo expõe um modelo a movimento, contato, permanência de objetos e causa e efeito. Os dados robóticos então ensinam como máquinas específicas podem influenciar essas cenas.

A colaboração anterior FLUX-mimic da empresa ofereceu uma prévia. Esse sistema conectou a base visual do FLUX 3 à experiência em robótica da mimic, incluindo trabalhos ligados à manipulação industrial.

FLUX 3 Action expande a ideia para pesos públicos e ferramentas reutilizáveis de adaptação. Ele também abrange mais que braços industriais nos experimentos da empresa.

A Black Forest Labs relata ter treinado versões para dois videogames e um drone de ambiente interno. A política de jogo usou um conjunto de pesos em ambientes de direção distintos, com uma legenda de texto identificando o jogo ativo.

No experimento com drone, o modelo recebeu uma visualização de câmera a bordo de 256 por 256 e gerou quatro valores de controle. Seu conjunto de treinamento continha 800 voos roteirizados criados no Isaac Sim.

A empresa afirma que o drone navegou por salas reorganizadas e seguiu instruções parafraseadas que não correspondiam exatamente às frases de treinamento. Esses resultados são demonstrações do desenvolvedor, não uma avaliação independente padronizada.

Ainda assim, eles ilustram a alegação arquitetural. Um modelo compartilhado pode representar comandos para um braço robótico, um drone ou um veículo virtual quando cada incorporação recebe entradas e cabeças de saída adequadas.

Isso não torna o modelo universalmente intercambiável. Cada máquina tem câmeras, dimensões de ação, unidades, temporização e limites de segurança diferentes. A adaptação ainda exige dados que representem o corpo e a tarefa-alvo.

O principal benefício é uma base visual reutilizável. Talvez os desenvolvedores não precisem treinar a compreensão de cenas do zero para cada nova máquina. Eles podem concentrar mais esforço de treinamento nas observações e nos controles do robô.

Essa abordagem se assemelha à estratégia de modelos fundamentais que remodelou o software de linguagem e imagem. A robótica apresenta um teste mais difícil porque saídas incorretas podem danificar hardware ou ferir pessoas.

O vídeo previsto pelo modelo oferece outra possível vantagem. Engenheiros podem inspecionar o que o modelo espera que aconteça, não apenas o comando numérico que ele envia. Essa previsão visual pode ajudar na depuração, embora não seja uma garantia formal de segurança.

Pesos abertos não significam robótica sem restrições

FLUX 3 Action é inspecionável e adaptável, mas sua licença, exigências de hardware e salvaguardas de implantação limitam o que “aberto” significa na prática.

A Black Forest Labs classifica o lançamento como pesos abertos, e não como totalmente open source. Os parâmetros do modelo estão disponíveis, e o código associado de inferência e treinamento é público. Os pesos usam a FLUX Kommunity License, enquanto partes do repositório de software usam uma licença open source convencional.

A licença do modelo permite uso não comercial e determinados usos comerciais por usuários qualificados. Organizações maiores ou implantações fora dessas condições podem precisar de um acordo separado.

Essa distinção importa para equipes de robótica que avaliam riscos de dependência de longo prazo. Um laboratório de pesquisa pode experimentar com os pesos, enquanto um fabricante comercial precisa examinar se seu uso proposto se qualifica.

Os requisitos de recursos do modelo representam outra fronteira. O checkpoint DROID usa cerca de 32 GB de memória de GPU em bfloat16 em uma Nvidia H200, segundo a orientação de hardware publicada.

A quantização FP8 e o offloading do codificador de texto podem acomodar o sistema em uma placa de 24 GB. A quantização reduz a precisão numérica para economizar memória e melhorar a velocidade, enquanto o offloading transfere parte do modelo para fora da GPU principal.

Essa exigência é acessível em comparação com alguns modelos de ponta, mas não se trata de inferência leve na borda. Um robô em produção ainda pode precisar de um servidor de GPU próximo, de um computador embarcado caro ou de um caminho de comunicação cuidadosamente projetado.

A latência é apenas uma preocupação operacional. A política produz posições-alvo das juntas, mas não impõe limites de velocidade das juntas, força, colisão ou espaço de trabalho.

O cartão do modelo instrui explicitamente os responsáveis pela implantação a adicionar esses controles no nível da aplicação. Ele recomenda validação em simulador, limites ativos de segurança do robô, supervisão humana e uma parada física acessível.

Esses avisos expõem a diferença entre uma política aprendida e um sistema completo de controle de robôs. Uma implantação em fábrica também precisa de monitoramento de estado, comportamento de emergência, detecção de falhas, controle de acesso, procedimentos de manutenção e delimitações de responsabilidade.

Blocos de ações criam uma questão adicional de controle. O FLUX 3 Action pode retornar 32 comandos em uma única previsão. Um controlador precisa decidir quantos executar antes de observar o ambiente e planejar novamente.

Executar toda a sequência pode melhorar a eficiência quando o mundo se comporta como esperado. Replanejar mais cedo pode ajudar quando objetos se movem, uma pegada escorrega ou uma pessoa entra no espaço de trabalho.

O exemplo SO-101 reflete esse equilíbrio. Seu loop de controle executa 32 ações de uma sequência prevista mais longa, descarta o restante e então planeja novamente.

Os desenvolvedores também devem preservar a ordenação das câmeras, a normalização, as unidades das juntas, o tempo e as convenções de estado associadas a cada checkpoint. Misturar esses detalhes pode produzir resultados aparentemente plausíveis, mas incorretos.

É por isso que pesos disponíveis para download não eliminam a engenharia de robótica. Eles transferem parte do trabalho de aprender uma política para integração, verificação e aplicação de segurança.

Para compradores empresariais, a pergunta mais útil não é se o modelo é aberto. É se o sistema completo continua testável, sustentável e seguro nas condições operacionais reais da organização.

A Comparação com a Nvidia É Real, mas Incompleta

O FLUX 3 Action pressiona a estratégia de modelos da Nvidia, mas o lançamento também depende fortemente do benchmark, das ferramentas de simulação e da plataforma computacional da Nvidia.

A comparação competitiva mais clara é entre o FLUX 3 Action e o Cosmos3-Nano-Policy. Ambos preveem estados visuais e ações futuras, ambos oferecem pesos acessíveis e ambos miram a manipulação robótica geral.

A Black Forest Labs relata melhor desempenho no RoboLab com menos parâmetros. Também afirma maior velocidade de inferência em várias GPUs testadas.

Essa combinação importa porque desenvolvedores de robôs frequentemente enfrentam uma restrição tripla entre capacidade, tempo de resposta e memória. Um modelo menor que melhora o sucesso das tarefas poderia reduzir as exigências de infraestrutura sem aceitar comportamento mais fraco.

No entanto, o tamanho do modelo por si só não estabelece eficiência de implantação. O FLUX 3 Action inclui um autoencoder visual congelado e um codificador de texto. O perfil completo de memória e latência depende de como esses componentes são executados.

A escolha do checkpoint também altera a comparação. A inferência em quatro etapas pode preservar a qualidade enquanto exige mais computação. Um checkpoint de etapa única é mais rápido, mas pode sacrificar parte do sucesso.

A Nvidia continua central para o lançamento. O RoboLab roda no Isaac Sim, os testes de inferência relatados usam GPUs Nvidia, e o modelo foi desenvolvido com suporte da Nvidia.

A Black Forest Labs também integra a colaboração mais ampla da Nvidia em modelos abertos. A relação se parece mais com competição dentro de uma plataforma compartilhada do que com um desafiante simples atacando uma empresa estabelecida.

A Hugging Face desempenha outro papel importante. Seu framework LeRobot reúne conjuntos de dados de robótica, políticas e integrações de hardware para que pesquisadores possam reproduzir fluxos de trabalho com mais consistência.

O checkpoint SO-101 do FLUX 3 Action chega com informações salvas de pré-processamento e normalização. Isso reduz uma fonte comum de erro ao transferir uma política entre um repositório e um braço físico.

O campo competitivo mais amplo inclui os modelos π da Physical Intelligence, Nvidia GR00T, DreamZero, OpenVLA, OASIS e outros sistemas de visão-linguagem-ação. Cada um faz escolhas diferentes sobre dados de treinamento, arquitetura do modelo, abertura e hardware compatível.

Alguns se concentram na previsão direta de ações. Outros adicionam componentes de modelagem de mundo ou planejamento. Vários publicam pesos, mas mantêm restrições relacionadas ao uso comercial ou aos dados de treinamento.

A posição distinta do FLUX 3 Action combina pré-treinamento em vídeo generativo, previsão conjunta de quadros futuros, ações de robôs e ferramentas públicas de adaptação. Sua liderança no benchmark fortalece esse conjunto, mas não encerra o debate arquitetural.

Uma política de ação direta pode ser menor e mais simples porque não prevê vídeo. Um modelo de ação de mundo usa computação para representar possíveis cenas futuras, o que pode melhorar o raciocínio físico, mas também aumentar a latência.

A evidência decisiva virá de comparações controladas sob os mesmos dados, hardware, restrições de segurança e tarefas do mundo real. Rankings públicos raramente capturam todo esse sistema.

Ainda assim, o lançamento muda as expectativas. Equipes de robótica agora podem perguntar por que um modelo maior ou fechado apresenta desempenho inferior a uma alternativa disponível de 7 bilhões de parâmetros em um benchmark relevante.

Os concorrentes precisam responder com resultados mais fortes, implantação mais rápida, suporte mais amplo a incorporações físicas, licenças mais claras ou evidências de instalações reais. Essa pressão é mais consequente do que a posição no ranking por si só.

O Que Desenvolvedores e Compradores Devem Observar a Seguir

Os próximos três sinais são reprodução independente, testes mais amplos em robôs reais e adaptação sustentada em novas máquinas.

O primeiro sinal é a reprodução do resultado RoboLab-120. Equipes independentes devem executar o checkpoint lançado com versões fixadas, prompts documentados e configurações de avaliação idênticas.

Uma pontuação reproduzida próxima de 42,92 por cento fortaleceria a alegação de que o FLUX 3 Action tem uma vantagem genuína no benchmark. Grandes desvios indicariam sensibilidade à configuração, às versões de software ou a detalhes não publicados.

A reprodução deve incluir mais de um checkpoint. As variantes base, destilada por orientação, destilada por etapas, bfloat16 e FP8 fazem diferentes compromissos entre velocidade, uso de memória e sucesso nas tarefas.

Os relatórios mais úteis publicarão detalhes completos do hardware e distribuições de falhas. Uma taxa geral de sucesso pode ocultar fragilidades em procedimentos complexos, relações espaciais ou instruções vagas.

O segundo sinal é uma avaliação maior em robôs reais. Um teste de terceiros citado na cobertura envolveu dez tarefas DROID, três tentativas cada e um braço Franka.

O FLUX 3 Action teria concluído 28 de 30 tentativas. O Cosmos 3 Nano concluiu 27, o DreamZero concluiu 20 e o π0.5 concluiu 13.

Esses resultados oferecem evidência externa encorajadora, mas 30 testes ainda são poucos demais para conclusões sobre implantação. Uma falha adicional alteraria materialmente a porcentagem.

Testes futuros devem incluir centenas de tentativas, objetos desconhecidos, mudanças de iluminação, perturbações de câmera, superfícies de trabalho deslocadas e interrupções humanas. Eles também devem documentar intervenções e movimentos inseguros, não apenas a conclusão final das tarefas.

O sucesso em simulação se torna mais convincente quando uma política preserva sua vantagem em locais físicos e hardwares mantidos por equipes diferentes. Se a vantagem desaparecer, o modelo pode estar se beneficiando do alinhamento com o benchmark.

O terceiro sinal é a adaptação a incorporações físicas genuinamente novas. A Black Forest Labs fornece um modelo base, suporte completo para ajuste fino e um fluxo de trabalho SO-101 eficiente em parâmetros.

Os desenvolvedores devem observar quanto de dados específicos de tarefa e capacidade computacional um novo robô exige. Um modelo de fundação útil deve reduzir a carga de adaptação, e não apenas realocá-la.

A evidência mais forte viria de equipes externas adaptando o modelo a diferentes braços, manipuladores móveis, drones ou ferramentas industriais. Esses projetos devem comparar tempo de treinamento, volume de dados, confiabilidade e latência de controle com políticas estabelecidas.

O licenciamento moldará essa adoção. Pesquisadores podem explorar o modelo agora, mas usuários comerciais precisam determinar se os termos da FLUX Kommunity se adequam à sua organização e implantação.

A economia de hardware também será importante. Um caminho de inferência de 24 GB amplia o acesso, mas uma operação de produção confiável inclui capacidade de reserva, monitoramento, hardware de controle e sistemas de segurança.

Desenvolvedores que trabalham nessas avaliações precisam manter registros disciplinados de prompts, checkpoints, layouts de câmera, conjuntos de dados e falhas. Uma base de conhecimento de engenharia pesquisável pode ajudar equipes a preservar esse contexto entre experimentos.

O FLUX 3 Action da Black Forest Labs chamou atenção ao conectar um mecanismo técnico claro a pesos públicos e resultados mensuráveis. Ele não estabeleceu inteligência robótica de propósito geral, e sua pontuação atual no benchmark deixa margem substancial para falhas.

A oportunidade imediata é a experimentação prática. As equipes podem inspecionar o código, executar observações gravadas sem um robô e avaliar o checkpoint em simulação antes de se aproximar de hardware físico.

A questão mais difícil vem depois. Os desenvolvedores conseguem reproduzir a liderança, transferi-la para máquinas desconhecidas e manter um comportamento seguro quando o ambiente deixa de corresponder ao benchmark?

Esses resultados determinarão se o FLUX 3 Action se tornará uma base de robótica amplamente usada ou permanecerá um ponto de referência impressionante. Por enquanto, sua contribuição mais importante é oferecer ao setor um modelo concreto e inspecionável para testar.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page