top of page

Hugging Face ottiene nuovi encoder LFM2.5, portando l'inferenza CPU a contesto lungo contro ModernBERT

30 lug
Tempo di lettura: 12 min

Hugging Face ha aggiunto due modelli encoder di Liquid AI in grado di elaborare input da 8.192 token, sfidando ModernBERT nella velocità su CPU per il contesto lungo. Il rilascio mette sotto esame un'affermazione specifica: l'elaborazione del linguaggio su scala documentale non richiede sempre una GPU né un modello generativo.

Liquid AI afferma che il suo encoder da 230 milioni di parametri completa un forward pass da 8.192 token su una CPU testata in circa 28 secondi. ModernBERT-base ha richiesto oltre 90 secondi nel confronto dell'azienda. Il divario riportato trasforma quindi LFM2.5 vs ModernBERT in una sfida sull'economia del deployment, non soltanto sull'accuratezza nei benchmark.

Il risultato è rilevante perché gli encoder gestiscono silenziosamente carichi di lavoro persistenti come classificazione, instradamento, estrazione, moderazione e rilevamento di dati personali. Questi sistemi spesso esaminano ogni documento o messaggio in ingresso. Un modello più lento può quindi richiedere infrastrutture significative anche quando ogni singola attività sembra modesta.

Liquid AI ha pubblicato i pesi dei modelli, l'harness di valutazione, le model card e dimostrazioni solo CPU. Tuttavia, la prestazione di punta resta un risultato eseguito dal fornitore. Dettagli importanti per il deployment, inclusi la configurazione del processore e il supporto a runtime ottimizzati, necessitano ancora di test indipendenti più ampi.

Hugging Face aggiunge due encoder LFM2.5 a pesi aperti

Il rilascio trasforma l'architettura decoder di Liquid AI in due encoder orientati a compiti specifici, pensati per documenti lunghi e hardware informatico comune.

Liquid AI ha rilasciato LFM2.5-Encoder-230M e LFM2.5-Encoder-350M su Hugging Face il 28 luglio 2026. Entrambi supportano contesti fino a 8.192 token e utilizzano l'architettura ibrida LFM2 dell'azienda.

Un encoder legge un input e produce rappresentazioni contestuali per classificazione, recupero delle informazioni, estrazione o decisioni a livello di token. A differenza di un modello linguistico causale, non genera principalmente il token successivo da sinistra a destra.

La distinzione influenza sia i costi sia il comportamento. Un router per ticket di assistenza deve selezionare una destinazione, non comporre una risposta. Un filtro per la privacy deve individuare segmenti sensibili, non produrre un paragrafo fluente.

Liquid AI ha adattato le esistenti basi decoder da 230M e 350M per questi compiti più circoscritti. Ha sostituito la maschera di attenzione causale con attenzione bidirezionale, consentendo a ciascun token di considerare il testo su entrambi i lati. L'azienda ha inoltre reso non causali le convoluzioni corte dell'architettura mediante padding simmetrico.

L'addestramento ha utilizzato il masked language modeling, in cui token selezionati vengono nascosti e il modello li predice dal contesto circostante. Liquid AI afferma di aver mascherato il 30 percento dei token durante l'addestramento.

L'azienda ha utilizzato un programma in due fasi. L'addestramento iniziale ha riguardato sequenze da 1.024 token su un ampio corpus web. Una seconda fase ha esteso il contesto a 8.192 token utilizzando dati destinati a rafforzare le prestazioni fattuali, legali e multilingue.

La model card 230M elenca circa 229,7 milioni di parametri. La versione 350M ne contiene circa 354,5 milioni. Entrambe hanno una dimensione nascosta di 1.024 e un vocabolario di 65.536 voci.

Secondo la model card, supportano 15 lingue. Tra queste figurano inglese, spagnolo, francese, arabo, hindi, giapponese, vietnamita e cinese.

Liquid AI posiziona il modello più piccolo per vincoli più stringenti di latenza e memoria. Presenta la versione più grande come scelta orientata all'accuratezza. Entrambi richiedono fine-tuning specifico per il compito prima di diventare classificatori, router o sistemi di estrazione pronti per la produzione.

Questa precisazione è importante per qualsiasi spiegazione dell'encoder LFM2.5 come applicazione pronta all'uso. I modelli di base forniscono rappresentazioni linguistiche, ma le organizzazioni devono aggiungere un output head e addestrarlo per il compito di destinazione.

I modelli utilizzano la LFM Open License v1.0 di Liquid AI. Definirli a pesi aperti significa che gli sviluppatori possono scaricare ed eseguire i parametri addestrati. Non significa che il rilascio utilizzi una licenza software permissiva standard.

Hugging Face fornisce il punto di distribuzione, le model card, la discussione della community e le dimostrazioni. Liquid AI fornisce l'architettura, i pesi, le valutazioni e l'implementazione. Questo accordo facilita la sperimentazione, mantenendo al contempo la responsabilità delle principali affermazioni sulle prestazioni presso lo sviluppatore del modello.

Il cambiamento immediato è quindi concreto. Gli sviluppatori dispongono ora di due encoder scaricabili a contesto lungo progettati attorno al deployment su CPU anziché alla generazione GPU-first.

Perché l'inferenza CPU a contesto lungo è il vero premio

L'opportunità centrale non è un chatbot più piccolo, ma un livello decisionale meno costoso in grado di esaminare documenti di lavoro completi.

I sistemi linguistici in produzione svolgono molte attività che non richiedono mai la generazione di testo. Etichettano richieste, rilevano violazioni delle policy, classificano il sentiment, identificano entità, ordinano passaggi e scelgono quale modello più grande riceverà un prompt.

Queste operazioni possono essere eseguite molto più frequentemente delle risposte visibili di un chatbot. Una piattaforma per agenti potrebbe valutare un prompt rispetto a diverse regole di sicurezza prima della generazione. Potrebbe classificare nuovamente il risultato prima di consegnarlo.

Eseguire ogni fase tramite un grande modello generativo aggiunge latenza e domanda di hardware. Può inoltre introdurre output variabile in compiti che richiedono etichette o segmenti di token prevedibili.

Un encoder sottoposto a fine-tuning offre un percorso diverso. Legge il testo pertinente in un unico forward pass e restituisce punteggi specifici per il compito. Il modello può restare all'interno di un processo locale invece di inviare ogni documento a un servizio esterno.

La lunghezza del contesto determina se quel processo vede la fonte completa. Gli encoder più vecchi erano spesso incentrati su sequenze più brevi, costringendo gli sviluppatori a dividere contratti, trascrizioni o thread di assistenza in blocchi. Il chunking può separare una decisione dalle prove che ne modificano il significato.

Una finestra da 8.192 token non copre tutti i documenti lunghi. Copre però molto più testo rispetto ai classici deployment BERT da 512 token. Questa differenza può ridurre il chunking e la logica di aggregazione circostante.

Liquid AI illustra l'approccio con Hugging Face Spaces solo CPU. Le sue dimostrazioni coprono prompt routing, policy linting, correzione ortografica e rilevamento di informazioni di identificazione personale.

Secondo quanto riportato, la dimostrazione PII rileva 40 tipi di informazioni in 16 lingue. Il policy linting assegna punteggi ai token rispetto a regole fornite come testo libero. Il prompt routing confronta un prompt completo con categorie di instradamento definite dall'utente.

Queste dimostrazioni identificano i carichi di lavoro che Liquid AI intende conquistare. Sono attività di comprensione ad alto volume, con output delimitati e costi infrastrutturali ricorrenti.

Un filtro delle policy locale è particolarmente rilevante per i sistemi basati su agenti. Il filtro può operare nello stesso ambiente di un'applicazione, riducendo la necessità di esporre testo interno a un altro endpoint remoto.

La stessa logica si applica ai documenti tecnici locali. I team che costruiscono una base di conoscenza ricercabile necessitano di fasi di classificazione, estrazione e recupero prima che appaia qualsiasi risposta generata.

Il deployment su CPU amplia i luoghi in cui queste fasi possono essere eseguite. Un laptop per sviluppatori, un server applicativo o un dispositivo edge possono eseguire il modello senza riservare un acceleratore separato.

Tuttavia, “funziona su CPU” non significa automaticamente istantaneo o economico a qualsiasi scala. Un passaggio da 28 secondi può essere pratico per un contratto e inadatto a un'interfaccia interattiva. Anche il throughput in batch differisce dalla latenza su un singolo documento.

L'affermazione più forte riguarda la flessibilità operativa. I team possono collocare l'elaborazione linguistica specializzata dove risiedono già i loro dati, riservando poi GPU o modelli remoti ai compiti che richiedono davvero la generazione.

Questa divisione del lavoro mette sotto pressione i fornitori che vendono inferenza general-purpose per ogni operazione linguistica. Mette inoltre sotto pressione i team che ricorrono per default ai grandi modelli linguistici prima di misurare se un encoder più piccolo sia in grado di soddisfare il requisito.

LFM2.5 vs ModernBERT dipende dall'architettura

Il vantaggio di velocità riportato da Liquid AI cresce con la lunghezza dell'input perché la sua base ibrida evita di applicare l'attenzione completa in ogni livello.

ModernBERT rappresenta l'avversario più chiaro perché punta anch'esso a una codifica bidirezionale efficiente con un contesto da 8.192 token. Rilasciato alla fine del 2024, ha aggiornato il design BERT per input più lunghi, hardware moderno e addestramento migliorato.

La ricerca originale su BERT ha stabilito il pre-addestramento bidirezionale come fondamento per la comprensione del linguaggio. ModernBERT ha poi combinato tale approccio con aggiornamenti architetturali e di addestramento mirati alle attuali esigenze di deployment.

Liquid AI segue un'altra strada. LFM2 alterna attenzione grouped-query con blocchi di convoluzione corta gated. L'attenzione collega le informazioni lungo una sequenza, mentre le convoluzioni corte si concentrano sui token vicini con un minore overhead computazionale.

Questa struttura ibrida è importante quando gli input crescono. La self-attention completa confronta le posizioni lungo la sequenza, quindi il suo carico computazionale aumenta rapidamente con la lunghezza. I livelli convoluzionali limitano una parte maggiore del loro lavoro ai vicinati locali.

Liquid AI non elimina l'attenzione. Riduce la frequenza con cui l'architettura ne sostiene il costo completo. Il modello può comunque scambiare informazioni tra posizioni distanti elaborando molti livelli tramite operazioni locali meno costose.

Per l'uso come encoder, Liquid AI ha reso bidirezionali tali operazioni locali. Il padding simmetrico consente a una convoluzione di incorporare i vicini prima e dopo il token corrente. Anche i livelli di attenzione completa ricevono una maschera bidirezionale.

Questo meccanismo costituisce il caso centrale di LFM2.5 vs ModernBERT. Liquid AI scommette che l'elaborazione ibrida delle sequenze possa preservare una comprensione competitiva rallentando al contempo la crescita della latenza per input lunghi.

Secondo i risultati del rilascio, LFM2.5-Encoder-230M è stato il modello testato più rapido a ogni lunghezza di sequenza su CPU. Il suo vantaggio è diventato più visibile al limite di 8.192 token.

Liquid AI riporta circa 28 secondi per il modello LFM2.5 più piccolo a quella lunghezza. Afferma che ModernBERT-base abbia impiegato oltre 90 secondi, producendo il vantaggio dichiarato di 3,7 volte.

L'azienda ha osservato un andamento più ristretto su una GPU Apple. Secondo quanto riportato, ModernBERT-base era in testa sotto circa 1.000 token. Gli encoder di Liquid AI sono passati in vantaggio a partire da circa 2.000 token.

Questo punto di sorpasso illustra il compromesso. Le scelte architetturali ottimizzate per input lunghi non garantiscono la leadership su quelli brevi. Molte richieste di classificazione in produzione restano ben al di sotto di 2.000 token.

Anche il numero di parametri complica un semplice confronto di velocità. ModernBERT-base contiene circa 149 milioni di parametri, mentre l'encoder più piccolo di Liquid AI ne contiene circa 230 milioni. Il modello LFM2.5 è più grande ma, secondo quanto riportato, più rapido su sequenze CPU lunghe.

Il benchmark quindi misura più del numero di parametri. Comportamento dei kernel, accesso alla memoria, lunghezza della sequenza, configurazione del runtime e caratteristiche del processore influenzano tutti la latenza misurata.

L'encoder LFM2.5 spiegato attraverso questo meccanismo non è un sostituto universale dei modelli basati sull'attenzione. È l'affermazione che operazioni di sequenza miste si adattino meglio ai carichi di lavoro CPU a contesto lungo.

Gli sviluppatori dovrebbero effettuare benchmark sulla propria distribuzione effettiva degli input. Un sistema dominato da messaggi brevi potrebbe privilegiare scelte architetturali diverse rispetto a uno che elabora accordi legali o lunghe trascrizioni.

Dovrebbero inoltre misurare il tempo totale della pipeline dopo il fine-tuning. Tokenizzazione, batching, teste di output, post-elaborazione e trasferimento dei dati possono modificare il vantaggio osservabile in un forward pass del solo modello.

La qualità dei benchmark è competitiva, ma le evidenze hanno dei limiti

Liquid AI presenta un pacchetto di riproducibilità credibile, ma i suoi risultati non definiscono le prestazioni in produzione su CPU, runtime o attività specializzate differenti.

L’azienda ha valutato 14 modelli su 17 attività tratte da GLUE, SuperGLUE e suite di classificazione multilingue. Ogni modello ha ricevuto un fine-tuning supervisionato completo per ciascuna attività.

Liquid AI riporta la media di cinque seed casuali separati. L’uso di più seed riduce il rischio che un’esecuzione di addestramento insolitamente favorevole determini la classifica.

Il suo encoder da 350M si è classificato quarto con una media riportata su 17 attività di 81,02. I modelli davanti erano XLM-R XL, ModernBERT-large e XLM-R large.

XLM-R XL era in testa con 83,06 e contiene 3,5 miliardi di parametri. ModernBERT-large ha ottenuto 81,68 con 395 milioni di parametri. XLM-R large ha raggiunto 81,34 con 560 milioni.

LFM2.5-Encoder-230M si è classificato sesto con 79,29. ModernBERT-base è arrivato settimo con 78,19. Queste medie supportano l’affermazione di Liquid AI secondo cui i suoi encoder restano competitivi per le loro dimensioni.

Non mostrano però una leadership costante in ogni attività. ModernBERT-base ha superato il modello LFM2.5 da 230M in diversi benchmark individuali, mentre Liquid AI era in testa in altri.

La classifica aggregata combina inoltre tipi di valutazione diversi. Le attività includono inferenza in linguaggio naturale, rilevamento di parafrasi, analisi del sentiment, similarità semantica e classificazione multilingue.

Una media aiuta a confrontare la capacità generale, ma può nascondere la metrica importante per una specifica implementazione. Un sistema per policy si preoccupa dei falsi negativi e della calibrazione, non della sua posizione in un’attività di sentiment non correlata.

Liquid AI ha pubblicato il proprio evaluation harness, migliorando la possibilità di replica. Il repository include codice di fine-tuning downstream e configurazioni associate ai confronti riportati.

Tuttavia, codice aperto non equivale a una conferma indipendente. Liquid AI ha scelto la procedura di addestramento, la configurazione di confronto, il metodo di aggregazione e l’ambiente di inferenza.

L’affermazione sulla latenza della CPU comporta la principale questione ancora senza risposta. L’articolo pubblico descrive le lunghezze delle sequenze e i tempi trascorsi, ma non identifica chiaramente la configurazione della CPU testata.

Questa omissione influenza l’interpretazione. Processori per laptop, CPU di server cloud, canali di memoria, set di istruzioni, numero di thread e limiti di potenza possono produrre comportamenti molto diversi.

Le attuali istruzioni di caricamento usano inoltre trust_remote_code=True, consentendo al codice fornito dal repository di essere eseguito tramite la libreria Transformers. Le organizzazioni con controlli software rigorosi dovranno esaminare quel codice prima della distribuzione.

La model card non presenta un percorso di distribuzione ONNX o OpenVINO maturo. Questi runtime sono spesso importanti per i team che ottimizzano l’inferenza su CPU, la quantizzazione e il serving multipiattaforma.

Le prestazioni quantizzate sono un’altra questione aperta. Il confronto pubblicato non stabilisce come LFM2.5 si comporti dopo la conversione a precisione inferiore né se lo stesso vantaggio relativo si mantenga.

La release manca anche di evidenze di produzione relative alla concorrenza sostenuta. L’elaborazione di una singola sequenza lunga misura la latenza, mentre un classificatore sempre attivo richiede throughput, latenza di coda, utilizzo della memoria e stabilità sotto carico.

Anche l’accuratezza richiede la stessa cautela. Il fine-tuning sui benchmark non stabilisce le prestazioni sui contratti di un’organizzazione, sulle regole di sicurezza, sul linguaggio dei clienti o sulle categorie di privacy.

Un team che valuta LFM2.5 rispetto a ModernBERT dovrebbe riprodurre entrambi i modelli usando hardware identico e impostazioni ottimizzate. Dovrebbe testare documenti brevi, mediani e nel caso peggiore provenienti dal carico di lavoro reale.

La valutazione dovrebbe includere i costi degli errori. Un rilevatore di PII più veloce ha scarso valore se non individua identificativi sensibili che il sistema attuale rileva. Un modello di instradamento deve inoltre evitare di inviare richieste a strumenti downstream inappropriati.

Questi limiti non invalidano la release. Definiscono la differenza tra un promettente risultato architetturale e una decisione di distribuzione.

Cosa dovrebbero osservare ora gli sviluppatori di Hugging Face

Tre segnali determineranno se questa release diventerà uno standard pratico per le CPU o resterà un interessante benchmark del fornitore.

Il primo segnale è la replica indipendente su hardware. Gli sviluppatori hanno bisogno di risultati su Apple silicon, laptop x86 comuni e processori server, con conteggi dei thread e configurazioni di memoria dichiarati.

La replica dovrebbe misurare più del solo endpoint da 8.192 token. I dataset reali contengono lunghezze miste, quindi la latenza per percentile e i documenti elaborati all’ora offrono un quadro operativo più chiaro.

Se i test indipendenti manterranno un ampio vantaggio sul contesto lungo, la tesi architetturale di Liquid AI si rafforzerà. Se il divario si ridurrà dopo un’ottimizzazione equivalente del runtime, le scelte di implementazione probabilmente spiegheranno una parte maggiore del risultato principale.

Il secondo segnale è il supporto per runtime ottimizzati. Esportazioni ONNX, integrazione OpenVINO, ricette di quantizzazione stabili e supporto per librerie native renderebbero i modelli più semplici da utilizzare oltre gli ambienti Python sperimentali.

Queste aggiunte verificherebbero anche se il backbone ibrido si adatta bene alle toolchain CPU ampiamente distribuite. Un modello che dipende dall’esecuzione eager personalizzata può incontrare ostacoli all’adozione nonostante buoni risultati nei benchmark.

Distribuzioni riuscite a 8 bit o a precisione inferiore rafforzerebbero l’argomento a favore dell’inferenza locale. Potrebbero ridurre la memoria e aumentare il throughput, mantenendo al contempo l’accuratezza delle attività entro limiti accettabili.

Il risultato opposto indebolirebbe il confronto. ModernBERT e altri encoder consolidati beneficiano di percorsi di ottimizzazione maturi, quindi la velocità dell’architettura grezza non garantisce il miglior sistema distribuito.

Il terzo segnale è l’adozione a livello di attività. I conteggi dei download di Hugging Face offrono un indicatore iniziale, ma fine-tuning pubblicati e casi di studio riproducibili contano di più.

Evidenze utili includerebbero filtri per policy misurati su regole organizzative, sistemi PII multilingue testati rispetto a identificativi realistici e router operativi con traffico applicativo sostenuto.

Gli sviluppatori dovrebbero cercare tassi di falsi positivi, tassi di falsi negativi, calibrazione, utilizzo della memoria e latenza di coda. Queste misure rivelano se il modello migliora un sistema anziché una posizione in classifica.

L’esempio di fine-tuning di Liquid AI offre ai team un punto di partenza per la classificazione. Il passo successivo sono evidenze da utenti che non hanno progettato l’architettura.

Le risposte dei concorrenti forniranno un altro indizio nell’ambito di questi segnali. Le implementazioni di ModernBERT possono ottenere kernel ottimizzati, mentre altri encoder a contesto lungo possono adottare elaborazione ibrida o sparsa.

Anche i fornitori di modelli generativi hanno margine per rispondere con endpoint di classificazione più economici. Tuttavia, i servizi remoti devono ancora affrontare vincoli di trasferimento dati, connettività e controllo locale che gli encoder on-device evitano.

Per i knowledge worker, questo sviluppo potrebbe rendere l’organizzazione locale dei documenti più reattiva e privata. Contratti, trascrizioni, note e cronologie di assistenza possono essere classificati prima che qualsiasi testo lasci un ambiente controllato.

Per gli acquirenti aziendali, la release pone una domanda di approvvigionamento più netta. Ogni attività linguistica richiede ragionamento generativo, oppure un encoder specializzato può fornire la decisione necessaria con minori esigenze infrastrutturali?

Per gli sviluppatori, la risposta corretta è la misurazione. Create un set di test rappresentativo, definite soglie di accuratezza, registrate la distribuzione delle lunghezze di input e confrontate pipeline complete sull’hardware di distribuzione.

Hugging Face rende questo esperimento accessibile perché entrambe le varianti LFM2.5 e i relativi materiali di supporto sono disponibili in un unico luogo. L’accessibilità, tuttavia, non dovrebbe sostituire la validazione.

Liquid AI ha proposto una chiara tesi tecnica: la comprensione del contesto lungo può rimanere sulle CPU quando un’architettura limita il lavoro ripetuto di attenzione completa. I suoi benchmark offrono a questa tesi un supporto iniziale credibile.

La questione irrisolta è se le distribuzioni indipendenti riprodurranno il vantaggio dopo che ogni modello avrà ricevuto un’ottimizzazione equivalente. Questa domanda dovrebbe guidare la prossima ondata di test, fine-tuning e report di produzione.

Se il vostro team elabora continuamente documenti lunghi, confrontate LFM2.5 con l’encoder che già serve il vostro carico di lavoro. Usate documenti reali, hardware dichiarato e misure di errore specifiche per l’attività.

L’esito più importante non sarà un altro punteggio medio nei benchmark. Sarà la prova che un piccolo encoder può esaminare l’intero contesto di lavoro, soddisfare i requisiti di accuratezza ed eseguire in modo prevedibile dove risiedono i dati.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page