Holo4: alimentare agenti generalisti per l'uso del computer, ma il divario nei benchmark conta ancora
Holo4 è arrivato il 28 settembre con due modelli, quattro modalità di interazione e una sfida diretta ai sistemi specializzati per l'uso del computer. H Company descrive Holo4: alimentare agenti generalisti per l'uso del computer come una famiglia di modelli in grado di navigare gli schermi, eseguire codice e richiamare strumenti software.
Il rilascio è significativo perché l'automazione informatica raramente resta confinata a una sola interfaccia. Un processo aziendale può iniziare in un browser, proseguire tramite un'API e terminare in un software desktop privo di integrazioni moderne. La maggior parte dei sistemi ad agenti gestisce questa transizione combinando modelli, strumenti e cicli di controllo diversi.
Holo4 propone una strada più semplice. Lo stesso modello può scegliere tra interfacce grafiche, codice, strumenti Model Context Protocol e API. MCP è uno standard che consente ai sistemi di IA di accedere a strumenti e dati esterni tramite connessioni strutturate.
Questa promessa contrappone Holo4 a un'architettura specialistica, non semplicemente a un altro fornitore di modelli. L'approccio specialistico assegna modelli o policy differenti alla navigazione visiva, alla programmazione e al richiamo di strumenti. H Company sostiene che un unico generalista addestrato possa coordinare queste superfici in modo più efficiente.
L'azienda ha inoltre reso disponibili per l'ispezione migliaia di traiettorie di benchmark. Questa trasparenza offre agli sviluppatori più elementi di valutazione rispetto al solo punteggio in una classifica. Non risolve però i dubbi su affidabilità, sicurezza o prestazioni nelle organizzazioni reali.
Holo4: alimentare agenti generalisti per l'uso del computer attraverso quattro interfacce
Il cambiamento centrale è architetturale: Holo4 considera l'interfaccia una scelta interna al compito, anziché un confine fisso attorno all'agente.
Secondo il rilascio di Holo4, la famiglia include un modello denso da 27 miliardi di parametri e un modello mixture-of-experts da 35 miliardi di parametri. Quest'ultimo attiva circa tre miliardi di parametri per ciascun passaggio di inferenza.
Un modello mixture-of-experts instrada gli input attraverso componenti interni selezionati anziché attivare ogni parametro. Questo design può ridurre il calcolo, anche se la velocità effettiva dipende da hardware, software e scelte di deployment.
Entrambi i modelli Holo4 possono interagire con interfacce utente grafiche, scrivere ed eseguire codice e richiamare strumenti MCP o API. H Company afferma che lo stesso modello possa operare su desktop, siti web, dispositivi Android, sandbox di programmazione e sistemi aziendali.
Questo differisce da un agente che predice soltanto clic del mouse a partire da screenshot. Differisce anche da un modello di tool calling che diventa inefficace quando un'applicazione non dispone di un'API. Holo4 è progettato per cambiare metodo al variare di un flusso di lavoro.
Si consideri una normale operazione finanziaria. Un agente potrebbe estrarre campi da un documento, normalizzarli con il codice, inviarli tramite un'API e verificare il risultato sullo schermo. Un software enterprise datato potrebbe imporre un ulteriore passaggio al controllo tramite mouse e tastiera.
Un modello generalista potrebbe mantenere un unico processo decisionale lungo queste fasi. Uno stack specialistico instraderebbe di norma ogni fase verso un modello, una policy o un servizio distinto. Questo instradamento può migliorare il controllo, ma introduce anche più passaggi di consegna e punti di errore.
H Company afferma di aver addestrato Holo4 tramite apprendimento supervisionato e reinforcement learning in ambienti interattivi generati. Secondo quanto riportato, la sua task factory interna ha creato circa 10.000 compiti che coprono applicazioni web, desktop, server MCP e ambienti ibridi.
Questi compiti generati sono importanti perché esempi statici non possono riprodurre le conseguenze delle azioni di un agente. Un ambiente interattivo può verificare se un clic ha modificato lo stato, se il codice è stato eseguito o se una chiamata API ha prodotto il record previsto.
L'approccio consente inoltre a H Company di generare compiti a partire da documentazione e screenshot. Questo potrebbe ampliare la copertura dell'addestramento senza progettare manualmente ogni flusso di lavoro. Tuttavia, gli ambienti generati possono comunque differire dai sistemi di produzione, spesso disordinati e caratterizzati da autorizzazioni, ritardi e stati imprevisti.
Il rilascio include un modello Holotron4 Nano aggiornato accanto alle due varianti principali di Holo4. Offre inoltre i pesi dei modelli in vari formati, tra cui BF16, FP8, NVFP4 e GGUF a quattro bit.
La disponibilità in questi formati offre agli sviluppatori varie opzioni di deployment. Tuttavia, l'affermazione più rilevante rimane che un singolo modello possa coordinare più interfacce senza un livello esterno di selezione del modello.
Questo rende Holo4: alimentare agenti generalisti per l'uso del computer una prova per verificare se la generalità delle interfacce possa ridurre la complessità del sistema senza sacrificare la precisione offerta dagli agenti specialistici.
Perché i flussi di lavoro lunghi mettono sotto pressione gli stack di agenti specialistici
Holo4 mette sotto pressione gli stack specialistici perché i flussi di lavoro lunghi moltiplicano il costo di ogni decisione di instradamento, passaggio di contesto e fase di recupero.
Un breve compito nel browser può nascondere debolezze architetturali. Un agente potrebbe aprire una pagina, inserire un valore e inviare un modulo. Anche un sistema fragile talvolta riesce a completare questa sequenza.
Il lavoro professionale è diverso. Coinvolge più applicazioni, stato persistente, istruzioni ambigue e informazioni che emergono durante l'esecuzione. Un agente deve ricordare vincoli precedenti adattandosi agli eventi successivi.
OSWorld 2.0 è stato progettato attorno a questo contesto più difficile. I suoi ricercatori hanno assemblato 108 flussi di lavoro a lungo orizzonte, che spaziano tra attività quotidiane e professionali. A un essere umano esperto serve una mediana di circa 1,6 ore per completare ciascun compito.
Il benchmark riporta che gli agenti di punta possono raggiungere in media oltre 300 passaggi per flusso di lavoro. I compiti di OSWorld 1.0 richiedevano circa 30 passaggi, rendendo il benchmark più recente un test molto più severo della gestione del contesto.
I fallimenti vanno inoltre oltre i clic imprecisi. I ricercatori hanno osservato agenti perdere vincoli, ignorare informazioni in arrivo, fare supposizioni quando era necessario chiedere chiarimenti e saltare le verifiche. Queste debolezze possono accumularsi durante un processo lungo.
H Company afferma di aver ricostruito l'harness dell'agente Holo4 in risposta a questi problemi. Un harness è il ciclo di esecuzione che fornisce osservazioni, gestisce il contesto, esegue azioni e restituisce risultati al modello.
Le sue due aggiunte più rilevanti sono state una memoria persistente per centinaia di passaggi e una shell eseguita sul computer desktop. La shell offre all'agente una strada basata sul codice quando l'interazione diretta con la GUI diventa inefficiente.
È qui che il design generalista diventa più di un elenco di funzionalità. Il modello può decidere che analizzare un file locale con il codice sia preferibile alla lettura visiva. Può poi tornare all'interfaccia per azioni che richiedono una conferma visiva.
Uno stack specialistico può eseguire la stessa sequenza. Tuttavia, deve decidere quando trasferire il controllo e quanto contesto accompagnare in ogni trasferimento. Una scelta di instradamento errata può sprecare passaggi o scartare informazioni.
Holo4 cerca di collocare questa decisione all'interno del modello addestrato. Se l'approccio funziona in modo coerente, gli sviluppatori potrebbero ridurre la logica necessaria per coordinare controllo del browser, controllo desktop, esecuzione del codice e strumenti strutturati.
Questo non elimina l'orchestrazione. I sistemi di produzione necessitano ancora di gestione delle credenziali, sandboxing, tentativi ripetuti, logging e controlli di approvazione. Hanno inoltre bisogno di un modo affidabile per fermare un agente prima che un'azione incerta causi danni.
Il cambiamento è più circoscritto, ma resta significativo. Gli sviluppatori potrebbero dedicare meno impegno a decidere quale modello debba gestire ciascuna interfaccia. Potrebbero concentrarsi maggiormente sulla definizione delle autorizzazioni, la convalida degli output e la misurazione di flussi di lavoro completi.
Questa distinzione è importante per i team che creano una base di conoscenza ricercabile. I loro flussi di lavoro attraversano spesso documenti locali, ricerca interna, strumenti browser e sistemi aziendali strutturati.
Holo4 non dimostra che i generalisti sostituiranno ogni specialista. Rende l'instradamento specialistico una scelta progettuale che gli sviluppatori devono giustificare, anziché una base inevitabile.
Un modello di agente è più semplice, ma gli specialisti stabiliscono ancora lo standard di affidabilità
La sfida principale vede un unico modello generalista contrapposto a uno stack coordinato di specialisti, con l'affidabilità a determinare quale architettura prevalga.
Gli specialisti offrono un vantaggio intuitivo. Un modello addestrato specificamente per il grounding visivo può concentrarsi sull'individuazione dei controlli. Un modello di programmazione può concentrarsi su sintassi, esecuzione e debugging senza dover interpretare ogni screenshot.
Anche i modelli di tool calling beneficiano di schemi strutturati. Un'API espone azioni consentite e campi prevedibili. Un'interfaccia grafica offre più flessibilità, ma pulsanti, layout e stati transitori creano ambiguità.
L'approccio specialistico consente agli ingegneri di selezionare il modello migliore per ciascuna superficie. Può inoltre isolare capacità rischiose. Un agente visivo potrebbe ricevere accesso allo schermo senza ottenere l'esecuzione arbitraria della shell.
Tuttavia, la specializzazione trasferisce la complessità al sistema circostante. Un router deve classificare ogni fase, scegliere un componente e preservare l'intento dell'utente durante i passaggi di consegna. Lo stack deve riconciliare formati di contesto e segnali di errore diversi.
L'approccio generalista di Holo4 trasferisce parte di questo coordinamento nel modello. L'agente può osservare uno schermo, riconoscere che la manipolazione diretta è inefficiente e utilizzare invece codice o uno strumento strutturato.
H Company illustra questo approccio con compiti su software professionale. In un esempio, secondo quanto riportato, Holo4 27B ha usato 68 chiamate e 2,4 milioni di token per creare un gioco autonomo in Godot. La sua base Qwen ha usato 197 chiamate e 11,4 milioni di token con lo stesso prompt e harness.
Questi dati provengono dalla valutazione di H Company, non da un laboratorio indipendente. Descrivono un singolo compito anziché le prestazioni medie in produzione. Mostrano comunque il tipo di efficienza che l'azienda intende offrire con Holo4.
Altri esempi riguardano la costruzione di oggetti dettagliati in FreeCAD. Questi flussi di lavoro combinano interpretazione spaziale, controllo del software e generazione di codice. Sono più impegnativi della compilazione di un singolo modulo web.
Gli esempi rivelano anche un limite. Secondo quanto riportato, il compito della Torre Eiffel di Holo4 ha richiesto 84 chiamate e 1,3 milioni di token. Le lunghe sessioni di utilizzo del computer possono restare onerose dal punto di vista computazionale anche quando il risultato finale ha successo.
Gli specialisti mantengono un altro vantaggio quando il flusso di lavoro è prevedibile. Uno script deterministico o una stretta integrazione API può essere più rapido e più facile da sottoporre ad audit rispetto a un agente che sceglie tra diverse azioni possibili.
Il caso generalista diventa più forte quando i flussi di lavoro variano, le interfacce cambiano o i sistemi legacy non dispongono di integrazioni. Il caso specialistico resta più forte quando le organizzazioni richiedono ripetibilità e possono definire il processo con precisione.
Ciò significa che Holo4 difficilmente eliminerà l'automazione convenzionale. Compete invece per l'incerto terreno intermedio in cui gli script fissi si interrompono, ma gli agenti frontier senza restrizioni restano troppo costosi o difficili da governare.
Gli sviluppatori dovrebbero quindi valutare compiti completi, non clic isolati. La domanda rilevante è se Holo4 riduca fallimenti e carico ingegneristico nei flussi di lavoro reali.
Un modello che raggiunge lo stato finale corretto tramite meno passaggi di consegna può giustificare una precisione grezza inferiore in una capacità ristretta. Un generalista che cambia metodo in modo imprevedibile può creare un maggiore carico di debugging.
Il risultato dipenderà dalla qualità delle traiettorie, dalla riproducibilità e dal comportamento di recupero. Questi fattori contano più del fatto che un'architettura appaia più pulita in un diagramma.
I risultati dei benchmark di Holo4 richiedono i rispettivi harness e le note a piè di pagina
I risultati di Holo4 sono degni di nota, ma il rilascio stesso spiega perché diversi confronti da titolo non sono direttamente equivalenti.
H Company riferisce che Holo4 27B ha ottenuto il 61,7% su OSWorld 2.0. Il suo modello 35B-A3B ha raggiunto il 30,9%. L’azienda confronta questi risultati con l’81,8% di Opus 5.5.
Il divario di 20,1 punti tra Holo4 27B e Opus 5.5 è significativo. Holo4 non supera il più forte modello chiuso secondo questa metrica riportata. La sua argomentazione si concentra sulle dimensioni del modello, sulla flessibilità di implementazione e sul costo stimato per attività.
H Company cita inoltre punteggi del 70,2% per Opus 5 e del 66,2% per GPT-5.6 Sol. Questi riferimenti utilizzano ricompense parziali a sforzo massimo su un set offline di OSWorld 2.0 datato 8 agosto 2026.
Il rilascio avverte che versioni dei modelli, harness e sottoinsiemi di attività variano. Questa precisazione dovrebbe accompagnare ogni confronto. Le prestazioni degli agenti dipendono da molto più del checkpoint del modello.
L’harness controlla memoria, accesso agli strumenti, formattazione delle osservazioni, comportamento dei tentativi ripetuti e numero massimo di passaggi. Modificare una qualsiasi di queste variabili può alterare il risultato, anche quando il modello sottostante resta invariato.
I grafici dei costi richiedono analoga cautela. H Company ha stimato le spese in base ai token di input e output utilizzati durante ciascuna esecuzione. Ha calcolato Holo4 secondo le proprie tariffe API e ha usato prezzi di listino esterni per gli altri modelli.
Stime di questo tipo possono sostenere la pianificazione interna, ma non sono misurazioni economiche controllate. Ipotesi di caching, infrastruttura di inferenza, tentativi ripetuti e sconti sui volumi possono modificare i costi effettivi di implementazione.
AutomationBench introduce un ulteriore problema di comparabilità. H Company ha valutato Holo4 e i suoi baseline Qwen usando la versione 1.0.6 nel proprio harness interno. I punteggi degli altri modelli provenivano dal set pubblico del benchmark.
Le cifre di costo citate per gli altri modelli provenivano da una leaderboard eseguita su un set privato. H Company afferma di voler riportare Holo4 su tale valutazione privata dopo aver effettuato i test.
Fino ad allora, i lettori non dovrebbero considerare tutti i punti di AutomationBench come risultati di un unico esperimento controllato. Rappresentano misurazioni correlate prodotte in condizioni differenti.
Persino le definizioni dei benchmark possono orientare una narrazione. OSWorld 2.0 supporta sia il completamento binario sia il punteggio a credito parziale. Un modello può ricevere un credito parziale significativo pur non riuscendo a completare un flusso di lavoro.
Ciò non rende inutile il punteggio parziale. Può rilevare progressi in attività lunghe, per le quali il successo binario nasconderebbe i miglioramenti. Tuttavia, gli acquirenti tengono conto del fatto che il record finale, il file o la transazione siano corretti.
L’efficienza richiede inoltre più dei soli conteggi di token. Una ricerca sull’efficienza degli agenti ha rilevato che, nella propria valutazione, i principali agenti per l’uso del computer compivano da 1,4 a 2,7 volte più passaggi del necessario.
La stessa ricerca ha riscontrato che i passaggi successivi possono richiedere molto più tempo di quelli iniziali. Le chiamate di pianificazione e riflessione rappresentavano gran parte della latenza. Una lunga traccia dell’agente può quindi amplificare i ritardi oltre il numero visibile di azioni.
Questi risultati rafforzano l’attenzione di H Company verso memoria e accesso alla shell. Mostrano anche perché un punteggio positivo in un benchmark non produca automaticamente un’esperienza utente accettabile.
La lettura corretta non è né il rigetto né l’accettazione. Holo4 registra un risultato competitivo riportato dall’azienda per un modello relativamente compatto, pur restando dietro al principale sistema chiuso.
Il test pratico è se tali risultati persistano in harness indipendenti, valutazioni private e flussi di lavoro contenenti autorizzazioni e dati specifici dell’organizzazione.
Le traiettorie aperte migliorano la verifica, non la sicurezza
La mossa più credibile di H Company è pubblicare le tracce dietro i suoi punteggi, anche se un comportamento ispezionabile non è automaticamente un comportamento sicuro.
Il dataset delle traiettorie contiene 7.366 esecuzioni di Holo4 27B e Holo4 35B-A3B. Ogni traccia può includere attività, ragionamento, azioni, risultati degli strumenti, screenshot, durata, passaggi e punteggio finale.
La raccolta include oltre 2.100 esecuzioni OSWorld tra i due modelli. Contiene inoltre 212 esecuzioni OSWorld 2.0 e quasi 3.200 esecuzioni AutomationBench.
Ulteriori tracce coprono AndroidWorld, PinchBench e Agents’ Last Exam. H Company consente agli utenti di scaricare il dataset o riprodurre le tracce tramite un visualizzatore dedicato.
Questa divulgazione offre ai ricercatori diversi modi per contestare le conclusioni dell’azienda. Possono verificare se un’esecuzione riuscita abbia seguito un percorso ragionevole, ripetuto azioni non necessarie o tratto vantaggio da scorciatoie specifiche dell’attività.
Possono anche esaminare i modelli di fallimento. Un punteggio aggregato non può mostrare se l’agente abbia frainteso l’istruzione, fatto clic sul bersaglio sbagliato, perso il contesto o interrotto l’esecuzione prima della verifica.
Le traiettorie aperte possono rivelare se i miglioramenti prestazionali derivino da un ragionamento migliore o da un harness più permissivo. Possono inoltre aiutare i team a stimare quanto spesso potrebbe essere necessario l’intervento umano.
Tuttavia, la trasparenza dopo l’esecuzione è diversa dal controllo prima dell’esecuzione. Una traccia aiuta gli investigatori a capire cosa sia accaduto. Non impedisce a un agente di inviare dati, eliminare file o seguire istruzioni malevole.
Gli agenti per l’uso del computer affrontano rischi che i sistemi di chat convenzionali evitano. Operano in ambienti contenenti contenuti non affidabili e credenziali di valore. Una pagina web può inserire testo avversario direttamente nell’osservazione del modello.
Il benchmark OS-Harm testa l’uso improprio deliberato, la prompt injection e il comportamento involontario del modello in 150 attività. I suoi ricercatori hanno rilevato comportamenti non sicuri rilevanti in diversi sistemi di frontiera.
Quello studio non ha valutato Holo4, quindi i suoi risultati non possono stabilire la sicurezza di Holo4. Dimostra però che il controllo competente del computer e il controllo sicuro del computer sono problemi di valutazione distinti.
Il rischio diventa più netto quando un modello dispone di un ampio accesso alle interfacce. Un generalista può passare dalla lettura di una pagina web all’esecuzione di codice o alla chiamata di un’API. Questa flessibilità aumenta l’utilità e il possibile impatto di un errore.
Le aziende avranno bisogno di controlli stratificati indipendentemente dai punteggi dei benchmark. Tali controlli includono credenziali con ambito limitato, esecuzione isolata, accesso di rete ristretto, azioni reversibili e approvazione umana per i passaggi rilevanti.
Avranno inoltre bisogno di log che colleghino ogni azione all’istruzione dell’utente e allo stato osservato in quel momento. Il formato delle traiettorie di Holo4 offre un modello utile per tali registri di audit.
Anche le licenze meritano attenzione. I pesi aperti non garantiscono diritti commerciali identici per ogni checkpoint o componente. I team dovrebbero esaminare ogni model card e dipendenza prima dell’implementazione.
Lo stesso vale per la governance dei dati. Screenshot e tracce degli agenti possono acquisire informazioni personali, record dei clienti o documenti riservati. Registrare tutto può migliorare il debug, creando al contempo un altro dataset sensibile.
H Company afferma che credenziali, host interni e dati personali sono stati mascherati nel rilascio pubblico delle traiettorie. Gli operatori di produzione devono predisporre controlli equivalenti di redazione e conservazione per le proprie tracce.
Il dataset aperto alza l’asticella per i futuri lanci. I fornitori che rivendicano prestazioni superiori nell’uso del computer hanno ora un esempio più chiaro di come possano apparire prove riproducibili.
Tuttavia, il lavoro esterno più prezioso riguarderà replay avversari, punteggi indipendenti e test al di fuori dell’harness di H Company. La trasparenza apre questo processo; non lo completa.
Tre segnali mostreranno se la scommessa generalista di Holo4 regge
La fase successiva dovrebbe essere giudicata attraverso riproduzioni indipendenti, risultati di benchmark privati e prove provenienti da flussi di lavoro in produzione.
Il primo segnale è la riproduzione indipendente delle prestazioni di Holo4 su OSWorld 2.0. I ricercatori devono eseguire i pesi rilasciati con infrastruttura, prompt, limiti di passaggi e regole di punteggio documentati.
Raggiungere il 61,7% riportato rafforzerebbe l’affermazione di H Company secondo cui è il modello stesso a portare questa capacità. Grandi differenze suggerirebbero che l’harness dell’azienda contribuisce più di quanto il titolo lasci intendere.
La riproduzione dovrebbe inoltre confrontare completamento binario, credito parziale, passaggi, latenza e tassi di intervento. Un singolo punteggio non può catturare se un agente raggiunga un risultato utilizzabile entro limiti pratici.
Le traiettorie rilasciate rendono questo lavoro più realizzabile. I ricercatori possono partire da esecuzioni note, esaminare i confini del fallimento e confrontare harness alternativi sulle stesse attività.
Il secondo segnale è il risultato di Holo4 su AutomationBench privato. Il rilascio riconosce che i suoi punteggi attuali derivano da un’esecuzione interna sul set pubblico, mentre i costi di confronto fanno riferimento a una leaderboard su set privato.
Una valutazione privata creerebbe un confronto più pulito e ridurrebbe le preoccupazioni legate all’ottimizzazione rispetto ad attività visibili. Testerebbe inoltre se Holo4 generalizza attraverso flussi API non familiari.
Il risultato dovrebbe includere più di un tasso di successo. Gli sviluppatori hanno bisogno di costi, uso dei token, tentativi ripetuti, latenza e categorie di fallimento in un’unica configurazione di valutazione documentata.
Il terzo segnale consiste in prove di produzione credibili provenienti da flussi di lavoro a interfacce miste. I casi migliori riguarderebbero attività che richiedono realmente GUI, codice e strumenti strutturati in un’unica sessione.
Una reportistica utile mostrerebbe il completamento senza correzione umana, il recupero da modifiche dell’interfaccia e le prestazioni con autorizzazioni limitate. Dovrebbe inoltre conteggiare gli errori irreversibili, non solo le esecuzioni riuscite.
Un flusso di elaborazione delle spese offre un test rappresentativo. L’agente deve leggere documenti, convalidare campi, interagire con software aziendale e confermare che i record abbiano raggiunto lo stato previsto.
Un altro test solido coinvolgerebbe operazioni ingegneristiche tra file locali, tracker di issue, console del browser e strumenti da riga di comando. Questi flussi di lavoro mostrano se il contesto condiviso sia un vantaggio o una fonte di comportamento incontrollato.
Gli aggiornamenti del modello forniranno un segnale correlato. H Company afferma che sono previsti checkpoint di drafter ottimizzati per accelerare l’inferenza. Riduzioni misurate della latenza rafforzerebbero il caso economico dell’architettura generalista.
Anche le risposte dei concorrenti contano, ma restano prove di supporto. I fornitori di modelli chiusi possono migliorare l’uso del computer, mentre gli sviluppatori di modelli aperti possono aggiungere un addestramento più ampio sugli strumenti alle proprie versioni.
La domanda centrale non è se Holo4 resti davanti a ogni alternativa. È se un singolo modello generalista offra un rapporto affidabilità-complessità migliore rispetto a uno stack di specialisti.
Per gli sviluppatori, l’opportunità immediata è una valutazione controllata. Usate attività rappresentative, credenziali ristrette e ambienti reversibili. Misurate i risultati completati anziché azioni isolate del modello.
Per gli acquirenti aziendali, la domanda di procurement dovrebbe includere l’harness. Chiedete quale componente gestisce memoria, approvazioni, tentativi ripetuti, segreti, log di audit e recupero dopo un’esecuzione parziale.
Per i knowledge worker, il rilascio suggerisce che gli agenti attraverseranno un numero maggiore di confini tra applicazioni. Questa comodità rende anche più importanti la progettazione delle autorizzazioni e la conferma visibile.
Holo4: potenziare gli agenti generalisti per l’uso del computer è quindi meno una dichiarazione di vittoria che una concreta sfida architetturale. H Company ha fornito modelli, affermazioni e tracce insolitamente dettagliate.
La prossima mossa spetta ai valutatori indipendenti e ai team di implementazione. Holo4 può riprodurre i risultati riportati, affrontare attività non familiari e completare lavoro reale senza ampliare il rischio operativo?
Questi tre test determineranno se gli agenti generalisti per l’uso del computer semplificheranno l’automazione oppure sposteranno semplicemente i suoi problemi più difficili.



