I dati di Anthropic e a16z dicono che gli agenti superano gli esseri umani, ma il benchmark nasconde una realtà più difficile
I dati di Anthropic e a16z collocano ora Claude Fable 5 all'85% su OSWorld-Verified, al di sopra del punteggio umano del 72,36% ampiamente citato. Un anno prima, il miglior punteggio riportato per un agente era vicino al 42%. Questa crescita suggerisce che gli agenti per l'uso del computer abbiano superato una soglia che fino a poco tempo fa sembrava lontana.
Il confronto porta con sé anche una nota importante. Il punteggio umano proviene dallo studio originale su OSWorld, mentre il risultato dell'85% usa la valutazione rivista OSWorld-Verified. Questi numeri descrivono test correlati, ma non costituiscono una gara controllata tra Claude Fable 5 e le persone.
La distinzione è importante perché gli agenti informatici stanno passando dalle dimostrazioni ai flussi di lavoro in cui gli errori comportano conseguenze. OpenAI, Google, Anthropic e sviluppatori specializzati vogliono che gli agenti operino su browser, applicazioni desktop e sistemi aziendali. Un punteggio elevato cambia le aspettative degli acquirenti, anche quando non risolve la questione se questi sistemi possano gestire una normale giornata lavorativa.
I dati di Anthropic e a16z mostrano un notevole balzo in un anno
Il cambiamento più importante non è che un singolo modello abbia raggiunto l'85%. È che un benchmark difficile per l'uso del computer è migliorato da circa il 42% all'85% in un solo anno.
La classifica degli agenti informatici evidenziata da a16z registra un netto aumento su OSWorld-Verified. Claude Fable 5 guida i risultati riportati con l'85%. Il grafico presenta l'interazione con il computer come una delle aree in più rapida evoluzione dell'AI applicata.
OSWorld verifica se un agente riesce a completare attività in ambienti software reali. Invece di rispondere a una domanda, l'agente deve ispezionare uno schermo e decidere cosa fare. Esegue poi azioni tramite interfacce che ricordano i controlli di mouse e tastiera.
Un'attività potrebbe richiedere di modificare un documento, cambiare un'impostazione dell'applicazione, gestire file o spostare informazioni tra programmi. Il successo dipende da molto più della generazione del linguaggio. L'agente deve identificare gli elementi dell'interfaccia, preservare lo stato, pianificare più passaggi e riconoscere se le sue azioni hanno funzionato.
Il benchmark OSWorld originale conteneva 369 attività che coinvolgevano applicazioni come Chromium, LibreOffice, Thunderbird, GIMP, VLC e Visual Studio Code. Otto attività di Google Drive potevano essere escluse perché richiedevano una configurazione manuale, producendo una valutazione su 361 attività.
I ricercatori hanno riportato un tasso di successo del 12,24% per il miglior modello quando hanno introdotto il benchmark nel 2024. Partecipanti umani non familiari con il software hanno completato il 72,36% delle attività. Questo enorme divario ha reso OSWorld un test utile perché ha evidenziato debolezze nascoste dai benchmark conversazionali.
Gli agenti faticavano con il grounding dell'interfaccia grafica utente, ovvero il collegamento tra un obiettivo visivo e la corretta posizione sullo schermo. Mancavano inoltre di conoscenze operative sul comportamento delle applicazioni. Un modello poteva comprendere l'istruzione e tuttavia fare clic sul controllo sbagliato o perdere traccia di una finestra di dialogo.
Il successivo progetto OSWorld-Verified ha affrontato attività difettose o instabili nella raccolta originale. La manutenzione del benchmark è importante perché i siti web cambiano, le applicazioni si aggiornano e gli script di valutazione possono interpretare erroneamente risultati validi. Un test più pulito può misurare gli agenti in modo più coerente.
Tuttavia, modificare un benchmark cambia anche il significato dei suoi punteggi. Rimuovere le attività difettose migliora la validità, ma impedisce un semplice confronto storico a meno che ogni sistema precedente non venga rieseguito in condizioni identiche. Anche le impostazioni degli agenti, i limiti delle azioni, la risoluzione dello schermo e gli harness di valutazione devono coincidere.
Per questo la linea dal 42% all'85% va interpretata soprattutto come un segnale di rapido progresso. Non è una stima controllata secondo cui gli agenti siano diventati esattamente due volte più capaci. La tendenza è forte, mentre la sua entità precisa resta incerta.
La cifra dell'85% resta comunque rilevante. I sistemi per l'uso del computer devono tradurre ripetutamente osservazioni visive in azioni, quindi gli errori si accumulano lungo una traiettoria. Aumentare i tassi di completamento richiede miglioramenti nella percezione, nel ragionamento, nella memoria e nel recupero dagli errori.
Questo rende il risultato più ampio di un aggiornamento sulla qualità del modello. Indica che gli sviluppatori stanno migliorando nell'assemblare l'intero ciclo di esecuzione. Modelli migliori aiutano, ma anche prompt, rappresentazioni dello schermo, passaggi di riflessione e componenti specializzati per il grounding influenzano il risultato.
Il confronto tra Anthropic e a16z coglie quindi un cambiamento reale. Gli agenti per l'uso del computer non falliscono più quasi automaticamente nelle normali attività desktop. La domanda più difficile è se superare un benchmark ora predica un lavoro affidabile al di fuori del suo ambiente controllato.
Il titolo sulle prestazioni a livello umano combina due test diversi
Claude Fable 5 sembra superare una celebre linea di base umana, ma le prove disponibili non stabiliscono un confronto equivalente tra esseri umani e agenti.
Il dato del 72,36% proviene da test umani condotti per l'articolo originale su OSWorld. Il dato dell'85% è associato a OSWorld-Verified, un insieme di attività e un processo di valutazione rivisti. Trattarli come intercambiabili elimina il contesto metodologico alla base di entrambi i numeri.
Anche la parola “umano” richiede una precisazione. Lo studio originale ha testato persone che non avevano familiarità con il software. Il loro punteggio non rappresentava un limite teorico delle prestazioni umane. Utenti esperti, più tempo o un onboarding più chiaro potrebbero produrre un risultato diverso.
Il punteggio dell'agente dipende anche dalle sue condizioni operative. Le valutazioni dell'uso del computer possono variare per risoluzione dello schermo, cronologia delle azioni disponibile, numero massimo di passaggi, politica di tentativi e budget di ragionamento. Un agente a cui è consentita più inferenza o riflessione può completare più attività, consumando però più tempo e risorse computazionali.
I tassi di superamento possono inoltre essere riportati su un singolo tentativo o su più tentativi. Un sistema che riesce una volta in più esecuzioni offre un'esperienza di prodotto diversa da uno che riesce in modo affidabile al primo tentativo. L'automazione aziendale richiede di solito il secondo comportamento.
Un'altra questione riguarda i dati sulle traiettorie. Le attività del benchmark e le tracce di interazione riuscite possono influenzare l'addestramento successivo dei modelli o la progettazione degli agenti. L'esposizione non invalida automaticamente un risultato, ma indebolisce l'affermazione che un punteggio misuri una competenza informatica generale.
Il team originale di OSWorld ha rilevato che una cronologia testuale più lunga delle traiettorie migliorava le prestazioni. Tale cronologia offriva agli agenti più informazioni sulle decisioni precedenti. Tuttavia, creava anche problemi di efficienza con l'espansione del contesto di ragionamento.
Anche la risoluzione dello schermo era importante. Screenshot a risoluzione più elevata miglioravano generalmente i risultati perché i modelli potevano individuare con maggiore precisione i piccoli controlli. La scoperta mostra perché due valutazioni nominalmente simili possono produrre punteggi diversi quando i loro ambienti non sono allineati.
Un punteggio dell'85% lascia inoltre un tasso di fallimento significativo. Su 361 attività, un tasso di fallimento del 15% corrisponderebbe a circa 54 attività non riuscite se ogni attività avesse lo stesso peso. Questa stima illustra il divario operativo, anche se i protocolli di benchmark riportati possono aggregare le esecuzioni in modo diverso.
Per un esperimento destinato ai consumatori, un fallimento occasionale può essere tollerabile. Per le buste paga, la conformità, l'amministrazione degli account o i registri dei clienti, il fallimento in un'attività su sette è un vincolo di implementazione. Il costo dipende dal fatto che il sistema si fermi in sicurezza o lasci dietro di sé uno stato errato.
Questo non rende il benchmark privo di significato. OSWorld-Verified misura qualcosa di importante: se un agente sia in grado di eseguire un'istruzione delimitata in un ambiente informatico configurato. Offre una sfida più realistica rispetto alla risposta a domande statiche.
Il problema inizia quando il successo in quel test diventa un'affermazione di autonomia generale sul posto di lavoro. Il lavoro reale contiene richieste poco chiare, sessioni interrotte, autorizzazioni che cambiano, informazioni mancanti e conseguenze che non possono essere azzerate con una nuova macchina virtuale.
Le persone sanno anche quando le istruzioni sono in conflitto con il contesto. Chiedono chiarimenti, notano cambiamenti sospetti e apportano conoscenze esterne a un'attività. Gli agenti informatici spesso ottimizzano per completare l'istruzione apparente, anche quando l'azione corretta sarebbe fermarsi.
Il titolo di anthropic a16z è quindi utile in termini direzionali, ma fragile dal punto di vista numerico. Ci dice che Claude Fable 5 e il sistema di agenti che lo circonda possono completare molte attività desktop standardizzate. Non dimostra che il sistema sia più capace di un dipendente esperto nei flussi di lavoro reali.
Un'affermazione più rigorosa sulle prestazioni a livello umano richiederebbe che esseri umani e agenti affrontassero le stesse attività verificate con limiti comparabili. I ricercatori dovrebbero riportare completamento, tempo, tentativi, interventi ed errori dannosi. Senza questi controlli, l'85% contro il 72,36% resta un confronto accattivante tra misurazioni correlate.
Gli agenti informatici mettono ora sotto pressione ogni strategia di automazione
Il punteggio mette sotto pressione le aziende che hanno costruito l'automazione attorno ad API, script e flussi di lavoro fissi, perché gli agenti a livello di interfaccia possono raggiungere software a cui tali metodi non arrivano.
L'automazione tradizionale funziona al meglio quando un sistema espone interfacce strutturate. Gli sviluppatori collegano un'interfaccia di programmazione delle applicazioni, o API, a un altro servizio. Gli strumenti di automazione robotica dei processi seguono invece passaggi e regole dell'interfaccia predefiniti.
Entrambi gli approcci possono essere efficaci, ma il lavoro di integrazione crea attrito. Alcuni strumenti interni non dispongono di API. Il software più datato può esporre interfacce incomplete, mentre piccole modifiche al flusso di lavoro possono richiedere a uno sviluppatore o a un consulente di ricostruire l'automazione.
Un agente per l'uso del computer offre un'altra strada. Interpreta gli stessi schermi che vede una persona, poi agisce attraverso l'interfaccia esistente. In teoria, questo consente a un'organizzazione di automatizzare il software senza aspettare che ogni fornitore offra un'integrazione dedicata.
Anthropic ha introdotto la propria capacità di uso del computer attorno a questa idea. La sua documentazione sull'uso del computer descrive un ciclo in cui un'applicazione fornisce screenshot ed esegue le azioni di mouse o tastiera richieste. Il modello osserva ogni nuovo stato prima di scegliere un'altra azione.
Questa struttura è interessante perché separa il ragionamento dall'esecuzione. Un'azienda può collocare il modello in un ambiente controllato e decidere quali azioni consentire. L'agente non ha bisogno di un accesso illimitato al computer fisico di un dipendente.
Il punteggio più alto su OSWorld-Verified aumenta il rendimento atteso della costruzione di tale infrastruttura. Un sistema che riesce in meno della metà delle attività richiede una supervisione costante. All'85%, le implementazioni mirate iniziano a sembrare più plausibili, soprattutto quando i fallimenti sono facili da rilevare.
Questo cambiamento mette sotto pressione diversi gruppi.
I fornitori di software aziendale devono decidere se gli agenti debbano operare sulle loro interfacce grafiche o usare API supportate. L'accesso all'interfaccia amplia la copertura, ma può creare un carico imprevedibile e aggirare flussi di prodotto progettati per la revisione umana.
I fornitori di soluzioni di automazione devono dimostrare perché i flussi di lavoro deterministici restino preziosi. Il loro vantaggio risiede nella ripetibilità, nell'auditabilità e nelle regole esplicite. Gli agenti informatici competono gestendo variazioni e istruzioni non strutturate.
I fornitori di modelli affrontano la pressione di migliorare più della sola accuratezza nei benchmark. I clienti hanno bisogno di controlli dell'identità, registri delle azioni, confini delle autorizzazioni e modi affidabili per interrompere l'esecuzione. Un modello che vede il pulsante giusto è solo una componente di un agente implementabile.
OpenAI e Google competono anch’esse in quest’area. I loro sistemi usano combinazioni diverse di modelli visivi, browser, strumenti e ambienti di esecuzione. Le classifiche dei benchmark contano, ma la diffusione di un prodotto dipende da quanto questi componenti riescono a operare insieme in sicurezza.
Gli sviluppatori di agenti specializzati possono ancora superare un modello generalista restringendo l’ambiente operativo. Un sistema progettato per una singola applicazione può includere parser personalizzati, regole di ripristino e controlli di convalida. L’uso generalizzato del computer copre più attività, mentre l’automazione specializzata può offrire maggiore prevedibilità.
Questo compromesso influenzerà l’adozione. Un agente generalista potrebbe redigere un’email, aggiornare un foglio di calcolo e caricare un file nella stessa sessione. Un sistema specializzato potrebbe invece gestire un singolo processo di rimborso con controlli più rigorosi e responsabilità più chiare.
Le imprese dovrebbero aspettarsi architetture ibride. Un agente può interpretare una richiesta e orientarsi in stati non familiari, mentre le API eseguono transazioni sensibili. Validatori deterministici possono ispezionare il risultato prima che avvenga qualsiasi azione irreversibile.
Questa progettazione limita l’importanza di una singola classifica. La domanda commerciale utile non è se Anthropic computer use abbia raggiunto l’85%. È se un sistema configurato possa completare la distribuzione delle attività di un’azienda entro la sua tolleranza al rischio.
Le organizzazioni necessitano inoltre dell’accesso a un contesto pertinente. Un agente che opera su software deve sapere quale file, scheda cliente, policy o messaggio sia applicabile. Una base di conoscenza AI ricercabile può aiutare le persone a organizzare quel contesto, anche se non elimina la necessità di controlli sull’esecuzione.
Il nuovo risultato del benchmark cambia l’assunto di partenza. Gli acquirenti non devono più chiedersi se l’automazione a livello di interfaccia funzioni affatto. Devono individuare dove funzioni con continuità, dove richieda approvazione e dove un’API resti più sicura.
Cosa Non Misura il Punteggio dell’85%
L’evidenza più forte contro un’ampia autonomia proviene dalle attività più lunghe, in cui gli agenti continuano a perdere il contesto, a non rilevare i cambiamenti e a non verificare il proprio lavoro.
Le attività originali di OSWorld prevedevano in genere circa 30 azioni. Sono sufficienti a far emergere fallimenti di grounding, ma restano molto più brevi di molti flussi di lavoro professionali. Gli incarichi reali possono estendersi su diverse applicazioni, documenti, account e punti decisionali.
OSWorld 2.0 è stato progettato per testare questo contesto più complesso. Il suo benchmark a lungo orizzonte contiene 108 flussi di lavoro in ambiti professionali e quotidiani. Una persona esperta impiega una mediana di circa 1,6 ore per completare un’attività.
I flussi di lavoro includono ricerca, ingegneria, produzione creativa, finanza, operazioni, amministrazione, conformità normativa e sanità. Circa il 69,6% richiede a un utente esperto più di un’ora. Includono informazioni dinamiche, stato nascosto e fatti distribuiti tra più fonti.
Un esempio riguarda l’invio di una richiesta di rimborso. L’agente deve leggere un tutorial, esaminare le ricevute, controllare registri bancari ed email, gestire un nuovo messaggio, recuperare le informazioni del dipendente e risolvere un’incoerenza. Fare clic correttamente è solo l’inizio.
Su OSWorld 2.0, il miglior sistema riportato ha completato il 20,6% delle attività secondo la metrica binaria primaria. Il suo punteggio parziale ha raggiunto il 54,8%, il che significa che spesso ha compiuto progressi senza completare correttamente l’intero flusso di lavoro.
Questo risultato determina il rovesciamento centrale. Gli agenti informatici possono apparire sovrumani su attività verificate più brevi, pur restando molto al di sotto di prestazioni affidabili su incarichi professionali lunghi. Entrambi i risultati possono essere veri perché misurano orizzonti diversi.
Le prestazioni sono diminuite drasticamente con l’allungarsi delle attività. Per flussi di lavoro della durata compresa tra 137 e 163 minuti umani, nessun modello testato ha superato il 10% di completamento binario. Oltre i 163 minuti, i modelli mantenuti non hanno completato nessuna attività.
Anche il modello di fallimento è cambiato. Gli agenti non hanno fallito principalmente perché incapaci di usare un controllo di base. Hanno perso traccia dei vincoli, trascurato nuove informazioni, fatto supposizioni anziché porre domande e saltato la verifica finale.
Si tratta di fallimenti gravi sul posto di lavoro. Un dipendente può spesso correggere immediatamente un clic nel posto sbagliato. Un sistema che dimentica una condizione di policy o ignora un’email aggiornata può produrre un risultato apparentemente completo ma sostanzialmente errato.
L’efficienza aggiunge un ulteriore divario. Lo studio OSWorld-Human ha esaminato quanti passaggi fossero necessari agli agenti rispetto a traiettorie progettate da esseri umani. Ha rilevato che i sistemi leader usavano molte più azioni del necessario.
I ricercatori hanno inoltre identificato le chiamate al modello per pianificazione, riflessione e valutazione come importanti fonti di latenza. I passaggi successivi potevano richiedere fino a tre volte più tempo di quelli iniziali man mano che le traiettorie si espandevano. Un ragionamento maggiore ha migliorato alcune decisioni, ma ha anche rallentato il flusso di lavoro.
In un esempio, modificare due paragrafi impostando la doppia spaziatura ha richiesto a un agente 12 minuti. Una persona con conoscenze informatiche di base avrebbe potuto completare la stessa azione in meno di 30 secondi. Il solo completamento non coglieva la differenza pratica.
Lo studio ha riportato che il 23% degli errori analizzati derivava da un grounding visivo insufficiente. Questi errori potevano aggiungere fino a 30 passaggi inutili a un’attività. Il comportamento di recupero spesso consumava risorse senza garantire un risultato corretto.
Questo complica in modo produttivo la narrativa anthropic a16z. Il punteggio dell’85% riflette un progresso reale nell’esecuzione a breve orizzonte. Le evidenze più recenti individuano il confine oltre il quale quel progresso smette di trasferirsi.
Il costo resta un’altra dimensione mancante. Un agente potrebbe migliorare il completamento usando più token di output, più tentativi o una riflessione più approfondita. OSWorld 2.0 ha rilevato un chiaro compromesso tra efficienza dei token e completamento massimo.
La configurazione Claude con il punteggio più alto usava un budget di output molto maggiore rispetto a un sistema GPT più efficiente. Gli acquirenti hanno bisogno di entrambe le misurazioni, perché il miglior punteggio di benchmark potrebbe non offrire il miglior risultato economico su larga scala.
Nemmeno la sicurezza è catturata da una semplice percentuale di completamento. Un agente può tecnicamente finire un’attività compiendo però un’azione inaccettabile lungo il percorso. Potrebbe esporre informazioni sensibili, accettare un prompt inatteso o apportare una modifica irreversibile senza approvazione.
Gli ambienti di benchmark partono inoltre da stati controllati. I computer di produzione accumulano notifiche, estensioni, sessioni memorizzate nella cache, richieste di autorizzazione e variazioni dell’interfaccia. Piccole differenze possono interrompere una strategia di esecuzione che funzionava in una macchina virtuale standard.
I contenuti web introducono rischi avversariali. Una pagina può contenere testo che cerca di reindirizzare l’agente o richiedere credenziali. I sistemi necessitano di una distinzione affidabile tra l’istruzione dell’utente e il contenuto non attendibile mostrato durante l’attività.
Gli agenti per l’uso del computer necessitano quindi di difese a più livelli. Le organizzazioni possono isolare le sessioni, limitare i domini, restringere le autorizzazioni, richiedere conferma e convalidare gli output tramite sistemi separati. Questi controlli riducono il rischio, ma restringono anche il significato di operazione autonoma.
Un punteggio di benchmark dovrebbe definire i confini di distribuzione anziché cancellarli. I casi d’uso più solidi nel breve termine sono circoscritti, reversibili e facili da ispezionare. Le azioni ad alto impatto dovrebbero comunque passare attraverso controlli deterministici o l’approvazione umana.
Tre Segnali Mostreranno Se il Risultato si Trasferisce
La prossima fase sarà decisa dal completamento di attività lunghe, dall’affidabilità al primo tentativo e da un’adozione produttiva misurabile, piuttosto che da un altro record isolato in classifica.
Il primo segnale è la prestazione su OSWorld 2.0 o su un altro benchmark comparabile a lungo orizzonte. Il risultato dell’85% di Claude Fable 5 su OSWorld-Verified diventa molto più convincente se lo stesso modello migliora la frontiera del 20,6% di completamento nei flussi di lavoro estesi.
I progressi parziali non saranno sufficienti. Un’attività professionale spesso crea valore solo quando ogni passaggio richiesto è completo e verificato. I ricercatori dovrebbero riportare insieme completamento binario, credito parziale, uso di token, conteggio delle azioni e frequenza degli interventi.
Un grande miglioramento nelle attività lunghe rafforzerebbe l’ipotesi che i modelli possano preservare obiettivi e vincoli in ambienti mutevoli. Un piccolo miglioramento suggerirebbe che il risultato dell’85% dipende principalmente da interazioni più brevi e circoscritte.
Il secondo segnale è l’affidabilità al primo tentativo in condizioni standardizzate. I fornitori dovrebbero pubblicare il numero di esecuzioni, i limiti di azione, le impostazioni di ragionamento e gli harness di valutazione alla base dei loro punteggi. Riesecuzioni indipendenti renderebbero i confronti tra modelli più credibili.
La varianza conta perché gli utenti non sperimentano la prestazione media dei benchmark. Vivono un’esecuzione alla volta. Un sistema che alterna successi e fallimenti genera costi di supervisione, anche quando il suo risultato medio appare forte.
I report dovrebbero inoltre separare le prestazioni dirette del modello dai miglioramenti apportati dal framework dell’agente. Un pianificatore, un grounder visivo, un meccanismo di ripetizione e un verificatore possono aumentare il punteggio finale. Gli acquirenti devono sapere quali componenti hanno prodotto il miglioramento e se possono riprodurlo.
Risultati costanti di superamento al primo tentativo rafforzerebbero l’argomento delle prestazioni a livello umano. Punteggi che richiedono tentativi ripetuti o budget di ragionamento insolitamente ampi lo indebolirebbero per l’implementazione ordinaria.
Il terzo segnale è l’evidenza di produzione proveniente da flussi di lavoro aziendali circoscritti. Una rendicontazione utile includerebbe tassi di completamento, tempo medio di esecuzione, frequenza delle escalation e quota degli output corretti dalle persone.
Le implementazioni più informative riguarderanno software senza API comode. È qui che gli agenti a livello di interfaccia offrono il vantaggio più chiaro rispetto all’integrazione convenzionale. Ed è anche qui che i cambiamenti dell’interfaccia possono rivelarne la fragilità.
Osservate se le organizzazioni estendono gli agenti dall’osservazione all’azione. Un sistema che raccoglie informazioni e prepara una bozza comporta meno rischi di uno che invia pagamenti, modifica autorizzazioni o contatta clienti.
L’espansione verso azioni a maggiore impatto indicherebbe una fiducia crescente nella tecnologia e nei suoi controlli. La continua limitazione a bozze e attività di sola lettura mostrerebbe che i progressi dei benchmark non hanno eliminato le preoccupazioni operative.
I dati Anthropic a16z meritano attenzione perché gli agenti per l’uso del computer sono migliorati molto più rapidamente di quanto suggerissero i risultati originali di OSWorld. Il punteggio riportato dell’85% di Claude Fable 5 segna un cambiamento credibile nella capacità a breve orizzonte.
Non stabilisce che gli agenti ora superino le persone nell’uso dei computer in generale. Tale conclusione richiede test equivalenti, esecuzione efficiente, primi tentativi stabili e successo lungo flussi di lavoro estesi.
Per sviluppatori e acquirenti, la risposta pratica non è né il rifiuto né l’autonomia immediata. Testate gli agenti su attività rappresentative, misurate ogni intervento e separate le azioni reversibili da quelle con conseguenze. Poi ponetevi la domanda che conta: il risultato anthropic a16z resiste al contatto con il vostro lavoro reale?



