top of page

I risultati di GPT-6 Sol Max Agent Arena di Arena rivendicano un guadagno del 7,7%, ma la verifica è in ritardo

26 set
Tempo di lettura: 14 min

Arena afferma che i risultati di GPT-6 Sol Max Agent Arena mostrano un miglioramento netto del 7,7% in oltre 4.000 sessioni reali con agenti. La voce segnalata si classifica al sesto posto e si trova sulla frontiera di Pareto del benchmark, che bilancia le prestazioni con il costo delle attività.

Sarebbe un risultato significativo per gli sviluppatori che scelgono modelli per il lavoro autonomo. Tuttavia, l'annuncio crea subito una tensione. Arena ha pubblicato affermazioni precise sulle prestazioni senza sufficienti prove pubbliche per identificare il modello o riprodurre il confronto in modo indipendente.

Anche il nome “GPT-6 Sol (Max)” necessita di chiarimenti. Arena associa la voce a OpenAI, ma la documentazione pubblica di OpenAI non conferma quel nome esatto come modello generalmente disponibile. Finché Arena o OpenAI non spiegheranno l'etichetta, i lettori dovrebbero considerare il risultato riportato come un'affermazione di benchmark piuttosto che come una tappa verificata di prodotto.

Cosa rivendicano realmente i risultati di GPT-6 Sol Max Agent Arena

L'annuncio di Arena presenta un forte risultato relativo, ma il post pubblico lascia irrisolti dettagli essenziali sulla misurazione.

L'annuncio di Arena afferma che GPT-6 Sol (Max) è entrato in Agent Arena dopo oltre 4.000 conversazioni reali con agenti. Riporta un miglioramento netto del 7,7% e colloca la voce al sesto posto della classifica.

Arena descrive inoltre il modello come situato sulla frontiera di Pareto di Agent Arena. Una frontiera di Pareto comprende sistemi che non possono migliorare una dimensione misurata senza sacrificarne un'altra. Qui, le dimensioni rilevanti sembrano essere le prestazioni nei compiti e il costo.

Questa distinzione è importante. Un modello può classificarsi sotto diverse alternative in termini di successo puro, pur restando interessante perché completa i compiti in modo più economico. Un altro modello può primeggiare nella qualità, ma perdere terreno quando il costo entra nel confronto.

Il miglioramento dichiarato del 7,7% non dovrebbe quindi essere letto come un aumento universale dell'intelligenza. È un risultato all'interno del quadro di valutazione di Arena. Il suo significato dipende dal riferimento, dal metodo di punteggio, dalla distribuzione dei compiti e dal trattamento delle esecuzioni fallite.

L'espressione “miglioramento netto” richiede un esame particolare. L'annuncio non identifica chiaramente il sistema di riferimento usato per calcolarlo. Non spiega neppure se il valore tenga conto di costo, latenza, tentativi ripetuti o preferenze dei valutatori.

Queste possibilità producono interpretazioni molto diverse. Un aumento del 7,7% nel completamento dei compiti differisce da un aumento del 7,7% nella preferenza degli utenti. Entrambi differiscono da un punteggio composito che combina qualità e uso delle risorse.

Anche la descrizione del campione lascia aperte delle domande. Oltre 4.000 sessioni sembrano un numero rilevante, ma il solo conteggio delle sessioni non stabilisce la confidenza statistica. Un benchmark richiede informazioni sulla diversità dei compiti, sui tentativi ripetuti, sulla coerenza dei valutatori e sulla configurazione del modello.

Le sessioni possono inoltre variare molto in difficoltà. Una richiesta potrebbe chiedere a un agente di riassumere una pagina. Un'altra potrebbe richiedere ricerca, uso di strumenti, recupero dagli errori e un risultato finale completo.

La sesta posizione offre un utile riferimento competitivo, ma non abbastanza contesto per una decisione d'acquisto. I lettori necessitano ancora della classifica completa, degli intervalli di confidenza e dei punteggi delle voci vicine.

La divulgazione dei costi nel post è rilevante per l'affermazione sulla frontiera di Pareto. Tuttavia, una singola mediana può nascondere fallimenti costosi e compiti con code lunghe. I team di deployment hanno bisogno di dati sulla distribuzione, non solo dell'osservazione centrale.

L'affermazione di Arena è quindi specifica ma incompleta. Identifica un risultato che merita approfondimento senza fornire ancora informazioni sufficienti per stabilire perché si sia verificato il miglioramento.

Perché la frontiera di Pareto conta più del sesto posto

L'affermazione importante non è che il modello sia arrivato sesto. È che Arena non rileva un'opzione chiaramente migliore allo stesso equilibrio tra prestazioni e costo.

Le posizioni in classifica attirano attenzione perché riducono valutazioni complesse a un elenco ordinato. Questa semplicità può anche oscurare la decisione che gli sviluppatori devono realmente affrontare.

I sistemi agentici consumano quantità diverse di calcolo compiendo numeri diversi di passaggi. Possono chiamare strumenti di ricerca, ispezionare file, eseguire codice, riprovare azioni fallite o chiedere a un altro modello di valutare una risposta.

Un modello che completa più compiti può comunque essere inefficiente. Potrebbe generare tracce di ragionamento più lunghe, effettuare chiamate agli strumenti non necessarie o richiedere ripetuti tentativi di recupero.

Il quadro di Pareto cerca di rendere esplicito questo compromesso. Un modello si trova sulla frontiera quando nessun concorrente misurato è al tempo stesso migliore e meno costoso. Passare a un altro sistema richiede quindi di rinunciare a qualcosa.

Questo approccio è più utile di un singolo punteggio di qualità per molti team di produzione. Un agente che gestisce migliaia di richieste deve restare efficace entro vincoli di carico di lavoro e budget.

Tuttavia, il metodo funziona solo quando gli assi sono misurati in modo coerente. Le prestazioni devono rappresentare lo stesso obiettivo di attività tra i modelli. I calcoli dei costi devono includere input, output, chiamate agli strumenti e tentativi ripetuti comparabili.

Il benchmark deve anche controllare le impostazioni del modello. Lo sforzo di ragionamento, i limiti di contesto, i prompt di sistema e i permessi degli strumenti possono modificare sia la qualità sia l'uso delle risorse. Un modello testato con un budget maggiore può sembrare più forte per ragioni non correlate alle sue capacità di base.

L'uso da parte di Arena di conversazioni reali può migliorare la validità ecologica, ovvero il grado in cui il test assomiglia all'uso effettivo. Può anche introdurre differenze non controllate che rendono più difficile l'interpretazione causale.

Gli utenti raramente distribuiscono compiti identici in modo uniforme tra tutti i modelli. I modelli nuovi o di maggiore rilievo possono ricevere prompt più difficili. Possono anche attirare tester esperti che sanno come ottenere risultati migliori.

Gli effetti di preferenza creano un altro problema. Un nome di modello riconoscibile può influenzare le aspettative, a meno che le valutazioni non siano condotte in cieco. L'ordine di presentazione e lo stile della risposta possono influenzare i voti senza modificare la correttezza del compito.

L'originale paper di Chatbot Arena descrive un modello di valutazione crowdsourced basato sulle preferenze umane a coppie. La valutazione degli agenti aggiunge un ulteriore livello, poiché il successo può dipendere da strumenti, ambienti ed esecuzione in più passaggi.

Questo rende l'analisi di Pareto preziosa, ma più difficile da verificare. La frontiera non è una proprietà permanente di un modello. È una proprietà di un particolare dataset, regola di punteggio e metodo di contabilizzazione dei costi.

Una piccola revisione del punteggio può spostare sistemi vicini dentro o fuori dalla frontiera. Un cambiamento nel mix di compiti può fare lo stesso.

L'etichetta del sesto posto dovrebbe quindi restare secondaria. La domanda più rilevante è se il modello rimanga efficiente quando i compiti richiedono pianificazione più lunga, recupero difficile e output finali verificabili.

Se così fosse, il risultato di Arena metterebbe pressione ai leader del benchmark che ottengono punteggi più alti attraverso budget di inferenza molto maggiori. In caso contrario, la posizione sulla frontiera potrebbe riflettere il carico di lavoro campionato piuttosto che un vantaggio duraturo.

Il vero avversario è la prestazione senza riproducibilità

Il risultato più forte di Arena compete con la sua divulgazione più debole: i lettori possono vedere i numeri principali ma non possono ancora ricostruire il test.

Gli annunci sui benchmark IA arrivano spesso prima degli artefatti di valutazione completi. Questo può essere comprensibile quando le piattaforme si aggiornano continuamente, ma limita ciò che gli osservatori esterni possono concludere.

Un risultato agentico riproducibile richiede più di un'etichetta del modello e di un punteggio aggregato. I ricercatori necessitano di definizioni dei compiti, versioni degli ambienti, prompt, schemi degli strumenti, impostazioni di campionamento e regole sui fallimenti.

Hanno anche bisogno della finestra di confronto esatta. Le classifiche degli agenti possono cambiare con l'arrivo di nuove conversazioni. Un'istantanea effettuata prima di un picco di traffico potrebbe non coincidere con la stessa pagina alcuni giorni dopo.

I risultati di GPT-6 Sol Max Agent Arena presentano un ulteriore problema di identità. Il nome esatto del modello non è stabilito nel catalogo pubblico dei modelli OpenAI disponibile per gli sviluppatori.

Questo non prova che la voce sia invalida. Arena potrebbe testare un'anteprima, un endpoint privato, un alias interno o un'etichetta di configurazione. Il nome potrebbe anche combinare un modello di base con un'impostazione di inferenza.

Ogni spiegazione comporta implicazioni diverse. Un'anteprima privata mostrerebbe una possibile capacità futura, ma gli sviluppatori non potrebbero adottarla immediatamente. Un'etichetta di configurazione significherebbe che il risultato riflette una particolare modalità operativa.

Un alias interno renderebbe i confronti più difficili perché i lettori non potrebbero associare la voce a un identificatore API stabile. Un'etichetta assegnata dal benchmark richiederebbe che Arena spiegasse come è stata attribuita.

Conta anche l'assenza di OpenAI dall'annuncio. Arena attribuisce la voce a OpenAI, ma le prove fornite non contengono un rilascio o una nota tecnica OpenAI corrispondente.

L'interpretazione più prudente è limitata. Arena afferma di aver valutato un sistema etichettato GPT-6 Sol (Max), e Arena riporta le prestazioni associate. Il registro pubblico non stabilisce ancora l'identità commerciale del sistema.

Questa distinzione protegge i lettori dal trasformare una riga della classifica in un annuncio di lancio. L'accesso ai benchmark può precedere la disponibilità generale. Può anche coinvolgere varianti sperimentali che non verranno mai distribuite con il nome testato.

La riproducibilità ha conseguenze pratiche oltre alla cautela accademica. Un team di ingegneria non può stimare il lavoro di migrazione senza conoscere l'endpoint, il comportamento del contesto, il protocollo degli strumenti e i limiti di velocità.

Non può nemmeno verificare se il miglioramento riportato resista al proprio carico di lavoro. Gli agenti per assistenza clienti, ingegneria del software, ricerca e automazione del browser falliscono in modi diversi.

Il framework AgentBench ha illustrato perché la valutazione degli agenti debba coprire ambienti diversi. Ha testato modelli linguistici su compiti che richiedevano interazione, pianificazione e processo decisionale anziché risposte isolate.

Le valutazioni nel mondo reale possono integrare le suite controllate. Rivelano il comportamento degli utenti e modalità di fallimento inattese che i test fissi non rilevano.

Tuttavia, il traffico reale non elimina la necessità di reportistica controllata. Le prove più solide combinano entrambi gli approcci. Le sessioni pubbliche possono rivelare la domanda, mentre i compiti ripetibili verificano se la differenza osservata persiste.

Arena può colmare gran parte dell'attuale divario pubblicando una scheda del modello per la voce. Tale documento dovrebbe identificare il fornitore, lo stato dell'endpoint, le date di valutazione, la configurazione e il calcolo del punteggio.

Fino ad allora, l'affermazione sulle prestazioni resta degna di nota ma circoscritta. Il titolo suggerisce un nuovo leader dell'efficienza. Le prove disponibili stabiliscono soltanto che Arena ne ha riportato uno.

Oltre 4.000 sessioni lasciano comunque interrogativi importanti

Un ampio numero di sessioni riduce alcune forme di rumore, ma non può correggere un campione poco chiaro o una metrica non definita.

Quattromila osservazioni possono sostenere un confronto affidabile quando i compiti sono indipendenti, rappresentativi e valutati in modo coerente. Queste assunzioni non possono essere dedotte dal solo conteggio.

Le sessioni degli agenti sono particolarmente difficili da trattare come campioni indipendenti. Diverse sessioni possono provenire da un utente che testa prompt correlati. Un modello di compito popolare può comparire molte volte con piccole variazioni nella formulazione.

I modelli possono inoltre incontrare strumenti o siti web diversi tra le sessioni. I servizi esterni cambiano, le pagine non funzionano e l'autenticazione scade. Due richieste apparentemente simili possono essere eseguite in condizioni molto diverse.

La valutazione deve separare i fallimenti del modello dai fallimenti dell’ambiente. Un agente browser non dovrebbe perdere punti perché un sito di destinazione era temporaneamente non disponibile. Al contrario, il benchmark non dovrebbe giustificare l’uso improprio ripetuto degli strumenti come un problema infrastrutturale.

Anche la politica di retry è una variabile nascosta. Un sistema potrebbe recuperare dopo un’azione fallita, mentre un altro si ferma immediatamente. Se il benchmark consente un recupero illimitato, la persistenza può aumentare il successo facendo però crescere i costi.

Il punteggio deve stabilire se questo compromesso sia desiderabile. Un utente potrebbe preferire un agente più lento che completa correttamente il lavoro. Un’azienda che opera su larga scala potrebbe rifiutare un consumo di risorse imprevedibile.

Il costo mediano aiuta a riassumere un’esecuzione tipica, ma dice poco sulla varianza. Un agente può avere una mediana accettabile pur generando una lunga coda di sessioni costose, in loop o bloccate.

Anche le etichette di completamento possono nascondere differenze qualitative. Un agente di viaggio potrebbe restituire un itinerario senza verificare la disponibilità. Un agente di coding potrebbe modificare la funzione richiesta compromettendo test non correlati.

I benchmark necessitano di una verifica dei risultati coerente con il compito. La preferenza umana è utile per la scrittura e la ricerca a risposta aperta. I test eseguibili funzionano meglio quando la correttezza ha un esito oggettivo.

I benchmark di ingegneria del software dimostrano questo principio. La metodologia SWE-bench valuta le modifiche a un repository in base a criteri fondati sui test, anche se tali risultati dipendono fortemente dalla struttura di supporto e dalla progettazione dell’ambiente.

Gli agenti generalisti affrontano una sfida di verifica più ampia. I loro output possono includere documenti, prenotazioni, fogli di calcolo, codice e decisioni. Nessun singolo giudice può convalidare ogni tipologia con la stessa efficacia.

I modelli valutatori introducono i propri bias. Un giudice potrebbe premiare formulazioni familiari, risposte più lunghe o output simili alle sue preferenze di addestramento. I valutatori umani possono essere in disaccordo o trascurare errori nascosti.

Arena dovrebbe dichiarare se la cifra del 7,7% deriva da voti umani, verifiche oggettive dei compiti, modelli giudice o da una combinazione di questi elementi. I lettori devono inoltre conoscere l’incertezza attorno a tale stima.

Un intervallo di confidenza mostrerebbe se il vantaggio riportato è stabile. Senza di esso, una differenza del 7,7% potrebbe rappresentare una netta separazione o un normale movimento in classifica.

Il mix di compiti conta altrettanto. Un modello può eccellere nella ricerca e faticare nell’esecuzione del codice. Un punteggio aggregato può nascondere questi risultati contrastanti.

La rendicontazione a livello di categoria renderebbe il risultato più utilizzabile. Gli sviluppatori potrebbero quindi confrontare il carico di lavoro del benchmark con la distribuzione prevista.

Il benchmark dovrebbe inoltre riportare i comportamenti di rifiuto e sicurezza. Un agente che tenta ogni compito può ottenere un buon punteggio finché non incontra richieste che richiedono cautela, controlli della privacy o approvazione esplicita.

Queste domande non invalidano il risultato. Definiscono quali prove siano ancora necessarie prima che il risultato possa guidare un’implementazione ad alto rischio.

Chi subirebbe pressione se l’affermazione di Arena fosse confermata

Un incremento di efficienza verificato metterebbe sotto pressione i modelli agent premium, gli operatori di benchmark e i team che selezionano ancora i sistemi in base al semplice posizionamento in classifica.

La pressione più diretta ricadrebbe sui modelli che ottengono alti punteggi come agenti con inferenza costosa. Un risultato di frontiera suggerisce che gli acquirenti possano mantenere gran parte delle prestazioni utilizzando meno risorse.

Questa pressione non produrrebbe necessariamente un cambio immediato di fornitore. Gli agenti enterprise dipendono da affidabilità, controlli di sicurezza, disponibilità regionale e supporto all’integrazione.

Tuttavia, un concorrente credibile sul rapporto costo-prestazioni cambia i termini delle trattative. Gli acquirenti possono chiedere se un modello meglio classificato fornisca abbastanza successo aggiuntivo da giustificare le sue esigenze operative.

Anche gli operatori di benchmark subiscono pressione. Agent Arena deve dimostrare che la sua frontiera è stabile, comprensibile e resistente alla manipolazione. Altrimenti, i fornitori di modelli possono ottimizzare metriche visibili senza migliorare gli esiti pratici.

Una classifica pubblica può influenzare i sistemi di routing e le shortlist di approvvigionamento. Questa influenza comporta la responsabilità di divulgare modifiche rilevanti a prompt, strumenti, punteggi e configurazione del modello.

Anche gli sviluppatori che realizzano router di modelli hanno motivo di prestare attenzione. Un router assegna ciascun compito a un modello adatto in base a difficoltà, velocità, rischio o costo.

Un modello al sesto posto sulla frontiera di Pareto può essere più utile per il routing di un modello al primo posto con un profilo di risorse molto più pesante. I compiti di routine possono essere assegnati al sistema efficiente.

I casi difficili possono essere escalati a un modello più capace. Questa struttura può ridurre l’uso medio di risorse senza costringere un singolo sistema a gestire ogni richiesta.

Tuttavia, il routing dipende da prestazioni prevedibili a livello di categoria. Una classifica aggregata non può indicare a un router quali compiti spostare verso quale modello.

I team hanno bisogno di firme di fallimento. Devono sapere se il sistema fatica con pianificazione a lungo orizzonte, navigazione web, esecuzione del codice, memoria o istruzioni ambigue.

Il risultato mette inoltre in discussione l’assunto secondo cui budget di inferenza più elevati producano sempre il miglior agente implementabile. Un ragionamento più esteso può aiutare, ma solo quando questi passaggi aggiuntivi rimangono focalizzati.

Tracce più lunghe possono creare maggiori opportunità di deviazione. Gli agenti possono ripetere ricerche, perdere vincoli o agire sulla base di conclusioni intermedie obsolete.

I knowledge worker dovrebbero interessarsene perché questi schemi di fallimento incidono sul carico di revisione. Un agente rapido che produce lavoro plausibile ma non supportato può costare più tempo umano di uno più lento e affidabile.

La misura rilevante non è quindi solo il completamento del compito. È il completamento verificato per unità di sforzo totale, inclusi controllo e correzione umani.

È qui che l’affermazione di Arena potrebbe diventare importante per i flussi di lavoro quotidiani. Ricerca, pianificazione di progetti e produzione di documenti traggono tutti vantaggio da agenti che preservano le prove e rendono il proprio lavoro verificabile.

Gli utenti possono già ridurre l’attrito della revisione mantenendo il materiale sorgente in una base di conoscenza personale ricercabile. Tuttavia, il modello deve comunque collegare ogni conclusione alla fonte corretta.

Un agente efficiente con una provenienza debole non risolverebbe questo problema. Genererebbe semplicemente conclusioni non supportate a un costo misurato inferiore.

Se il modello di Arena si comporta bene nel tracciamento delle prove, nell’uso vincolato degli strumenti e nella correzione, il risultato andrebbe oltre la competizione in classifica. Indicherebbe la strada verso agenti supervisionati più economici.

Se il guadagno deriva principalmente da compiti brevi o facilmente valutabili, il suo impatto sarà più limitato. I sistemi premium manterrebbero il loro vantaggio nei flussi di lavoro complessi, dove un singolo fallimento può annullare molti successi meno costosi.

Cosa deve accadere prima che il risultato cambi le decisioni d’acquisto

Tre segnali determineranno se questo annuncio diventerà un risultato di benchmark duraturo o un’affermazione di classifica di breve durata.

Il primo segnale è una chiara dichiarazione d’identità da parte di Arena o OpenAI. Il record pubblico deve spiegare cosa indichi “GPT-6 Sol (Max)” e se gli sviluppatori possano accedere allo stesso sistema.

Questo chiarimento dovrebbe includere un identificatore stabile del modello. Dovrebbe inoltre distinguere il modello sottostante dal profilo di inferenza utilizzato durante i test.

Se Arena conferma un endpoint pubblico riproducibile, l’affermazione diventa più concreta. Se l’etichetta si riferisce a una configurazione privata o temporanea, il risultato rimane principalmente indicativo.

Il secondo segnale è il rilascio della metodologia relativa al miglioramento del 7,7%. Arena dovrebbe definire il baseline, la formula di punteggio, la progettazione dei valutatori, la finestra di campionamento e l’incertezza.

Dovrebbe inoltre spiegare come il costo entri nel calcolo di Pareto. Token di input, token di output, token di ragionamento, chiamate agli strumenti, retry e servizi esterni possono tutti incidere sul totale.

Un rilascio della metodologia rafforzerebbe l’affermazione se ricercatori indipendenti potessero ricostruire la classifica. Variazioni significative del punteggio dopo la divulgazione indebolirebbero l’interpretazione originale.

Il terzo segnale è la replica su carichi di lavoro controllati. Team indipendenti dovrebbero testare lo stesso modello su compiti stabili con strumenti, budget e criteri di successo fissi.

Questi test dovrebbero includere lavori a lungo orizzonte. Categorie utili includono riparazione di repository, ricerca multi-fonte, flussi di lavoro browser e produzione di documenti strutturati.

La replica non richiede che ogni benchmark produca la stessa classifica. Suite diverse misurano capacità diverse. La domanda importante è se il vantaggio di efficienza emerga in ambienti rilevanti.

I lettori dovrebbero inoltre osservare la stabilità della classifica. Una posizione di frontiera che resiste a diverse settimane di nuove sessioni ha più peso di una breve apparizione successiva al lancio.

Il solo movimento non dimostrerebbe nulla di improprio. I nuovi modelli attirano spesso un mix variabile di prompt e campioni piccoli possono cambiare rapidamente.

Tuttavia, Arena dovrebbe conservare snapshot datati. I dati storici consentirebbero agli osservatori di separare le reali modifiche al modello dalla deriva della valutazione.

Gli attuali risultati di GPT-6 Sol Max su Agent Arena dovrebbero quindi guidare le domande, non gli acquisti. Identificano un sistema potenzialmente efficiente e mettono in luce le prove di cui gli acquirenti hanno ancora bisogno.

Gli sviluppatori che valutano agenti possono usare l’annuncio come piano di test. Chiedete se un candidato completa l’intero compito, usa gli strumenti responsabilmente, cita le prove e recupera dagli errori.

Misurate poi l’intero flusso di lavoro. Includete tentativi non riusciti, revisione umana, correzioni e compiti che richiedono escalation.

Non presumete che la posizione aggregata di un modello predica le prestazioni su dati privati. Eseguite valutazioni rappresentative con le autorizzazioni e gli strumenti previsti per la produzione.

I team dovrebbero inoltre conservare output e decisioni dei revisori. Un flusso di lavoro AI strutturato rende i confronti ripetuti più utili delle impressioni informali.

Arena ha fornito un segnale interessante: un sistema etichettato GPT-6 Sol (Max) avrebbe migliorato le prestazioni nette degli agenti mantenendo un profilo di risorse competitivo. Il risultato merita attenzione perché inquadra la qualità degli agenti come un problema di efficienza.

Non dimostra ancora un nuovo prodotto OpenAI, un guadagno universale di capacità del 7,7% o una frontiera riproducibile. Queste conclusioni richiedono identificazione del modello, metodi trasparenti e test indipendenti.

La prossima mossa spetta ad Arena e OpenAI. Se pubblicheranno dettagli sufficienti affinché altri possano riprodurre il risultato, il benchmark potrebbe influenzare il routing degli agenti e la selezione dei modelli. Se la divulgazione rimarrà limitata, il vostro team dovrebbe fidarsi della classifica o costruire una valutazione controllata attorno al lavoro che conta davvero?

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page