Holo4: Generalistische Computer-Use Agents vorantreiben, doch die Benchmark-Lücke bleibt relevant
Holo4 wurde am 28. September mit zwei Modellen, vier Interaktionsmodi und einem direkten Angriff auf spezialisierte Computer-Use-Systeme vorgestellt. H Company beschreibt Holo4: generalistische Computer-Use Agents vorantreiben als eine Modellfamilie, die Bildschirme bedienen, Code ausführen und Software-Tools aufrufen kann.
Die Veröffentlichung ist relevant, weil Computerautomatisierung selten innerhalb einer einzigen Oberfläche bleibt. Ein Geschäftsprozess kann in einem Browser beginnen, über eine API weiterlaufen und in Desktop-Software ohne moderne Integrationen enden. Die meisten Agentensysteme bewältigen diesen Übergang durch die Kombination verschiedener Modelle, Tools und Steuerungsschleifen.
Holo4 schlägt einen einfacheren Weg vor. Dasselbe Modell kann zwischen grafischen Oberflächen, Code, Model Context Protocol-Tools und APIs wählen. MCP ist ein Standard, über den KI-Systeme mithilfe strukturierter Verbindungen auf externe Tools und Daten zugreifen können.
Dieses Versprechen stellt Holo4 einer Spezialistenarchitektur gegenüber, nicht bloß einem weiteren Modellanbieter. Der Spezialistenansatz weist visueller Navigation, Programmierung und Tool-Aufrufen jeweils unterschiedliche Modelle oder Richtlinien zu. H Company argumentiert, dass ein trainierter Generalist diese Bereiche effizienter koordinieren kann.
Das Unternehmen hat zudem Tausende Benchmark-Trajektorien zur Prüfung bereitgestellt. Diese Transparenz liefert Entwicklern mehr Anhaltspunkte als ein Leaderboard-Wert allein. Fragen zu Zuverlässigkeit, Sicherheit oder Leistung in realen Organisationen beantwortet sie jedoch nicht abschließend.
Holo4: Generalistische Computer-Use Agents über vier Schnittstellen hinweg vorantreiben
Die zentrale Veränderung ist architektonisch: Holo4 behandelt die Schnittstelle als Wahlmöglichkeit innerhalb einer Aufgabe statt als feste Grenze um den Agenten herum.
Laut dem Holo4-Release umfasst die Familie ein dichtes Modell mit 27 Milliarden Parametern sowie ein Mixture-of-Experts-Modell mit 35 Milliarden Parametern. Letzteres aktiviert bei jedem Inferenzschritt etwa drei Milliarden Parameter.
Ein Mixture-of-Experts-Modell leitet Eingaben durch ausgewählte interne Komponenten, statt jeden Parameter zu aktivieren. Dieses Design kann den Rechenaufwand reduzieren, wobei die tatsächliche Geschwindigkeit von Hardware, Software und Bereitstellungsentscheidungen abhängt.
Beide Holo4-Modelle können mit grafischen Benutzeroberflächen interagieren, Code schreiben und ausführen sowie MCP- oder API-Tools aufrufen. H Company zufolge kann dasselbe Modell auf Desktops, Websites, Android-Geräten, Coding-Sandboxes und Geschäftssystemen arbeiten.
Das unterscheidet sich von einem Agenten, der ausschließlich Mausklicks aus Screenshots vorhersagt. Es unterscheidet sich auch von einem Tool-Calling-Modell, das unwirksam wird, sobald einer Anwendung eine API fehlt. Holo4 ist darauf ausgelegt, seine Methoden mit dem Workflow zu wechseln.
Man denke an einen routinemäßigen Finanzvorgang. Ein Agent könnte Felder aus einem Dokument extrahieren, sie mit Code normalisieren, über eine API übermitteln und das Ergebnis auf dem Bildschirm prüfen. Ältere Unternehmenssoftware könnte einen weiteren Wechsel zur Maus- und Tastatursteuerung erzwingen.
Ein generalistisches Modell könnte über diese Phasen hinweg einen einheitlichen Entscheidungsprozess beibehalten. Ein Spezialisten-Stack würde jede Phase üblicherweise an ein separates Modell, eine Richtlinie oder einen Dienst weiterleiten. Dieses Routing kann die Kontrolle verbessern, führt jedoch auch zu mehr Übergaben und Fehlerquellen.
H Company erklärt, Holo4 mittels überwachten Lernens und Reinforcement Learning über generierte interaktive Umgebungen trainiert zu haben. Die interne Aufgabenfabrik habe Berichten zufolge rund 10.000 Aufgaben erstellt, die Webanwendungen, Desktops, MCP-Server und hybride Umgebungen abdecken.
Diese generierten Aufgaben sind wichtig, weil statische Beispiele die Folgen von Agentenaktionen nicht abbilden können. Eine interaktive Umgebung kann prüfen, ob ein Klick den Zustand verändert hat, ob Code ausgeführt wurde oder ob ein API-Aufruf den beabsichtigten Datensatz erzeugte.
Der Ansatz ermöglicht es H Company auch, Aufgaben aus Dokumentation und Screenshots zu generieren. Das könnte die Trainingsabdeckung erweitern, ohne jeden Workflow manuell entwerfen zu müssen. Generierte Umgebungen können sich jedoch weiterhin von unübersichtlichen Produktionssystemen mit Berechtigungen, Verzögerungen und unerwarteten Zuständen unterscheiden.
Neben den beiden wichtigsten Holo4-Varianten umfasst die Veröffentlichung ein aktualisiertes Holotron4 Nano-Modell. Außerdem werden Modellgewichte in mehreren Formaten angeboten, darunter BF16, FP8, NVFP4 und vierbitiges GGUF.
Die Verfügbarkeit dieser Formate eröffnet Entwicklern verschiedene Bereitstellungsoptionen. Die folgenreichere Behauptung bleibt jedoch, dass ein Modell mehrere Schnittstellen ohne eine externe Modell-Auswahlschicht koordinieren kann.
Damit wird Holo4: generalistische Computer-Use Agents vorantreiben zu einem Test dafür, ob Schnittstellen-Generalisierung die Systemkomplexität senken kann, ohne die Präzision spezialisierter Agenten einzubüßen.
Warum lange Workflows Spezialisten-Stacks für Agenten unter Druck setzen
Holo4 setzt Spezialisten-Stacks unter Druck, weil lange Workflows die Kosten jeder Routing-Entscheidung, Kontextübergabe und Wiederherstellungsmaßnahme vervielfachen.
Eine kurze Browseraufgabe kann architektonische Schwächen verdecken. Ein Agent könnte eine Seite öffnen, einen Wert eingeben und ein Formular absenden. Selbst ein fragiles System schließt diese Abfolge manchmal erfolgreich ab.
Professionelle Arbeit sieht anders aus. Sie umfasst mehrere Anwendungen, persistenten Zustand, mehrdeutige Anweisungen und Informationen, die während der Ausführung auftauchen. Ein Agent muss frühere Einschränkungen berücksichtigen und sich zugleich an spätere Ereignisse anpassen.
OSWorld 2.0 wurde für dieses schwierigere Szenario entwickelt. Die Forschenden stellten 108 Workflows mit langem Horizont aus Alltags- und Berufsarbeit zusammen. Ein qualifizierter Mensch benötigt im Median rund 1,6 Stunden, um jede Aufgabe abzuschließen.
Der Benchmark berichtet, dass führende Agenten im Durchschnitt mehr als 300 Schritte pro Workflow benötigen können. Aufgaben in OSWorld 1.0 erforderten etwa 30 Schritte, wodurch der neuere Benchmark zu einem deutlich strengeren Test des Kontextmanagements wird.
Die Fehler gehen zudem über unpräzise Klicks hinaus. Die Forschenden beobachteten, dass Agenten Einschränkungen verloren, eingehende Informationen übersahen, bei notwendiger Klärung rieten und Verifikationen übersprangen. Diese Schwächen können sich über einen langen Prozess hinweg verstärken.
H Company erklärt, den Holo4-Agenten-Harness als Reaktion auf diese Probleme neu aufgebaut zu haben. Ein Harness ist die Ausführungsschleife, die Beobachtungen bereitstellt, Kontext verwaltet, Aktionen ausführt und Ergebnisse an das Modell zurückgibt.
Die zwei auffälligsten Ergänzungen waren persistenter Speicher für Hunderte Schritte und eine Shell auf dem Desktop-Rechner. Die Shell eröffnet dem Agenten einen codebasierten Weg, wenn direkte GUI-Interaktion ineffizient wird.
Hier wird das generalistische Design mehr als eine Funktionsliste. Das Modell kann entscheiden, dass das Parsen einer lokalen Datei mit Code dem visuellen Lesen vorzuziehen ist. Anschließend kann es zur Oberfläche zurückkehren, um Aktionen auszuführen, die eine visuelle Bestätigung erfordern.
Ein Spezialisten-Stack kann dieselbe Abfolge durchführen. Er muss jedoch entscheiden, wann die Kontrolle übergeben wird und wie viel Kontext jede Übergabe begleitet. Eine falsche Routing-Entscheidung kann Schritte verschwenden oder Informationen verwerfen.
Holo4 versucht, diese Entscheidung in das trainierte Modell zu verlagern. Wenn der Ansatz konsistent funktioniert, könnten Entwickler den Aufwand für die Koordination von Browsersteuerung, Desktopsteuerung, Codeausführung und strukturierten Tools verringern.
Das beseitigt Orchestrierung nicht. Produktionssysteme benötigen weiterhin Anmeldedatenverwaltung, Sandboxing, Wiederholungsversuche, Logging und Freigabeschranken. Sie brauchen zudem eine zuverlässige Möglichkeit, einen Agenten zu stoppen, bevor eine unsichere Aktion Schaden verursacht.
Die Verschiebung ist enger begrenzt, aber dennoch relevant. Entwickler könnten weniger Aufwand darauf verwenden, zu entscheiden, welches Modell welche Schnittstelle bearbeiten soll. Stattdessen könnten sie sich stärker auf Berechtigungen, die Validierung von Ergebnissen und die Messung vollständiger Workflows konzentrieren.
Diese Unterscheidung ist für Teams relevant, die eine durchsuchbare Wissensdatenbank aufbauen. Ihre Workflows verlaufen häufig über lokale Dokumente, interne Suche, Browser-Tools und strukturierte Unternehmenssysteme.
Holo4 beweist nicht, dass Generalisten jeden Spezialisten ersetzen werden. Es macht spezialisiertes Routing zu einer Designentscheidung, die Entwickler begründen müssen, statt zu einer unvermeidlichen Grundlage.
Ein Agentenmodell ist einfacher, doch Spezialisten setzen weiterhin die Messlatte für Zuverlässigkeit
Der zentrale Wettbewerb besteht zwischen einem generalistischen Modell und einem koordinierten Stack von Spezialisten, wobei Zuverlässigkeit entscheidet, welche Architektur gewinnt.
Spezialisten bieten einen intuitiven Vorteil. Ein eng für visuelles Grounding trainiertes Modell kann sich auf das Auffinden von Bedienelementen konzentrieren. Ein Coding-Modell kann sich auf Syntax, Ausführung und Debugging fokussieren, ohne jeden Screenshot interpretieren zu müssen.
Auch Tool-Calling-Modelle profitieren von strukturierten Schemata. Eine API stellt erlaubte Aktionen und vorhersehbare Felder bereit. Eine grafische Oberfläche bietet mehr Flexibilität, doch ihre Schaltflächen, Layouts und temporären Zustände schaffen Mehrdeutigkeit.
Der Spezialistenansatz erlaubt es Ingenieuren, für jede Oberfläche das beste Modell auszuwählen. Er kann auch riskante Fähigkeiten isolieren. Ein visueller Agent könnte Bildschirmzugriff erhalten, ohne beliebige Shell-Ausführung zu erlangen.
Spezialisierung verlagert die Komplexität jedoch in das umgebende System. Ein Router muss jede Phase klassifizieren, eine Komponente wählen und die Absicht des Nutzers über Übergaben hinweg bewahren. Der Stack muss unterschiedliche Kontextformate und Fehlersignale zusammenführen.
Holo4s generalistischer Ansatz verlagert einen Teil dieser Koordination in das Modell. Der Agent kann einen Bildschirm betrachten, erkennen, dass direkte Manipulation ineffizient ist, und stattdessen Code oder ein strukturiertes Tool verwenden.
H Company veranschaulicht diesen Ansatz mit Aufgaben in professioneller Software. In einem Beispiel nutzte Holo4 27B Berichten zufolge 68 Aufrufe und 2,4 Millionen Tokens, um in Godot ein autonomes Spiel zu erstellen. Seine Qwen-Basis benötigte unter demselben Prompt und Harness 197 Aufrufe und 11,4 Millionen Tokens.
Diese Werte stammen aus H Companys eigener Auswertung, nicht aus einem unabhängigen Labor. Sie beschreiben eine einzelne Aufgabe statt durchschnittlicher Produktionsleistung. Dennoch zeigen sie die Art von Effizienz, die das Unternehmen mit Holo4 erreichen möchte.
Weitere Beispiele betreffen die Konstruktion detaillierter Objekte in FreeCAD. Diese Workflows verbinden räumliche Interpretation, Softwaresteuerung und Codegenerierung. Sie sind anspruchsvoller als das Ausfüllen eines einzelnen Webformulars.
Die Beispiele offenbaren auch eine Einschränkung. Für Holo4s Eiffelturm-Aufgabe waren Berichten zufolge 84 Aufrufe und 1,3 Millionen Tokens erforderlich. Lange Computer-Use-Sitzungen können rechenintensiv bleiben, selbst wenn das Endergebnis erfolgreich ist.
Spezialisten behalten einen weiteren Vorteil, wenn der Workflow vorhersehbar ist. Ein deterministisches Skript oder eine eng zugeschnittene API-Integration kann schneller und leichter prüfbar sein als ein Agent, der zwischen mehreren möglichen Aktionen wählt.
Der generalistische Ansatz wird stärker, wenn Workflows variieren, Schnittstellen sich verändern oder Legacy-Systemen Integrationen fehlen. Der Spezialistenansatz bleibt stärker, wenn Organisationen Wiederholbarkeit benötigen und den Prozess präzise definieren können.
Das bedeutet, dass Holo4 konventionelle Automatisierung voraussichtlich nicht verdrängen wird. Stattdessen konkurriert es um das unsichere Mittelfeld, in dem feste Skripte scheitern, uneingeschränkte Frontier-Agenten jedoch weiterhin zu teuer oder schwer zu steuern sind.
Entwickler sollten daher vollständige Aufgaben bewerten, nicht isolierte Klicks. Die entscheidende Frage lautet, ob Holo4 Fehler und Entwicklungsaufwand über reale Workflows hinweg reduziert.
Ein Modell, das den korrekten Endzustand mit weniger Übergaben erreicht, kann eine geringere Rohpräzision in einer eng abgegrenzten Fähigkeit rechtfertigen. Ein Generalist, der seine Methoden unvorhersehbar wechselt, kann hingegen eine größere Debugging-Last schaffen.
Das Ergebnis wird von der Qualität der Trajektorien, Reproduzierbarkeit und dem Wiederherstellungsverhalten abhängen. Diese Faktoren sind wichtiger als die Frage, ob eine Architektur in einem Diagramm sauberer wirkt.
Holo4-Benchmark-Ergebnisse benötigen ihre Harnesses und Fußnoten
Die Ergebnisse von Holo4 sind bemerkenswert, doch die Veröffentlichung selbst erklärt, warum mehrere prominente Vergleiche nicht unmittelbar gleichwertig sind.
H Company berichtet, dass Holo4 27B bei OSWorld 2.0 61,7 Prozent erreichte. Sein Modell 35B-A3B kam auf 30,9 Prozent. Das Unternehmen vergleicht diese Ergebnisse mit 81,8 Prozent für Opus 5.5.
Der Abstand von 20,1 Punkten zwischen Holo4 27B und Opus 5.5 ist erheblich. Holo4 führt das leistungsstärkste geschlossene Modell bei dieser gemeldeten Kennzahl nicht an. Seine Argumentation konzentriert sich auf Modellgröße, Bereitstellungsflexibilität und geschätzte Aufgabenkosten.
H Company nennt außerdem Werte von 70,2 Prozent für Opus 5 und 66,2 Prozent für GPT-5.6 Sol. Diese Referenzen verwenden bei einem Offline-OSWorld-2.0-Set vom 8. August 2026 Teilbelohnungen bei maximalem Aufwand.
Die Veröffentlichung weist darauf hin, dass Modellversionen, Harnesses und Aufgabenteilmengen variieren. Dieser Hinweis sollte bei jedem Vergleich berücksichtigt werden. Die Leistung von Agenten hängt von weit mehr ab als vom Modell-Checkpoint.
Der Harness steuert Speicher, Tool-Zugriff, Formatierung der Beobachtungen, Wiederholungsverhalten und die maximale Schrittzahl. Schon die Änderung einer dieser Variablen kann das Ergebnis verändern, selbst wenn das zugrunde liegende Modell unverändert bleibt.
Auch die Kostencharts erfordern ähnliche Vorsicht. H Company schätzte die Ausgaben anhand der während jedes Durchlaufs verwendeten Input- und Output-Token. Holo4 wurde mit den eigenen API-Preisen bewertet, während für andere Modelle externe Listenpreise verwendet wurden.
Solche Schätzungen können die interne Planung unterstützen, sind jedoch keine kontrollierten wirtschaftlichen Messungen. Caching-Annahmen, Inferenzinfrastruktur, Wiederholungen und Mengenrabatte können die tatsächlichen Bereitstellungskosten verändern.
AutomationBench bringt ein weiteres Vergleichbarkeitsproblem mit sich. H Company bewertete Holo4 und seine Qwen-Baselines mit Version 1.0.6 im eigenen internen Harness. Die Werte anderer Modelle stammen aus dem öffentlichen Set des Benchmarks.
Die angeführten Kostenangaben für andere Modelle stammen von einer Bestenliste, die ein privates Set verwendet. H Company erklärt, Holo4 nach Abschluss der Tests in dieser privaten Evaluation ausweisen zu wollen.
Bis dahin sollten Leser nicht alle AutomationBench-Werte als Ergebnisse eines einzigen kontrollierten Experiments betrachten. Sie stellen verwandte Messungen dar, die unter unterschiedlichen Bedingungen entstanden sind.
Selbst Benchmark-Definitionen können eine Erzählung prägen. OSWorld 2.0 unterstützt binäre Abschlüsse und Teilbewertung. Ein Modell kann erhebliche Teilpunkte erhalten, obwohl es keinen abgeschlossenen Workflow liefert.
Das macht Teilbewertungen nicht nutzlos. Sie können Fortschritte bei langen Aufgaben sichtbar machen, bei denen binärer Erfolg Verbesserungen verdecken würde. Käufer interessiert jedoch, ob der endgültige Datensatz, die Datei oder die Transaktion korrekt ist.
Auch Effizienz braucht mehr als Token-Zählungen. Forschung zu Agenteneffizienz ergab, dass führende Computer-Use-Agenten in der Bewertung zwischen 1,4- und 2,7-mal mehr Schritte benötigten als erforderlich.
Dieselbe Forschung zeigte, dass spätere Schritte deutlich länger dauern können als frühe. Planungs- und Reflexionsaufrufe verursachten einen Großteil der Latenz. Eine lange Agentenspur kann Verzögerungen daher weit über ihre sichtbare Anzahl an Aktionen hinaus verstärken.
Diese Erkenntnisse untermauern den Fokus von H Company auf Speicher und Shell-Zugriff. Sie zeigen jedoch auch, warum ein erfolgreicher Benchmark-Wert nicht automatisch zu einer akzeptablen Nutzererfahrung führt.
Eine faire Lesart ist weder Zurückweisung noch vorbehaltlose Akzeptanz. Holo4 erzielt ein konkurrenzfähiges, vom Unternehmen gemeldetes Ergebnis für ein relativ kompaktes Modell, bleibt jedoch hinter dem führenden geschlossenen System zurück.
Der Praxistest besteht darin, ob diese Ergebnisse in unabhängigen Harnesses, privaten Evaluationen und Workflows mit unternehmensspezifischen Berechtigungen und Daten bestehen bleiben.
Offene Trajektorien verbessern die Überprüfbarkeit, nicht die Sicherheit
Der stärkste Glaubwürdigkeitsschritt von H Company ist die Veröffentlichung der Spuren hinter seinen Ergebnissen, obwohl überprüfbares Verhalten nicht automatisch sicheres Verhalten bedeutet.
Der Trajektoriendatensatz enthält 7.366 Durchläufe von Holo4 27B und Holo4 35B-A3B. Jede Spur kann die Aufgabe, das Reasoning, Aktionen, Tool-Ergebnisse, Screenshots, Dauer, Schritte und die Endbewertung enthalten.
Die Sammlung umfasst über 2.100 OSWorld-Durchläufe der beiden Modelle. Außerdem enthält sie 212 OSWorld-2.0-Durchläufe und nahezu 3.200 AutomationBench-Durchläufe.
Weitere Spuren decken AndroidWorld, PinchBench und Agents’ Last Exam ab. H Company ermöglicht Nutzern, den Datensatz herunterzuladen oder Spuren über einen speziellen Viewer wiederzugeben.
Diese Offenlegung gibt Forschern mehrere Möglichkeiten, die Schlussfolgerungen des Unternehmens zu hinterfragen. Sie können prüfen, ob ein erfolgreicher Durchlauf einen angemessenen Weg nahm, unnötige Aktionen wiederholte oder von aufgabenspezifischen Abkürzungen profitierte.
Sie können auch Fehlermuster untersuchen. Eine aggregierte Punktzahl kann nicht zeigen, ob der Agent die Anweisung missverstand, das falsche Ziel anklickte, den Kontext verlor oder vor der Überprüfung stoppte.
Offene Trajektorien können offenlegen, ob Leistungsverbesserungen auf besserem Reasoning oder einem nachsichtigerem Harness beruhen. Sie können Teams zudem helfen einzuschätzen, wie häufig menschliches Eingreifen nötig sein könnte.
Transparenz nach der Ausführung unterscheidet sich jedoch von Kontrolle vor der Ausführung. Eine Spur hilft Untersuchenden zu verstehen, was passiert ist. Sie verhindert nicht, dass ein Agent Daten versendet, Dateien löscht oder böswilligen Anweisungen folgt.
Computer-Use-Agenten sind Risiken ausgesetzt, die herkömmliche Chat-Systeme vermeiden. Sie arbeiten in Umgebungen mit nicht vertrauenswürdigen Inhalten und wertvollen Zugangsdaten. Eine Webseite kann adversarialen Text direkt in die Beobachtung des Modells einfügen.
Der OS-Harm-Benchmark prüft absichtlichen Missbrauch, Prompt Injection und unbeabsichtigtes Modellverhalten über 150 Aufgaben hinweg. Seine Forscher fanden bei mehreren Frontier-Systemen nennenswertes unsicheres Verhalten.
Diese Studie bewertete Holo4 nicht; ihre Ergebnisse können daher die Sicherheit von Holo4 nicht belegen. Sie zeigt jedoch, dass kompetente Computersteuerung und sichere Computersteuerung getrennte Evaluierungsprobleme sind.
Das Risiko wird größer, wenn ein Modell breiten Schnittstellenzugriff hat. Ein Generalist kann vom Lesen einer Webseite zum Ausführen von Code oder zum Aufruf einer API wechseln. Diese Flexibilität erhöht den Nutzen und die möglichen Folgen eines Fehlers.
Unternehmen werden unabhängig von Benchmark-Ergebnissen mehrschichtige Kontrollen benötigen. Dazu gehören begrenzte Zugangsdaten, isolierte Ausführung, eingeschränkter Netzwerkzugriff, rückgängig machbare Aktionen und menschliche Freigaben für folgenschwere Schritte.
Sie benötigen außerdem Logs, die jede Aktion mit der Anweisung des Nutzers und dem zu diesem Zeitpunkt beobachteten Zustand verbinden. Das Trajektorienformat von Holo4 bietet ein nützliches Modell für solche Prüfaufzeichnungen.
Auch die Lizenzierung verdient Aufmerksamkeit. Offene Gewichte garantieren nicht für jeden Checkpoint oder jede Komponente identische kommerzielle Rechte. Teams sollten vor dem Einsatz jede Modellkarte und Abhängigkeit prüfen.
Dasselbe gilt für Data Governance. Screenshots und Agentenspuren können personenbezogene Informationen, Kundendaten oder vertrauliche Dokumente erfassen. Alles zu protokollieren kann das Debugging verbessern, zugleich aber einen weiteren sensiblen Datensatz schaffen.
H Company erklärt, dass Zugangsdaten, interne Hosts und personenbezogene Daten in der öffentlichen Trajektorienveröffentlichung maskiert wurden. Betreiber in der Produktion müssen gleichwertige Kontrollen für Schwärzung und Aufbewahrung ihrer eigenen Spuren schaffen.
Der offene Datensatz setzt einen höheren Maßstab für künftige Veröffentlichungen. Anbieter, die überlegene Computer-Use-Leistung behaupten, haben nun ein klareres Beispiel dafür, wie reproduzierbare Evidenz aussehen kann.
Die wertvollste externe Arbeit wird dennoch adversariales Replay, unabhängige Bewertung und Tests außerhalb des Harness von H Company umfassen. Transparenz eröffnet diesen Prozess; sie schließt ihn nicht ab.
Drei Signale werden zeigen, ob Holo4s Generalistenwette aufgeht
Die nächste Phase sollte anhand unabhängiger Reproduktion, privater Benchmark-Ergebnisse und Evidenz aus Produktions-Workflows beurteilt werden.
Das erste Signal ist die unabhängige Reproduktion der OSWorld-2.0-Leistung von Holo4. Forscher müssen die veröffentlichten Gewichte mit dokumentierter Infrastruktur, Prompts, Schrittlimits und Bewertungsregeln ausführen.
Das Erreichen der gemeldeten 61,7 Prozent würde die Behauptung von H Company stärken, dass das Modell selbst diese Fähigkeit trägt. Große Unterschiede würden darauf hindeuten, dass der Harness des Unternehmens mehr beiträgt, als die Schlagzeile vermuten lässt.
Die Reproduktion sollte außerdem binären Abschluss, Teilpunkte, Schritte, Latenz und Eingriffsraten vergleichen. Eine einzelne Punktzahl kann nicht erfassen, ob ein Agent innerhalb praktischer Grenzen zu einem nutzbaren Ergebnis gelangt.
Die veröffentlichten Trajektorien machen diese Arbeit besser umsetzbar. Forscher können von bekannten Durchläufen ausgehen, Fehlergrenzen untersuchen und alternative Harnesses anhand derselben Aufgaben vergleichen.
Das zweite Signal ist das private AutomationBench-Ergebnis von Holo4. Die Veröffentlichung räumt ein, dass die aktuellen Werte aus einem internen Durchlauf auf dem öffentlichen Set stammen, während Vergleichskosten auf eine Bestenliste mit privatem Set verweisen.
Eine private Evaluation würde einen saubereren Vergleich ermöglichen und Bedenken über Optimierung auf sichtbare Aufgaben reduzieren. Sie würde außerdem prüfen, ob Holo4 über unbekannte API-Workflows hinweg generalisiert.
Das Ergebnis sollte mehr als eine Erfolgsquote enthalten. Entwickler benötigen Kosten, Tokenverbrauch, Wiederholungen, Latenz und Fehlerkategorien unter einer dokumentierten Evaluierungskonfiguration.
Das dritte Signal sind glaubwürdige Produktionsbelege aus Workflows mit gemischten Schnittstellen. Die besten Fälle würden Aufgaben umfassen, die innerhalb einer Sitzung tatsächlich GUIs, Code und strukturierte Tools erfordern.
Nützliche Berichterstattung würde Abschlüsse ohne menschliche Korrektur, Erholung nach Schnittstellenänderungen und Leistung unter eingeschränkten Berechtigungen zeigen. Sie sollte auch irreversible Fehler zählen, nicht nur erfolgreiche Durchläufe.
Ein Workflow zur Ausgabenverarbeitung bietet einen repräsentativen Test. Der Agent muss Dokumente lesen, Felder validieren, mit Unternehmenssoftware interagieren und bestätigen, dass Datensätze den vorgesehenen Zustand erreicht haben.
Ein weiterer aussagekräftiger Test beträfe Engineering-Operationen über lokale Dateien, Issue-Tracker, Browser-Konsolen und Kommandozeilentools hinweg. Solche Workflows zeigen, ob gemeinsamer Kontext ein Vorteil oder eine Quelle unkontrollierten Verhaltens ist.
Modellupdates werden ein verwandtes Signal liefern. H Company erklärt, dass optimierte Drafter-Checkpoints geplant sind, um die Inferenz zu beschleunigen. Gemessene Latenzsenkungen würden das wirtschaftliche Argument für die Generalistenarchitektur stärken.
Auch Reaktionen von Wettbewerbern sind relevant, bleiben aber unterstützende Evidenz. Anbieter geschlossener Modelle können ihre Computer-Use-Fähigkeiten verbessern, während Entwickler offener Modelle ihren eigenen Veröffentlichungen umfassenderes Tool-Training hinzufügen können.
Die zentrale Frage lautet nicht, ob Holo4 jeder Alternative voraus bleibt. Entscheidend ist, ob ein einzelnes Generalistenmodell ein besseres Verhältnis von Zuverlässigkeit zu Komplexität liefert als ein Spezialisten-Stack.
Für Entwickler liegt die unmittelbare Chance in kontrollierter Evaluation. Verwenden Sie repräsentative Aufgaben, eingeschränkte Zugangsdaten und rückgängig machbare Umgebungen. Messen Sie abgeschlossene Ergebnisse statt isolierter Modellaktionen.
Für Unternehmenskäufer sollte die Beschaffungsfrage auch den Harness einschließen. Fragen Sie, welche Komponente Speicher, Freigaben, Wiederholungen, Geheimnisse, Audit-Logs und Wiederherstellung nach teilweiser Ausführung verwaltet.
Für Wissensarbeiter legt die Veröffentlichung nahe, dass Agenten mehr Anwendungsgrenzen überschreiten werden. Diese Bequemlichkeit macht Berechtigungsdesign und sichtbare Bestätigung jedoch auch wichtiger.
Holo4: powering generalist computer-use agents ist daher weniger eine Siegeserklärung als eine konkrete architektonische Herausforderung. H Company hat Modelle, Behauptungen und ungewöhnlich detaillierte Spuren geliefert.
Der nächste Schritt liegt bei unabhängigen Evaluatoren und Deployment-Teams. Kann Holo4 seine gemeldeten Ergebnisse reproduzieren, unbekannte Aufgaben bewältigen und echte Arbeit abschließen, ohne das operative Risiko auszuweiten?
Diese drei Tests werden bestimmen, ob Generalisten-Computer-Use-Agenten die Automatisierung vereinfachen oder lediglich ihre schwierigsten Probleme verlagern.



