top of page

Anthropic-a16z-Daten sagen, dass Agenten Menschen schlagen, doch der Benchmark verbirgt eine schwierigere Realität

11. Aug.
12 Min. Lesezeit

Anthropic-a16z-Daten setzen Claude Fable 5 bei OSWorld-Verified inzwischen auf 85 % und damit über einen häufig zitierten menschlichen Wert von 72,36 %. Ein Jahr zuvor lag der beste gemeldete Agentenwert bei rund 42 %. Dieser Anstieg deutet darauf hin, dass Computer-Use-Agenten eine Schwelle überschritten haben, die bis vor Kurzem noch weit entfernt schien.

Der Vergleich trägt jedoch eine wichtige Fußnote. Der menschliche Wert stammt aus der ursprünglichen OSWorld-Studie, während das Ergebnis von 85 % die überarbeitete OSWorld-Verified-Evaluierung nutzt. Diese Zahlen beschreiben verwandte Tests, bilden aber keinen kontrollierten Wettbewerb zwischen Claude Fable 5 und Menschen ab.

Die Unterscheidung ist wichtig, weil Computeragenten sich von Demonstrationen hin zu Arbeitsabläufen bewegen, in denen Fehler Folgen haben. OpenAI, Google, Anthropic und spezialisierte Entwickler wollen Agenten Browser, Desktop-Anwendungen und Geschäftssysteme bedienen lassen. Ein hoher Wert verändert die Erwartungen von Käufern, selbst wenn er nicht klärt, ob diese Systeme einen gewöhnlichen Arbeitstag bewältigen können.

Anthropic-a16z-Daten zeigen einen bemerkenswerten Anstieg innerhalb eines Jahres

Die wichtigste Veränderung ist nicht, dass ein Modell 85 % erreicht hat. Sie besteht darin, dass sich ein anspruchsvoller Benchmark für Computer-Use in etwa einem Jahr von rund 42 % auf 85 % verbessert hat.

Die von a16z hervorgehobene Scorecard für Computeragenten zeichnet bei OSWorld-Verified einen steilen Anstieg nach. Claude Fable 5 führt die gemeldeten Ergebnisse mit 85 % an. Das Diagramm präsentiert Computerinteraktion als einen der sich am schnellsten verbessernden Bereiche angewandter KI.

OSWorld prüft, ob ein Agent Aufgaben in realen Softwareumgebungen abschließen kann. Statt eine Frage zu beantworten, muss der Agent einen Bildschirm prüfen und entscheiden, was zu tun ist. Anschließend führt er Aktionen über Schnittstellen aus, die Maus- und Tastatursteuerungen ähneln.

Eine Aufgabe kann das Bearbeiten eines Dokuments, das Ändern einer Anwendungseinstellung, das Verarbeiten von Dateien oder das Verschieben von Informationen zwischen Programmen erfordern. Erfolg hängt von mehr als Sprachgenerierung ab. Der Agent muss Elemente der Benutzeroberfläche erkennen, Zustände erhalten, mehrere Schritte planen und feststellen, ob seine Aktionen funktioniert haben.

Der ursprüngliche OSWorld-Benchmark umfasste 369 Aufgaben mit Anwendungen wie Chromium, LibreOffice, Thunderbird, GIMP, VLC und Visual Studio Code. Acht Google-Drive-Aufgaben konnten ausgeschlossen werden, weil sie manuelle Konfiguration erforderten, wodurch eine Evaluierung mit 361 Aufgaben entstand.

Als die Forschenden den Benchmark 2024 vorstellten, meldeten sie für das beste Modell eine Erfolgsquote von 12,24 %. Mit der Software nicht vertraute menschliche Teilnehmende erledigten 72,36 % der Aufgaben. Diese enorme Lücke machte OSWorld zu einem nützlichen Test, weil er Schwächen offenlegte, die in dialogorientierten Benchmarks verborgen bleiben.

Agenten hatten Schwierigkeiten mit der Verankerung in grafischen Benutzeroberflächen, also damit, ein visuelles Ziel mit der richtigen Bildschirmposition zu verbinden. Ihnen fehlte zudem operatives Wissen darüber, wie Anwendungen funktionieren. Ein Modell konnte die Anweisung verstehen und dennoch auf das falsche Bedienelement klicken oder den Überblick über ein Dialogfenster verlieren.

Die spätere Initiative OSWorld-Verified befasste sich mit fehlerhaften oder instabilen Aufgaben in der ursprünglichen Sammlung. Die Pflege von Benchmarks ist wichtig, weil sich Websites verändern, Anwendungen aktualisiert werden und Evaluierungsskripte gültige Ergebnisse falsch auslesen können. Ein bereinigter Test kann Agenten konsistenter messen.

Eine Änderung des Benchmarks verändert jedoch auch die Bedeutung seiner Werte. Das Entfernen defekter Aufgaben verbessert die Validität, verhindert aber einen einfachen historischen Vergleich, sofern nicht jedes ältere System unter identischen Bedingungen erneut ausgeführt wird. Auch Agenteneinstellungen, Aktionslimits, Bildschirmauflösung und Evaluierungsharnesses müssen übereinstimmen.

Deshalb lässt sich die Entwicklung von 42 % auf 85 % am besten als Signal schnellen Fortschritts verstehen. Sie ist keine kontrollierte Schätzung, wonach Agenten exakt doppelt so leistungsfähig geworden sind. Der Trend ist stark, seine genaue Größenordnung bleibt jedoch unsicher.

Der Wert von 85 % ist dennoch folgenreich. Computer-Use-Systeme müssen visuelle Beobachtungen wiederholt in Aktionen übersetzen, sodass sich Fehler entlang einer Ausführungskette aufsummieren. Höhere Abschlussquoten erfordern Verbesserungen bei Wahrnehmung, Schlussfolgern, Gedächtnis und Fehlerbehebung.

Damit geht das Ergebnis über ein Update zur Modellqualität hinaus. Es zeigt, dass Entwickler besser darin werden, den gesamten Ausführungszyklus zusammenzustellen. Bessere Modelle helfen, doch auch Prompts, Bildschirmrepräsentationen, Reflexionsschritte und spezialisierte Komponenten zur Verankerung beeinflussen das Ergebnis.

Der Anthropic-a16z-Vergleich erfasst daher eine reale Veränderung. Computer-Use-Agenten scheitern nicht mehr nahezu automatisch an gewöhnlichen Desktop-Aufgaben. Die schwierigere Frage lautet, ob das Bestehen eines Benchmarks nun verlässliche Arbeit außerhalb seiner kontrollierten Umgebung vorhersagt.

Die Schlagzeile zum menschlichen Niveau verbindet zwei unterschiedliche Tests

Claude Fable 5 scheint einen bekannten menschlichen Referenzwert zu übertreffen, doch die verfügbaren Belege begründen keinen gleichwertigen Vergleich zwischen Menschen und Agenten.

Der Wert von 72,36 % stammt aus den menschlichen Tests für die ursprüngliche OSWorld-Arbeit. Der Wert von 85 % wird mit OSWorld-Verified, einem überarbeiteten Aufgabensatz und Evaluierungsprozess, in Verbindung gebracht. Sie als austauschbar zu behandeln, blendet den methodischen Kontext beider Zahlen aus.

Selbst das Wort „menschlich“ bedarf einer Einordnung. Die ursprüngliche Studie testete Personen, die mit der Software nicht vertraut waren. Ihr Wert war keine theoretische Obergrenze menschlicher Leistung. Erfahrene Nutzer, mehr Zeit oder eine klarere Einführung könnten zu einem anderen Ergebnis führen.

Auch der Agentenwert hängt von seinen Betriebsbedingungen ab. Computer-Use-Evaluierungen können sich bei Bildschirmauflösung, verfügbarer Aktionshistorie, maximalen Schritten, Wiederholungsrichtlinien und Budget für Schlussfolgerungen unterscheiden. Ein Agent, dem mehr Inferenz oder Reflexion erlaubt ist, kann mehr Aufgaben abschließen, benötigt dabei aber mehr Zeit und Rechenressourcen.

Erfolgsquoten können zudem aus einem Versuch oder aus mehreren Versuchen berichtet werden. Ein System, das in mehreren Durchläufen einmal erfolgreich ist, bietet eine andere Produkterfahrung als eines, das beim ersten Versuch zuverlässig erfolgreich ist. Geschäftsautomatisierung verlangt in der Regel das zweite Verhalten.

Ein weiteres Thema sind Daten zu Ausführungsverläufen. Benchmark-Aufgaben und erfolgreiche Interaktionsspuren können spätere Modelltrainings oder Agentendesigns beeinflussen. Eine solche Exposition entwertet ein Ergebnis nicht automatisch, schwächt jedoch die Behauptung, ein Wert messe allgemeine Computerkompetenz.

Das ursprüngliche OSWorld-Team stellte fest, dass ein längerer textbasierter Verlauf der Ausführung die Leistung verbesserte. Dieser Verlauf gab Agenten mehr Informationen über frühere Entscheidungen. Er schuf jedoch auch Effizienzprobleme, da der Kontext für das Schlussfolgern wuchs.

Auch die Bildschirmauflösung spielte eine Rolle. Höher aufgelöste Screenshots verbesserten die Ergebnisse im Allgemeinen, weil Modelle kleine Bedienelemente genauer lokalisieren konnten. Dieses Ergebnis zeigt, warum zwei nominell ähnliche Evaluierungen unterschiedliche Werte liefern können, wenn ihre Umgebungen nicht abgestimmt sind.

Ein Wert von 85 % lässt zudem eine erhebliche Fehlerquote zurück. Bei 361 Aufgaben entspräche eine Fehlerquote von 15 % ungefähr 54 nicht erfolgreich erledigten Aufgaben, wenn jede Aufgabe gleich gewichtet würde. Diese Schätzung verdeutlicht die operative Lücke, auch wenn gemeldete Benchmark-Protokolle Durchläufe unterschiedlich aggregieren können.

Für ein Verbraucherexperiment kann ein gelegentlicher Fehler akzeptabel sein. Bei Lohnabrechnung, Compliance, Kontoverwaltung oder Kundendaten ist ein Fehler bei einer von sieben Aufgaben eine Einschränkung für den Einsatz. Die Kosten hängen davon ab, ob das System sicher anhält oder einen falschen Zustand hinterlässt.

Das macht den Benchmark nicht bedeutungslos. OSWorld-Verified misst etwas Wichtiges: ob ein Agent eine begrenzte Anweisung in einer konfigurierten Computerumgebung ausführen kann. Er stellt eine realistischere Herausforderung dar als statisches Beantworten von Fragen.

Das Problem beginnt, wenn Erfolg in diesem Test zu einer Behauptung über allgemeine Autonomie am Arbeitsplatz wird. Reale Arbeit enthält unklare Anfragen, unterbrochene Sitzungen, wechselnde Berechtigungen, fehlende Informationen und Folgen, die sich nicht mit einer neuen virtuellen Maschine zurücksetzen lassen.

Menschen wissen auch, wenn Anweisungen mit dem Kontext kollidieren. Sie bitten um Klärung, bemerken verdächtige Änderungen und bringen externes Wissen in eine Aufgabe ein. Computeragenten optimieren oft darauf, die scheinbare Anweisung zu erfüllen – selbst wenn die richtige Handlung darin bestünde, innezuhalten.

Die Anthropic-a16z-Schlagzeile ist daher in ihrer Richtung nützlich, aber numerisch fragil. Sie besagt, dass Claude Fable 5 und das umgebende Agentensystem viele standardisierte Desktop-Aufgaben abschließen können. Sie zeigt nicht, dass das System in realen Arbeitsabläufen leistungsfähiger ist als ein erfahrener Mitarbeiter.

Eine sauberere Behauptung zum menschlichen Niveau würde verlangen, dass Menschen und Agenten dieselben verifizierten Aufgaben unter vergleichbaren Grenzen bearbeiten. Forschende müssten Abschluss, Zeit, Wiederholungen, Eingriffe und schädliche Fehler berichten. Ohne diese Kontrollen bleibt 85 % gegenüber 72,36 % ein aufmerksamkeitsstarker Vergleich verwandter Messgrößen.

Computeragenten setzen jede Automatisierungsstrategie unter Druck

Der Wert setzt Unternehmen unter Druck, die ihre Automatisierung auf APIs, Skripte und feste Workflows aufgebaut haben, weil Agenten auf Schnittstellenebene Software erreichen können, die diese Methoden nicht erreichen.

Traditionelle Automatisierung funktioniert am besten, wenn ein System strukturierte Schnittstellen bereitstellt. Entwickler verbinden eine Programmierschnittstelle, also eine API, mit einem anderen Dienst. Tools für robotergestützte Prozessautomatisierung folgen stattdessen vordefinierten Schnittstellenschritten und Regeln.

Beide Ansätze können wirksam sein, doch Integrationsarbeit erzeugt Reibung. Einige interne Tools verfügen über keine APIs. Ältere Software bietet möglicherweise unvollständige Schnittstellen, während kleine Änderungen im Workflow einen Entwickler oder Berater erfordern können, um die Automatisierung neu aufzubauen.

Ein Computer-Use-Agent bietet einen anderen Weg. Er interpretiert dieselben Bildschirme, die ein Mensch sieht, und handelt dann über die vorhandene Schnittstelle. Theoretisch kann eine Organisation damit Software automatisieren, ohne darauf zu warten, dass jeder Anbieter eine eigene Integration bereitstellt.

Anthropic stellte seine Computer-Use-Funktion rund um diese Idee vor. Die Computer-Use-Dokumentation beschreibt einen Zyklus, in dem eine Anwendung Screenshots bereitstellt und angeforderte Maus- oder Tastaturaktionen ausführt. Das Modell beobachtet jeden neuen Zustand, bevor es die nächste Aktion auswählt.

Diese Struktur ist attraktiv, weil sie Schlussfolgern und Ausführung trennt. Ein Unternehmen kann das Modell in einer kontrollierten Umgebung einsetzen und entscheiden, welche Aktionen zulässig sind. Der Agent benötigt keinen uneingeschränkten Zugriff auf den physischen Computer eines Mitarbeiters.

Der stärkere OSWorld-Verified-Wert erhöht die erwartete Rendite beim Aufbau dieser Infrastruktur. Ein System, das weniger als die Hälfte seiner Aufgaben erfolgreich erledigt, erfordert ständige Aufsicht. Bei 85 % erscheinen gezielte Einsätze plausibler, insbesondere wenn Fehler leicht zu erkennen sind.

Dieser Wandel setzt mehrere Gruppen unter Druck.

Anbieter von Unternehmenssoftware müssen entscheiden, ob Agenten ihre grafischen Oberflächen bedienen oder unterstützte APIs verwenden sollen. Schnittstellenzugriff erweitert die Abdeckung, kann jedoch unvorhersehbare Last erzeugen und Produktabläufe umgehen, die für menschliche Überprüfung konzipiert wurden.

Anbieter von Automatisierungslösungen müssen zeigen, warum deterministische Workflows weiterhin wertvoll bleiben. Ihr Vorteil liegt in Wiederholbarkeit, Auditierbarkeit und expliziten Regeln. Computeragenten konkurrieren, indem sie Variationen und unstrukturierte Anweisungen bewältigen.

Modellanbieter stehen unter Druck, mehr als Benchmark-Genauigkeit zu verbessern. Kunden benötigen Identitätskontrollen, Aktionsprotokolle, Berechtigungsgrenzen und zuverlässige Möglichkeiten, die Ausführung zu unterbrechen. Ein Modell, das den richtigen Button erkennt, ist nur eine Komponente eines einsetzbaren Agenten.

Auch OpenAI und Google konkurrieren in diesem Bereich. Ihre Systeme nutzen unterschiedliche Kombinationen aus visuellen Modellen, Browsern, Tools und Ausführungsumgebungen. Benchmark-Ranglisten sind wichtig, doch die Produktreichweite hängt davon ab, wie sicher diese Komponenten zusammenarbeiten.

Spezialisierte Agentenentwickler können ein allgemeines Modell weiterhin übertreffen, indem sie die Umgebung eingrenzen. Ein für eine einzelne Anwendung entwickeltes System kann eigene Parser, Wiederherstellungsregeln und Validierungsprüfungen enthalten. Allgemeine Computernutzung deckt mehr Aufgaben ab, während spezialisierte Automatisierung mehr Vorhersehbarkeit bieten kann.

Dieser Zielkonflikt wird die Akzeptanz prägen. Ein allgemeiner Agent könnte in einer Sitzung eine E-Mail entwerfen, eine Tabellenkalkulation aktualisieren und eine Datei hochladen. Ein spezialisiertes System könnte einen einzelnen Schadensfall mit strengeren Prüfungen und klarerer Verantwortlichkeit bearbeiten.

Unternehmen sollten mit hybriden Designs rechnen. Ein Agent kann eine Anfrage interpretieren und sich durch unbekannte Zustände navigieren, während APIs sensible Transaktionen ausführen. Deterministische Validatoren können das Ergebnis prüfen, bevor eine irreversible Aktion erfolgt.

Dieses Design begrenzt die Bedeutung einer einzelnen Rangliste. Die relevante kommerzielle Frage lautet nicht, ob Anthropic computer use 85 % erreicht hat. Sie lautet, ob ein konfiguriertes System die Aufgabenverteilung eines Unternehmens innerhalb seiner Risikotoleranz bewältigen kann.

Organisationen benötigen außerdem Zugang zu relevantem Kontext. Ein Agent, der Software bedient, muss wissen, welche Datei, welcher Kundendatensatz, welche Richtlinie oder welche Nachricht zutrifft. Eine durchsuchbare AI knowledge base kann Menschen helfen, diesen Kontext zu organisieren, ersetzt jedoch nicht die Notwendigkeit von Ausführungskontrollen.

Das neue Benchmark-Ergebnis verändert die Ausgangsannahme. Käufer müssen nicht länger fragen, ob Automatisierung auf Schnittstellenebene überhaupt funktioniert. Sie müssen herausfinden, wo sie zuverlässig funktioniert, wo sie eine Freigabe benötigt und wo eine API weiterhin sicherer ist.

Was der Wert von 85 % nicht misst

Die stärksten Belege gegen weitreichende Autonomie liefern längere Aufgaben, bei denen Agenten weiterhin Kontext verlieren, Änderungen übersehen und ihre eigene Arbeit nicht überprüfen.

Die ursprünglichen Aufgaben von OSWorld umfassten meist etwa 30 Aktionen. Das reicht aus, um Grounding-Fehler offenzulegen, ist aber deutlich kürzer als viele professionelle Arbeitsabläufe. Reale Aufgaben können sich über mehrere Anwendungen, Dokumente, Konten und Entscheidungspunkte erstrecken.

OSWorld 2.0 wurde entwickelt, um diese anspruchsvollere Situation zu testen. Sein Long-Horizon-Benchmark enthält 108 Workflows aus beruflichen und alltäglichen Bereichen. Eine erfahrene Person benötigt im Median etwa 1,6 Stunden, um eine Aufgabe abzuschließen.

Die Workflows umfassen Recherche, Engineering, kreative Produktion, Finanzen, Betrieb, Verwaltung, Compliance und Gesundheitswesen. Etwa 69,6 % dauern für einen erfahrenen Nutzer länger als eine Stunde. Sie enthalten dynamische Informationen, verborgene Zustände und über verschiedene Quellen verteilte Fakten.

Ein Beispiel betrifft die Einreichung eines Erstattungsantrags. Der Agent muss ein Tutorial lesen, Belege prüfen, Bank- und E-Mail-Daten kontrollieren, eine neue Nachricht bearbeiten, Mitarbeiterinformationen wiederherstellen und eine Unstimmigkeit auflösen. Korrektes Klicken ist dabei nur der Anfang.

Auf OSWorld 2.0 schloss das am besten berichtete System unter der primären binären Metrik 20,6 % der Aufgaben ab. Sein Teilwert erreichte 54,8 %, was bedeutet, dass es häufig Fortschritte machte, ohne den gesamten Workflow korrekt abzuschließen.

Dieses Ergebnis führt zur zentralen Umkehrung. Computeragenten können bei kürzeren, verifizierten Aufgaben übermenschlich erscheinen und bei langen professionellen Aufgaben dennoch weit unter einer zuverlässigen Leistung bleiben. Beide Befunde können zutreffen, weil sie unterschiedliche Zeithorizonte messen.

Die Leistung nahm mit zunehmender Aufgabendauer stark ab. Bei Workflows, die zwischen 137 und 163 menschliche Minuten dauerten, überschritt kein getestetes Modell 10 % binäre Abschlussrate. Über 163 Minuten hinaus schlossen die verbliebenen Modelle keine der Aufgaben ab.

Auch das Fehlermuster änderte sich. Agenten scheiterten nicht hauptsächlich daran, dass sie eine grundlegende Steuerung nicht bedienen konnten. Sie verloren Einschränkungen aus den Augen, übersahen neue Informationen, rieten statt Fragen zu stellen und ließen die abschließende Überprüfung aus.

Das sind gravierende Fehler am Arbeitsplatz. Ein Mitarbeiter kann einen falsch platzierten Klick oft sofort korrigieren. Ein System, das eine Richtlinienbedingung vergisst oder eine aktualisierte E-Mail ignoriert, kann ein Ergebnis erzeugen, das vollständig aussieht, aber inhaltlich falsch ist.

Die Effizienz eröffnet eine weitere Lücke. Die OSWorld-Human-Studie untersuchte, wie viele Schritte Agenten im Vergleich zu von Menschen entworfenen Trajektorien benötigten. Sie stellte fest, dass führende Systeme deutlich mehr Aktionen als nötig verwendeten.

Die Forschenden identifizierten außerdem Modellaufrufe für Planung, Reflexion und Bewertung als wesentliche Quellen von Latenz. Aufeinanderfolgende Schritte konnten mit wachsender Trajektorie dreimal länger dauern als frühe Schritte. Mehr Schlussfolgern verbesserte einige Entscheidungen, verlangsamte den Workflow jedoch.

In einem Beispiel benötigte ein Agent 12 Minuten, um zwei Absätze auf doppelten Zeilenabstand umzustellen. Eine Person mit grundlegender Computererfahrung könnte dieselbe Aktion in weniger als 30 Sekunden erledigen. Der bloße Abschluss erfasste diesen praktischen Unterschied nicht.

Die Studie berichtete, dass 23 % der analysierten Fehler auf schlechtes visuelles Grounding zurückgingen. Diese Fehler konnten einer Aufgabe bis zu 30 unnötige Schritte hinzufügen. Wiederherstellungsverhalten verbrauchte häufig Ressourcen, ohne ein korrektes Ergebnis zu garantieren.

Dies verkompliziert die anthropic a16z-Erzählung auf produktive Weise. Der Wert von 85 % spiegelt echte Fortschritte bei der Ausführung kurzfristiger Aufgaben wider. Die neueren Belege markieren die Grenze, an der sich dieser Fortschritt nicht mehr übertragen lässt.

Kosten bleiben eine weitere fehlende Dimension. Ein Agent könnte die Abschlussrate verbessern, indem er mehr Output-Token, mehr Versuche oder tiefere Reflexion einsetzt. OSWorld 2.0 stellte einen klaren Zielkonflikt zwischen Token-Effizienz und maximaler Abschlussrate fest.

Die Claude-Konfiguration mit der höchsten Punktzahl verwendete ein wesentlich größeres Output-Budget als ein effizienteres GPT-System. Käufer benötigen beide Messwerte, weil der beste Benchmark-Wert möglicherweise nicht das beste wirtschaftliche Ergebnis im großen Maßstab liefert.

Auch Sicherheit lässt sich nicht durch einen einfachen Prozentsatz abgeschlossener Aufgaben erfassen. Ein Agent kann eine Aufgabe technisch abschließen und dabei eine inakzeptable Aktion ausführen. Er könnte sensible Informationen offenlegen, einen unerwarteten Prompt akzeptieren oder ohne Freigabe eine irreversible Änderung vornehmen.

Benchmark-Umgebungen beginnen zudem aus kontrollierten Zuständen. Produktionscomputer sammeln Benachrichtigungen, Erweiterungen, zwischengespeicherte Sitzungen, Berechtigungsaufforderungen und Schnittstellenvariationen an. Kleine Unterschiede können eine Ausführungsstrategie brechen, die in einer standardisierten virtuellen Maschine funktionierte.

Webinhalte bringen gegnerische Risiken mit sich. Eine Seite kann Text enthalten, der versucht, den Agenten umzuleiten oder Zugangsdaten anzufordern. Systeme benötigen eine zuverlässige Unterscheidung zwischen der Anweisung des Nutzers und nicht vertrauenswürdigen Inhalten, die während der Aufgabe angezeigt werden.

Agenten für Computernutzung benötigen daher mehrschichtige Schutzmaßnahmen. Organisationen können Sitzungen isolieren, Domains beschränken, Berechtigungen begrenzen, Bestätigungen verlangen und Ergebnisse über separate Systeme validieren. Diese Kontrollen senken das Risiko, engen aber auch die Bedeutung autonomen Handelns ein.

Ein Benchmark-Wert sollte Einsatzgrenzen informieren, statt sie aufzuheben. Die stärksten kurzfristigen Anwendungsfälle sind begrenzt, reversibel und leicht zu prüfen. Maßnahmen mit hoher Auswirkung sollten weiterhin deterministische Prüfungen oder menschliche Freigaben durchlaufen.

Drei Signale werden zeigen, ob sich das Ergebnis übertragen lässt

Die nächste Phase wird durch den Abschluss langer Aufgaben, Zuverlässigkeit beim ersten Versuch und messbare Akzeptanz in der Produktion entschieden – nicht durch einen weiteren isolierten Ranglistenrekord.

Das erste Signal ist die Leistung auf OSWorld 2.0 oder einem anderen vergleichbaren Long-Horizon-Benchmark. Claude Fable 5s OSWorld-Verified-Ergebnis von 85 % wird deutlich überzeugender, wenn dasselbe Modell die Grenze von 20,6 % Abschlussrate bei erweiterten Workflows verbessert.

Teilfortschritt wird nicht ausreichen. Eine professionelle Aufgabe schafft oft nur dann Wert, wenn jeder erforderliche Schritt abgeschlossen und verifiziert ist. Forschende sollten binären Abschluss, Teilpunkte, Token-Verbrauch, Aktionszahl und Eingriffshäufigkeit gemeinsam berichten.

Ein großer Gewinn bei langen Aufgaben würde die Annahme stärken, dass Modelle Ziele und Einschränkungen über sich verändernde Umgebungen hinweg bewahren können. Ein kleiner Gewinn würde nahelegen, dass das Ergebnis von 85 % hauptsächlich von kürzeren, begrenzten Interaktionen abhängt.

Das zweite Signal ist Zuverlässigkeit beim ersten Versuch unter standardisierten Bedingungen. Anbieter sollten die Anzahl der Durchläufe, Aktionslimits, Einstellungen für Schlussfolgern und Evaluierungsharnesses hinter ihren Werten veröffentlichen. Unabhängige Wiederholungen würden Modellvergleiche glaubwürdiger machen.

Varianz ist wichtig, weil Nutzer keine durchschnittliche Benchmark-Leistung erleben. Sie erleben eine einzelne Ausführung nach der anderen. Ein System, das zwischen Erfolg und Fehler wechselt, verursacht Aufsichtskosten, selbst wenn sein Durchschnittsergebnis stark erscheint.

Berichte sollten außerdem die direkte Modellleistung von Verbesserungen durch Agenten-Frameworks trennen. Ein Planer, visueller Grounder, Wiederholungsmechanismus und Verifizierer können den Endwert erhöhen. Käufer müssen wissen, welche Komponenten den Gewinn erzeugt haben und ob sie ihn reproduzieren können.

Konsistente Ergebnisse beim ersten Versuch würden das Argument für menschliches Leistungsniveau stärken. Werte, die wiederholte Versuche oder ungewöhnlich große Budgets für Schlussfolgern erfordern, würden es für den gewöhnlichen Einsatz schwächen.

Das dritte Signal sind Produktionsbelege aus begrenzten Geschäftsworkflows. Nützliche Berichte würden Abschlussraten, durchschnittliche Ausführungszeit, Eskalationshäufigkeit und den Anteil der von Menschen korrigierten Ergebnisse umfassen.

Die aufschlussreichsten Einsätze werden Software ohne praktische APIs betreffen. Dort bieten Agenten auf Schnittstellenebene den deutlichsten Vorteil gegenüber konventioneller Integration. Dort können Schnittstellenänderungen aber auch ihre Fragilität offenlegen.

Beobachten Sie, ob Organisationen Agenten von der Beobachtung zur Handlung ausweiten. Ein System, das Informationen sammelt und einen Entwurf vorbereitet, birgt weniger Risiko als eines, das Zahlungen einreicht, Berechtigungen ändert oder Kunden kontaktiert.

Eine Ausweitung auf Maßnahmen mit höherer Auswirkung würde auf wachsendes Vertrauen in die Technologie und ihre Kontrollen hindeuten. Eine anhaltende Beschränkung auf Entwürfe und schreibgeschützte Aufgaben würde zeigen, dass Benchmark-Fortschritte operative Bedenken nicht ausgeräumt haben.

Die Daten von Anthropic a16z verdienen Aufmerksamkeit, weil sich Agenten für Computernutzung wesentlich schneller verbessert haben, als die ursprünglichen OSWorld-Ergebnisse vermuten ließen. Claude Fable 5s berichteter Wert von 85 % markiert eine glaubwürdige Veränderung der kurzfristigen Fähigkeiten.

Sie belegen nicht, dass Agenten Menschen bei der allgemeinen Computernutzung nun übertreffen. Diese Schlussfolgerung erfordert gleichwertige Tests, effiziente Ausführung, stabile Erstversuche und Erfolg über lange Workflows hinweg.

Für Entwickler und Käufer lautet die praktische Reaktion weder Ablehnung noch sofortige Autonomie. Testen Sie Agenten an repräsentativen Aufgaben, messen Sie jeden Eingriff und trennen Sie reversible von folgenreichen Aktionen. Stellen Sie dann die entscheidende Frage: Übersteht das anthropic a16z-Ergebnis den Kontakt mit Ihrer tatsächlichen Arbeit?

 
 

Kostenlos loslegen

Ein Local-First-KI-Assistent mit persönlichem Wissensmanagement

Für ein besseres KI-Erlebnis

unterstützt remio derzeit nur Windows 10+ (x64) und M-Chip Macs.

Ihr KI-Partner bei der Arbeit
Mehr schaffen mit remio

Planen. Erstellen. Liefern.
Alles an einem Ort.

bottom of page