top of page

AT&T senkt KI-Kosten mit Modell-Routing und offenen Modellen um 90 %

21. Aug.
12 Min. Lesezeit

AT&T erklärt, einige Kosten für künstliche Intelligenz um bis zu 90 % gesenkt zu haben, obwohl das Unternehmen täglich durchschnittlich 45 Milliarden Token verarbeitet. Die Behauptung, die Google-News-Leser erreicht, ist bemerkenswert – doch der Mechanismus ist wichtiger als der Prozentwert in der Überschrift.

Das Unternehmen fand nicht ein günstigeres Modell, das jedes Premiumsystem ersetzen könnte. Stattdessen baute es ein Gateway, das je nach erwarteter Schwierigkeit, Geschwindigkeit, Qualität und Kosten einer Anfrage unterschiedliche Modelle auswählt.

Dieser Ansatz stellt die Annahme infrage, dass Unternehmen sich auf ein einziges Spitzenmodell von OpenAI, Anthropic, Google oder einem anderen großen Anbieter standardisieren sollten. AT&T kombiniert stattdessen kommerzielle Systeme mit kleineren offenen Modellen, die für Telekommunikationsaufgaben trainiert wurden.

Die Strategie bringt einen klaren Zielkonflikt mit sich. Die Modellauswahl kann Inferenzkosten senken und die Abhängigkeit von einem einzelnen Anbieter verringern. Zugleich entsteht eine komplexe Betriebsebene, die Qualität, Sicherheit, Latenz und Ausfälle über viele Systeme hinweg bewerten muss.

Die Ergebnisse von AT&T beruhen weiterhin auf eigenen Angaben, und die öffentlich verfügbaren Belege liefern kein vollständiges unabhängiges Audit. Dennoch macht der Umfang dies zu mehr als einem weiteren KI-Experiment eines Unternehmens.

AT&T nahm seinen Modell-Router in Betrieb

Die wesentliche Veränderung bei AT&T besteht nicht allein darin, offene Modelle einzusetzen. Das Unternehmen platzierte die Modellauswahl zwischen Mitarbeitenden, Anwendungen und den Modellen, die ihre Anfragen beantworten.

Andy Markus, Chief Data and AI Officer von AT&T, beschrieb die Strategie in einem Unternehmensbeitrag vom 23. Juli über die KI-Ökonomie. Das Unternehmen verarbeitet laut diesem KI-Kosten-Update täglich durchschnittlich 45 Milliarden Token.

Ein Token ist eine kleine Text- oder Dateneinheit, die von einem Modell verarbeitet wird. Das Tokenvolumen ist eine nützliche Betriebskennzahl, weil die meisten gehosteten KI-Dienste nach Ein- und Ausgabevolumen abrechnen.

Jedes Token an das leistungsfähigste Modell zu senden, wäre einfach. Es würde jedoch teure Reasoning-Kapazität für Routineaufgaben wie Extraktion, Klassifizierung, Zusammenfassung und Datenaufbereitung verschwenden.

AT&Ts proprietäres AI Gateway soll diese Verschwendung verhindern. Das Gateway nutzt cachebewusstes Routing und berücksichtigt damit, ob wiederverwendbare Informationen bereits vorhanden sind, bevor es ein Modell auswählt.

Bei jedem Zug wägt das System die erwartete Antwortqualität gegen Geschwindigkeit und Kosten ab. Es kann zudem während einer mehrzügigen Unterhaltung das Modell wechseln, anstatt die gesamte Sitzung bei einem Anbieter zu belassen.

Diese Fähigkeit zum Wechsel innerhalb einer Sitzung ist wichtig. Eine Unterhaltung kann mit einer einfachen Abfrage beginnen, zu spezialisierter Netzwerkanalyse übergehen und mit einer komplexen Empfehlung enden.

Eine statische Zuweisung würde diese Schritte als eine einzige Arbeitslast behandeln. Dynamisches Routing kann sie entsprechend ihren Anforderungen an unterschiedliche Systeme senden.

AT&T erklärt, dieser Prozess habe die relevanten KI-Kosten um bis zu 90 % gesenkt und spare bereits Millionen. Diese Aussagen beziehen sich auf den Produktiveinsatz, nicht auf einen Lab-Benchmark.

AT&T hat jedoch den Nenner hinter der 90-%-Angabe nicht öffentlich gemacht. Das Unternehmen hat weder den Anteil des Datenverkehrs offengelegt, der die maximale Senkung erhält, noch einen detaillierten Qualitätsvergleich vorgelegt.

Die Behauptung sollte daher als unternehmensinternes Ergebnis an der oberen Grenze gelesen werden. Sie sollte nicht als garantierte Einsparung für jede Anwendung oder jedes Unternehmen gelten.

Trotz dieser Einschränkung verleiht das offengelegte Volumen dem Ergebnis Gewicht. Kleine Verbesserungen beim Routing summieren sich, wenn ein Unternehmen täglich Dutzende Milliarden Token verarbeitet.

Das System spiegelt zudem frühere Architekturentscheidungen von AT&T wider. Ask AT&T stützte sich zunächst auf OpenAI-Technologie, doch der Telekommunikationsanbieter konzipierte es so, dass es Algorithmen anderer Unternehmen unterstützen kann.

Diese Flexibilität zeigte sich beim Start von Ask AT&T im Jahr 2023. Der interne Assistent unterstützte Programmierung, Kundenservice, Übersetzung, Dokumentensuche, Netzwerkoptimierung und die Arbeit an Legacy-Software.

AT&Ts aktuelles Gateway macht aus dieser Optionalität eine Betriebsrichtlinie. Anwendungen müssen nicht mehr jede Modellentscheidung eigenständig treffen.

Das Gateway wird zu einem Kontrollpunkt für Routing, Caching, Messung und Governance. Es kann einheitliche Regeln anwenden, selbst wenn Anbieter neue Modelle veröffentlichen oder ihre Servicebedingungen ändern.

Deshalb ist die über Google News verbreitete Geschichte größer als eine Ankündigung zur Kostensenkung. AT&T behandelt die Modellauswahl als Unternehmensinfrastruktur statt als Anwendungseinstellung.

Warum Modell-Routing die Ökonomie von Unternehmens-KI verändert

Der Router verlagert den Wettbewerb weg von der Suche nach einem universell überlegenen Modell hin zur Suche nach dem kostengünstigsten Modell, das die Anforderungen jeder Aufgabe erfüllt.

Die Einführung von Unternehmens-KI beginnt häufig mit einem einfachen Muster. Ein Team wählt ein führendes gehostetes Modell, verbindet Unternehmensinformationen damit und erweitert nach einem erfolgreichen Pilotprojekt den Zugang.

Kosten werden schwieriger vorherzusagen, wenn die Nutzung über Mitarbeitende hinausgeht, die gelegentlich Fragen stellen. Automatisierte Workflows können wiederholte Prompts, lange Kontexte, Tool-Aufrufe, Wiederholungsversuche und Zwischenausgaben erzeugen.

Agenten erhöhen diesen Druck, weil eine Nutzeranfrage viele Modellaufrufe auslösen kann. Ein Workflow könnte Datensätze abrufen, Dokumente klassifizieren, einen Plan erstellen, Softwaretools aufrufen, Ergebnisse prüfen und seine Antwort überarbeiten.

Der Nutzer sieht eine erledigte Aufgabe. Das Unternehmen zahlt für jeden Schritt, der zu ihrer Ausführung erforderlich war.

AT&Ts Router geht dieses Problem an, bevor Verbrauch entsteht. Er versucht, bei jedem Zug das passende Modell auszuwählen, statt Mehrausgaben erst nach Eingang einer Rechnung zu analysieren.

Das ist vergleichbar mit der Verteilung von Arbeit in einem gemischten Team. Routineanfragen benötigen nicht immer den spezialisiertesten Experten, während schwierige Entscheidungen weiterhin eine Eskalation rechtfertigen.

Die Analogie hat Grenzen, weil ein Router diese Beurteilung automatisch treffen muss. Eine falsche Entscheidung kann eine schwache Antwort erzeugen, bevor jemand erkennt, dass ein leistungsfähigeres Modell nötig gewesen wäre.

AT&T erklärt, sein Gateway schätze neben Kosten und Geschwindigkeit auch die erwartete Ausgabequalität. Diese Qualitätsschwelle ist die zentrale Komponente, auch wenn der Einsparprozentsatz mehr Aufmerksamkeit auf sich zieht.

Reines Kosten-Routing würde durchgehend das kleinste verfügbare Modell bevorzugen. Produktions-Routing muss stattdessen die kostengünstigste Option identifizieren, die für eine konkrete Aufgabe noch akzeptabel ist.

Das daraus entstehende System kann Unternehmen mehr Verhandlungsmacht geben. Ein Unternehmen, das Arbeitslasten zwischen Anbietern verschieben kann, steht unter geringerem Druck, die technischen Einschränkungen oder kommerziellen Bedingungen eines einzelnen Anbieters zu akzeptieren.

Die Strategie verändert auch die Art, wie Anwendungen gebaut werden. Entwickler können eine Fähigkeit oder ein Serviceniveau anfordern, ohne jedes Feature dauerhaft an ein Modell zu binden.

Diese Abstraktion kann künftige Migrationen verkürzen. Sie kann Teams außerdem ermöglichen, ein neues Modell anhand von Live-Arbeitslastkategorien zu bewerten, bevor sie ihm breiteren Zugang gewähren.

AT&Ts Ansatz weist Spitzenmodellen eine engere Rolle zu. Sie werden zu Eskalationszielen für reasoning-intensive Anfragen statt zu den Standard-Engines für jede Interaktion.

Das bedeutet nicht, dass Spitzensysteme ihren Wert verlieren. Es bedeutet, dass ihr Wert auf Arbeit abgestimmt werden muss, die kleinere Modelle nicht zuverlässig erledigen können.

Unabhängige Beobachter sehen den Ansatz als Teil eines breiteren Unternehmensmusters. Roy Chua, Principal bei AvidThink, sagte Mobile World Live, dass führende Unternehmen Routing-Gateways für Kosten-, Sicherheits-, Caching- und Auditkontrollen nutzen.

Futuriom-Gründer Scott Raynovich argumentierte, dass offene Modelle proprietäre Unternehmensdaten unterstützen können, ohne Unternehmen von den teuersten Spitzensystemen abhängig zu machen.

Diese Kommentare stützen die Architektur, validieren AT&Ts gemeldete Einsparung jedoch nicht unabhängig. Die Unterscheidung ist wichtig, weil Architektur und gemessene Geschäftsergebnisse getrennte Fragen sind.

Der Router bündelt außerdem Entscheidungsmacht. Wer das Gateway kontrolliert, bestimmt, welche Modelle Datenverkehr erhalten, welche Qualitätsschwellen gelten und wie Ausfälle behandelt werden.

Diese Position gewinnt strategisch an Wert. Modellanbieter konkurrieren um Leistungsfähigkeit, während Routing-Ebenen die Nachfrage über Anwendungen und Anbieter hinweg beobachten.

Ein Router kann lernen, welches Modell bei Programmierung, Kundensupport, Telekommunikationsstandards, Betrugsanalyse oder Dokumentextraktion gut abschneidet. Diese Leistungshistorie wird zu nützlichen Betriebsdaten.

Für Unternehmenskäufer ist die Lehre praktisch. Modell-Benchmarks allein können die Ökonomie eines produktiven KI-Programms nicht erklären.

Die Zusammensetzung der Arbeitslast ist ebenso wichtig. Eine Organisation muss wissen, welche Aufgaben häufig sind, welche teuer sind und welche tatsächlich Reasoning auf Spitzenniveau erfordern.

Teams benötigen außerdem nachvollziehbare Bewertungskriterien. Ohne sie kann Routing zu einem intransparenten Mechanismus werden, der stillschweigend Antwortqualität gegen niedrigeren Verbrauch eintauscht.

Ein durchsuchbarer KI-Workflow kann Teams helfen, Entscheidungen, Belege und Ergebnisse festzuhalten. Diese Aufzeichnung wird wichtiger, wenn mehrere Modelle zu einem Prozess beitragen.

Die Berichterstattung in Google News kann die 90-%-Angabe wie einen einzelnen technischen Durchbruch erscheinen lassen. AT&Ts tatsächliche Methode ist eine fortlaufende Disziplin aus Klassifizierung, Bewertung, Caching und Messung der Arbeitslast.

Offene Telekommunikationsmodelle geben AT&T einen weiteren Kostenhebel

Routing senkt unnötigen Verbrauch, während domänenspezifische offene Modelle dem Router kostengünstigere Optionen geben, die Telekommunikationsterminologie und -abläufe verstehen.

AT&T kombinierte sein Gateway mit OTel 2.0, einer offenen Modellfamilie, die für Telekommunikation angepasst wurde. Das Unternehmen entwickelte die Modelle mit Branchendaten und einer Mischung aus Computing-Plattformen.

Ein domänenspezifisches Modell wird für ein abgegrenztes Fachgebiet trainiert oder angepasst, statt für allgemeine Unterhaltung. Sein engerer Fokus kann die Leistung bei spezialisiertem Vokabular, Dokumenten und operativen Fragen verbessern.

Die Telekommunikation stellt einen schwierigen Test dar. Modelle müssen möglicherweise technische Standards, Netzwerktopologie, Gerätetelemetrie, Funkkonfigurationen und Multi-Vendor-Systeme interpretieren.

Ein allgemeines Modell kann diese Themen umfassend diskutieren. Ihm kann dennoch die für den Netzbetrieb erforderliche Präzision fehlen, wo eine plausible, aber falsche Antwort schwerwiegende Folgen haben kann.

GSMA Intelligence argumentiert, dass domänenangepasste Modelle kleiner sein können und bei Telekommunikationsaufgaben dennoch wettbewerbsfähig bleiben. Seine OTel-Analyse ordnet AT&Ts Strategie als Alternative dazu ein, jede Anfrage über ein allgemeines Spitzenmodell zu routen.

AT&T erklärt, OTel 2.0 mit mehr als 400 Milliarden Token auf AMD GPUs nachtrainiert zu haben. Der umfassendere Entwicklungsworkflow verarbeitete ungefähr eine Billion Token.

Microsoft erklärt, AT&T habe etwa 530 GPUs über Foundry Managed Compute genutzt. Diese Gesamtzahl umfasste 430 AMD Instinct MI300X GPUs und mehrere Hardwarearchitekturen.

Die Modellentwicklungspipeline verteilte die Arbeit zudem auf mehrere offene Modelle. Microsofts Phi-4 übernahm Datenaufbereitung und synthetische Datengenerierung und verarbeitete monatlich mehr als 700 Milliarden Token.

Andere Modelle unterstützten Reasoning- und Entwicklungsaufgaben. Dies spiegelt die Philosophie des Produktions-Gateways wider: Ein Modell muss nicht jede Phase dominieren.

Microsoft erklärt, die Datengenerierung mit offenen Modellen habe im Vergleich zum Einsatz von Spitzenmodellen für dieselbe Entwicklungsarbeit Dutzende Millionen eingespart. Dies ist ein von einem Partner gemeldeter Vergleich, kein neutrales Finanzaudit.

Dennoch liefert der Microsoft-Account technische Details, die über AT&Ts kürzere Ankündigung hinausgehen. Er zeigt, dass die Wahl des Modells und die Wahl der Hardware als miteinander verbundene Entscheidungen behandelt wurden.

Offene Modelle können auf dedizierter Infrastruktur betrieben werden, statt ausschließlich über eine von einem Anbieter kontrollierte Programmierschnittstelle. Unternehmen können daher unterschiedliche Kombinationen aus Modellen, Beschleunigern, Clouds und On-Premises-Systemen bewerten.

Diese Flexibilität unterstützt AT&Ts erklärtes Interesse an Souveränität. In diesem Zusammenhang bedeutet Souveränität, Datenflüsse, Bereitstellungsentscheidungen und Abhängigkeiten von Zulieferern zu kontrollieren.

Das bedeutet nicht, dass AT&T externe Technologie eliminiert hat. Das Projekt nutzt Microsoft-Infrastruktur, AMD-Hardware, GSMA-Daten und anderswo entwickelte zugrunde liegende Modelle.

Die Strategie lässt sich besser als diversifizierte Abhängigkeit verstehen. AT&T versucht zu verhindern, dass ein einzelnes Modell, ein Chiplieferant, eine Cloud oder eine Entwicklungsumgebung unersetzlich wird.

Diese Position kann die Verhandlungsmacht verbessern. Wenn das Unternehmen auf mehreren Plattformen vergleichbare Ergebnisse nachweist, werden Wechsel während Beschaffungsgesprächen glaubwürdiger.

Offene Modelle ermöglichen zudem eine tiefere Domänenanpassung. AT&T kann mit freigegebenem Telekommunikationsmaterial trainieren und die Bewertung auf netzspezifische Aufgaben ausrichten.

Laut GSMA umfasste das anfängliche Quellmaterial Standards und Branchendokumente. Zu den Mitwirkenden gehörten Organisationen und Projekte zu Funknetzen, Schnittstellen, APIs und Telekommunikationsbetrieb.

Die Modellfamilie ist zudem für einen breiteren Einsatz in der Branche vorgesehen. Die Bereitstellung des Ergebnisses für andere kann gemeinsame Tests, Erweiterungen und spezialisierte Anwendungen fördern.

Allerdings erfordert „Open Source“ im Bereich KI eine sorgfältige Auslegung. Eine Veröffentlichung kann Gewichte und Nutzungsrechte bereitstellen, ohne jeden Trainingsdatensatz, jede Filterentscheidung oder jede Entwicklungsmethode offenzulegen.

Organisationen, die OTel 2.0 bewerten, müssen dessen tatsächliche Lizenz, Dokumentation, Datenoffenlegungen und Bereitstellungsanforderungen prüfen. Das Label allein beantwortet keine Governance-Fragen.

Der Umfang des Trainingsworkflows zeigt zudem, dass offen nicht kostenlos bedeutet. Dedizierte GPUs, Entwicklungsarbeit, Sicherheitskontrollen, Evaluierung und laufende Inferenz verursachen allesamt Kosten.

AT&T kann diese Investitionen rechtfertigen, weil das Unternehmen in einem ungewöhnlichen Maßstab arbeitet. Ein kleineres Unternehmen könnte für Aufbau und Verwaltung eines Modellportfolios mehr ausgeben, als es durch Routing einspart.

Dieser Größenunterschied begrenzt eine direkte Nachahmung. Die übertragbare Idee besteht nicht darin, dass jedes Unternehmen ein Telekommunikationsmodell trainieren sollte.

Die allgemeinere Lehre besteht darin, die Modellauswahl mit arbeitslastspezifischen Nachweisen zu verbinden. Ein Unternehmen sollte ein offenes Modell dort einsetzen, wo Domänenleistung, Kontrolle und Betriebskosten die zusätzliche Verantwortung rechtfertigen.

Die Einsparung von 90 % braucht weiterhin eine Qualitätsprüfung

AT&T hat einen glaubwürdigen Mechanismus und einen erheblichen Betriebsumfang offengelegt, aber nicht genügend Belege veröffentlicht, um das zentrale Ergebnis unabhängig zu verifizieren.

Die erste Unsicherheit betrifft den Umfang. „Bis zu 90 %“ beschreibt die stärkste gemeldete Reduktion, nicht unbedingt den Durchschnitt über AT&Ts gesamte KI-Landschaft.

Öffentliche Angaben nennen nicht den Ausgangsmix der Modelle. Sie zeigen auch nicht, wie viel Traffic auf kleinere Modelle verlagert wurde, wie oft der Router eskalierte oder wie stark die Einsparungen je nach Anwendung variierten.

Die zweite Unsicherheit betrifft die Qualität. AT&T sagt, dass Routing die Qualität nicht beeinträchtigt, doch Leser können weder aufgabenbezogene Akzeptanzschwellen noch Bewertungsergebnisse prüfen.

Diese Auslassung ist bedeutsam, weil Qualität keine einzelne Kennzahl ist. Eine Kundenservice-Zusammenfassung, eine Netzwerkempfehlung, ein Software-Patch und eine Betrugswarnung erfordern jeweils andere Standards.

Ein Router kann die durchschnittlichen Ausgaben senken, indem er mehr Traffic an kleinere Modelle sendet. Das Ergebnis ist nur dann wertvoll, wenn diese Modelle für die ihnen zugewiesene Arbeit zuverlässig bleiben.

Die Bewertung muss auch seltene Fehler erkennen. Ein Durchschnittswert kann eine kleine Zahl kostspieliger Fehler im Netzbetrieb oder in regulierten Workflows verdecken.

Menschliche Prüfung bleibt wichtig. Als Ask AT&T startete, sagte Markus, dass Fachexperten weiterhin generierten Code und andere folgenreiche Ergebnisse überprüfen müssten.

Routing hebt diese Anforderung nicht auf. Es fügt eine weitere Entscheidung hinzu, die Teams überwachen müssen, da sich eine Anwendung anders verhalten kann, wenn sich das ausgewählte Modell ändert.

Cache-bewusster Betrieb bringt verwandte Bedenken mit sich. Die Wiederverwendung früherer Berechnungen kann den Verbrauch senken, doch zwischengespeicherte Informationen müssen aktuell, korrekt abgegrenzt und geschützt bleiben.

Eine für einen Mitarbeiter oder Kunden geeignete Antwort kann nicht automatisch für einen anderen wiederverwendet werden. Identität, Berechtigungen, geografische Vorgaben und Richtlinien zur Datenaufbewahrung müssen der Anfrage folgen.

Sicherheitsteams müssen zudem jeden angebundenen Anbieter und jedes Modell bewerten. Ein Multi-Modell-System schafft mehr Integrationen, Zugangsdaten, Protokolle, Richtliniengrenzen und mögliche Fehlermodi.

Das Gateway kann diese Kontrollen zentralisieren, was ein Vorteil ist. Zugleich macht die Zentralisierung das Gateway zu einem hochwertigen Ziel und einer kritischen Abhängigkeit.

Wenn seine Klassifizierungslogik versagt, könnte eine sensible Aufgabe ein nicht freigegebenes Modell erreichen. Wird der Dienst nicht verfügbar, können viele nachgelagerte Anwendungen gleichzeitig ausfallen.

Latenz stellt einen weiteren Zielkonflikt dar. Der Router muss genügend Informationen prüfen, um ein Modell auszuwählen, und eine komplexe Bewertung kann die Antwort verzögern.

Caching kann einen Teil der Verzögerung ausgleichen, während kleinere Modelle möglicherweise schneller antworten. Das Gesamtergebnis hängt vom Routing-Overhead, dem Anwendungsdesign und dem gewählten Modell ab.

Anbietervielfalt schafft ebenfalls operative Arbeit. Anbieter verwenden unterschiedliche Schnittstellen, Kontextgrenzen, Formate für Tool-Aufrufe, Sicherheitskontrollen und Update-Zeitpläne.

Ein Gateway kann einen Teil dieser Unterschiede normalisieren. Es kann nicht garantieren, dass zwei Modelle jede Anweisung oder jedes strukturierte Ausgabeformat identisch interpretieren.

Modellaktualisierungen machen das Problem kontinuierlich. Eine Route, die im vergangenen Monat gut funktionierte, kann schlechter werden, nachdem ein Anbieter sein Verhalten ändert oder einen Ersatz veröffentlicht.

AT&T muss daher Bewertungen fortlaufend pflegen, statt jede Route nur einmal zu zertifizieren. Produktionsspuren sollten Fehlerraten, Eskalationen, Latenz und menschliche Korrekturen nach Arbeitslast offenlegen.

Bereitstellungen offener Modelle bringen Überlegungen zur Lieferkette hinzu. Teams müssen Gewichte, Bibliotheken, Lizenzen, Modellherkunft und Schwachstellen im gesamten Bereitstellungs-Stack nachverfolgen.

Auch die Datenqualität ist eine Einschränkung. Ein Telekommunikationsmodell, das auf Standards und synthetischem Material trainiert wurde, kann dennoch Lücken, veraltete Annahmen oder eine schwache Abdeckung ungewöhnlicher Geräte übernehmen.

Ein Ergebnis auf einer Bestenliste liefert nützliche Hinweise, bildet aber nicht jede Bedingung eines Live-Netzwerks ab. Produktionsevaluierungen müssen AT&Ts eigene Daten, Tools und operative Folgen widerspiegeln.

Die letzte Unsicherheit ist organisatorischer Natur. Ein technisch solides Routing kann weder einen unklaren Workflow noch eine Anwendung ohne verantwortliche Eigentümer beheben.

AT&T-Führungskräfte haben End-to-End-Workflows statt isolierter KI-Aufgaben betont. Dieser Unterschied ist wichtig, weil lokale Einsparungen verschwinden können, wenn Mitarbeitende schwache Ergebnisse später korrigieren müssen.

Unternehmen, die ähnliche Systeme erwägen, sollten die Gesamtkosten des Prozesses berechnen. Die Rechnung sollte Modellverbrauch, Infrastruktur, Evaluierungen, Entwicklung, Sicherheit, Prüfung und Fehlerbehebung einschließen.

Sie sollten zudem abgeschlossene Ergebnisse vergleichen, nicht nur Token. Eine günstigere Antwort ist nicht wirtschaftlich, wenn sie einen weiteren Anruf, einen weiteren Modelldurchlauf oder manuelle Nacharbeit verursacht.

Keines dieser Risiken widerlegt AT&Ts Ergebnis. Sie erklären, warum der gemeldete Prozentsatz einen Due-Diligence-Prozess beginnen und nicht beenden sollte.

Für Google-News-Leser ist die verantwortungsvolle Interpretation eng gefasst. AT&T sagt, sein Gateway habe Reduktionen von bis zu 90 % erzielt, doch die breitere Anwendbarkeit bleibt unbestätigt.

Was nach AT&Ts KI-Kostenbehauptung zu beobachten ist

Drei Signale werden zeigen, ob AT&T eine wiederholbare Unternehmensarchitektur aufgebaut oder eine ungewöhnlich günstige Gruppe von Arbeitslasten dokumentiert hat.

Das erste Signal ist eine detailliertere Produktions-Scorecard. AT&T sollte durchschnittliche Einsparungen über Arbeitslastkategorien hinweg offenlegen, nicht nur die größte Reduktion.

Eine hilfreiche Berichterstattung würde Kundenbetreuung, Programmierung, Dokumentenabruf, Netzwerkanalyse, Betrugserkennung und autonome Workflows getrennt ausweisen. Jede Kategorie hat eine andere Qualitätsschwelle und ein anderes Modellprofil.

Eine aussagekräftige Scorecard würde Eskalationsraten, Latenz, Fehlerraten und menschliche Korrekturen enthalten. Sie würde außerdem zeigen, ob der Verbrauch weiter steigt, nachdem die Stückkosten sinken.

Bleiben die durchschnittlichen Kosten bei wachsendem Volumen kontrolliert, wird AT&Ts Argument für Modellrouting stärker. Konzentrieren sich die Einsparungen auf eine kleine Gruppe einfacher Aufgaben, wird die Behauptung weniger übertragbar.

Das zweite Signal ist eine unabhängige Bewertung von OTel 2.0. Branchen-Bestenlisten bieten einen Ausgangspunkt, doch Betreiber benötigen Tests, die mit realen Netzwerkentscheidungen verknüpft sind.

Bewerter sollten das Modell mit größeren allgemeinen Systemen bei der Interpretation von Standards, Topologieanalyse, Telemetrie-Schlussfolgerungen, Fehlerbehebung und Tool-Nutzung vergleichen.

Sie sollten außerdem dokumentieren, wo das kleinere Modell versagt. Ein vertrauenswürdiges Domänenmodell benötigt klare Eskalationsgrenzen, nicht nur hohe aggregierte Werte.

Eine Einführung von OTel 2.0 außerhalb von AT&T würde eine weitere Form von Evidenz liefern. Andere Betreiber können testen, ob die gemeldeten Vorteile unterschiedliche Netzwerke, Anbieter, Sprachen und Vorschriften überstehen.

Eine bedeutsame externe Bereitstellung würde AT&Ts Argument stützen, dass spezialisierte offene Modelle einer Branche dienen können. Eine begrenzte Einführung würde darauf hindeuten, dass die Wirtschaftlichkeit stark von AT&Ts Größe und internen Daten abhängt.

Das dritte Signal ist die Reaktion von Anbietern führender Modelle und Infrastruktur. AT&Ts Strategie setzt sie unter Druck, den Premium-Verbrauch für jede Arbeitslast zu rechtfertigen.

Anbieter können mit kleineren Modellen, Systemen mit geringerer Latenz, stärkerem Caching, automatisiertem Routing oder besser planbaren Unternehmensverträgen reagieren. Sie können zudem Domänenanpassung und Optionen für private Bereitstellung verbessern.

Besondere Aufmerksamkeit verdient der Wettbewerb auf der Routing-Ebene. Cloud-Unternehmen, Modellanbieter, unabhängige Gateways und Anbieter von Unternehmenssoftware wollen alle die Modellauswahl beeinflussen.

Wenn Routing standardisiert wird, können Unternehmen Arbeitslasten freier verlagern. Entwickelt jede Plattform einen proprietären Router, könnte sich die Abhängigkeit von Lieferanten lediglich nach oben verschieben.

Auch Hardwarevielfalt wird wichtig sein. AT&Ts Einsatz von AMD und anderen Architekturen prüft, ob Unternehmen vermeiden können, ihre KI-Ökonomie an die Roadmap eines einzelnen Beschleunigers zu binden.

Konsistente Leistung über verschiedene Hardware hinweg würde das Souveränitätsargument stärken. Schwierige Migrationen oder ungleichmäßige Softwareunterstützung würden die Kosten der Aufrechterhaltung dieser Flexibilität offenlegen.

AT&Ts Erfahrung gibt Unternehmenskäufern zudem eine praktische Checkliste. Sie können beginnen, indem sie Anfragen nach Aufgabe, Risiko, Latenz, Qualität und abgeschlossenem Geschäftsergebnis messen.

Anschließend können sie testen, ob kleinere Modelle eng definierte Arbeitslasten erfüllen. Erst dann sollten sie automatisiertes Routing zwischen freigegebenen Optionen einführen.

Governance muss vor breitem Traffic eingeführt werden. Teams benötigen Zugriffskontrollen, Protokolle, Bewertungsschranken, Fallback-Regeln, Verfahren für Vorfälle und benannte Verantwortliche für jede Produktionsroute.

Das Ziel ist nicht, den Anteil günstig bearbeiteter Anfragen zu maximieren. Es besteht darin, die Kosten akzeptabler, abgeschlossener Arbeit zu minimieren.

Diese Unterscheidung hält den Router auf Geschäftsergebnisse ausgerichtet. Sie verhindert zudem, dass ein Kostenziel stillschweigend den Kundenservice, die Netzwerkzuverlässigkeit oder das Vertrauen der Mitarbeitenden schwächt.

AT&T hat eines der klarsten Beispiele eines Großunternehmens für diese Architektur präsentiert. Die Kombination aus 45 Milliarden täglichen Token, dynamischem Routing und domänenspezifischen Modellen verdient Aufmerksamkeit.

Das Unternehmen hat nicht gezeigt, dass jede Organisation eine Reduktion von 90 % reproduzieren kann. Es hat gezeigt, warum es im Produktionsmaßstab schwierig wird, ein Modell für jede Aufgabe bezahlen zu lassen.

Die nächste Phase wird von Belegen abhängen, nicht von einer weiteren Schlagzeile. Achten Sie auf die durchschnittlichen Einsparungen, externe OTel-2.0-Validierung und Reaktionen der Anbieter auf den Kauf mehrerer Modelle.

Diese Signale werden darüber entscheiden, ob die Behauptung von Google News zu einem Branchenleitfaden wird oder ein beeindruckendes Ergebnis bleibt, das von der ungewöhnlichen Größe von AT&T geprägt ist. Unternehmensteams sollten jetzt beginnen, ihren eigenen Workload-Mix zu messen, bevor sie einen Router auswählen oder ein weiteres Modell trainieren.

 
 

Kostenlos loslegen

Ein Local-First-KI-Assistent mit persönlichem Wissensmanagement

Für ein besseres KI-Erlebnis

unterstützt remio derzeit nur Windows 10+ (x64) und M-Chip Macs.

Ihr KI-Partner bei der Arbeit
Mehr schaffen mit remio

Planen. Erstellen. Liefern.
Alles an einem Ort.

bottom of page