Geprüfte Erhebung
Von rund 38.000 Domains mit einer llms.txt erhielten 97 Prozent im Mai 2026 keinerlei Abruf der Datei.
Was die Zahl nicht sagt: Sie misst Abrufe, nicht Wirkung. Für Coding- und Browser-Agenten bleibt die Datei sinnvoll. Widerlegt ist allein die Behauptung, KI-Suchsysteme läsen llms.txt für ihre Empfehlungen. Und auf die Bezugsgröße achten: Die 97 Prozent beziehen sich auf die rund 38.000 Domains, die eine Datei haben, nicht auf alle 137.210 untersuchten. Untersucht wurde außerdem kein Querschnitt des Webs, sondern die Domains eines Analyse-Anbieters, die im Mai Zugriffe hatten.
Ahrefs, 137.210 Domains, davon 28 Prozent mit llms.txt · Juni 2026
Geprüfte Erhebung
Bei knapp 300.000 untersuchten Domains fand sich kein Zusammenhang zwischen einer llms.txt und der Häufigkeit, mit der eine Domain in KI-Antworten als Quelle auftauchte.
Was die Zahl nicht sagt: Kein Zusammenhang ist keine Wirkungsmessung. Die Studie vergleicht, sie experimentiert nicht, und sie schränkt selbst auf das getestete Modell und den getesteten Datensatz ein. Die Vergleichsgruppe ist zudem kleiner als die Gesamtzahl vermuten lässt: Nur 10,13 Prozent der Domains hatten überhaupt eine Datei. Belastbar ist sie als zweite unabhängige Erhebung mit demselben Ergebnis wie der Befund oben.
SE Ranking, knapp 300.000 Domains, davon 10,13 Prozent mit llms.txt · November 2025
Herstellerdokumentation
Google erklärt llms.txt, Spezial-Markup und eigenes Chunking für die KI-Suche ausdrücklich für nicht nötig.
Was die Aussage nicht sagt: Sie gilt für die Google-Suche einschließlich ihrer generativen Funktionen, ausdrücklich nicht für andere Systeme. Für Dienste, die solche Dateien nutzen, hält Google sie im selben Text für unbedenklich. Und zu strukturierten Daten sagt Google nicht „nutzlos“, sondern rät weiter dazu, weil sie für Rich Results in der klassischen Suche qualifizieren. Aus Googles Sicht ist KI-Such-Optimierung weiterhin SEO.
Google Search Central, offizieller Leitfaden · Stand 10. Juli 2026
Einzelner Test
1.885 Seiten, die JSON-LD ergänzten, bewegten sich gegenüber 4.000 Kontrollseiten kaum: bei ChatGPT und Google AI Mode kein von null unterscheidbarer Effekt, bei den AI Overviews ein statistisch signifikanter Rückgang um 4,6 Prozent.
Was der Test nicht sagt: Untersucht wurden ausschließlich Seiten, die von KI bereits stark zitiert wurden; jede hatte im Februar 2025 über hundert Zitierungen in AI Overviews. Für Seiten, die bisher gar nicht vorkommen, trifft die Studie keine Aussage, und die Autoren halten dort einen Nutzen ausdrücklich für möglich. Es ist eine Beobachtungsstudie mit gematchten Kontrollen, kein Experiment. Für Rich Results in der klassischen Suche bleibt das Markup unstrittig nützlich.
Ahrefs, 1.885 Seiten gegen 4.000 gematchte Kontrollseiten, Ergänzungen zwischen August 2025 und März 2026 · Mai 2026
Geprüfte Erhebung
Erwähnungen durch Dritte korrelieren mit der Sichtbarkeit in KI-Antworten deutlich stärker als die klassischen Größen der eigenen Website: 0,66 bis 0,74 gegen 0,27 bis 0,33 für die Domain-Autorität und 0,19 für die Zahl der eigenen Seiten.
Was die Zahl nicht sagt: Korrelation ist keine Kausalität. Große Marken werden häufiger erwähnt und häufiger zitiert, ohne dass das eine das andere verursacht. Belastbar ist die Rangfolge: Was Dritte schreiben, wiegt schwerer als die eigene Technik. Zur Spanne: Sie fasst zwei Faktoren zusammen, Erwähnungen auf YouTube (0,737) und Erwähnungen im übrigen Web (0,656 bis 0,709 je nach System). Untersucht wurden außerdem etablierte Marken mit einer Domain-Autorität über 40, nicht ein Querschnitt.
Ahrefs, Korrelationsanalyse über 75.000 Marken in ChatGPT, Google AI Mode und AI Overviews · Dezember 2025
Geprüfte Erhebung
Stellt man zweimal dieselbe Frage, liegt die Wahrscheinlichkeit unter eins zu hundert, dieselbe Markenliste zu bekommen.
Was daraus folgt und was nicht: Wer KI-Sichtbarkeit mit einem einzigen Durchlauf misst, misst vor allem Zufall. Die Studie zieht daraus aber ausdrücklich nicht den Schluss, Messen sei sinnlos: Über Dutzende bis Hunderte Abfragen, mehrfach ausgeführt, hält sie einen Sichtbarkeitsanteil für eine vernünftige Kennzahl. Wer sie als „Tracking bringt nichts“ zitiert, geht weiter als der Beleg.
SparkToro mit Gumshoe.ai, 600 Teilnehmende, 12 Fragestellungen, 2.961 Durchläufe in ChatGPT, Claude und Google AI · Januar 2026
Geprüfte Erhebung
Erscheint eine KI-Zusammenfassung, klicken Nutzer bei 8 Prozent der Besuche auf ein klassisches Suchergebnis. Ohne Zusammenfassung sind es 15 Prozent.
Was die Zahl nicht sagt: Sie belegt keine Ursache. Anfragen, die eine KI-Zusammenfassung auslösen, sind systematisch andere als solche ohne, der Vergleich läuft also zwischen Anfragetypen, nicht innerhalb derselben Anfrage. Sie belegt auch keinen Umsatzverlust und nichts über kommerzielle Anfragen. Die härtere Zahl steht daneben: Auf einen Link innerhalb der Zusammenfassung wurde in einem Prozent der Besuche geklickt. Und die Quellenmischung der Zusammenfassungen ähnelte der normalen Suche, was der verbreiteten Erzählung von der Konzentration auf Reddit und Wikipedia widerspricht.
Pew Research Center, passives Browser-Tracking bei 900 US-Erwachsenen, 68.879 Google-Suchen im März 2025 · Juli 2025
Geprüfte Erhebung
Steht eine KI-Zusammenfassung über den Ergebnissen, liegt die Klickrate der ersten organischen Position rund 58 Prozent niedriger. Auf Position 2 sind es 50,8 Prozent, auf Position 3 46,4 Prozent.
Was die Zahl nicht sagt: Verglichen werden zwei verschiedene Keyword-Mengen, nicht zwei Zustände derselben Anfrage. Eine Ursache belegt das nicht. Der Vergleich läuft außerdem über zwei Jahre, Dezember 2023 gegen Dezember 2025, sodass jede andere Veränderung der Suche mit eingeht. Ahrefs verkauft Werkzeuge für Suchmaschinenoptimierung. Bemerkenswert ist die Selbsteinschränkung: Die Autoren verweisen auf konkurrierende Untersuchungen mit abweichenden Ergebnissen, darunter Seer Interactive, Kevin Indig und Authoritas. Die eigene Vorgängerstudie vom April 2025 kam für Position 1 noch auf 34,5 Prozent.
Ahrefs, Ryan Law, 300.000 Keywords, davon 150.000 mit und 150.000 ohne KI-Zusammenfassung, Daten aus Dezember 2025 · 4. Februar 2026
Geprüfte Erhebung
Bei informationsgetriebenen Anfragen mit KI-Zusammenfassung fiel die organische Klickrate von 1,76 auf 0,61 Prozent, also um 61 Prozent. Bei Anfragen ohne Zusammenfassung fiel sie im selben Zeitraum von 2,74 auf 1,62 Prozent, also um 41 Prozent.
Was die Zahl nicht sagt: Der zweite Teil ist der wichtigere und wird beim Zitieren fast immer weggelassen. Auch ohne KI-Zusammenfassung brach die Klickrate um 41 Prozent ein. Der Rückgang lässt sich also nicht allein den Zusammenfassungen zuschreiben, das Suchverhalten verändert sich insgesamt. Seer schreibt selbst, ein Ursachenbeweis sei nicht möglich, und nennt Streuungen von 0,8 bis 1,2 Prozentpunkten zwischen den einzelnen Anfragen. Untersucht wurden ausschließlich informationsgetriebene Anfragen, keine kommerziellen; die bezahlte Stichprobe ist mit 1,1 Millionen Impressionen deutlich kleiner als die organische.
Seer Interactive, 3.119 Suchbegriffe über 42 Organisationen, 25,1 Millionen organische und 1,1 Millionen bezahlte Impressionen, Juni 2024 bis September 2025 · 4. November 2025
Anbietermessung, vorläufig
Reddits Anteil an ChatGPTs Quellenangaben fiel binnen weniger Tage von 3,83 auf 0,52 Prozent. Am 8. August 2026 sprang ChatGPTs Gebrauch des site:-Operators von 0,37 auf 16,8 Prozent seiner abgeleiteten Suchabfragen. Ein zweites Anbieterpanel zählt im selben Fenster einen Rückgang der täglichen Reddit-Zitate von 497 auf 132, bei um 3,5 Prozent gestiegenem Gesamtzitatvolumen.
Was die Zahlen nicht sagen: Beide Anbieter verkaufen Sichtbarkeits-Werkzeuge. Promptwatch schließt einen eigenen Erfassungsfehler nicht aus und nennt die Größe des Rückgangs vorläufig. Otterly nennt seine 73,4 Prozent eine konservative Untergrenze: Das Vorfenster enthält den Bruch vom 8. August, das Nachfenster misst nur vier Tage. Die beiden Zahlen ergeben keine Spanne: Promptwatch misst einen Anteil an allen Quellenangaben, Otterly absolute Zitate je Tag gegen ein gestiegenes Gesamtvolumen. Aus Otterlys Zahlen abgeleitet liegt das Ausgangsniveau bei 1,38 statt 3,83 Prozent, Faktor 2,8. Verlässlich sind Richtung und Zeitpunkt, nicht Nachkommastelle und Niveau. Offengelegt ist bei Promptwatch der Nenner, nicht die Zusammensetzung des Panels. Was der Fall dennoch zeigt: Auf Googles KI-Oberflächen fiel Reddit im selben Zeitraum nur um 11 und 30 Prozent. Die Erklärung, Reddit habe Inhalte entfernt, ist entkräftet: Andere Maschinen zitieren dieselben Beiträge weiter. Belegt hat die Ursache kein Anbieter. Ein vergleichbarer Einbruch ein Jahr zuvor wurde Googles Abschaltung des Parameters num=100 zugeschrieben, nicht OpenAI.
Promptwatch, Klaas Foppen, Datenseite „Reddit Citations Are Dropping in ChatGPT“, 18. August 2026: täglicher Anteil von reddit.com an allen Quellenangaben von ChatGPT Search, gezählt werden nur Antworten mit mindestens einer Quellenangabe, Vergleich 18. Juli bis 7. August gegen 14. bis 17. August 2026 · der site:-Operator stammt aus derselben Reihe, eigene Datenseite vom 10. August 2026 (Datenseite site:-Operator) · erzählende Fassung beider Befunde im Blog vom 20. August 2026, zuletzt geändert am 8. September 2026, am Erscheinungstag berichtet von Axios (Blogfassung) · zweites Panel: Otterly.ai, 27. August 2026, 16 Markenberichte aus 14 Branchen im US-Markt, Vorfenster 6. bis 13. August, Nachfenster 14. bis 17. August 2026, Tagesmittel (zweite Messung)
Wird meist falsch zitiert
Die meistzitierte Zahl der KI-Sichtbarkeits-Branche, „bis zu 40 Prozent mehr Sichtbarkeit“, stammt aus einem Laboraufbau mit einem inzwischen abgelösten Modell und misst eine eigens definierte Kennzahl.
Wofür die Zahl wirklich gilt: Gemessen wurde ein positionsgewichteter Wortanteil, den eine Quelle in einer erzeugten Antwort einnimmt. Die „generative Suchmaschine“ war ein zweistufiger Eigenbau: die fünf besten Google-Treffer holen, dann mit GPT-3.5 eine Antwort erzeugen. Kein kommerzielles Produkt, kein heutiges Modell. „Bis zu 40 Prozent“ ist außerdem ein Maximalwert über die besten Methoden, kein Durchschnitt. Nicht belegt sind mehr Klicks, mehr Umsatz oder häufigere Nennung in ChatGPT oder Google. Die Arbeit selbst ist sauber und nennt ihre Grenzen; überdehnt wird sie beim Zitieren.
Aggarwal u. a., GEO: Generative Engine Optimization, arXiv 2311.09735, KDD 2024 · eingereicht November 2023
Geprüfte Erhebung
45 Prozent der Antworten von vier KI-Assistenten zu Nachrichtenfragen hatten mindestens einen erheblichen Mangel. Bei 31 Prozent lag er in der Quellenbehandlung.
Was die Zahl nicht sagt: Geprüft wurden Nachrichteninhalte, keine Marken. Wer sie als Beleg dafür zitiert, wie oft KI Unternehmen falsch darstellt, überträgt sie unzulässig. Bewertet haben Journalisten der beteiligten Häuser, also keine unabhängige Instanz, und die Modellstände sind von Mitte 2025. Markenrelevant ist trotzdem der Quellen-Befund: Fast ein Drittel der Antworten schrieb Aussagen einer Quelle zu, die sie nicht deckt. Das ist genau die Mechanik, über die auch eine Marke falsch zitiert wird.
European Broadcasting Union und BBC, 22 Medienhäuser in 18 Ländern und 14 Sprachen (darunter ARD, ZDF, Deutsche Welle und SRF), über 3.000 bewertete Antworten · Oktober 2025
Anbietermessungen, nicht vergleichbar
Wie viele der in Googles KI-Übersichten zitierten Quellen zugleich organisch in den Top 10 stehen, messen die beiden großen Anbieter unvereinbar: BrightEdge rund 17 Prozent im Mittel über Februar 2025 bis Februar 2026, Ahrefs 37,1 Prozent in seiner Erhebung vom 2. März 2026. Im einzigen Monat, für den beide eine Zahl ausweisen, ist der Abstand am größten: für Juli 2025 weist BrightEdge rund 16,6 Prozent aus, Ahrefs in seiner Erhebung aus demselben Monat 76,1 Prozent.
Woher der Abstand kommt: nicht aus dem Zeitversatz. Ahrefs zählte 2025 nur die drei sichtbarsten Zitate je Übersicht, 2026 nach eigener Angabe mehr davon, bei ebenfalls geändertem Parsing. Der Sprung von 76 auf 37 ist damit zu unbekanntem Anteil ein Verfahrensartefakt, kein Verlauf. Ahrefs zählt Adressen, BrightEdge nennt seine Einheit nur sources. Was offen bleibt: BrightEdge veröffentlicht Monatswerte nur bis Juli 2025, obwohl sein angegebener Erhebungszeitraum bis Februar 2026 reicht, und nennt die Größe seines Keyword-Sets nicht. Ahrefs nennt keinen Erhebungszeitraum, Sprache und Land keine der drei Erhebungen. Beide messen auf eigenen Indizes, und keine der Zahlen sagt, ob eine Nennung Besuche oder Umsatz bringt.
Ahrefs, Louise Linehan, 863.000 Keyword-SERPs und 4 Millionen zitierte Adressen, organisch 37,1 Prozent, Schlagzeile 37,9 Prozent einschließlich Anzeigen und SERP-Features, kein Erhebungszeitraum genannt · veröffentlicht 2. März 2026 · dieselbe Reihe, 1,9 Millionen Zitate aus 1 Million Übersichten, nur die drei sichtbarsten je Übersicht · veröffentlicht 21. Juli 2025 · BrightEdge, AI Catalyst und Generative Parser, wöchentliche Messung, Umfang nicht offengelegt, angegebener Erhebungszeitraum Februar 2025 bis Februar 2026, veröffentlichte Überschneidungstabelle nur Februar bis Juli 2025 · veröffentlicht 12. Februar 2026 · Zur BrightEdge-Quelle
Kontrollierter Test des Anbieters, Ergebnisdaten offen
Auf 20 Doku-Websites arbeiteten zwei Coding-Agenten deutlich sparsamer, sobald deren Unterseiten ganz oben auf die llms.txt verwiesen. Claude Code brauchte im Mittel 25,4 statt 30,8 Sekunden und 175.000 statt 215.000 Tokens je Aufgabe, Codex 45,1 statt 57,1 Sekunden und 115.000 statt 156.000 Tokens. Das sind 18 bis 26 Prozent weniger.
Was die Zahlen nicht sagen: Für Marken-Websites ist damit nichts belegt. Gemessen wurde auf Entwicklerdokumentation, die der Anbieter selbst ausliefert und verkauft. Gewonnen wird Effizienz, nicht Richtigkeit: Die Trefferquote bewegt sich über alle vier Varianten kaum, 94 bis 99 Prozent. Es sind Mittelwerte über rechtsschiefe Verteilungen, im Median sind es 9 bis 15 Prozent. Und der Vergleich ist hergestellt: Die gute Variante ist die unveränderte Auslieferung, die schlechte entsteht erst, indem der Testaufbau den Verweis herausschneidet und die llms.txt mit einem künstlichen 404 sperrt. Gemessen ist eine Wegnahme. Auf Signifikanz geprüft sind allein Fehlabrufe und Abrufzahl, nicht Zeit und Tokens. Die Protokolle, die die Quelle als mitgeliefert bezeichnet, fehlen im Repository.
Mintlify, Docs URL Discovery Bench · 20 Doku-Websites, 5 Fragen je Website, 4 Auslieferungsvarianten, 2 Agenten, 3 Durchläufe, 2.400 gewertete Läufe bei n=300 je Zelle · Claude Code auf claude-sonnet-5, Codex CLI auf gpt-5.5 · Juli 2026
Anbietermessung, Preprint ohne Begutachtung
Fragt man KI-Suchsysteme nach einer Kategorie, ohne den Markennamen zu nennen, erscheinen global bekannte Marken im ersten Messlauf im Schnitt in 72,9 Prozent der Antworten, etablierte Mittelstands- und Regionalmarken in 43,6 Prozent, kleine und Nischenmarken in 11,4 Prozent. Von allen 149.912 gezählten Quellenangaben führen 2,9 Prozent auf die Website der Marke selbst, 75,2 Prozent auf die anderer Unternehmen derselben Kategorie.
Was die Zahlen nicht sagen: Sie belegen keine Ursache. Die drei Stufen sind von Hand nach Wikipedia-Artikel, Presseecho und Finanzierung vergeben, also nach Hilfsgrößen für Web-Prominenz; gemessen wird danach eine aus dem Web gespeiste Sichtbarkeit. Den Zirkel benennt der Autor selbst. Die drei Werte mitteln über die 11, 36 und 55 Marken einer Stufe, nicht über alle Antworten; das 95-Prozent-Intervall der untersten reicht von 4,2 bis 20,3 Prozent. Wer gemessen hat: Der Autor ist Mitgründer von Ranqo und hält Anteile daran, die untersuchten Marken sind Kunden der Plattform, der Text ein Preprint ohne Begutachtung. Wer die oft zitierten 78 Prozent Unternehmensseiten liest, als trage die eigene Website die Sichtbarkeit, dreht den Befund um.
Pratyush Kumar (Mitgründer von Ranqo), Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines, arXiv:2606.20065v1, Preprint ohne Begutachtung, 14 Seiten · 102 Marken, 3.508 abgeschlossene Messläufe, 102.025 Antworten von fünf Systemen (ChatGPT, Gemini, Perplexity, Claude, Grok), 149.912 Quellenangaben aus Antworten, in denen die Marke vorkam, erhoben auf der Plattform Ranqo zwischen März und Mai 2026 · eingereicht 18. Juni 2026
Anbietermessung, vorläufig
Von 18.012 Zitierungen ChatGPTs aus Webseiten stammen 44,2 Prozent aus den ersten 30 Prozent des Textes. Der mittlere Abschnitt, mit 40 Prozent Textlänge der breiteste, trägt 31,1 Prozent, der Schluss 24,7 Prozent. In einer zweiten Auswertung über 11.022 Zitierungen lag die Eigennamen-Dichte zitierter Einleitungen bei 20,6 Prozent, gegenüber 5 bis 8 Prozent, die der Autor aus Standardkorpora ableitet (Brown Corpus, Penn Treebank), ohne Rechenweg.
Was die Zahlen nicht sagen: Gemessen ist, woher ChatGPT zitiert hat. Ob ein umgeschriebener Text häufiger zitiert wird, ist ungeprüft. Auf Absatzebene gilt die Regel nicht: In einer gesonderten Auswertung von 1.000 stark zitierten Inhalten stammen 53 Prozent der Zitierungen aus der Absatzmitte, nur 24,5 Prozent aus dem ersten Satz. Erhebungszeitraum und Modellstand fehlen; zur Sprache des Materials sagt die Quelle nichts, englisch sind nur die Vergleichskorpora. Woher die Daten kommen: Einzige Quelle ist der Anbieter Gauge, der KI-Sichtbarkeitssoftware verkauft; derselbe Methodik-Abschnitt wirbt zwei Absätze weiter mit 75 Prozent Rabatt auf dessen Verkaufsgespräch. Welcher Satz zitiert wurde, ist über Textvektoren geschätzt.
Kevin Indig, Growth Memo, Daten von Gauge · 18.012 Zitierungen für die Positionsanalyse, 11.022 für die Sprachanalyse, isoliert aus einem Bestand von 1,2 Millionen, den die Quelle an drei Stellen unterschiedlich bezeichnet (Suchergebnisse, ChatGPT-Antworten, verifizierte Zitierungen); Gauge lieferte rund 3 Millionen Antworten mit 30 Millionen Zitierungen · 16. Februar 2026 · Original hinter Bezahlschranke; Forschungsteil und Methodik im Internet Archive lesbar, das Zusatzmaterial für Bezahlabonnenten fehlt
Geprüfte Erhebung
Auf 30,6 Prozent von einer Million untersuchten Startseiten fanden sich Buttons ohne zugänglichen Namen, auf 51 Prozent Formularfelder ohne Beschriftung.
Was die Zahlen nicht sagen: Sie stammen aus einer Barrierefreiheits-Erhebung, nicht aus einem Agenten-Test; der Bezug ist trotzdem direkt, weil ein Button ohne Namen auch im Accessibility-Baum keine Bezeichnung trägt und Agenten, die über diesen Baum arbeiten, ihn dann nicht benennen können. Gemessen sind Startseiten, nicht ganze Websites, und beide Anteile zählen Seiten mit mindestens einem solchen Fehler, nicht den Anteil aller Buttons oder aller Formularfelder. Bei den Formularfeldern ist das die entscheidende Unterscheidung: Dieselbe Erhebung zählt getrennt 33,1 Prozent aller Formularfelder ohne Beschriftung, also ein Drittel. Geprüft wurde der Seitenzustand nach Ausführung von JavaScript, also das, was ein rendernder Agent vorfindet. WebAIM hält fest, dass ein automatisches Werkzeug nicht alle Verstöße findet: Die Werte sind eher zu niedrig als zu hoch, und ein ausbleibender Fund belegt keine Barrierefreiheit.
WebAIM Million, achte Ausgabe: WAVE-Prüfung von einer Million Startseiten aus dem Tranco-Ranking · Daten von Februar 2026, Seite zuletzt geändert am 30. März 2026 · Vorjahreswerte 29,6 Prozent bei den Buttons und 48,2 Prozent bei den Formularfeldern
Vorläufig, Prototyp
In einem kontrollierten Versuch erreichten drei Browser-Agenten auf der agentenfreundlich gebauten Fassung eine strikte Erfolgsquote von 89,3 Prozent gegenüber 49,3 Prozent auf der Ausgangsfassung.
Was der Versuch nicht sagt: Variiert wurde maschinelle Klarheit, nicht Barrierefreiheit, und es sind zwei Fassungen eines eigens gebauten Shop-Prototyps, keine echte Website. Die Autoren halten ausdrücklich fest, es handle sich um einen Proof of Concept, dessen Ergebnisse „should not be generalized to all domains, websites, or agent systems“. Genannt ist zudem die strengere von zwei gemessenen Erfolgsquoten. Es ist der beste vorhandene Hinweis, kein Nachweis.
Elnaffar und Rashidi, Designing Agent-Ready Websites, arXiv 2607.12056, 300 Durchläufe mit drei Modellen · Juli 2026
Wird meist falsch zitiert
Die vielzitierte Zahl vom Absturz der Agenten-Erfolgsquote von 78 auf 42 Prozent stammt aus einer Studie, die keine einzige Website verändert hat.
Was wirklich variiert wurde: die Bedienung des Agenten, nicht die Barrierefreiheit der Seiten. Die Studie hat dem Agenten sinngemäß die Maus weggenommen und ihn auf die Tastatur beschränkt. Als Beleg dafür, dass barrierefreie Websites Agenten helfen, taugt sie deshalb nicht, obwohl sie genau dafür überall zitiert wird. Ein sauberer Vergleich barrierefrei gegen nicht barrierefrei fehlt bis heute. Auch die Zahlen sind enger, als sie zitiert werden: Sie gelten für ein einzelnes Modell (Claude Sonnet 4.5, genau 78,33 auf 41,67 Prozent), und die Aufgaben umfassen Desktop-Anwendungen, nicht nur Websites. Ein zweites, offenes Modell fiel von 20 auf 0 Prozent.
A11y-CUA, arXiv 2602.09310, vorgestellt auf der CHI 2026 · Februar 2026
Kontrollierter Test
Sieben verbreitete KI-Assistenten aus den USA führen beim nutzerausgelösten Abruf kein JavaScript aus und werten nur das rohe HTML aus. Fünf andere tun es.
Was der Test zeigt und was nicht: Getestet wurde mit einem Köderwert im rohen HTML und dem echten Wert hinter JavaScript. ChatGPT, Claude, Gemini, Perplexity, Meta AI, Copilot und Grok lieferten den Köder, DeepSeek, ERNIE, Qwen, Kimi und Mistral den echten Wert. Die Trennlinie verläuft nach Anbieter, nicht nach Technik: Es ist eine Entscheidung, keine Grenze. Und der Befund gilt für den direkten Abruf, nicht für Inhalte, die über den Google-Index in eine Antwort gelangen. Ein früherer Test vom Dezember 2025 hatte Gemini noch als einziges rendernde System gemessen; die Lage ändert sich also.
Search Engine World, 12 Assistenten im Vergleich · Juni 2026 · früherer Test: searchVIU, Dezember 2025
Herstellerdokumentation
Lighthouse führt seit Version 13.3.0 vom 7. Mai 2026 eine Kategorie „Agentic Browsing“ in der Standardkonfiguration.
Was der Score nicht sagt: Google kennzeichnet die Kategorie ausdrücklich als experimentell und auf vorgeschlagenen Standards beruhend; sie braucht Chrome 150 oder neuer, und die WebMCP-Prüfungen setzen eine Anmeldung zum Origin Trial voraus. Ausgegeben wird eine Bestehensquote, kein Wert von 0 bis 100 wie bei Performance oder SEO. Gemessen wird Agenten-Tauglichkeit, ausdrücklich nicht die Sichtbarkeit in der Google-Suche. Bemerkenswert ist die Richtung: Maschinenlesbarkeit wird von einer Behauptung zu einer gemessenen Eigenschaft.
Lighthouse-Release 13.3.0 vom 7. Mai 2026, Kategorie in der Standardkonfiguration · Googles Dokumentation dazu
Herstellerdokumentation
Google nennt drei Wege, auf denen Agenten eine Seite wahrnehmen: Bildschirmfotos, rohes HTML und den Accessibility-Baum. Moderne Agenten kombinieren sie.
Was daraus nicht folgt: dass Agenten ausschließlich über den Accessibility-Baum arbeiten. Genau diese Verkürzung kursiert. Google beschreibt den Baum als hochauflösende Karte, die den visuellen Lärm ignoriert, sagt aber im selben Text, dass Agenten Baum und DOM mit einer visuellen Darstellung abgleichen. Für die Praxis ändert das wenig: Ein Element ohne zugänglichen Namen fehlt in zwei der drei Wege.
Google, Build agent-friendly websites (web.dev) · Stand 1. April 2026
Herstellerdokumentation
Meta hat sein acht Jahre intern gewachsenes Designsystem im Juni 2026 als Open Source veröffentlicht und begründet dessen Bauweise ausdrücklich mit Agenten: Designsysteme seien historisch für den menschlichen Gebrauch entworfen worden, und da immer mehr Code von Agenten geschrieben werde, müsse man ihre Struktur neu denken. Bedient wird das System über Kommandozeile oder MCP.
Was das nicht sagt: Es sind Herstellerangaben, nicht unabhängig geprüft. Die Reichweite von über 13.000 Anwendungen bezieht sich auf Metas eigenen Bestand, nicht auf den Markt, und das System ist als Beta gekennzeichnet. Die zweite, gern weitergereichte Zahl gehört eingeordnet: Der Rückgang der wöchentlichen Einfügerate aus der zugehörigen Figma-Bibliothek um 95 Prozent ist eine interne Beobachtung bei Meta, kein Branchenwert. Und die Bibliothek wurde nicht abgeschafft, sondern im August als Experiment veröffentlicht, gebaut und gepflegt von einem Cronjob mit Anbindung an Figmas MCP.
Astryx by Meta, „Introducing Astryx“, 18. Juni 2026, und „Who needs a Figma Library?“, 5. August 2026 · Repository unter MIT-Lizenz
Geprüfte Erhebung
Von 20 untersuchten Open-Source-Designsystemen liefern 17 einen herstellereigenen MCP-Server, 17 offizielle Agent Skills und 14 eine llms.txt. Die Erhebung fasst das so zusammen: „Nobody is still arguing about whether to ship a machine interface.“
Was die Zahl nicht sagt, und das ist beim Nachrechnen der erste Stolperstein: Die Erhebung führt zwei Reihen. Der Essay zählt ausschließlich herstellereigene, offizielle Angebote und kommt auf 17, 17 und 14; die Systemtabelle auf der Startseite zählt Community-Angebote mit und kommt auf 19, 18 und 14. Beide sind richtig, sie messen Verschiedenes. Wer die engere Zahl zitiert, muss „herstellereigen“ dazusagen. Der wichtigere Vorbehalt: Gemessen wurden Designsysteme, also Komponenten und Code für Entwickler, nicht Markenrichtlinien. Über Marken außerhalb der Softwarebranche sagt die Erhebung nichts. Sie ist außerdem eine Momentaufnahme von drei Tagen und stammt von einer einzelnen Person, nicht von einem Institut.
Kaelig Deloumeau-Prigent, 20 Open-Source-Designsysteme, Daten erhoben 26. bis 28. Juli 2026 · Bericht 1. September 2026 · CC BY 4.0 · die engeren Zahlen stehen im Essay-Teil der Seite
Dokumentierter Einzelfall
GitLab hält Markenstimme, Namensregeln, Markenzeichen-Richtlinien, Werte und Mission als versionierte Markdown-Dateien in einem öffentlichen Repository, jede Änderung mit Datum, Klarnamen und schriftlicher Begründung. Die Neufassung der drei Merkmale der Markenpersönlichkeit ist ein einzelner Commit vom 22. Mai 2025 über vier eingefügte und fünf gelöschte Zeilen, von Senior Brand Managerin Betsy Bula, begründet mit der Angleichung an aktuelle Kommunikation und den FY26-Unternehmensplan.
Was der Fall nicht zeigt: ein einziges Unternehmen, und einen Softwarehersteller, dem das öffentliche Repository ohnehin Hausform ist. Belegt ist die Form, keine Wirkung: ob Sprachmodelle GitLab deshalb treffender beschreiben, ist nirgends gemessen. Und keine zweite Prüfinstanz, Merge Request 13766 ist von derselben Person eingereicht und nach knapp 16 Minuten kommentarlos selbst zusammengeführt. Wo die Offenheit endet: Die offiziellen Brand Guidelines liegen nicht dort, sondern auf design.gitlab.com, wo dieselben drei Merkmale weiter den Wortlaut von vor dem 22. Mai 2025 tragen, zuletzt inhaltlich geändert am 20. Dezember 2024. Der Widerspruch steht seit über fünfzehn Monaten; ein Versionsverlauf erzeugt Nachvollziehbarkeit, keine Übereinstimmung. Dazu die Gegenbewegung: die Vision am 10. Februar 2025 ins interne Handbuch verschoben, die Strategieseite am 17. Juli 2025 entfernt. Positionierung im Marketing-Sinn liegt dagegen weiter öffentlich dort, je Anwendungsfall als Message House mit eigener Zeile „Positioning Statement“. Wer datiert, datiert je Datei: Das Repository entstand am 23. Januar 2023, die Werte kamen am 2. Mai 2023, Markenzeichen-Richtlinien am 16. November 2023, Markenstimme am 21. Dezember 2023, Namensregeln erst am 6. Februar 2025. Nach dem Anlagedatum zu datieren, liegt um bis zu zwei Jahre daneben.
GitLab Handbook, öffentliches Repository gitlab-com/content-sites/handbook, geprüft am 10. September 2026 · Markenstimme mit den drei Merkmalen in content/handbook/marketing/brand-experience/content-style-guide.md, Namensregeln in naming.md, Markenzeichen-Richtlinien in trademark-guidelines.md, Werte in content/handbook/values/_index.md, Mission in content/handbook/company/mission.md · Commit e692ba4b vom 22. Mai 2025, 17:11 Uhr UTC, Merge Request 13766 · abweichende Fassung derselben Merkmale im Design-System-Repository gitlab-org/gitlab-services/design.gitlab.com, contents/brand-messaging/brand-voice.md (Design-System-Repository)
Stand der Normung
Ein einheitlicher Standard dafür, wie Websites die KI-Nutzung ihrer Inhalte erlauben oder untersagen, existiert bis heute nicht.
Wie weit die Arbeit ist: Die IETF-Arbeitsgruppe AIPREF entwickelt zwei Bausteine, Vokabular und Anbindungsmechanismus. Beide stehen am 10. September 2026 im IESG-Zustand „I-D Exists“, also noch nicht eingereicht, kein RFC. Vom 4. September bis 3. November 2025 lief die Schlussabstimmung, danach wieder „WG Document“. Der Vokabular-Entwurf trägt seit April 2026 den Hinweis, sein Inhalt spiegele keinen Konsens wider, und markiert zwei Abschnitte als noch ohne Konsens; der Anbindungs-Entwurf nicht. Der eigene Zeitplan ist zweimal gerissen: fällig im August 2025, am 23. September 2025 verschoben auf den 31. August 2026, auch dieser Termin ohne Einreichung verstrichen und nicht neu datiert. Was der Eintrag nicht sagt: ob ein Standard kommt und wann, und wie gut die Behelfe tragen, robots.txt und anbieterspezifische Kennungen. Gemessen ist der Stand an der IETF, nicht bei anderen Gremien oder Anbietern. Acht weitere Einzelentwürfe zum selben Thema liegen bei der Arbeitsgruppe, keiner angenommen. Der Datatracker listet den 18. August 2026, weil er US-Pazifikzeit zeigt; die Entwürfe tragen den 19. August 2026.
IETF, Arbeitsgruppe AI Preferences (aipref), Zustand „Active“ · draft-ietf-aipref-vocab-07 und draft-ietf-aipref-attach-05, beide vom 19. August 2026, IESG-Zustand „I-D Exists“, WG-Zustand „WG Document“, vorgesehener Rang Proposed Standard, kein RFC · Meilensteine beider Bausteine am 23. September 2025 von August 2025 auf den 31. August 2026 verschoben und seither unverändert (Verlauf der Arbeitsgruppe) · Volltext des Vokabular-Entwurfs mit dem Konsens-Hinweis (Entwurfstext) · geprüft am 10. September 2026
Marktbeobachtung
Der Kauf direkt im Chat wurde gut fünf Monate nach dem Start zurückgebaut. Live waren zu dem Zeitpunkt je nach Quelle ein Dutzend oder knapp dreißig Shopify-Händler.
Was daraus folgt und was nicht: Die These, der Handel verlagere sich vollständig in den Chat, ist vorerst entkräftet. Nicht entkräftet ist die Verschiebung beim Entdecken: Gefunden wird beim Agenten, gekauft weiterhin bei der Marke. Zur Zahl: Die Quelle nennt zwei widersprüchliche Angaben, ein Dutzend nach einem Medienbericht und „nahe 30 und steigend“ nach Shopify selbst. Beide beziehen sich nur auf Shopify-Händler, nicht auf alle Partner.
Forrester, Analyse zum Rückbau von Instant Checkout · 7. März 2026 (Start: 29. September 2025)
Kontrollierter Test
In einem Test der Flugsuche steuerten Sprachmodelle die Website der Airline nur in etwa fünf Prozent der Fälle direkt an. Bevorzugt wurden Buchungsportale.
Warum das für Marken zählt: Der Direktkanal und das Bonusprogramm, die teuersten Vertriebs-Assets vieler Marken, werden im Agenten-Layer umgangen. Die Begründung der Untersuchung ist bemerkenswert unspektakulär: Portale liefern sauberere, strukturiertere und maschinenlesbarere Daten. Grenzen: drei europäische Fluggesellschaften, ihre zehn wichtigsten Märkte, drei Sprachmodelle, 60 markenneutrale Anfragen. Eine Branche, ein Zeitpunkt, keine Aussage über andere Kategorien.
Bain & Company, Test mit drei Fluggesellschaften, drei Sprachmodellen und 60 Anfragen · 16. März 2026
Anbieter- und Unternehmensangaben
Walmart lässt Lieferantenverhandlungen von einem KI-System führen: 2.000 Verhandlungen gleichzeitig, rund drei Prozent durchschnittliche Einsparung, drei von vier Lieferanten verhandeln lieber mit der Maschine als mit einem Menschen.
Woher die Zahlen stammen: vom Anbieter des Systems und von Walmart selbst, berichtet über Bloomberg. Es gibt keine unabhängige Prüfung. Die häufig mitzitierte Abschlussquote von 68 Prozent stammt aus einer älteren Fallstudie in der Harvard Business Review. Bemerkenswert bleibt die dritte Zahl: Die Präferenz für die Maschine kommt von der Gegenseite, nicht vom Betreiber. Das ist Vollmacht im Einkauf, beziffert und im Betrieb.
Pactum-Angaben via Bloomberg, April 2023 · Abschlussquote: Harvard Business Review, November 2022
Befragung
30 bis 45 Prozent der US-Verbraucher nutzen generative KI für Produktrecherche und Vergleich. Ihren Weihnachtseinkauf auf einer KI-Plattform beginnen wollten 17 Prozent.
Was die Zahlen nicht sagen: Sie beruhen auf Selbstauskunft und gelten für die USA, nicht für den deutschsprachigen Markt. Und die beiden Zahlen messen Verschiedenes: Recherche und Vergleich sind nicht dasselbe wie der Beginn der Kaufreise. Wer sie zusammenzieht, bekommt eine Zahl, die es nicht gibt. Ein begonnener Einkauf ist zudem kein Kauf. Als Größenordnung für die Verschiebung beim Entdecken sind sie brauchbar, als Umsatzaussage nicht.
Bain & Company, Consumer-Lab-Befragung USA · November 2025 · die Insights-Seite vom Mai 2026 nennt rund 30 Prozent
Befragung
Nur 11 Prozent der Befragten würden einer KI die Kaufentscheidung überlassen, und das auch nur in Kategorien mit geringem Einsatz wie Körperpflege und Haushaltswaren.
Was die Zahl relativiert: Auch die Zustimmung zur bloßen Hilfe ist keine Mehrheit: 31 Prozent würden eine KI die Auswahl bei Haushaltswaren eingrenzen lassen, 28 Prozent bei Elektronik. Es ist das Gegengewicht zu den Prognosen über autonom kaufende Agenten. Geäußerte Präferenz und späteres Verhalten fallen allerdings regelmäßig auseinander, besonders wenn die Erfahrung fehlt. Stichprobe: 322 US-Verbraucher.
Gartner, Befragung von 322 US-Verbrauchern im Januar 2026 · veröffentlicht 27. Mai 2026
Tribunal-Entscheidung
Air Canada haftet für die Zusage seines Chatbots. Die Verteidigung, der Bot sei für sein Handeln selbst verantwortlich, nannte der Entscheider „a remarkable submission“.
Was der Fall ist und was nicht: Es geht um einen Trauerfalltarif und 650,88 kanadische Dollar Schadenersatz, nicht um eine allgemeine Erstattungspraxis. Entschieden hat das Civil Resolution Tribunal in British Columbia, kein Gericht, und die Entscheidung bindet in Europa niemanden. Der tragende Satz gilt trotzdem weit über den Fall hinaus: Es mache keinen Unterschied, ob eine Auskunft von einer statischen Seite oder von einem Chatbot komme. Die Zuspitzung „eigene Rechtspersönlichkeit“ ist die Zusammenfassung des Entscheiders, nicht der Wortlaut der Airline.
Moffatt v. Air Canada, 2024 BCCRT 149, Civil Resolution Tribunal British Columbia · 14. Februar 2024 · Entscheidung im Volltext
Dokumentierter Vorfall
Der Support-Agent von Cursor erfand eine Nutzungsregel, die es nie gab, und antwortete unter dem Namen „Sam“.
Was der Fall zeigt: Der Schaden entstand nicht durch eine falsche Auskunft allein, sondern dadurch, dass sie wie eine verbindliche Regel der Firma klang. Der Mitgründer stellte öffentlich klar, es gebe keine solche Regel, und entschuldigte sich; danach berichteten Nutzer von Kündigungen. Eine Zahl dazu gibt es nicht. Ein Einzelfall, aber mit demselben Muster wie die übrigen: Der Agent spricht als die Marke.
The Register, 18. April 2025 (erfundene Regel, Entschuldigung) · Fortune, 19. April 2025 (Name „Sam“, Kündigungen)
Rechtslage
Die Transparenzpflichten des EU AI Act für Chatbots und für KI-erzeugte Inhalte gelten seit dem 2. August 2026. Generative Systeme, die vorher in Verkehr gebracht wurden, müssen die maschinenlesbare Kennzeichnung bis zum 2. Dezember 2026 nachrüsten. Die Hochrisiko-Pflichten wurden auf den 2. Dezember 2027 und den 2. August 2028 verschoben.
Wen was trifft: Die Kennzeichnung nach Artikel 50 Absatz 2 bindet den Anbieter des erzeugenden Systems, nicht die Marke, die ein fremdes Modell einsetzt; sie trifft Absatz 1 für den eigenen Chatbot, Absatz 4 als Betreiberin bei Deepfakes. Die Ausnahme des Absatzes 4 gilt nur für geprüften und redaktionell verantworteten Text, der die Öffentlichkeit über Angelegenheiten von öffentlichem Interesse informiert, nicht für Werbung, Produkttexte und Support; Absatz 2 bleibt unberührt. Umfang der Verschiebung: bewegt wurden Kapitel III Abschnitte 1 bis 3, ausgenommen Artikel 6 Absatz 5. Verbote und die Pflicht zur KI-Kompetenz sind nicht verschoben. Was der Eintrag nicht belegt: Durchsetzung. Ob die Marktüberwachung Artikel 50 anwendet, ist nicht erhoben; was „wesentlich verändern“ oder „redaktionelle Kontrolle“ bedeuten, ist ungeklärt, Rechtsprechung fehlt. Die Fristen wurden seit 2024 zweimal bewegt, zuletzt gut elf Wochen vor dem Geltungsbeginn, den sie verschoben haben. Die Richtung ist stabil, der Kalender war es nicht.
Verordnung (EU) 2024/1689 (KI-Verordnung), Artikel 50 Absätze 1, 2 und 4 sowie Artikel 113 · geändert durch Verordnung (EU) 2026/1744 vom 8. Juli 2026 (Digital-Omnibus zur KI), Amtsblatt vom 24. Juli 2026, in Kraft seit 27. Juli 2026: neuer Artikel 111 Absatz 4 und neu gefasster Artikel 113 Absatz 3
Gerichtsurteil, rechtskräftig
Ein deutsches Oberlandesgericht hat rechtskräftig entschieden, dass ein Unternehmen für die irreführenden Aussagen seines eigenen KI-Chatbots unmittelbar haftet. Der Chatbot sei kein Dritter im Sinne des Gesetzes.
Was der Fall ist: Der Chatbot der Aesthetify GmbH, Anbieterin minimal invasiver Behandlungen, schrieb ihren zwei ärztlichen Geschäftsführern Facharzttitel zu, die sie nicht besitzen. Dass nur korrekte Daten eingespeist waren, war unstreitig und half nicht. Tragend ist die Steuerungsgewalt: Die Falschauskünfte waren nach der Abmahnung per Anweisung und Filter abstellbar. Wo sie fehlt, ist die Übertragung offen. Was er nicht hergibt: Rechtskräftig heißt bindend zwischen den Parteien, seit dem 21. Juni 2026. Die wegen grundsätzlicher Bedeutung zugelassene Revision wurde nicht eingelegt, höchstrichterlich ist die Zurechnung offen. Es ist Wettbewerbsrecht, zugesprochen wurden Unterlassung und 260 Euro Abmahnkosten, kein Schadenersatz, und es geht um den selbst betriebenen Chatbot, für fremde Systeme ist nichts entschieden. Korrigiert am 10.09.2026: Bis dahin stand hier „nicht rechtskräftig, die Revision ist zugelassen“, dazu „eine Klinik-Betreiberin“. Ersteres gab den Stand des Urteilstags wieder, Letzteres stammte aus der Berichterstattung und machte den Fall größer, als er ist.
OLG Hamm, Urteil vom 12. Mai 2026, Az. 4 UKl 3/25 (Verbraucherzentrale Nordrhein-Westfalen gegen Aesthetify GmbH) · Rechtskraft seit 21. Juni 2026 laut Verbandsklageregister des Bundesamts für Justiz · Verbandsklageregister
Selbsteinschätzung, Prognose
In einer Gartner-Befragung schätzen Vorstandschefs, dass bis 2030 15 bis 20 Prozent ihres Umsatzes von Maschinen als Kunden kommen.
Was das ist: eine Selbsteinschätzung befragter Vorstände über die Zukunft, kein Messwert und keine Hausprognose von Gartner. Beides wird beim Zitieren gern zu „Gartner erwartet“ verkürzt. Solche Schätzungen zu neuen Kategorien liegen häufig daneben, meist im Zeitpunkt, nicht in der Richtung. Zur Quellenlage: Die Seite ist für automatisierte Abrufe gesperrt; die Formulierung ist über ein Archiv und Gartners eigenen Video-Titel belegt, nicht durch einen direkten Abruf.
Gartner, CEO-Befragung, zitiert in der Reihe Think Again · Archivstand Juli 2026
Anbieterangaben
Die großen Nutzerzahlen der KI-Systeme stammen von den Anbietern selbst und sind nicht miteinander vergleichbar: rund 900 Millionen wöchentlich aktive Nutzer bei ChatGPT, über eine Milliarde monatliche Nutzer bei Googles AI Mode.
Warum der Vergleich hinkt: Die eine Zahl zählt wöchentlich, die andere monatlich. Nebeneinandergestellt liest man sie trotzdem als gleichartig, und genau so wandern sie durch Präsentationen. Unabhängig geprüft ist keine von beiden. Die Google-Zahl ist immerhin direkt vom Anbieter dokumentiert, die ChatGPT-Zahl kursiert durchweg als Angabe in Berichten über das Unternehmen. Als Größenordnung brauchbar, als Beleg nicht.
Google, Blogbeitrag zum AI Mode, 19. Mai 2026 · ChatGPT-Zahl: OpenAI-Angabe, Februar 2026
Amtliche Statistik
26 Prozent der deutschen Unternehmen ab zehn Beschäftigten nutzten 2025 KI-Technologien. Bei den großen Unternehmen ab 250 Beschäftigten sind es 57 Prozent, bei den kleinen 23 Prozent.
Was die Zahl nicht sagt: Sie ist binär erhoben und sagt nichts über Intensität, Reifegrad oder Wirkung, und sie ist nicht nach Funktionsbereichen aufgeschlüsselt. Ein Beleg für Marketing oder Markenführung ist sie also nicht. Warum sie trotzdem hier steht: Sie ist die methodisch strengste verfügbare deutsche Zahl und ein nüchterner Anker gegen Verbandsumfragen, die für dasselbe Jahr deutlich höhere Werte melden. Wenn zwei Zahlen zur selben Frage weit auseinanderliegen, liegt es an Grundgesamtheit und Verfahren, nicht an der Wirklichkeit.
Statistisches Bundesamt, Erhebung zur Nutzung von IKT in Unternehmen, Unternehmen ab 10 Beschäftigten · November 2025
Eigene Erhebung, reproduzierbar
Von 160 angefragten Startseiten weisen 12 einen automatisierten Abruf mit aktiver Bot-Abwehr zurück, also 7,5 Prozent. Sie stammt bei zehn der zwölf Seiten von Akamai oder Cloudflare, bei Siemens und der Hannover Rück von Amazons CloudFront. Bei 18 von 22 auf HTTP-Ebene geprüften Seiten kam dieselbe Abweisung unabhängig von der Browser-Kennung; die Erkennung greift dort am TLS-Fingerabdruck und an der Reihenfolge der HTTP-Header. Bei den beiden CloudFront-Seiten entscheidet die Kennung allein.
Was die Zahl nicht sagt: Sie misst die Abwehr eines Abrufwerkzeugs, nicht die Erreichbarkeit für Agenten. Ein regulärer, ferngesteuerter Chrome kam bei mehreren dieser Seiten anstandslos durch. Die Abwehr trennt Werkzeug von Browser, nicht Mensch von Maschine. Ein Agent, der einen echten Browser steuert, dürfte weiter kommen; das wurde nicht getestet, weil es das Umgehen der Erkennung erfordert hätte. Nicht mitgezählt sind 13 weitere Ausfälle anderer Ursache: vier veraltete Adressen im Verzeichnis, vier technische Fehler, zwei Länderauswahlen statt Startseiten, zwei leere Antworten, ein schwankendes Ergebnis. Eine frühere Fassung dieser Zahl nannte 30 Prozent und fasste all das zusammen.
Eigene Messung, 30. August 2026 · Ursache je Seite auf HTTP-Ebene geprüft, mit gewöhnlicher und mit automatisierter Browser-Kennung · bei 18 von 22 Seiten dieselbe Antwort
Eigene Erhebung, reproduzierbar
Auf 135 Startseiten deutscher Börsenunternehmen aus DAX, MDAX und SDAX tragen 456 von 13.527 Bedienelementen keinen Namen im Accessibility-Baum, also 3,4 Prozent. Die Quote unterscheidet sich zwischen den drei Indizes kaum: DAX 3,1, MDAX 3,8, SDAX 3,3 Prozent.
Was die Zahl nicht sagt: Sie misst, was ein Agent vorfindet, nicht ob er seine Aufgabe löst. Gemessen sind Startseiten im Anlieferungszustand samt Zustimmungsdialog, keine Bestellstrecken und keine angemeldeten Bereiche, wo das Bild anders aussehen dürfte. Der Vergleich mit WebAIMs 30,6 Prozent leerer Schaltflächen trägt nicht: Der stammt aus einer Million Startseiten weltweit, hier stehen 135 börsennotierte Unternehmen. Die Verteilung ist ungleich: 57 der 135 Seiten haben keine einzige Lücke, 15 liegen über 10 Prozent, die schlechteste bei 30,6. Und die Lücken folgen fast alle einem Muster. Es sind Logos und Symbole, die als Link oder Schaltfläche dienen: Marken- und Partnerlogos, Symbole sozialer Netzwerke, Karussellpfeile, Abspielknöpfe.
Eigene Messung, 30. August 2026 · 160 Startseiten aus DAX, MDAX und SDAX angefragt, Auswahl und Adresse aus Wikidata · Chromes eigener Accessibility-Baum · zwei Durchläufe, 135 von 136 Seiten mit identischem Ergebnis
Eigene Erhebung, reproduzierbar
52 von 135 Startseiten deutscher Börsenunternehmen haben keine Hauptinhalt-Landmarke. Für ein Programm, das die Seite liest, fehlt damit die Angabe, wo der Inhalt beginnt und die Navigation endet.
Was die Zahl nicht sagt: Eine fehlende Landmarke macht eine Seite nicht unbenutzbar, denn Überschriften und Textstruktur bleiben lesbar, und Browser leiten teils eine ersatzweise Struktur ab. Sie ist ein Hinweis auf die Sorgfalt der Auszeichnung, kein Fehler mit unmittelbarer Folge. Gemessen sind Startseiten, keine Unterseiten.
Eigene Messung, 30. August 2026 · gezählt wurde die Rolle „main“ in Chromes Accessibility-Baum · zwei Durchläufe mit identischem Ergebnis
Eigene Erhebung, reproduzierbar
Auf 135 Startseiten deutscher Börsenunternehmen aus DAX, MDAX und SDAX tragen 1.662 von 3.979 Bildern, die Chrome im Accessibility-Baum ausweist, keinen Namen, also 41,8 Prozent. Unter den daraufhin nach Elementart untersuchten namenlosen Bildern sind 86 Prozent inline eingebundene SVG-Grafiken und 13 Prozent klassische img-Elemente.
Was die Zahl nicht sagt: Gezählt sind nur Bilder, die Chrome im Accessibility-Baum ausweist, korrekt als dekorativ gekennzeichnete fehlen in Zähler und Nenner zugleich. Auf einer Testseite mit sechs Bildern erschienen nur vier, die Quote lag bei 50 Prozent, obwohl zwei von sechs mangelhaft waren: Wer sauber auszeichnet, verkleinert seinen eigenen Nenner. Über den Anteil aller Bilder einer Seite sagt die Quote nichts. Die Aufteilung nennt die Elementart, nicht den Zweck: Ein verlinktes Konzernlogo, das einen Namen bräuchte, und ein Ziersymbol liegen in denselben 86 Prozent, der Anteil der Fälle mit tatsächlicher Folge liegt zwischen den 13 Prozent und einem unbekannten höheren Wert. Zwei weitere Grenzen: Bezugsgröße der 86 und 13 Prozent ist die auf 80 Knoten je Seite begrenzte untersuchte Teilmenge, nicht die 1.662; ob sie gegriffen hat, ist ohne aufbewahrte Rohdaten nicht mehr feststellbar, im Schnitt 12,3 namenlose Bilder je Seite sprechen dagegen; und dass die beiden Anteile 99 statt 100 Prozent ergeben, liegt an den genau zwei Elementarten, die das Werkzeug kennt. Und 1.662 zu 3.979 ist eine Summe über alle Seiten ohne Median und ohne Aufteilung nach Index: bei den Bedienelementen liegt er mit 1,0 Prozent weit unter der gepoolten Quote von 3,4 Prozent, dort tragen wenige Ausreißer das Ergebnis; ob das bei den Bildern ebenso ist, ist offen. Ein verlinktes Logo ohne Namen zählt zugleich als namenloses Bedienelement, addieren darf man die beiden Zahlen nicht. Unabhängig gegengeprüft ist diese Messung so wenig wie die drei anderen eigenen.
Eigene Messung, 30. August 2026 · 160 Startseiten aus DAX, MDAX und SDAX angefragt, 135 auswertbar, Auswahl und Adresse aus Wikidata · Chromes eigener Accessibility-Baum, gezählt sind nicht ignorierte Knoten der Rolle „image“ ohne Namen · Aufschlüsselung nach Elementart je Seite auf 80 Knoten begrenzt · zwei Durchläufe, 135 von 136 Seiten mit identischem Ergebnis
Eigene Erhebung, reproduzierbar
Von 76 auswertbaren deutschsprachigen Nachrichten- und Fachmedien sperren 44 in ihrer robots.txt mindestens einen Trainings-Crawler, also 57,9 Prozent. GPTBot sperren 38 von ihnen, also genau die Hälfte, CCBot 40 und Bytespider 36. Den Suchbot desselben Anbieters sperren weit weniger: OAI-SearchBot steht bei 8 Medien auf der Liste, das sind 10,5 Prozent. 11 Medien sperren das Training, ohne einen KI-Suchbot oder einen Abruf auf Nutzerfrage zu sperren.
Was die Zahl nicht sagt: robots.txt verbietet nichts, sie bittet. Gemessen ist eine Absichtserklärung, kein Zugriffsschutz: Der Standard RFC 9309 stellt die Befolgung ausdrücklich frei, und OpenAI schreibt für den Abruf auf Nutzerfrage selbst, dass die Regeln dort nicht gelten müssen. Eine Sperre gegen das Training sagt deshalb nichts über die Sichtbarkeit in KI-Antworten, solange die Suchbots offen bleiben. Offen heißt hier nicht erlaubt: Gemessen ist die Abwesenheit einer Sperre, nicht eine ausgesprochene Erlaubnis; genau 2 der 76 Medien schreiben einem KI-Bot eine ausdrückliche Erlaubnis in die Datei. Drei der gezählten Namen sind gar keine Crawler: Google-Extended, Applebot-Extended und Webzio-Extended holen keine Seite, sie steuern nur, was mit bereits geholten Daten geschehen darf. Bei Apple und Microsoft lassen sich Suche und KI technisch nicht trennen, beide führen dafür keinen eigenen Namen. Und der Name muss genau stimmen: Ein Fachtitel sperrt „ChatGPT“, eine Kennung, die OpenAI nicht führt, deshalb greift die Regel nicht. Und die Stichprobe ist offengelegt, aber nicht repräsentativ: 14 der 77 Titel stammen aus einer externen Rangliste, der Rest folgt benannten Regeln. Die Nachrichtenagenturen fehlen, und sie sind der stärkste Einwand: dpa, AFP, epd, APA und Keystone-SDA sperren zusammen keinen einzigen KI-Crawler, weil ihre Inhalte über Verträge geschützt sind und nicht über diese Datei.
Eigene Erhebung, 12. September 2026 · 77 Titel angefragt, 76 auswertbar · Nachrichtenteil nach dem Diagramm „Weekly reach online“ der Länderseite Deutschland im Reuters Institute Digital News Report 2026, Fachmedien sowie Österreich und die Schweiz nach benannter Regel · Auswertung nach RFC 9309 gegen 51 an der Dokumentation der Betreiber belegte Bot-Namen, gewertet ist der Zugriff auf die Startseite · abgerufen zuerst mit einer eigenen Kennung, bei Abweisung mit gewöhnlicher Browser-Kennung, nötig bei 3 Titeln · zwei Durchläufe mit identischem Urteil
Eigene Erhebung, reproduzierbar
Von 148 auswertbaren Startseiten der Unternehmen aus DAX, MDAX und SDAX sperren 10 mindestens einen Trainings-Crawler, also 6,8 Prozent; GPTBot sperren 4. 138 sperren keinen einzigen KI-Zugriff, darunter 14, die gar keine robots.txt ausliefern. 7 Unternehmen schreiben einem KI-Crawler eine ausdrückliche Erlaubnis in die Datei, 6 davon sperren zugleich keinen: Es gibt fast so viele Einladungen wie Sperren. Die einzige Reservierung von Rechten für Text und Data Mining, die sich im Index finden ließ, steht bei einem Wissenschaftsverlag, und der sperrt keinen einzigen Crawler.
Was die Zahl nicht sagt: Sie misst eine Bitte, keinen Zugriffsschutz; wie viele derselben Seiten einen automatisierten Abruf technisch abweisen, steht als eigener Beleg auf dieser Seite. Von den zehn Sperren sind acht namentlich. Eine Seite sperrt alles Unbenannte und lässt die großen Anbieter ausdrücklich herein, eine sperrt alle Crawler einschließlich Google, was keine Entscheidung über KI ist, und eine zählt nur mit, weil ein KI-Crawler in einer übernommenen Sammelliste von 139 unerwünschten Bots steht. Eine fehlende Sperre ist keine Entscheidung für KI: 14 Seiten haben gar keine Datei und damit nichts entschieden. 12 Seiten waren nicht auswertbar, sechs weisen den Abruf ab, sechs antworten nicht; in welche Richtung das die Quote verschiebt, bleibt offen, denn nach RFC 9309 gilt eine nicht erreichbare robots.txt als Erlaubnis. Gemessen ist die Startseite: Wer tiefer im Angebot andere Regeln setzt, erscheint hier als offen. Die Reservierung der Rechte ist nur technisch gesucht, in der dafür vorgesehenen Datei, im Kopf der Seite und im Seitenquelltext; 134 der 160 Seiten haben darauf eindeutig geantwortet. Ein Vorbehalt in den Nutzungsbedingungen, die in Deutschland übliche Form, ist damit nicht erfasst.
Eigene Erhebung, 12. September 2026 · dieselbe Liste wie die Erhebung vom 30. August, 160 Startseiten aus DAX, MDAX und SDAX, Index-Mitglieder aus Wikipedia, Adresse aus Wikidata · Auswertung nach RFC 9309 gegen 51 an der Dokumentation der Betreiber belegte Bot-Namen, gewertet ist der Zugriff auf die Startseite · abgerufen zuerst mit einer eigenen Kennung, bei Abweisung mit gewöhnlicher Browser-Kennung, nötig bei 2 Seiten · zwei Durchläufe, 160 von 160 Seiten mit identischem Urteil
Geprüfte Erhebung
Auf 300 Aufgaben über 136 echte Websites ist die Erfolgsquote der besten Web-Agenten in zehn Monaten von 61 auf 97,7 Prozent gestiegen. Als der Benchmark im Oktober 2025 zum ersten Mal ausgewertet wurde, meldete ein Agent selbst 89 Prozent und erreichte gemessen 30; die meisten schlugen einen simplen Agenten von Anfang 2024 nicht. Im August 2026 löst der beste Eintrag auch die schwersten Aufgaben, die elf Schritte und mehr brauchen, vollständig.
Was die Zahl nicht sagt: Die aktuellen Werte stammen aus vier Einträgen einer Bestenliste, eingereicht von den Anbietern der Agenten und vom Benchmark-Team nachgeprüft. Das ist keine unabhängige Reihenuntersuchung. Und eine Warnung steht auf der Bestenliste selbst: Die Aufgaben sind seit April 2025 öffentlich, das Team bittet ausdrücklich darum, sie nicht als Trainingsdaten zu verwenden. Ob die Werte Können abbilden oder Gewöhnung an bekannte Aufgaben, ist damit nicht entschieden. Gemessen wird außerdem, ob eine Aufgabe gelöst wurde, nicht wie gut und nicht, ob die Marke dabei korrekt dargestellt war.
Xue u. a., „An Illusion of Progress? Assessing the Current State of Web Agents“, COLM 2025 (arXiv:2504.01382) für die Ausgangswerte · Online-Mind2Web-Bestenliste, menschliche Bewertung, Stand 4. August 2026, für die aktuellen · 300 Aufgaben, 136 Websites · zur Bestenliste
Marktbeobachtung
Cloudflare meldet für 2026 erstmals, dass mehr als die Hälfte des Verkehrs im Internet nicht von Menschen stammt. Belastbarer beziffert im selben Bericht: 52 Prozent der Crawler-Anfragen dienten im Juni 2026 dem Training von KI-Modellen, gegenüber 22 Prozent im Frühjahr 2025.
Was die Zahl nicht sagt: Cloudflare nennt für die Hälfte-Aussage weder die Art des gemessenen Verkehrs noch den Zeitraum. Ob Seitenabrufe gemeint sind oder alle Anfragen, bleibt offen. Sie beruht auf dem eigenen Netz, das groß, aber nicht das Internet ist. Die Crawler-Zahl ist dagegen datiert und mit Vorjahreswert versehen und deshalb die brauchbarere von beiden. Achtung bei der Weiterverwendung: In Sekundärquellen kursiert die Angabe als „57,5 Prozent“. Diese Zahl steht bei Cloudflare nirgends.
Cloudflare, „Content Independence Day, one year on“, 1. Juli 2026 · Datengrundlage laut Bericht: Cloudflare Radar und Investor Day 2026
Stand der Normung
Der Tech Council des Handelsprotokolls UCP hat 16 Sitze; seit dem 24. April 2026 sitzen dort neben Google, Shopify, Etsy, Target und Wayfair auch Amazon, Meta, Microsoft, Stripe und Salesforce. Wie viele Händler das Protokoll tatsächlich einsetzen, nennt keine der beteiligten Firmen. Google führt Beispielhändler an, verbunden mit dem Wort „bald“: Nike, Sephora, Target, Ulta Beauty, Walmart, Wayfair sowie Shopify-Händler wie Fenty und Steve Madden.
Was die Zahl nicht sagt: Ein Sitz in einem Gremium ist keine Einführung. Dass Amazon, Meta und Microsoft am Protokoll mitarbeiten, sagt nichts darüber, ob sie es in ihren eigenen Läden verwenden. Die fehlende Verbreitungszahl ist ein Negativbefund: Sie fehlt in den geprüften Primärquellen, also den UCP-Ankündigungen im Projekt-Repository und zwei Google-Beiträgen vom 19. März und 19. Mai 2026. Anderswo kann es sie geben. Vorsicht bei Sekundärquellen: Sie geben Googles Satz verbreitet ohne das „bald“ wieder und machen aus einer Ankündigung einen Vollzug.
Universal Commerce Protocol, Projekt-Repository, Ankündigung neuer Tech-Council-Mitglieder, 24. April 2026 · Google, „Universal Cart“, 19. Mai 2026 und „UCP updates“, 19. März 2026, beide ohne Zahl zur Verbreitung · zu Googles Ankündigung
Rechtslage
Die neue EU-Produkthaftungsrichtlinie zählt Software in Artikel 4 ausdrücklich zu den Produkten. Nach Artikel 10 geht ein Gericht von der Fehlerhaftigkeit aus, wenn deren Beweis dem Kläger „insbesondere aufgrund der technischen oder wissenschaftlichen Komplexität übermäßig schwierig“ ist und er nur noch ihre Wahrscheinlichkeit nachweist. Vermutet wird die Fehlerhaftigkeit auch, wenn der Beklagte angeordnete Beweismittel nicht offenlegt. Umzusetzen ist die Richtlinie bis zum 9. Dezember 2026.
Was der Eintrag nicht belegt: eine Haftung. Die Richtlinie gilt nicht unmittelbar und erfasst nur Produkte, die nach dem 9. Dezember 2026 in Verkehr kommen; Artikel 21 hebt die alte Richtlinie 85/374/EWG zum selben Datum auf, für früher in Verkehr gebrachte Produkte gilt sie weiter. Artikel 10 Absatz 4 greift erst „trotz der Offenlegung von Beweismitteln gemäß Artikel 9“, und nach Absatz 5 darf der Beklagte jede Vermutung widerlegen: ein Beweisnachteil, keine Gefährdungshaftung. Rechtsprechung zu „übermäßig schwierig“ kann es noch nicht geben, weil die Regel auf kein Produkt anwendbar ist. Zum Kalender, Stand 10. September 2026: Deutschland ist drei Monate vor Fristablauf nicht durch das Parlament. Der Regierungsentwurf liegt seit dem 25. Februar 2026 als Bundestagsdrucksache 21/4297 vor, erste Lesung 4. März, Anhörung 13. April, danach kein belegbarer Schritt; nach dem 30. Januar 2026 steht er auf keiner Bundesrats-Tagesordnung mehr, auch nicht auf dem Entwurf für den 25. September. Inkrafttreten laut Entwurf: 9. Dezember 2026. Grenze der eigenen Erhebung: Die Auskunftsschnittstelle des Bundestages verlangt einen Schlüssel; geprüft wurde ersatzweise über die Tagesordnungen des Bundesrates, den jedes beschlossene Gesetz passieren muss. Ein Beschluss in der Sitzungswoche vom 8. bis 11. September wäre darin nicht sichtbar.
Richtlinie (EU) 2024/2853 über die Haftung für fehlerhafte Produkte, 23. Oktober 2024, Artikel 4 Nr. 1, Artikel 9 Absatz 1, Artikel 10 Absätze 1 bis 5, Artikel 21 und Artikel 22 Absatz 1 · Volltext über den Cellar-Dienst des Amts für Veröffentlichungen der EU, weil eur-lex.europa.eu automatisierte Abrufe abweist · Umsetzungsstand abgerufen am 10. September 2026: Bundestagsdrucksache 21/4297 vom 25. Februar 2026 (zur Drucksache), Wortprotokoll 21/31 des Ausschusses für Recht und Verbraucherschutz zur öffentlichen Anhörung am 13. April 2026, Beratungsvorgang BR-Drs. 775/25 und die Tagesordnungen der Bundesratssitzungen 1061 bis 1068 (zum Beratungsvorgang), BMJV-Verfahrensseite mit Status „Entwurf“ und letzter Aktualisierung vom 5. März 2026
Einstweilige Verfügung, durch Vergleich gegenstandslos
Ein deutsches Landgericht hat Google im Eilverfahren untersagt, in seiner KI-Übersicht acht Behauptungen über ein Verlagshaus und sieben über ein Unternehmen desselben Hauses zu verbreiten, darunter Betrugsmasche und Abo-Falle. Es sah darin eigene, Google zurechenbare Inhalte statt bloßer Suchergebnisse, hielt Google für eine unmittelbare Störerin und verneinte die Haftungsprivilegien für Hostprovider und Suchmaschinen. Nach Googles Berufung endete der Streit durch Vergleich.
Was der Fall ist und was nicht: Der Vergleich beseitigte das Urteil, bevor eine höhere Instanz es prüfen konnte; es bindet niemanden, die Rechtsfrage bleibt offen. Maßstab war die Glaubhaftmachung, keine Beweisaufnahme: teils machten die Klägerinnen die Unwahrheit eidesstattlich glaubhaft, teils konnte Google den Wahrheitsgehalt nicht glaubhaft machen. Von zehn und neun beantragten Punkten wurden acht und sieben untersagt, der Rest zurückgewiesen. Schadenersatz war nicht beantragt und im Eilverfahren nicht zu erlangen. Wo dieser Status steht: als redaktionelle Anmerkung der Rechtsprechungsdatenbank, nicht im Urteil; sie verweist auf einen Praxishinweis (Veelken, GRUR-Prax 2026, 426), der nicht geprüft wurde.
LG München I, Endurteil vom 28. Mai 2026, Az. 26 O 869/26, einstweiliges Verfügungsverfahren, Unterlassung nach Unternehmenspersönlichkeitsrecht · Berufung OLG München, Az. 18 U 1744/26 Pre e, durch Vergleich beendet, Urteil gegenstandslos laut redaktioneller Anmerkung bei BAYERN.RECHT · Fundstellen u. a. NJW 2026, 2271 und MMR 2026, 814 · geprüft am 10. September 2026
Rechtslage
Für Verarbeitung im Auftrag verlangt die Datenschutz-Grundverordnung einen Vertrag oder ein anderes Rechtsinstrument, das vorsieht, dass der Auftragsverarbeiter personenbezogene Daten nur auf dokumentierte Weisung des Verantwortlichen verarbeitet (Art. 28 Abs. 3 lit. a); unmittelbar bindet Art. 29, nachweispflichtig ist der Verantwortliche (Art. 24 Abs. 1). Die Kippgrenze zieht Art. 28 Abs. 10: Ein Auftragsverarbeiter, der unter Verstoß gegen die Verordnung die Zwecke und Mittel der Verarbeitung bestimmt, gilt in Bezug auf diese Verarbeitung als Verantwortlicher.
Was die Rechtslage nicht sagt: Sie regelt personenbezogene Daten, nicht Markenaussagen; die Übertragung auf Agenten ist eine Analogie ohne Rechtsprechung und bricht an Art. 28 Abs. 10: Ein Agent, der Zwecke und Mittel selbst bestimmt, wäre kein Weisungsempfänger mehr. Was beim Zitieren wegfällt: Adressat des Art. 28 Abs. 10 ist ein Auftragsverarbeiter, und das Bestimmen muss „unter Verstoß gegen diese Verordnung“ geschehen; der allgemeine Satz in Art. 4 Nr. 7 ist eine Definition, keine Kippregel. Gesetzliche Verarbeitungspflichten bleiben unberührt.
Verordnung (EU) 2016/679 (Datenschutz-Grundverordnung), Art. 28 Abs. 3 lit. a, Art. 29, Art. 24 Abs. 1 und Art. 28 Abs. 10 · an der Amtsblattfassung geprüft und gegen die konsolidierte Fassung 02016R0679 abgeglichen, von den drei Berichtigungen (ABl. L 314/2016, L 127/2018, L 74/2021) ist keine der vier Stellen berührt; die Berichtigungen von 2016 und 2021 gibt es nicht auf Englisch, geprüft sind alle drei am deutschen Text; in Kraft getretene Änderungen gibt es bis heute nicht, zwei Änderungsvorschläge liegen vor, COM(2025) 837 (Digital Omnibus) und COM(2025) 501 (Erleichterungen für kleine Mid-Caps), beide betreffen Art. 28 und 29 nicht · Amtsblatt L 119 vom 4. Mai 2016
Dokumentierter Vorfall
Der ChatGPT-gestützte Chatbot eines Chevrolet-Händlers sagte den Verkauf eines neuen Tahoe für einen Dollar zu und nannte das ein rechtlich bindendes Angebot ohne Rücktrittsmöglichkeit. Diese Formel hatte der Nutzer dem Chatbot im selben Gespräch wörtlich vorgegeben. Kurz darauf ging der Chatbot offline. Von einem Versuch, das Angebot einzufordern, berichtet keine der Quellen.
Was der Fall nicht belegt: weder eine Haftungsfolge noch ihr Ausbleiben. Von Kaufversuch, Forderung oder Verfahren berichtet keine der Quellen. Die verbreitete Angabe, der Händler habe den Kauf nicht anerkannt, steht in keiner zeitgenössischen Quelle, sondern erst in nachgelagerten Zusammenfassungen. Die Haftungsfrage wurde hier nicht verneint, sie wurde nie gestellt. Zur Quellenlage: Der Chatbot stammte vom Anbieter Fullpath, der ihn auf der Seite eines Chevrolet-Händlers auch betrieb; GM stellte nach Erscheinen klar, dass Händler dieses Werkzeug eigenständig beschaffen. Belegt ist der Verlauf allein über einen Screenshot des Nutzers. Ob Händler oder Anbieter abschaltete, berichten die Quellen unterschiedlich; ein Preis fehlt, weil ihn keine der beiden Quellen nennt und die Angaben danach auseinandergehen.
GM Authority, Jonathan Lopez, 18. Dezember 2023 (Wortlaut beider Seiten, Abschaltung, GM-Stellungnahme) · Business Insider, Katie Notopoulos, 18. Dezember 2023 (Anbieter- und GM-Stellungnahme; Volltext hinter der Zählschranke von businessinsider.com, frei gelesen in der lizenzierten Yahoo-Übernahme vom 19. Dezember 2023) · Originalbeleg: Beitrag von Chris Bakke auf X, 17. Dezember 2023, mit Screenshot
Dokumentierter Vorfall
Der Chatbot des Paketdienstes DPD nannte das eigene Unternehmen „the worst delivery firm in the world“, nachdem ein Kunde ihn aufgefordert hatte, bessere Zusteller zu empfehlen und in seinem Hass zu übertreiben. DPD teilte mit, das KI-Element sei sofort abgeschaltet worden.
Woher die Sätze stammen: Die Bot-Antworten hat die BBC nicht selbst erhoben. Sie stehen auf Screenshots des Kunden, die Bildunterschrift vermerkt eine nachträgliche Verpixelung. Von DPD selbst stammt allein die Firmenstellungnahme. Zur Ursache steht in ihrem zitierten Wortlaut nur eine Zeitangabe, „An error occurred after a system update yesterday“; die kausale Fassung geben BBC und Guardian als Angabe von DPD wieder. Was der Fall nicht zeigt: Der Bot wandte sich nicht von selbst gegen die eigene Marke, er wurde dazu angewiesen. Es gibt keinen Anspruch, kein Gericht, keinen bezifferten Schaden und keine Messung des Normalbetriebs. Die einzige Zahl, 800.000 Aufrufe des Kundenbeitrags in 24 Stunden, ist ein Zähler der Plattform.
Tom Gerken, BBC News · Stellungnahme von DPD, Wortlaut der Bot-Antworten aus Screenshots des Kunden · 19. Januar 2024 · Gegenprobe: Guardian, 20. Januar 2024
Dokumentierter Vorfall
New Yorks amtlicher MyCity-Chatbot riet Unternehmen zu Handlungen, die in der Stadt verboten sind: bargeldlos zu arbeiten, Trinkgeld der Beschäftigten einzubehalten und Mieter mit Wohngutscheinen abzuweisen. Zehn Mitglieder der Redaktion stellten dieselbe Frage, alle zehn bekamen dieselbe falsche Antwort. Die Stadt verteidigte ihn als Pilotprogramm; nach fast zwei weiteren Jahren wurde er Anfang Februar 2026 als Sparposten abgeschaltet.
Was der Fall ist und was nicht: eine journalistische Stichprobe ohne Grundgesamtheit und Fehlerquote. Er antwortete nicht immer gleich, einem Reporter richtig. Ob jemand danach handelte, ist unbekannt. Alle drei Verbote kennen Ausnahmen: selbstbewohnte Kleinhäuser beim Diskriminierungsverbot, beim Bargeld Telefon-, Post- und Internetkäufe, die außerhalb des Ladens bezahlt werden. Davon getrennt: Trinkgeld darf der Arbeitgeber auf den Mindestlohn anrechnen, nicht einbehalten. Die Stadt reagierte: Warnhinweise, Korrekturen, engeres Fragefeld. Was die Abschaltung nicht ist: ein Eingeständnis der Rechtswidrigkeit. Anlass war ein Haushaltsloch von 12 Milliarden Dollar. Verteidigt hat ihn die Vorgängerverwaltung, abgeschaltet die Anfang 2026 angetretene.
Colin Lecher, The Markup, copubliziert mit Documented und THE CITY · Stichprobentests am MyCity-Chatbot der Stadt New York · 29. März 2024 · Abschaltung bestätigt in der Aktualisierung vom 4. Februar 2026 zum Folgeartikel „Mamdani to kill the NYC AI chatbot we caught telling businesses to break the law“ von Colin Lecher und Katie Honan, The Markup mit THE CITY, 30. Januar 2026; chat.nyc.gov leitet seit dem 3. Februar 2026 auf eine Seite der Stadt weiter, Überschrift dort „The Chatbot beta test has ended.“ · Folgeartikel vom 30. Januar 2026
Gerichtsurteil, nicht endgültig
Ein US-Bundesberufungsgericht hat am 4. August 2026 die einstweilige Verfügung gegen Perplexity aufgehoben und zurückverwiesen. Setzt jemand einen Einkaufsagenten ein, dann greift nach dem Computer Fraud and Abuse Act der Nutzer auf die fremde Website zu, der Agent ist sein Werkzeug, der Anbieter greift selbst nicht zu, solange der Agent im Browser des Nutzers läuft und dessen Server die fremde Seite nie selbst aufrufen.
Was die Entscheidung ist und was nicht: Sie ist vorläufig, geprüft wurden nur die Erfolgsaussichten im Eilverfahren. Amazon hat am 18. August 2026 Rehearing en banc beantragt; der öffentliche Aktenspiegel weist dazu bis zum letzten Abgleich am 21. August 2026 nichts aus, spätere Einträge sind nicht ausgeschlossen. Es ist US-Recht und bindet in Europa niemanden. Was das Gericht offen lässt: Zu serverseitigen Agenten sagt es nichts, es errichte keine neue Rechtsordnung für agentische KI, entscheide nichts über Haftung aus Delikt, und bei anderer Aktenlage könne der Anbieter so viel Kontrolle ausüben, dass er selbst zugreift. Der Fall betrifft den fremden Agenten auf der eigenen Seite, nicht die Haftung für den eigenen. Die Nutzungsbedingungen bleiben unberührt.
Amazon.com Services, LLC gegen Perplexity AI, Inc., No. 26-1444, United States Court of Appeals for the Ninth Circuit, Opinion by Judge Milan D. Smith, Jr. · 21 Seiten, FOR PUBLICATION, ohne Sondervotum, Vorinstanz N.D. Cal., Richterin Maxine M. Chesney · Urteil vom 4. August 2026 · Antrag auf Rehearing en banc vom 18. August 2026 als Docket-Eintrag 66 nach dem öffentlichen RECAP-Aktenspiegel (CourtListener, Docket 72502129), letzter Abgleich 21. August 2026, nicht aus der verlinkten Entscheidung
Herstellerdokumentation
Ein Screenshot enthält die C2PA-Herkunftsdaten des Originals nicht: Sie liegen in der Datei, er erzeugt eine neue. Umgekehrt signiert eine C2PA-fähige Kamera, die ein KI-Bild abfotografiert, die Aufnahme, ohne Hinweis auf den KI-Ursprung. Im Regelfall hält sie Gerät, Zeit und Ort in den Metadaten fest und kann den Bildinhalt nicht analysieren; was eingetragen wird, liegt laut derselben Seite beim Hersteller.
Was der Beleg nicht sagt: Dieselbe Antwort hält zuerst fest, dass fehlende Historie angezeigt wird, der Screenshot bleibt als Datei ohne Herkunft erkennbar. Die Seite schränkt ein, Content Credentials seien ein positives Signal und kein negatives. Er trifft nur die Metadaten-Schicht: Sie führt Wasserzeichen als Technik, die „cropping, rotation, or screen capture“ übersteht, und die C2PA-Spezifikation sieht die Wiederherstellung entfernter Metadaten per Abgleich mit Wasserzeichen-Kennung oder Fingerabdruck vor. Wer das sagt: Die Seite steht unter Adobes Copyright und verweist daneben auf die eigene Abhilfe Durable Content Credentials. Die Wasserzeichen-Angabe ist Selbstauskunft ohne Messung, die Wiederherstellung eine Möglichkeit der Spezifikation, kein belegter Regelbetrieb.
Content Authenticity Initiative (Adobe), Entwicklerdokumentation · FAQ, sieben Fragen · Stand 10. September 2026
Herstellerdokumentation
Frontify öffnet sein Markenportal über einen selbst betriebenen MCP-Server. Am 10. September 2026 führt er, einzeln aufgeführt, 54 Werkzeuge in zehn Paketen, gestuft vom rein lesenden bis zum vollen Verwaltungszugriff. Das lesende Discovery-Paket enthält 24 Werkzeuge, das Admin-Paket alle 54, zwei davon sind als destruktiv gekennzeichnet.
Was die Zahl nicht sagt: 54 ist ein Stichtagswert eines Beta-Produkts und bewegt sich. Die Herstellerdokumentation nennt an zwei Stellen 52 und für das lesende Paket 25 statt 24: Wer 52 zitiert, zitiert die Dokumentation, nicht das ausgezählte System. Einen Grund dafür nennt keine der vier Frontify-Quellen. Die Paketzahlen sind überlappende Teilmengen der 54 und dürfen nicht addiert werden. Die Guide-Überschrift kündigt den Server mit zehn Werkzeugen an, gemeint sind zehn Pakete, mehr als das Fünffache daneben. Was der Eintrag nicht belegt: Belegt ist, was ein Anbieter über sein eigenes Produkt sagt, nirgends unabhängig geprüft: der Umfang einer Schnittstelle, nicht Verbreitung, Nutzung, Wirkung oder die Qualität der ausgelieferten Markenregeln. Kein Werkzeug entscheidet über eine Aussage, die Pakete lesen, schreiben und verwalten. Ein Zugriffsprotokoll ist nicht belegt: „Audit trail of AI interactions“ ist bei Frontify ein Auswahlkriterium für Käufer, in Repository, Server-Seiten und Help Center kommt das Wort audit nicht vor. Der Server ist nicht standardmäßig aktiv, der Zugang läuft über die Kundenbetreuung, derzeit kostenfrei mit Preisvorbehalt. Wie der angeschlossene KI-Anbieter die Daten verarbeitet, kontrolliert Frontify nach eigener Angabe nicht.
Frontify, MCP-Server-Übersicht und Paketseiten (/mcp/packs/admin und /mcp/packs/discovery), Werkzeuge einzeln aufgeführt und ausgezählt, 54 beziehungsweise 24 Einträge mit eindeutigen Namen, abgerufen am 10. September 2026 · Repository mit der Tabelle der zehn Pakete, MIT-Lizenz (Repository) · Help Center „Frontify MCP (Beta)“, nennt 52 Werkzeuge und für Discovery 25 (Help Center) · Guide „Choosing a DAM for the AI era“, veröffentlicht 22. Mai 2026, zuletzt geändert 30. Juli 2026, nennt ebenfalls 52 (Guide)
Herstellerdokumentation
Canva betreibt einen offiziellen MCP-Server und dokumentiert dafür 33 Werkzeuge. 27 stehen in allen Tarifen, darunter Designs erzeugen und exportieren. Vier setzen mindestens Canva Pro voraus, darunter Brand Kits auflisten und Markenvorlagen nutzen. Zwei bleiben Enterprise vorbehalten: eine Vorlage automatisch befüllen und den zugehörigen Datensatz auslesen. Jeder meldet sich einzeln an, ein Agent hat die Rechte des angemeldeten Menschen.
Wo die Tarifgrenze liegt: Die Übersichtsseite stellt den markenbezogenen Teil scheinbar auf Enterprise; maßgeblich ist die Werkzeugliste: „Pro and above“ heißt dort Pro, Business und Enterprise. Was der Eintrag nicht belegt: Eigenangaben eines Anbieters ohne unabhängige Prüfung. Belegt sind Existenz und Umfang der Schnittstelle, nicht Verbreitung, Nutzung oder Wirkung. Kein Werkzeug prüft eine Aussage gegen Markenregeln; Brand Kits werden gelesen und eingefüllt. Der Export läuft in allen Tarifen, freie aber nur in Standardqualität, und Premium-Elemente können ihn in jedem Tarif mit license_required scheitern lassen. Haltbarkeit: Die 33 gilt zum Abrufdatum, die Dokumentation trägt keine Versionsangabe. Der Server verlangt nur ein Canva-Konto in beliebigem Tarif; eine eigene Integration braucht Canvas Freigabe.
Canva, „MCP tools and rate limits“, Werkzeugkatalog mit Tarifstufen und Legende, 33 Einträge einzeln ausgezählt · Canva, „Canva Model Context Protocol (MCP)“, Serveradresse mcp.canva.com/mcp, Anmeldung und Tarifübersicht (Serverdokumentation) · beide abgerufen am 10. September 2026
Wird meist falsch zitiert
Klarnas meistzitierte KI-Zahl ist eine Schätzung, kein Personalstand: Die Pressemitteilung von Februar 2024 nennt „the equivalent work of 700 full-time agents“. Derselbe Wert steht im Börsenprospekt von September 2025 bei über 700 und im Geschäftsbericht von Februar 2026 in der Unternehmensbeschreibung weiter bei über 700, im Lagebericht desselben Berichts bei über 850. Der Personalstand steht daneben: rund 5.527 Vollzeitbeschäftigte Ende 2022, rund 2.831 Ende 2025.
Was die Zahl wirklich ist: eine Hochrechnung aus dem durchschnittlichen monatlichen Rückgang an Chat- und Telefongesprächen, im Prospekt und in der Unternehmensbeschreibung des Berichts auf Basis 2024, im Lagebericht auf Basis 2025. Die beiden Werte widersprechen sich deshalb nicht, sie stehen nur unkommentiert nebeneinander: die ältere Zahl im Präsens, die neuere im Rückblick auf das Jahr 2025. Kein Rückbau von KI: Klarna nennt es einen „dual-track approach“, hielt die menschliche Option schon 2024 offen und erwartet laut beiden Börsenpapieren weiter sinkende Beschäftigtenzahlen. Wer den Fall als Rückkehr zum Menschen zitiert, zitiert gegen die Quelle.
Klarna Group plc, eigene Angaben in Pressemitteilung, Börsenprospekt (Formular F-1/A) und Geschäftsbericht (Formular 20-F) bei der SEC · 27. Februar 2024 bis 26. Februar 2026
Stand der Normung
Das Model Context Protocol kennt drei Server-Bausteine mit je einer vorgesehenen Steuerungsinstanz: Werkzeuge (Tools) ruft das Modell auf, Ressourcen (Resources) steuert die Anwendung, Prompt-Vorlagen (Prompts) wählt der Nutzer aus. Verbindlich ist das nicht. Alle drei Kapitel tragen denselben Nachsatz: Das Protokoll schreibe kein bestimmtes Interaktionsmodell vor. Im Tools-Kapitel folgt darauf sofort eine Soll-Regel: Ein Mensch soll jederzeit einen Werkzeugaufruf ablehnen können.
Der Dreiklang steht in der Übersicht, nicht in den Regeln: Die Tabelle mit Model, Application, User steht im Erklärtext „Understanding MCP servers“ und in der Spezifikationsübersicht „Server Features“. Beide führen keine Muss- und Soll-Regeln; in den drei Kapiteln, die sie führen, heißen Ressourcen „application-driven“. Kein Server muss alle drei anbieten: „Servers offer any of the following features to clients“. Und er altert schnell: Seit dem 5. November 2024 gibt es fünf Revisionen, zwei davon seit November 2025. Methoden werden ersetzt: resources/subscribe steht in 2025-06-18 und 2025-11-25 je zweimal im Ressourcen-Kapitel, in 2026-07-28 kein einziges Mal, dort dreimal subscriptions/listen.
Model Context Protocol, getragen von Model Context Protocol a Series of LF Projects, LLC, Spezifikation Revision 2026-07-28, Kapitel Tools, Resources und Prompts, jeweils Abschnitt „User Interaction Model“, dazu die Übersichtsseiten /specification/2026-07-28, Abschnitt Features, und /specification/2026-07-28/server, Abschnitt Server Features, sowie der Erklärtext „Understanding MCP servers“ · Revisionsliste und Methodenwechsel als eigene Pfad- und Textprobe · 10. September 2026
Begutachtete Benchmark und Test des Anbieters
In einer Werkzeugbeschreibung versteckte Anweisungen bringen einen Agenten dazu, den privaten SSH-Schlüssel zu lesen und über einen Parameter namens „sidenote“ an einen fremden Server zu schicken; im Bestätigungsdialog steht nur der Name eines Additionswerkzeugs. Eine Benchmark auf 45 echten MCP-Servern mit 353 Werkzeugen misst über 20 Modelleinstellungen im Mittel 36,5 Prozent Angriffserfolg, höchstens 72,8.
Was das nicht sagt: Der Nutzer klickt mit. Verborgen ist nur der Inhalt der Freigabe, Cursor blendet den Schlüssel selbst im Dialog aus. Kein Server war kompromittiert, das vergiftete Werkzeug steht im System-Prompt. Der Erfolgsbegriff ist eng: Gezählt wird nur, wenn der Agent ein zweites, legitimes Werkzeug missbraucht; ruft er das vergiftete selbst auf, gilt das als Misserfolg. Gemessen wird die Werkzeugaufruf-Ausgabe des Modells in einer einzelnen Runde, ausgeführt wird nichts. Bezugsgröße sind die gültigen Ausgaben, nicht die 1.348 Testfälle. Der Rest ist keine Abwehrquote, verweigert hat selbst das am häufigsten verweigernde Modell, Claude-3.7-Sonnet, in unter 3 Prozent. Invariant verkauft Sicherheitswerkzeuge und veröffentlichte zehn Tage vor dem eigenen Scanner.
Invariant Labs (inzwischen Snyk), Luca Beurer-Kellner und Marc Fischer, zwei Versuche mit dem MCP-Client Cursor, 1. April 2025, Nachträge 7. und 11. April 2025 · Zhiqiang Wang und acht weitere (University of Science and Technology of China, Beihang University), „MCPTox“, 45 MCP-Server, 353 Werkzeuge, 1.348 Testfälle, 20 Modelleinstellungen, Zahlen aus Abschnitt 4.2 und Tabelle 2, AAAI-26, Proceedings of the AAAI Conference on Artificial Intelligence 40(42), S. 35811 bis 35819, 14. März 2026, doi:10.1609/aaai.v40i42.40895, Vorabfassung arXiv:2508.14925v1, 19. August 2025 · Zur begutachteten Fassung
Anbieterangaben, Beta
Monotype hat am 15. Juli 2026 eine Beta seines Enterprise MCP Connectors angekündigt. Er verbindet KI-Werkzeuge mit Schriftbibliothek, Lizenzangaben und Produktionsfreigaben eines Kunden: Er gleicht KI-Entwürfe gegen die Bibliothek ab, prüft referenzierte Schriften gegen die Produktionsschriftliste und gibt CSS im Chat zurück, sofern die Projektschriften zur Bibliothek gehören. Er läuft über das Model Context Protocol, zunächst in Claude und Claude Design.
Was die Angabe nicht sagt: Sie stammt vom Anbieter, keine auffindbare Meldung prüft selbst nach. Die Prüfung meldet und verweigert nicht: Nicht freigegebene Schriften werden laut Produktseite markiert, und der Labs-Beitrag verneint ausdrücklich, dass der Connector die Marken-, Rechts- oder Produktionsprüfung ersetzt. Wer freigibt, ist der Kunde: Vorausgesetzt sind freigegebene Produktionsschriften in seiner Instanz, die der Connector nur umsetzt. Gegenstand ist eine Schrift, keine Aussage. Web und HTML sind die erste Ausbaustufe, der Zugang auf ausgewählte Enterprise-Kunden von Monotype Fonts beschränkt, Zahlen zu Nutzung oder Wirkung fehlen.
Monotype Labs, „Bringing font governance into AI-native content creation“, Ablauf der Beta in sieben Schritten, 15. Juli 2026 · Pressemitteilung „Monotype Introduces Enterprise Connector Beta, Exploring How Brand Governance Works Inside AI-Native Workflows“, Woburn, Massachusetts, 15. Juli 2026 · Produktseite „Monotype Enterprise Connector“ mit Status „Now in BETA“ und Zugangsvoraussetzungen, abgerufen 10. September 2026 · Negativprobe an der Pressemitteilungsliste, 15. Juli bis 10. September 2026 ohne Statusänderung
Eigene Erhebung, reproduzierbar
Pulumi veröffentlicht die eigenen Markenrichtlinien als MCP-Server unter brand.pulumi.com/mcp. Er antwortete am 10. September 2026 ohne Anmeldung und führt 13 Ressourcen, eine Vorlage, 11 Werkzeuge und 3 Prompts; unter den Ressourcen Markenstimme, Schreibregeln und verbindliche Produktnamen. Eine Ressource regelt generative KI im Klartext, gerichtet an den Menschen: „never ship raw model output as a finished piece“, „never publish anything without a human reviewing it first“.
Was die Zahlen nicht sagen: Gemessen sind Erreichbarkeit und Umfang, nicht Nutzung, Wirkung oder ob sich jemand an die Regeln hält. Der Inhalt ist die ungeprüfte Selbstdarstellung einer einzelnen Softwarefirma über die eigene Marke. Was der Server entscheidet: Drei Prompts sagen eine strukturierte Bewertung von Text, Bild und Design zu, werden laut Hersteller aber vom Menschen ausgelöst und expandieren in eine vorbereitete Modellanfrage. Selbst gerechnet werden zwei Urteile: Farbkontrast gegen veröffentlichte APCA-Schwellen, im Test Lc 86,4 für violet-700 auf Weiß, und die nächstgelegene Markenfarbe samt Ersetzungsempfehlung. Über die Güte einer Aussage befindet ein Mensch, so verlangt es der Regeltext.
Eigener Abruf des Pulumi Brand MCP Server, Fassung 0.1.0, Protokollfassung der Sitzung 2025-06-18 (vom Client vorgegeben, der Server nennt 2025-11-25), per JSON-RPC über Streamable HTTP · Methoden initialize, resources/list, resources/templates/list, tools/list, prompts/list, resources/read auf brand://guidelines und tools/call auf check_color_accessibility und find_nearest_brand_color · alle Aufrufe HTTP 200 ohne Authentifizierungskopf, keine Liste mit nextCursor, Zählungen dreimal wiederholt und stabil · brand://guidelines im Volltext, 3.053 Zeichen, text/markdown · Herstellerdokumentation brand.pulumi.com/mcp-server für die Einordnung der Prompts · abgerufen am 10. September 2026
Herstellerdokumentation
Statista betreibt einen MCP-Server unter api.statista.ai/v1/mcp mit sechs dokumentierten Werkzeugen. Jeder Aufruf wird einzeln in Credits abgerechnet, gestaffelt nach Antwortart: Suchen kostet 0 oder 1 Credit, das Abrufen der Zahlen selbst 10 bis 15. Ohne Schlüssel antwortet der Server mit 401 Unauthorized.
Was die Staffelung nicht sagt: Was ein Credit in Geld kostet, steht in der gesamten Dokumentation nirgends, die einzige Preisseite nennt Verhältnisse. Belegt ist, was teuer ist, nicht wie teuer. Vier der sechs Werkzeuge betreffen Market und Consumer Insights, also Marktprognosen und Umfragedaten, nicht den Statistik-Katalog; Daten liefern davon nur zwei, die beiden anderen geben Suchtreffer zurück. Was der Eintrag nicht belegt: Herstellerangaben über das eigene Produkt. Unabhängig gemessen ist allein, dass der Endpunkt antwortet und ohne Schlüssel abweist, nichts über Verbreitung oder Nutzung. Die Bestandszahlen der Pressemitteilung vom 20. November 2025 sind nicht verwendet: über eine Million Statistiken meint dort den über MCP zugänglichen Teil, 1,5 Millionen den Gesamtbestand, beides Herstellerangaben ohne Zählvorschrift.
Statista, Entwicklerdokumentation MCP Server und Credit Logic, sechs Werkzeuge und Kreditkosten einzeln ausgezählt · eigene Abfrage des Endpunkts ohne Schlüssel · Pressemitteilung vom 20. November 2025 · abgerufen am 10. September 2026 · Pressemitteilung
Pressemitteilungen des Anbieters
Im regulierten Pharma-Freigabeverfahren ist die maschinelle Vorprüfung von Markenvorgaben ausgeliefertes Produkt. Veeva meldet am 3. Dezember 2025 einen Quick Check Agent, der Inhalte anhand redaktioneller, Marken-, Markt-, Kanal- und Compliance-Vorgaben prüft, bevor die MLR-Prüfung selbst beginnt. Am 23. Juni 2026 übernimmt Veeva den Anbieter Copli und startet ihn als Falcon MLR, mit dem erklärten Potenzial, binnen fünf Jahren 70 Prozent oder mehr der MLR-Handarbeit zu beseitigen.
Was der Eintrag nicht belegt: eine Wirkung. Die 70 Prozent sind Absicht unter Zukunftsvorbehalt. Alle Angaben stammen vom Anbieter, geprüft ist nur, dass er sie macht. Der Agent prüft gegen hinterlegte Vorgaben und entscheidet nichts; die Freigabe ist hier ein regulatorisch erzwungenes Verfahren, die Übertragung auf andere Marken bleibt Analogie. Die Werbezahl trägt das nicht: 57 Prozent kürzere Prüfzyklen bewirbt Veeva heute auf der Produktseite, ohne Stichprobe, Ausgangswert und Rechenvorschrift; wortgleich stehen sie schon in einem Datenblatt vom 2. Mai 2017, dieselbe Zahl in einem vom 21. März 2016, also mindestens neun Jahre vor dem ersten Agenten, in Unterlagen, die KI kein einziges Mal erwähnen.
Veeva Systems, Pressemitteilungen zur Verfügbarkeit der Veeva AI Agents und zur Übernahme von Copli, beide im Volltext geprüft · 3. Dezember 2025 und 23. Juni 2026 · die 57 Prozent bewirbt Veeva heute auf der Produktseite Veeva PromoMats Review and Approve, abgerufen 10. September 2026 · Altersnachweis: Veeva-Datenblatt „Ensuring End-to-End Commercial Content Compliance“ (PromoMats for EU), PDF-Erstellungsdatum 2. Mai 2017, veeva.com/eu/wp-content/uploads/2017/05/PromoMats-for-EU-Datasheet.pdf, dieselbe Zahl in der Fassung mit PDF-Erstellungsdatum 21. März 2016, veeva.com/eu/wp-content/uploads/2012/07/PromoMats-for-EU-Datasheet-1.pdf · Produktseite
Anbieterangaben
Anthropic nennt zur Übergabe des Model Context Protocol an die Linux Foundation am 9. Dezember 2025 mehr als 10.000 aktive öffentliche MCP-Server und über 97 Millionen monatliche SDK-Downloads für Python und TypeScript. Zu den Platin-Mitgliedern der neuen Agentic AI Foundation zählt die Stiftung AWS, Anthropic, Block, Bloomberg, Cloudflare, Google, Microsoft und OpenAI.
Was die Zahl nicht sagt: Sie steht im Beitrag des MCP-Entwicklers über die eigene Spende, in einer Aufzählung unter der Überschrift „incredible adoption“, ohne jede Erhebungsvorschrift: kein Verzeichnis, kein Stichtag, keine Definition von „aktiv“. Gegenprüfen hilft nur begrenzt, ein maßgebliches Verzeichnis gibt es nicht: Ein vollständiger Abzug des offiziellen Verzeichnisses am 10. September 2026 ergibt 30.363 eingetragene Server, davon 30.031 im Status „aktiv“. Gegen die Herstellerzahl rechnen lässt sich das nicht: Anthropic nennt keine Zählweise und meint einen anderen Gegenstand, ein Wachstumswert ergibt sich daraus nicht. Und das Verzeichnis zählt Einträge, die jemand angelegt hat, nicht benutzte Server; es ist als Vorschau gekennzeichnet und geht selbst von „minimal-to-no moderation“ aus. Ein Server ist kein Nutzer. Vorsicht beim Weiterreichen: Die Linux Foundation nennt dieselbe Zahl „published“, aus aktiven werden veröffentlichte Server. Zur Mitgliederliste: Platin-Mitgliedschaft ist bezahlt: Dass AWS, Google, Microsoft und OpenAI die Governance mittragen, belegt keinen Einsatz in ihren Produkten. Die Stiftung schreibt „include“, die Liste ist nicht abschließend. Stand Dezember 2025.
Anthropic, „Donating the Model Context Protocol and establishing the Agentic AI Foundation“, 9. Dezember 2025, erhebende Stelle für beide Zahlen · Linux Foundation, Pressemitteilung zur Gründung der Agentic AI Foundation, 9. Dezember 2025, für die Mitgliederliste (Pressemitteilung) · eigene Gegenprobe am offiziellen Verzeichnis registry.modelcontextprotocol.io am 10. September 2026
Hausprognosen, nicht vergleichbar
Morgan Stanley veranschlagt für 2030 190 bis 385 Milliarden Dollar US-Onlinehandel durch „agentic shoppers“, also 10 Prozent Marktanteil im wahrscheinlichen, bis zu 20 Prozent im optimistischen Fall. Bain nennt neun Tage später 300 bis 500 Milliarden Dollar für „agentic commerce“, rund 15 bis 25 Prozent. Nur Bain nennt eine Einschlussregel und zählt beeinflusste Käufe mit.
Warum die Überlappung keine Übereinstimmung ist: Bain zählt Käufe, die Agenten „initiated, influenced, or completed“ haben, und nimmt nur Kaufreisen mit reiner KI-gestützter Suche oder Entdeckung aus. Morgan Stanley nennt keine Regel, seine Assistenten suchen, vergleichen Preise und nehmen Wiederkäufe vorweg, bei minimalem Eingreifen des Nutzers. Nachgerechnet: Beide unterstellen rund zwei Billionen Dollar Onlinehandel, der Unterschied sitzt weitgehend im Zähler. Was keine Zahl sagt: wie viel der Agent selbst abschließt. Bains Schlusssatz nennt für KI „bis zu ein Viertel der Transaktionen“, dieselbe Obergrenze wie der Anteilswert, nur auf Transaktionen statt Umsatz. Beide verkaufen Beratung dazu, keines nennt Bezugsgröße oder Rechenweg für 2030, belegt sind nur Adoptionswerte, beide Zahlen gelten nur für die USA.
Morgan Stanley Research, „Here Come the Shopping Bots“, Hausprognose zum US-Onlinehandel · 8. Dezember 2025 · Bain & Company, Snap Chart „2030 Forecast: How Agentic AI Will Reshape US Retail“ von Aaron Cheris, Mikey Vu, Stephanie Koszyk und Katherine Hall, Hausprognose zum US-Onlinehandel · 17. Dezember 2025 · bain.com weist automatisierte Abrufe ab, am 10. September 2026 mit HTTP 403, gelesen in der Archivfassung vom 17. Dezember 2025 · Archivfassung
Befragung
Marketingverantwortliche in US-Unternehmen setzen KI oder maschinelles Lernen in 24,2 Prozent der Zeit ein, in der sie Marketing optimieren und automatisieren. Das typische Unternehmen nennt 20 Prozent. Zwei Erhebungen zuvor waren es 13,1 (September 2024) und 17,2 Prozent (Anfang 2025). Für generative KI allein stieg der Wert von 7,0 über 15,1 auf 22,4 Prozent. In drei Jahren erwarten dieselben Befragten 55,9 Prozent.
Was die Zahl nicht sagt: Gemessen ist ein selbst geschätzter Zeitanteil, gemittelt über die Antwortenden, ohne Abgleich mit Systemdaten. Es ist weder ein Anteil der Unternehmen noch ein Budgetanteil. 24,2 ist der Mittelwert einer rechtsschiefen Verteilung, der Median liegt bei 20. Geantwortet haben 191 der 2.111 Eingeladenen, rund 9 Prozent, auf die Erwartungsfrage 188. Dieselbe Frage ergab in den zwei Wellen zuvor 34,5 und 44,2 Prozent; die Erwartung wandert mit jeder Welle nach oben, geprüft wurde keine. Die Branchenwerte gehören zu zwei Fragen: Die 36,1 Prozent stammen aus der Gesamtfrage und der größten Branchenzelle (40 Unternehmen), die 8,7 Prozent aus der zu generativer KI und einer der kleinsten (3). Zur Gesamtfrage nennt der Bericht keinen Tiefstwert.
The CMO Survey, 35. Ausgabe, erhoben von Christine Moorman an der Fuqua School of Business der Duke University, gesponsert von Duke, Deloitte und der American Marketing Association · 2.111 angeschriebene Marketingverantwortliche in gewinnorientierten US-Unternehmen, 308 Antworten, Rücklauf 14,6 Prozent, davon 191 zu dieser Frage, 97 Prozent ab VP-Ebene · Feldzeit 7. bis 29. Januar 2026, Bericht April 2026 · Highlights Report Seite 21 (KI und maschinelles Lernen) und Seite 23 (generative KI), Kennzahlen im Topline Report Seite 12, Fallzahlen der Branchenzellen im Firm and Industry Breakout Report Seite 36 und 45 · Breakout Report
Wird meist falsch zitiert
Die meistzitierte Zahl zu ungenutzten Unternehmensdaten, 55 Prozent, bündelt Selbstschätzungen der 1.357 Befragten über das eigene Haus. Erhoben hat sie 2018/19 die Research-Einheit der PR-Agentur FleishmanHillard im Auftrag von Splunk, einem Anbieter von Software zur Auswertung genau dieser Daten.
Wofür die Zahl wirklich gilt: Prozent wovon bleibt offen, der Bericht nennt weder Einheit noch Zeitraum noch Rechengröße. Als Definition lag den Befragten vor: „Information that can be captured, quantified and analyzed“. Auf Seite 3 und 12 steht sie als Tatsache, als Schätzung zu erkennen geben sie erst die Regional- und Länderteile ab Seite 10: USA 56 Prozent, Deutschland 53, China 50 „compared with a global 55 percent“. Ein Schätzwert über Organisationen ist kein Anteil an einem Gesamtbestand, und 1.357 ist die Summe der Markt-Stichproben, der Bericht nennt 1.300 Befragte. Was regelmäßig damit vermengt wird: 60 Prozent der Befragten sagen, die Hälfte oder mehr ihrer Daten sei dunkel, 33 Prozent sagen 75 Prozent oder mehr. Das sind Anteile von Befragten, keine Anteile von Daten. Splunk führt die Zahl bis heute ohne Jahresangabe, am 26. März 2025 als „recent“, dort auch ohne Stichprobe.
TRUE Global Intelligence (FleishmanHillard) im Auftrag von Splunk, The State of Dark Data, 1.357 Befragte aus IT und Fachbereich in sieben Ländern · erhoben Oktober 2018 bis Januar 2019, Bericht Mai 2019
Befragung
78 von 188 US-Unternehmen, die diese Frage beantwortet haben, setzen KI für Generative Engine Optimization ein, also dafür, dass eigene Inhalte in KI-erzeugten Suchantworten auftauchen. Das sind 41,5 Prozent, bei einem 95-Prozent-Intervall von plus/minus 7,1 Prozentpunkten.
Was die Zahl nicht sagt: Sie ist eine Selbstauskunft aus einer Mehrfachauswahl und misst das Tun, nicht das Ergebnis. Die Bezugsgröße ist die Falle: Nenner sind nicht die 308 Antwortenden, sondern die 188, die diese Frage beantwortet haben; alle 188 kreuzten mindestens ein Feld an (Response Percent 100,0). Im Nenner steht damit kein Unternehmen ohne KI-Einsatz, die 41,5 Prozent sind ein Anteil unter KI-Nutzern. Wer auf 308 rechnet, kommt auf 128 statt auf 78. Mit dem Intervall reicht der Bereich von 34 bis 49 Prozent: gut vier von zehn, nicht jede zweite. Wer gefragt wurde: nur US-Unternehmen, 97 Prozent auf VP-Ebene oder darüber, 308 von 2.111 Angeschriebenen, 14,6 Prozent Rücklauf. Auf Deutschland ist die Zahl nicht übertragbar. Neu ist die Antwortoption, nicht die Frage: GEO stand 2026 erstmals zur Wahl und hat keine Vergleichszahl, die Frage selbst führt der Bericht als Zeitreihe gegen Fall 2023.
The CMO Survey, 35. Ausgabe, erhoben an der Fuqua School of Business der Duke University, gesponsert von Duke, Deloitte und der American Marketing Association · Topline Report 2026, Seite 12, Antwortoption „GEO (i.e., Generative Engine Optimization to get content to appear in AI-generated search results)“: 78 von 188 Fällen, 41,5 Prozent, plus/minus 7,1 Prozentpunkte · 308 Antwortende von 2.111 angeschriebenen Marketingverantwortlichen US-amerikanischer For-Profit-Unternehmen · Feldzeit 7. bis 29. Januar 2026 · beim Nachschlagen aufpassen: Die Zeile darüber, „Predictive analytics for customer insights“, trägt denselben Wert von 41,5 Prozent bei ebenfalls 78 Fällen
Befragung
In der Mitgliederbefragung des US-Werbeverbands ANA gaben 2023 82 Prozent der befragten Mitglieder an, eine eigene Inhouse-Agentur zu haben, nach 78 Prozent 2018, 58 Prozent 2013 und 42 Prozent 2008. Dass sie in den drei Jahren davor laufendes Geschäft von einer externen Agentur nach innen geholt hatten, sagten 2023 65 Prozent, 2018 waren es 70, 2013 erst 56.
Was die Zahlen nicht sagen: Gemessen ist, wo Arbeit sitzt, nicht ob sie besser oder markenkonformer wird. Ein Branchenverband befragt freiwillig teilnehmende eigene Mitglieder, die laut Bericht selbst zur Inhouse-Agentur gehören können. Vorsicht bei den 65 Prozent: Die ANA weist die Basis je Frage aus, sie ist regelmäßig kleiner als die Teilnehmerzahl. 2018 lag sie bei dieser Frage bei 166 von 412 Befragten, für 2023 ist sie nicht veröffentlicht und darf nicht mit den 162 Teilnehmern verrechnet werden. Der Abstand 70 zu 65 Prozent trägt keine Trendwende: Das Intervall reicht 2018 von 63 bis 77 Prozent, 2023 bei höchstens 162 Antworten von 58 bis 72 Prozent, und die Wellen sind unterschiedlich groß. Der ANA-Bericht vom Juni 2026 setzt die Reihe nicht fort, er befragt Preis-Juroren; die nächste Mitgliederwelle wäre 2028.
Association of National Advertisers, Mitgliederbefragung „The Continued Rise of the In-House Agency: 2023 Edition“, 162 Antwortende, erhoben im Februar und März 2023 · Pressemitteilung vom 2. Mai 2023, der Bericht selbst liegt hinter der Mitgliederschranke · Vergleichswerte und Basisangaben aus dem Vorgängerbericht vom Oktober 2018, 412 Antwortende, 57 Seiten · Vorgängerbericht
Geprüfte Erhebung
Von den englischsprachigen Artikeln, die im ersten Quartal 2026 neu erschienen, waren 49,9 Prozent überwiegend KI-generiert. Seit Anfang 2025 schwankt der Anteil zwischen 44,6 und 50,9 Prozent, ohne Trend nach oben.
Was die Zahl nicht sagt: Gemessen sind neu veröffentlichte englischsprachige Artikel und Listicles mit Artikel-Markup und mindestens 100 Wörtern aus Common Crawl, nicht das Netz insgesamt, andere Sprachen, Social Media oder Video. Nichts über Reichweite: Graphite erhob im Juni 2025 und veröffentlichte im Oktober 2025, dass 86 Prozent der zu 31.493 Suchbegriffen in Google rankenden und 82 Prozent der von ChatGPT und Perplexity zitierten Artikel von Menschen stammen, gemessen aber mit einem vierten Detektor (Surfer, Falsch-Positiv-Rate 4,2 Prozent), also auf anderer Skala. Wie tragfähig die 50 Prozent sind: Der Wert mittelt drei Detektoren, die im selben Quartal um 6,4 Punkte auseinanderliegen (Pangram 47,7, Copyleaks 48,1, GPTZero 54,1). Die Spanne ist größer als der Abstand zur 50-Prozent-Marke, zwei der drei sehen Menschen vorn. Bei GPTZero zählt das Urteil „gemischt“ ganz auf der KI-Seite (6,4 Prozent der Artikel), bei Pangram und Copyleaks entscheidet die Mehrheit.
Graphite, Wachstumsagentur · rund 55.400 zufällig aus Common Crawl gezogene englischsprachige Artikel mit Artikel-Markup und mindestens 100 Wörtern, veröffentlicht zwischen Januar 2020 und März 2026 · Klassifizierung als Mittelwert aus drei Detektoren (Pangram, Copyleaks, GPTZero), deren Falsch-Positiv-Raten von 1,844, 1,836 und 1,355 Prozent an rund 15.700 vor ChatGPT erschienenen Artikeln derselben Stichprobe gemessen wurden · Quartalsdaten offen einsehbar · Mai 2026
Drei Anbietermessungen
Drei Anbieter von Analysewerkzeugen beziffern, welcher Anteil der Website-Besuche aus einem KI-Assistenten kommt: Contentsquare 0,2 Prozent im vierten Quartal 2025, Semrush 0,14 Prozent für das Jahr 2025, Conductor 1,08 Prozent für Mai bis September 2025. Drei getrennt erhobene Messungen, Bruchteile eines Prozents bis gut ein Prozent.
Was die Zahlen nicht sagen: Gezählt sind Klicks mit erkennbarer Herkunft aus einem Assistenten, nicht wie oft eine Marke in Antworten genannt wird. Google AI Mode liegt außerhalb der beiden Werte, die sich dazu äußern: Semrush führt ihn als eigenen Kanal mit 0,01 Prozent, Conductor vermerkt, dass Google Analytics ihn nicht von organischem Verkehr trennt.
Warum die drei Werte nicht nebeneinandergehören: Contentsquare misst 6.500 Websites weltweit, Semrush über 50.000 weltweit, Conductor 1.215 eigene Kundendomains in den USA und nennt seine Werte Durchschnitte. Der Abstand von 0,14 auf 1,08 Prozent, fast Faktor acht, ist zu gutem Teil eine Frage der Auswahl. Alle drei verkaufen Analysewerkzeuge; Contentsquare und Conductor messen den eigenen Kundenbestand, Semrush schätzt aus einem zugekauften Klickstrom-Panel. Unabhängig geprüft ist keiner der Werte.
Contentsquare, 2026 Digital Experience Benchmarks, 99 Milliarden Sessions und 6.500 Websites weltweit, viertes Quartal 2024 gegen viertes Quartal 2025 · 29. Januar 2026 · Semrush, Traffic & Market Toolkit, über 50.000 Websites und 17 Branchen weltweit, Januar bis Dezember 2025 · 27. April 2026 · Conductor, AEO/GEO Benchmarks, Verkehrsteil aus 1.215 eigenen Enterprise-Kundendomains in den USA, Mai bis September 2025 · Stand 6. Juli 2026
Anbieterangaben
Der Takedown-Anbieter Netcraft gibt an, zwischen März 2024 und März 2025 gegen 1,3 Millionen Phishing-Seiten vorgegangen zu sein, die mehr als 16.000 Organisationen nachahmten.
Was die Zahl nicht sagt: Sie sagt nicht, dass diese Seiten verschwunden sind. Netcraft schreibt „disrupted“ und fasst darunter Sperren und Entfernen zusammen, wie sich die 1,3 Millionen aufteilen, steht nirgends. Dieselbe Seite rät Lesern, Anbieter genau danach zu fragen. Sie sagt auch nichts darüber, ob eine offengelegte Markenspezifikation das Klonen erleichtert oder erschwert, dafür fehlt jede Vergleichsgruppe. Belegt ist nur, dass Klone massenhaft existieren. Wer gezählt hat: Netcraft selbst, die eigenen Vorgänge, auf einer Verkaufsseite für diesen Dienst. Unabhängig geprüft ist nichts. Der oft mitzitierte Weltanteil von rund einem Drittel steht deshalb nicht in der Aussage: Die Seite beziffert die Weltmenge nirgends und widerspricht sich selbst, einmal Anteil an den Abschaltungen, einmal an den Angriffen. Auch die 16.000 Organisationen sind keine Marktgröße.
Netcraft, Leitfaden zu Erkennung und Störung von Phishing-Seiten, eigene Vorgänge des Anbieters von März 2024 bis März 2025 · 12. Dezember 2025, zuletzt geändert 12. März 2026
Marktbeobachtung auf Schätzdaten
Zwischen dem ersten Quartal 2023 und dem vierten Quartal 2025 ist die Summe aus Suchmaschinen-Besuchen und suchähnlichen KI-Sitzungen weltweit um 26 Prozent gestiegen, von 82,0 auf 103,2 Milliarden im Monat. Googles Anteil fällt von 89 auf 71 Prozent, ChatGPT kommt auf 20 Prozent.
Was die Zahl nicht sagt: Sie zählt keine Suchvorgänge, sondern Besuche und Sitzungen: ein Google-Besuch im Mittel 6,7 Seitenabrufe, eine App-Sitzung unbekannt viele Prompts. Und ungleich: Suchmaschinen nur Web, KI Web und App. Such-Apps schließt sie ohne Zahl als „relatively low“ aus, obwohl 83 Prozent der KI-Nutzung in Apps liegen. Von der KI zählen nur 52 Prozent „Asking“, laut Autoren eine Obergrenze. Die 71 Prozent sind Google Search und Gemini zusammen; je Tag sind es statt 26 nur 23,1. Dieselben 26 Prozent nennt sie anderswo für 2025 gegen 2024, wo ihre offenen Rohdaten 17,3 ergeben. Woher die Daten kommen: Similarweb-Schätzungen ohne Servermessung, gegengeprüft nur die Suchmaschinen-Zahlen an acht Websites, nur als Trendkorrelation; die KI-Zahlen gar nicht gegen Erstdaten. Der Autor verkauft Sichtbarkeit in Suchmaschinen und KI-Antworten und legt offen: beides groß zu nennen nützt ihm.
Graphite (Ethan Smith) · Auswertung von Similarweb-Schätzdaten zu Web-Besuchen und App-Sitzungen weltweit, Juli 2020 bis Dezember 2025, Rohdaten offen · März 2026
Kontrollierter Test
Erfahrene Entwickler brauchten mit KI-Werkzeugen 19 Prozent länger, hielten sich dabei aber für 20 Prozent schneller. Vorher hatten sie 24 Prozent Beschleunigung erwartet. Zwischen gemessener und empfundener Wirkung liegen 43 Prozentpunkte, mit umgekehrtem Vorzeichen.
Was die Zahl nicht sagt: 16 Entwickler, 246 Aufgaben, ausschließlich in Repositories, die sie im Schnitt seit fünf Jahren kennen. Genau diese Vertrautheit erklärt einen Teil des Ergebnisses: Wer sein eigenes Projekt im Kopf hat, gewinnt durch Assistenz weniger. Auf unbekannten Code oder andere Wissensarbeit lässt sich das nicht übertragen, und die Werkzeuge stammen von Anfang 2025. Was bleibt: die Lücke zwischen Messung und Selbsteinschätzung. Sie ist der Grund, jeder Produktivitätszahl zu misstrauen, die auf Befragung beruht.
METR, randomisiert kontrollierte Studie, Juli 2025 · 16 erfahrene Open-Source-Entwickler, 246 Aufgaben
Kontrollierter Test
In einem präregistrierten Experiment mit 758 Unternehmensberatern erledigten die KI-Nutzer 12,2 Prozent mehr Aufgaben, arbeiteten 25,1 Prozent schneller und lieferten über 30 Prozent bessere Qualität, solange die Aufgabe innerhalb der Modellfähigkeit lag. Bei einer Aufgabe knapp außerhalb lagen sie 19 Prozentpunkte häufiger falsch als die Gruppe ohne KI.
Was die Zahl nicht sagt: Wo die Grenze verläuft, war den Teilnehmern nicht erkennbar. Die Aufgaben sahen einander ähnlich. Das ist der Kern des Befunds und zugleich seine Einschränkung: Gemessen wurde eine bewusst außerhalb platzierte Aufgabe, nicht die Häufigkeit solcher Fälle im Arbeitsalltag. Das Experiment lief mit GPT-4; wo die Grenze heute liegt, ist offen. Beratungsarbeit ist außerdem nicht jede Wissensarbeit.
Dell'Acqua u. a., „Navigating the Jagged Technological Frontier“, Feldexperiment mit der Boston Consulting Group · Organization Science, online seit 11. März 2026, DOI 10.1287/orsc.2025.21838 · 758 Berater, 18 realistische Aufgaben · das Arbeitspapier von 2023 nannte für die Qualität noch über 40 Prozent
Kontrollierter Test
293 Teilnehmende schrieben je eine Kurzgeschichte, ein Teil davon mit Startideen von GPT-4, 600 Leser bewerteten sie. Mit KI-Idee galten die Geschichten als neuartiger, plus 5,4 Prozent bei Zugang zu einer Idee, plus 8,1 Prozent bei bis zu fünf. Zugleich glichen sie einander an: Die Ähnlichkeit einer Geschichte zum Mittel der übrigen ihrer Gruppe stieg um 0,871 Punkte auf einer Skala von 0 bis 100, laut Autoren 10,7 Prozent der Spannweite, die die Gruppe ohne KI aufspannte.
Was die Zahl nicht sagt: Die 0,871 Punkte gelten für den Zugang zu einer Idee. Bei bis zu fünf Ideen war die Angleichung kleiner, 0,718 Punkte und 8,9 Prozent, der Kreativitätsgewinn größer. „Mehr KI, mehr Gleichheit“ liest gegen die Daten. Gemessen ist der Zugang, nicht die Nutzung: In der Ein-Ideen-Bedingung riefen 82 von 100 überhaupt eine Idee ab, in der zweiten im Mittel 2,55, die vollen fünf nur 24,5 Prozent. Die eindrucksvollere Zahl ist die weichere: Die 10,7 Prozent sind ein Anteil an den 8,10 Punkten zwischen höchstem und niedrigstem Wert ohne KI, hängen also an zwei Extremwerten. Dieselben 10,7 Prozent stehen im Papier ein zweites Mal, als Neuartigkeits-Gewinn der am wenigsten kreativen Schreibenden, ohne Bezug dazu. Gemessen ist die Kosinus-Ähnlichkeit von Texteinbettungen einer Gruppe, nicht ob Ergebnisse schlechter sind. „Kreativer“ urteilen Laienleser, im Selbsturteil der Schreibenden gab es keinen statistisch signifikanten Unterschied. Acht Sätze ohne Dialog mit dem Modell, britische Prolific-Teilnehmende statt Berufsautoren: Kurzgeschichten sind keine Strategiepapiere.
Doshi und Hauser, „Generative AI enhances individual creativity but reduces the collective diversity of novel content“, Science Advances, Band 10, Ausgabe 28, eadn5290, 12. Juli 2024, DOI 10.1126/sciadv.adn5290 · präregistriert, 293 Schreibende und 600 Bewertende auf Prolific, 3.519 Einzelbewertungen, Ideen von GPT-4 · die Verlagsseite science.org wehrt automatisierte Abrufe ab, geprüft wurde am offenen Volltext bei Europe PMC
Redaktionell geprüft
Sieben Sprachmodelle wurden vor sieben strategische Grundsatzfragen gestellt, jede als Entweder-oder. Bei sechs der sieben wählten sie anbieterübergreifend dieselbe Seite, etwa Differenzierung vor Kostenführerschaft und Augmentierung vor Automatisierung. Nur bei Exploration gegen Exploitation gingen sie auseinander. Zwei Nachuntersuchungen an ChatGPT-5 mit je über 15.000 Durchläufen bewegten die Schlagseite kaum: Bei Differenzierung und Augmentierung senkte besseres Prompten den Anteil voreingenommener Antworten um weniger als 2 Prozent, zusätzlicher Unternehmenskontext verschob ihn im Mittel über die ganze Nachuntersuchung um 11 Prozent, in beide Richtungen. Die Autoren nennen das „strategy trendslop“: die sozial erwünschteste Antwort des Internet-Durchschnitts.
Korrigiert am 10.09.2026: Bis dahin standen hier „96 Prozent Differenzierung“ und „93 Prozent Augmentierung“. Beide Werte stehen nirgends im Beitrag; der Volltext nennt keinen Anteilswert, nur Verschiebungen gegenüber der Ausgangslage, und die Zahlen stammen aus Blog-Zusammenfassungen, vermutlich aus einer Abbildung abgelesen. Ebenfalls korrigiert: Die über 15.000 Durchläufe gelten nicht für die sieben Modelle. Beide 15.000er-Blöcke sind Nachuntersuchungen an einem einzigen Modell, ChatGPT-5; die Sieben-Modelle-Messung beruht auf 50 Durchläufen je Modell und Frage, eine Gesamtzahl nennen die Autoren nicht. Was die Zahlen nicht sagen: Die Unempfindlichkeit gilt nur für zwei der sieben Fragen; bei den übrigen fünf verschob besseres Prompten die Antworten im Mittel um 22 Prozent in beide Richtungen, am stärksten wirkte die Reihenfolge der Optionen mit 19 Prozent. Ob die bevorzugte Antwort falsch ist, sagt der Befund nicht, gemessen ist allein die Unempfindlichkeit gegen den Kontext. Zur Quelle: ein HBR Digital Article ohne Begutachtung, ein eigenständiges Paper gibt es nicht; ein Repositorium führt ihn als begutachtet, das ist ein Katalogartefakt. Die bezahlgeschränkte Seite liefert den Volltext in ihren strukturierten Daten mit aus, zeichengleich in Archivfassungen vom 17. März und 14. Juli 2026.
Angelo Romasanta, Llewellyn D. W. Thomas und Natalia Levina, „Researchers Asked LLMs for Strategic Advice. They Got ‚Trendslop‘ in Return.“, Harvard Business Review, 16. März 2026, HBR Digital Article H093GG · getestet wurden ChatGPT, Claude, DeepSeek, GPT-5 über die API, Gemini, Grok und Mistral, je 50 Durchläufe pro Modell und Frage; die beiden Blöcke mit über 15.000 Durchläufen liefen allein auf ChatGPT-5 · Volltext mit 15.613 Zeichen aus den strukturierten Daten der Seite, gegengeprüft an zwei Archivfassungen
Kontrollierter Test und Herstellerdokumentation
Zustimmung ist im Trainingssignal belohnt. In einer Analyse von 15.000 Antwortpaaren aus Anthropics eigenen Rückmeldungsdaten gehört die Übereinstimmung mit den Überzeugungen des Nutzers durchgehend zu den stärksten Vorhersagern menschlicher Vorzugswahl; einzelne Merkmale verschieben die Vorzugswahrscheinlichkeit um höchstens rund 6 Prozentpunkte. Im April 2025 nahm OpenAI ein GPT-4o-Update zurück, weil das Modell übermäßig gefällig geworden war, und nennt vorläufig drei zusammenwirkende Änderungen, darunter ein zusätzliches Belohnungssignal aus den Daumen-hoch- und Daumen-runter-Rückmeldungen der Nutzer.
Was die Zahl nicht sagt: Die Untersuchung stammt von Anthropic, zwei der fünf getesteten Assistenten und das analysierte Belohnungsmodell sind eigene, alle Modelle sind von 2023. Wahrhaftigkeit ist ebenfalls belohnt, je nach Versuchsbedingung ist Übereinstimmung nicht das stärkste Merkmal. Geprüft sind Faktenfragen und Freitextaufgaben, nicht Strategieempfehlungen. Gemessen ist, was die Daten belohnen, nicht wie oft ein Assistent im Betrieb schmeichelt; die OpenAI-Rücknahme zeigt nur, dass der Effekt dort auftreten und bemerkt werden kann, nicht wie stark er heute ist. Vorsicht bei der meistzitierten Zahl: Im Teilversuch an 266 Fehlannahmen sind die zustimmenden Antworten eigens erzeugt: ein Modell sollte subtil täuschen, aus 4.096 Ziehungen wurde die überzeugendste gewählt. Die 95 Prozent sind das Urteil des Claude-2-Präferenzmodells, nicht das von Menschen, gemessen gegen die beste von drei kurzen, menschlich geschriebenen Widerspruchsantworten, ausgewählt von ebendiesem Modell. Für die menschlichen Bewerter nennt das Papier keine Zahl; sie zogen die korrigierende Antwort überwiegend vor, mit steigender Schwierigkeit seltener, aus der Abbildung abgelesen rund 3 Prozent auf der leichtesten und rund 21 Prozent auf der schwersten Stufe. Das ist die Mehrheit mehrerer Laien ohne Nachschlagemöglichkeit, der einzelne Bewerter liegt im Mittel darüber. Die Autoren nennen den Datensatz einen Machbarkeitsnachweis.
Sharma, Tong u. a., „Towards Understanding Sycophancy in Language Models“, arXiv:2310.13548v4 vom 10. Mai 2025, erste Fassung 20. Oktober 2023, begutachtet und als Poster auf der ICLR 2024 angenommen · Kennzahl aus Abschnitt 4.1: 15.000 zufällig gezogene Antwortpaare aus der Helpfulness-Teilmenge von Anthropics hh-rlhf-Datensatz, 23 Merkmale, Bayessche logistische Regression, Holdout-Genauigkeit 71,3 Prozent · getestet wurden Claude 1.3, Claude 2, GPT-3.5, GPT-4 und LLaMA 2 · dazu OpenAI, „Sycophancy in GPT-4o“, 29. April 2025, und „Expanding on what we missed with sycophancy“, 2. Mai 2025; Update vom 25. April, Rücknahme ab dem 28. April (OpenAI-Mitteilung)
Negativbefund einer dokumentierten Recherche
Ob eine Marke als Spezifikation zu markenkonformerem KI-Output führt als ein Brand Book, ist in keiner öffentlich nachprüfbaren Messung entschieden; einen öffentlichen Benchmark dafür findet die Recherche nicht. Nachbarfelder haben solche Benchmarks: Leitlinientreue in der Medizin seit Dezember 2024, Regeltreue in Support-Dialogen seit Anfang 2026.
Was der Befund nicht sagt: dass es nichts gibt. Gesucht am 10. September 2026, 24 Phrasenabfragen; ungeprüft blieben Semantic Scholar (HTTP 429), die ACL Anthology, Bezahlschranken-Datenbanken und unveröffentlichte Anbieterstudien. Gegen die eigene These: Die allgemeine Formfrage ist gemessen. Ein Benchmark vom 31. Juli 2026 stapelt 24 maschinell prüfbare Anweisungen, darunter eine feste Tonalität, und prüft, ob dieselben Anweisungen kompiliert besser befolgt werden: bis zu 11 Prozentpunkte mehr Befolgung beim schwächsten Modell, bei starken praktisch nichts, nach eigener Angabe nie verglichen mit einem kompetent von Hand geschriebenen Prompt. „Völlig offen“ ist die Frage damit nicht. Kein Nachbar misst Marke: Die drei nächstliegenden Benchmarks messen Regeltreue in Support-Dialogen und die Erkennung von Verstößen durch ein Modell als Richter. Alle drei Datensätze sind maschinell erzeugt, CompliBench ein Preprint, zwei seiner acht Autoren arbeiten bei einem Contact-Center-Anbieter. Adobes Markenkonformitäts-Score ist Produktfunktion, nicht nachprüfbar. Das Gegenteil ist ebenso wenig gemessen.
Eigene Recherche, 10. September 2026: arXiv-Programmierschnittstelle mit 24 Phrasenabfragen, darunter brand voice, brand guidelines, brand consistency, brand compliance, machine-readable brand, brand book, style guide, tone of voice und corporate identity; dazu OpenAlex, allgemeine Websuche und die Anbieterseiten von Adobe, Frontify, Jasper und Writer · nächstliegende gemessene Arbeit zur Formfrage: „Instruction Stacking Collapse“, arXiv:2608.02639, 31. Juli 2026, 24 verifikatorgeprüfte Anweisungen, drei Modelle (zum Papier) · nächstliegende Benchmarks zur Regeltreue: CompliBench, arXiv:2604.12312, 14. April 2026, Preprint, 318 maschinell erzeugte Dialoge (CompliBench), PluralisticBehaviorSuite, arXiv:2511.05018, 300 Verhaltensrichtlinien aus 30 Branchen, und JourneyBench, arXiv:2601.00596, 703 Gespräche · zum Vergleich Medizin: AMEGA, npj Digital Medicine 7:358, 12. Dezember 2024, und CPGBench, arXiv:2603.25196, 26. März 2026, 3.418 Leitliniendokumente
Historische Untersuchung
Ein Jahrhundert Haushaltstechnik hat die Hausarbeitszeit nicht gesenkt. Die Geräte ersetzten vor allem die Arbeit von Männern, Kindern und Dienstboten; die eingesparte Zeit ging in gestiegene Ansprüche an Sauberkeit und Versorgung. Die Erwartung, Automatisierung setze Zeit frei, hat einen dokumentierten Präzedenzfall, in dem genau das ausblieb.
Was die Untersuchung nicht sagt: Sie handelt von Haushalten zwischen offener Feuerstelle und Mikrowelle, nicht von Wissensarbeit und nicht von KI. Wer sie überträgt, zieht eine Analogie, keinen Beweis. Sie taugt als Korrektiv, nicht als Prognose: Sie zeigt, dass Arbeitsersparnis durch Technik eine Annahme ist, die historisch schon einmal nicht eingetreten ist. Dass sie wieder ausbleibt, zeigt die Untersuchung nicht.
Ruth Schwartz Cowan, „More Work for Mother: The Ironies of Household Technology from the Open Hearth to the Microwave“, 1983 · ausgezeichnet mit dem Dexter Prize der Society for the History of Technology, 1984
Längsschnittstudie
Konzerne, deren Zukunftsvorbereitung 2008 als ausgeprägt eingestuft wurde, erreichten 2015 eine Profitabilität von 16 Prozent gegenüber 12 Prozent im Branchenmittel, also 33 Prozent mehr. Beim Wachstum der Marktkapitalisierung über dieselben sieben Jahre lagen sie bei 75 Prozent gegenüber 25 Prozent im Mittel. Firmen mit erkannten Defiziten lagen 37 bis 44 Prozent unter dem Durchschnitt.
Was die vielzitierte Zahl verschweigt: Von 83 befragten Konzernen blieben nach dem Abgleich mit Leistungsdaten 70 für die Profitabilität und nur 42 für das Marktkapitalisierungswachstum. Die Autoren nennen das selbst eine wesentliche Einschränkung. Die „200 Prozent zusätzliches Wachstum“, die in der Foresight-Branche kursieren, stehen damit auf 42 Unternehmen. Und es ist ein Zusammenhang, keine Ursache: Konzerne, die sich Zukunftsarbeit leisten, unterscheiden sich auch sonst von denen, die es nicht tun.
Rohrbeck und Kum, „Corporate foresight and its impact on firm performance: A longitudinal analysis“, Technological Forecasting & Social Change 129, 2018 · Vorbereitung 2008 erhoben, Leistung 2015
Laufende Messung
Auf der Turnier-Rangliste von ForecastBench steht der Median menschlicher Superforecaster mit 68,8 auf Rang vier, vor ihm drei Einreichungen von Google DeepMind mit Werkzeugen und Zusatzkontext. Auf der Basis-Rangliste ohne Werkzeuge führt der menschliche Median mit 67,8 vor dem besten Modell mit 62,6.
Was die Rangliste nicht sagt: Sie erklärt den Vorsprung der Maschinen nicht für gesichert. Die eigene Signifikanzspalte verneint einen Unterschied für die drei Spitzenplätze, p-Werte 0,71, 0,60 und 0,57, die Vertrauensbereiche überlappen fast vollständig. Der Brier Index ist trotz Prozentzeichen keine Trefferquote, die Umrechnung nichtlinear. Bestwert aus vielen Versuchen: Google DeepMind hält 50 der 334 Einreichungen und alle drei Plätze vor dem Menschen, der eine einzige Zeile ist. Es sind nicht dieselben Fragen: Menschen zuletzt befragt im Juli 2024, 578 Fragen gegen 790 und 1.165. Zur Parität: Die Betreiber führen den Gleichstand im Turnier als erreicht zum 7. Juni 2026 und projizieren ihn werkzeugfrei auf Februar 2028, Intervall Juli 2026 bis Dezember 2030; es bildet nur die Unsicherheit der Geradenanpassung ab. Prognosefragen zu datierten Ereignissen sind keine strategischen Urteile über eine Marke.
ForecastBench des Forecasting Research Institute, Turnier- und Basis-Rangliste, abgerufen am 10. September 2026 · Einreichungen erscheinen erst 50 Tage nach Abgabe, die Rangliste ist kein tagesaktueller Stand
Präregistriertes Experiment
991 Teilnehmende beantworteten sechs Prognosefragen, teils mit Zugang zu einem Sprachmodell. Die Assistenz verbesserte die Treffsicherheit um 24 bis 28 Prozent gegenüber der Kontrollgruppe. Bemerkenswert ist der Vergleich innerhalb der Gruppen: Auch ein bewusst überkonfident und verrauscht eingestellter Assistent half deutlich.
Was das Ergebnis nahelegt und nicht beweist: Dass auch der schlechte Assistent wirkte, spricht dafür, dass ein Teil des Gewinns aus dem Vorgang des Befragens stammt und nicht aus der Güte der Maschinenantwort. Bewiesen ist das nicht. Die Autoren weisen selbst darauf hin, dass Ausreißer das Bild beeinflussen und die Robustheit zu prüfen bleibt. Sechs Fragen sind eine schmale Grundlage, und es ist ein Preprint.
Schoenegger, Park, Karger, Trott und Tetlock, „AI-Augmented Predictions: LLM Assistants Improve Human Forecasting Accuracy“, präregistriert, arXiv, Februar 2024 · 991 Teilnehmende
Standardwerk
Berufe konkurrieren nach Andrew Abbotts Untersuchung nicht über die Ausführung ihrer Arbeit, sondern über deren Definition. Wer bestimmt, was ein Problem ist und wer dafür zuständig, hat den Wettbewerb bereits entschieden. Abbotts Befund über die Entstehung: Zuständigkeiten werden beansprucht, wenn sie frei werden. Nicht, indem man eine besetzte besser ausfüllt.
Was die Untersuchung nicht sagt: Sie stammt von 1988 und behandelt klassische Professionen (Medizin, Recht, Buchhaltung), nicht Beratung und nicht KI. Ihre Übertragung auf heutige Berufsbilder ist eine Deutung. Und sie erklärt nicht, wie man eine Zuständigkeit gewinnt, sondern beschreibt, worum konkurriert wird. Als Beleg taugt sie für die Frage, was Definitionsmacht bedeutet, und nicht als Anleitung.
Andrew Abbott, „The System of Professions: An Essay on the Division of Expert Labor“, University of Chicago Press, 1988
Fachbuch
Die Soziologin Elena Esposito hält den Vergleich von Algorithmen mit menschlicher Intelligenz für irreführend und schlägt einen anderen Begriff vor: künstliche Kommunikation. Ihr Satz dazu: Wenn Maschinen zur sozialen Intelligenz beitragen, dann nicht, weil sie gelernt haben zu denken wie wir, sondern weil wir gelernt haben, mit ihnen zu kommunizieren.
Was das Buch nicht ist: keine Messung, sondern ein theoretischer Vorschlag aus der Systemtheorie. Es belegt keine Zahl und lässt sich nicht widerlegen wie ein Experiment. Und es handelt nicht von Marken: Espositos Beispiele sind Empfehlungslisten, Profilbildung und das Recht auf Vergessen. Die Übertragung auf die Frage, ob eine Marke für Maschinen lesbar ist, ist eine Deutung: eine naheliegende, aber keine, die im Buch steht.
Elena Esposito, „Artificial Communication: How Algorithms Produce Social Intelligence“, MIT Press, 24. Mai 2022 · 200 Seiten, Open-Access-Ausgabe verfügbar
Feldstudie, Arbeitspapier
Eine Feldstudie unter 244 Unternehmensberatern fand drei Arten, mit generativer KI zu arbeiten. Sie unterscheiden sich nicht im Werkzeug, sondern darin, wer den Ablauf steuert. Wer die KI durchgehend einbezieht, erwirbt neue KI-Kompetenz. Wer sie gezielt für einzelne Schritte einsetzt und die Problemstellung selbst behält, vertieft die eigene Fachkompetenz. Wer den ganzen Vorgang abgibt, baut weder das eine noch das andere auf.
Was die Studie nicht sagt: Sie vergleicht nicht die Qualität der Ergebnisse. Im Abstract steht keine Aussage darüber, welche Arbeitsweise genauere Empfehlungen hervorbringt; anderslautende Zusammenfassungen im Umlauf gehen über die Quelle hinaus. Gemessen ist der Kompetenzaufbau, nicht das Ergebnis. Außerdem: ein Arbeitspapier in Entwurfsform, nicht begutachtet, und die Befragten kommen alle aus einer einzigen Beratung.
Randazzo, Lifshitz, Kellogg, Dell'Acqua, Mollick, Candelon und Lakhani, „Cyborgs, Centaurs and Self-Automators“, Harvard Business School Working Paper 26-036, 2025 · 244 Berater der Boston Consulting Group
Feldexperiment
Bei 5.179 Kundendienst-Mitarbeitenden eines Großunternehmens stieg die Zahl gelöster Anliegen pro Stunde durch einen KI-Assistenten um 14 Prozent im Schnitt. Der Durchschnitt verdeckt jedoch das Eigentliche: Anfänger und geringqualifizierte Kräfte legten um 34 Prozent zu, bei erfahrenen und hochqualifizierten war die Wirkung „minimal“. Die Autoren vermuten, das Modell verbreite die Praktiken der Fähigeren an die Neuen.
Was die Zahl nicht sagt: Kundendienst ist stark strukturierte Arbeit mit wiederkehrenden Fällen. Die Übertragung auf Strategie oder Gestaltung ist offen. Und es ist ein Arbeitspapier, laut Deckblatt ausdrücklich nicht begutachtet. Gemessen wurde außerdem Menge, nicht Güte: gelöste Anliegen pro Stunde, nicht wie gut sie gelöst wurden, auch wenn die Kundenstimmung sich mitverbesserte.
Brynjolfsson, Li und Raymond, „Generative AI at Work“, NBER Working Paper 31161, April 2023, überarbeitet November 2023 · 5.179 Kundendienst-Mitarbeitende
Präregistriertes Experiment
In einem präregistrierten Experiment mit 444 Fachkräften mit Hochschulabschluss sank die Bearbeitungszeit für Schreibaufgaben um 0,8 Standardabweichungen, die Qualität stieg um 0,4. Auch hier verringerte sich der Abstand zwischen den Teilnehmenden; die Schwächeren gewannen mehr. Der Befund der Autoren dazu: Das Werkzeug ersetze überwiegend Anstrengung, statt Können zu ergänzen, und verschiebe die Arbeit weg vom Rohentwurf hin zu Ideenfindung und Überarbeitung.
Zur Zahl selbst: Hier stehen die Werte der geprüften Arbeitspapier-Fassung vom März 2023, die ausdrücklich nicht begutachtet ist. Die begutachtete Fassung erschien später in Science und trägt abweichende Angaben: In Umlauf sind 453 Teilnehmende und „40 Prozent Zeitersparnis“; diese Fassung liegt hinter einer Bezahlschranke und wurde nicht im Original eingesehen. Was die Zahl nicht sagt: Es waren kurze, isolierte Schreibaufgaben, keine Projekte über Wochen.
Noy und Zhang, „Experimental Evidence on the Productivity Effects of Generative Artificial Intelligence“, MIT, Arbeitspapier vom 2. März 2023 · begutachtete Fassung in Science 381, 2023, S. 187–192
Kontrollierter Test
In einem Ideenwettbewerb zur Kreislaufwirtschaft bewerteten 300 geprüfte Bewerter je 13 von 234 Lösungen, zusammen 3.900 Bewertungen: 54 von Menschen, 180 von GPT-4 mit menschlich gesteuerten Prompts. Die menschlichen galten als neuartiger (die maschinellen minus 0,140 auf einer Skala von 1 bis 5), die maschinellen als strategisch tragfähiger, ökologisch und finanziell wertvoller und insgesamt besser (plus 0,088 bis 0,160). Am oberen Rand kippt das Bild: Die Höchstnote für Neuheit bekamen die KI-Lösungen 7,9 Prozentpunkte seltener, ihr Wertvorsprung verschwand dort in allen vier Dimensionen.
Was die Zahlen nicht sagen: Verglichen wurde nicht Mensch gegen Maschine, sondern Menge gegen menschlich geführte KI mit eigens gebauten Prompts. Wurde das Modell iterativ zum Differenzieren angehalten, war der Rückstand im Mittel nicht mehr nachweisbar (minus 0,056) und blieb nur bei der Höchstnote. Woran sie hängen: Urteile über Texte, keine realisierten Ideen. Alle Bewerter sitzen in den USA. GPT-4 im Stand von Mitte 2023, ein Aufgabenfeld, je Block zehn KI- gegen drei Menschenlösungen. Zwei der fünf Autoren sind der beteiligten KI-Firma zugeordnet, Mitautor Jacimovic hat sie gegründet.
Boussioux, Lane, Zhang, Jacimovic und Lakhani, „The Crowdless Future? Generative AI and Creative Problem-Solving“, Organization Science 35(5), S. 1589 bis 1607 · 234 bewertete Lösungen, 300 Bewerter, 3.900 Bewertungen, Wettbewerb 30. Januar bis 15. Mai 2023 · eingereicht 30. November 2023, überarbeitet 23. Januar, 14. Mai und 20. Juni 2024, angenommen 26. Juni 2024, online 16. August 2024, Heft September/Oktober 2024
Explorative Fallstudien, begriffsbildend
Henry Mintzberg definierte Strategie 1978 als „ein Muster in einem Strom von Entscheidungen“: Gebildet ist sie, sobald eine Folge von Entscheidungen über die Zeit Konsistenz zeigt. Damit werden auch die Strategien untersuchbar, die sich trotz der Absichten einstellten oder ganz ohne Absicht entstanden. Gezeigt hat er das an zwei Langzeitfällen, dem Volkswagenwerk und den USA in Vietnam von 1950 bis 1973.
Was der Aufsatz nicht misst: Er bildet Begriffe und beschreibt. Dass eine gewachsene Strategie zu besseren Ergebnissen führt als eine geplante, belegt er nirgends. Mintzberg greift die Planungslehre durchaus an, ihre Trennung von Formulierung und Umsetzung ruhe auf zwei oft falschen Annahmen. Geprüft hat er das nicht. Der Unterbau ist größer als das Gezeigte: Die allgemeinen Schlüsse stützen sich auf vier finanzierte Hauptstudien und über zwanzig studentische Arbeiten; nur zwei der vier sind im Text dokumentiert, die übrigen nicht. Beide gezeigten Fälle sind historisch, liegen außerhalb der Markenführung und wurden rückblickend von derselben Forschergruppe rekonstruiert, die festlegte, was als Muster zählt.
Henry Mintzberg, „Patterns in Strategy Formation“, Management Science, Vol. 24, No. 9, S. 934 bis 948 · vier vom Canada Council finanzierte Hauptstudien und über zwanzig studentische Arbeiten, davon zwei vorgeführt: Volkswagenwerk 1934 bis 1974 laut Abstract und 1920 bis 1974 laut Abschnittsüberschrift, USA in Vietnam 1950 bis 1973 · Manuskript eingegangen am 19. April 1976, gedruckt Mai 1978
Befragung
Über 17 Warengruppen in Australien und Großbritannien halten im Schnitt 11 Prozent der aktuellen Verwender ihre eigene Marke für anders und 10 Prozent für einzigartig; 17 Prozent nennen wenigstens eines von beidem. Gekauft wird die Marke trotzdem. Die Autoren empfehlen stattdessen Wiedererkennbarkeit.
Was die Zahl nicht sagt: Sie belegt nicht, dass Käufer gar keine Unterschiede sehen. Im Schnitt sprechen 54 Prozent wenigstens einer Marke der Warengruppe eines von beidem zu, bei britischen Erfrischungsgetränken 76 Prozent. Niedrig ist der Einzelwert, weil jeder Befragte nur ein oder zwei Marken nennt, und jeder andere; je Warengruppe 8 bis 36 Prozent. Befragt wurden nur Verwender; dass sie die Marke trotzdem kaufen, folgt daraus, nicht aus der Messung. Wer erhoben und wer bezahlt hat: Fallzahlen fehlen im zugänglichen Text. Die meisten Daten kommen samt Messverfahren von der Werbeagentur Young & Rubicam, erhoben 1999; das Institut nennt als Geldgeber unter anderem Coca-Cola, Mars und Nielsen. Über maschinelle Auswahl sagt der Aufsatz nichts, er ist älter als jeder Agent.
Jenni Romaniuk, Byron Sharp und Andrew Ehrenberg, Ehrenberg-Bass-Institut, Australasian Marketing Journal 15 (2), Seiten 42 bis 54 · Befragung aktueller Markenverwender in 17 Warengruppen, die australischen per Telefon, die britischen aus dem Brand Asset Valuator von Young & Rubicam, erhoben 1999 · 2007
Ende der Liste: 92 von 92 Einträgen. Letzter Eintrag: wahrgenommene-differenzierung.
Kein Beleg passt zu dieser Auswahl.