# Belege: Urteil

19 von 103 Einträgen der Sammlung „Belege“ von Robert Haase, Stand 21. September 2026.

Seite: https://robert-haase.de/belege.html · Übersicht aller Aussagen: https://robert-haase.de/belege.md · JSON: https://robert-haase.de/belege.json · English: https://robert-haase.de/en/evidence-judgement.md

Lizenz: CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Bitte die Primärquelle zitieren, nicht diese Seite.

Diese Datei wird aus der Seite erzeugt. Weichen beide voneinander ab, gilt die Seite.

## Wie diese Sammlung entsteht

Jede Zahl wird bis zu der Stelle zurückverfolgt, die sie erhoben hat, nicht bis zu dem Artikel, der sie zitiert. Auf dem Weg durch die Weitergaben verlieren Zahlen zuerst ihre Bezugsgröße, dann ihre Einschränkung, zuletzt ihre Herkunft. Ist eine Zahl nur über einen Dritten zugänglich, steht dieser Mittler in der Quellenzeile. Eigene Messungen tragen ihre Methode mit, unabhängig gegengeprüft sind sie bisher nicht.

**Die Grenze gehört zur Zahl.** Der häufigste Fehler ist nicht die falsche Zahl, sondern die richtige mit einer Aussage, die weiter geht als der Beleg. Deshalb hat jeder Eintrag zwei Teile, und der zweite ist der wichtigere. Über jeder Zahl steht, was für ein Beleg sie ist, von der geprüften Erhebung bis zum Einzelfall. Davon hängt ab, wie weit sie trägt.

Was der Prüfung nicht standhält, kommt nicht herein oder wieder heraus, auch aus meinen eigenen Artikeln. In einem davon stand, 44 Prozent der US-Onlinekäufer begännen ihre Kaufreise im Sprachmodell, zugeschrieben an Bain. Bain nennt zwei andere Zahlen, 17 Prozent und 30 bis 45 Prozent, die unterwegs zu einer verschmolzen waren. Beide stehen jetzt hier, die 44 nicht.

Diese Seite altert. Jeder Eintrag trägt sein Datum, überholte Zahlen werden ersetzt und nicht still gelöscht. Wenn du einen Fehler findest: [schreib mir](mailto:hallo@robert-haase.de), ich korrigiere und vermerke das Datum.

Die Sammlung bildet nicht den Forschungsstand ab, sondern die Zahlen, die ich für eigene Texte gebraucht habe. Verwendung frei mit Quellenangabe. Verlinke im Zweifel die Primärquelle, nicht diese Seite.

## Einstufung in diesem Thema

+ Geprüfte Erhebung, Herstellerdokumentation oder Gerichtsentscheidung (7) → metr-selbsteinschaetzung, jagged-frontier, homogenisierung, sykophanz, cowan-standards, kompetenz-nivellierung, boussioux-neuheit-wert
+ Vorläufig: Prototyp, Einzeltest, Prognose oder Anbieterangabe (0)
+ Sachstand, Fallbericht oder Marktbeobachtung (12) → strategie-trendslop, markenspezifikation-wirkung, foresight-performance, prognose-mensch-maschine, prognose-assistenz, abbott-zustaendigkeit, esposito-kommunikation, drei-arbeitsweisen, aufwand-statt-koennen, mintzberg-muster, wahrgenommene-differenzierung, de-skilling

---

## metr-selbsteinschaetzung

**Aussage:** Erfahrene Entwickler brauchten mit KI-Werkzeugen 19 Prozent *länger*, hielten sich dabei aber für 20 Prozent schneller. Vorher hatten sie 24 Prozent Beschleunigung erwartet. Zwischen gemessener und empfundener Wirkung liegen 43 Prozentpunkte, mit umgekehrtem Vorzeichen.

**Was die Zahl nicht sagt:** 16 Entwickler, 246 Aufgaben, ausschließlich in Repositories, die sie im Schnitt seit fünf Jahren kennen. Genau diese Vertrautheit erklärt einen Teil des Ergebnisses: Wer sein eigenes Projekt im Kopf hat, gewinnt durch Assistenz weniger. Auf unbekannten Code oder andere Wissensarbeit lässt sich das nicht übertragen, und die Werkzeuge stammen von Anfang 2025. **Was bleibt:** die Lücke zwischen Messung und Selbsteinschätzung. Sie ist der Grund, jeder Produktivitätszahl zu misstrauen, die auf Befragung beruht.

**Quelle:** METR, randomisiert kontrollierte Studie, Juli 2025 · 16 erfahrene Open-Source-Entwickler, 246 Aufgaben · [Zur Studie](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)

**Einstufung:** Kontrollierter Test · Gruppe: Geprüfte Erhebung, Herstellerdokumentation oder Gerichtsentscheidung

**Direktlink:** https://robert-haase.de/belege.html#metr-selbsteinschaetzung

---

## jagged-frontier

**Aussage:** In einem präregistrierten Experiment mit 758 Unternehmensberatern erledigten die KI-Nutzer 12,2 Prozent mehr Aufgaben, arbeiteten 25,1 Prozent schneller und lieferten über 30 Prozent bessere Qualität, solange die Aufgabe innerhalb der Modellfähigkeit lag. Bei einer Aufgabe knapp außerhalb lagen sie 19 Prozentpunkte häufiger falsch als die Gruppe ohne KI.

**Was die Zahl nicht sagt:** Wo die Grenze verläuft, war den Teilnehmern nicht erkennbar. Die Aufgaben sahen einander ähnlich. Das ist der Kern des Befunds und zugleich seine Einschränkung: Gemessen wurde *eine* bewusst außerhalb platzierte Aufgabe, nicht die Häufigkeit solcher Fälle im Arbeitsalltag. Das Experiment lief mit GPT-4; wo die Grenze heute liegt, ist offen. Beratungsarbeit ist außerdem nicht jede Wissensarbeit.

**Quelle:** Dell'Acqua u. a., „Navigating the Jagged Technological Frontier“, Feldexperiment mit der Boston Consulting Group · Organization Science, online seit 11. März 2026, DOI 10.1287/orsc.2025.21838 · 758 Berater, 18 realistische Aufgaben · das Arbeitspapier von 2023 nannte für die Qualität noch über 40 Prozent · [Zur begutachteten Fassung](https://www.hbs.edu/ris/Publication%20Files/dell-acqua-et-al-2026-navigating-the-jagged-technological-frontier_5c589c8c-fbb5-458f-b285-c944746cd717.pdf)

**Einstufung:** Kontrollierter Test · Gruppe: Geprüfte Erhebung, Herstellerdokumentation oder Gerichtsentscheidung

**Direktlink:** https://robert-haase.de/belege.html#jagged-frontier

---

## homogenisierung

**Aussage:** 293 Teilnehmende schrieben je eine Kurzgeschichte, ein Teil davon mit Startideen von GPT-4, 600 Leser bewerteten sie. Mit KI-Idee galten die Geschichten als neuartiger, plus 5,4 Prozent bei Zugang zu einer Idee, plus 8,1 Prozent bei bis zu fünf. Zugleich glichen sie einander an: Die Ähnlichkeit einer Geschichte zum Mittel der übrigen ihrer Gruppe stieg um 0,871 Punkte auf einer Skala von 0 bis 100, laut Autoren 10,7 Prozent der Spannweite, die die Gruppe ohne KI aufspannte.

**Was die Zahl nicht sagt:** Die 0,871 Punkte gelten für den Zugang zu einer Idee. Bei bis zu fünf Ideen war die Angleichung kleiner, 0,718 Punkte und 8,9 Prozent, der Kreativitätsgewinn größer. „Mehr KI, mehr Gleichheit“ liest gegen die Daten. **Gemessen ist der Zugang, nicht die Nutzung:** In der Ein-Ideen-Bedingung riefen 82 von 100 überhaupt eine Idee ab, in der zweiten im Mittel 2,55, die vollen fünf nur 24,5 Prozent. **Die eindrucksvollere Zahl ist die weichere:** Die 10,7 Prozent sind ein Anteil an den 8,10 Punkten zwischen höchstem und niedrigstem Wert ohne KI, hängen also an zwei Extremwerten. Dieselben 10,7 Prozent stehen im Papier ein zweites Mal, als Neuartigkeits-Gewinn der am wenigsten kreativen Schreibenden, ohne Bezug dazu. Gemessen ist die Kosinus-Ähnlichkeit von Texteinbettungen einer Gruppe, nicht ob Ergebnisse schlechter sind. „Kreativer“ urteilen Laienleser, im Selbsturteil der Schreibenden gab es keinen statistisch signifikanten Unterschied. Acht Sätze ohne Dialog mit dem Modell, britische Prolific-Teilnehmende statt Berufsautoren: Kurzgeschichten sind keine Strategiepapiere.

**Quelle:** Doshi und Hauser, „Generative AI enhances individual creativity but reduces the collective diversity of novel content“, Science Advances, Band 10, Ausgabe 28, eadn5290, 12. Juli 2024, DOI 10.1126/sciadv.adn5290 · präregistriert, 293 Schreibende und 600 Bewertende auf Prolific, 3.519 Einzelbewertungen, Ideen von GPT-4 · die Verlagsseite science.org wehrt automatisierte Abrufe ab, geprüft wurde am offenen Volltext bei Europe PMC · [Zum Volltext](https://europepmc.org/article/MED/38996021)

**Einstufung:** Kontrollierter Test · Gruppe: Geprüfte Erhebung, Herstellerdokumentation oder Gerichtsentscheidung

**Direktlink:** https://robert-haase.de/belege.html#homogenisierung

---

## strategie-trendslop

**Aussage:** Sieben Sprachmodelle wurden vor sieben strategische Grundsatzfragen gestellt, jede als Entweder-oder. Bei sechs der sieben wählten alle Anbieter dieselbe Seite, etwa Differenzierung vor Kostenführerschaft und Augmentierung vor Automatisierung; nur bei Exploration gegen Exploitation gingen sie auseinander. Zwei Nachuntersuchungen an ChatGPT-5 mit je über 15.000 Durchläufen prüften, ob sich diese Schlagseite wegprompten lässt. Kaum: Bei Differenzierung und Augmentierung senkte besseres Prompten den Anteil voreingenommener Antworten um weniger als 2 Prozent, zusätzlicher Unternehmenskontext verschob ihn im Mittel um 11 Prozent, in beide Richtungen. Die Autoren nennen das „strategy trendslop“, die sozial erwünschteste Antwort des Internet-Durchschnitts.

**Die Unempfindlichkeit gilt nur für zwei der sieben Fragen:** Bei den übrigen fünf verschob besseres Prompten die Antworten im Mittel um 22 Prozent in beide Richtungen, am stärksten wirkte die Reihenfolge der Optionen mit 19 Prozent. **Ob die bevorzugte Antwort falsch ist, sagt der Befund nicht:** Gemessen ist allein die Unempfindlichkeit gegen den Kontext. **Zur Quelle:** ein HBR Digital Article ohne Begutachtung, ein eigenständiges Paper gibt es nicht; ein Repositorium führt ihn als begutachtet, das ist ein Katalogartefakt. Die bezahlgeschränkte Seite liefert den Volltext in ihren strukturierten Daten mit aus, zeichengleich in Archivfassungen vom 17. März und 14. Juli 2026. **Korrigiert am 10. September 2026:** Bis dahin standen hier „96 Prozent Differenzierung“ und „93 Prozent Augmentierung“. Beide Werte stehen nirgends im Beitrag; der Volltext nennt keinen Anteilswert, nur Verschiebungen gegenüber der Ausgangslage, und die Zahlen stammen aus Blog-Zusammenfassungen, vermutlich aus einer Abbildung abgelesen. Ebenfalls korrigiert: Die über 15.000 Durchläufe gelten nicht für die sieben Modelle, sondern für die zwei Nachuntersuchungen an einem einzigen Modell; die Sieben-Modelle-Messung beruht auf 50 Durchläufen je Modell und Frage, eine Gesamtzahl nennen die Autoren nicht.

**Quelle:** Angelo Romasanta, Llewellyn D. W. Thomas und Natalia Levina, „Researchers Asked LLMs for Strategic Advice. They Got ‚Trendslop‘ in Return.“, Harvard Business Review, 16. März 2026, HBR Digital Article H093GG · getestet wurden ChatGPT, Claude, DeepSeek, GPT-5 über die API, Gemini, Grok und Mistral, je 50 Durchläufe pro Modell und Frage; die beiden Blöcke mit über 15.000 Durchläufen liefen allein auf ChatGPT-5 · Volltext mit 15.613 Zeichen aus den strukturierten Daten der Seite, gegengeprüft an zwei Archivfassungen · [Zum Beitrag](https://hbr.org/2026/03/researchers-asked-llms-for-strategic-advice-they-got-trendslop-in-return)

**Einstufung:** Redaktionell geprüft · Gruppe: Sachstand, Fallbericht oder Marktbeobachtung

**Direktlink:** https://robert-haase.de/belege.html#strategie-trendslop

---

## sykophanz

**Aussage:** Zustimmung ist im Trainingssignal belohnt. Anthropic hat dafür 15.000 Antwortpaare aus den eigenen Rückmeldungsdaten ausgewertet: Ob eine Antwort den Überzeugungen des Nutzers entspricht, gehört durchgehend zu den stärksten Vorhersagern dafür, welche Antwort Menschen vorziehen. Ein einzelnes Merkmal verschiebt diese Wahrscheinlichkeit um höchstens rund 6 Prozentpunkte. Im April 2025 nahm OpenAI ein GPT-4o-Update zurück, weil das Modell übermäßig gefällig geworden war, und nennt als vorläufige Erklärung drei zusammenwirkende Änderungen, darunter ein zusätzliches Belohnungssignal aus den Daumen-hoch- und Daumen-runter-Rückmeldungen der Nutzer.

**Wer gemessen hat:** Die Untersuchung stammt von Anthropic; zwei der fünf getesteten Assistenten und das analysierte Belohnungsmodell sind eigene, alle Modelle sind von 2023. **Was daneben belohnt wird:** Wahrhaftigkeit ebenfalls, und je nach Versuchsbedingung ist Übereinstimmung nicht das stärkste Merkmal. Geprüft sind Faktenfragen und Freitextaufgaben, keine Strategieempfehlungen. Gemessen ist, was die Daten belohnen, nicht wie oft ein Assistent im Betrieb schmeichelt; die Rücknahme bei OpenAI zeigt, dass der Effekt auftreten und bemerkt werden kann, nicht wie stark er heute ist. **Vorsicht bei der meistzitierten Zahl:** Die 95 Prozent stammen aus einem Teilversuch an 266 Fehlannahmen, und dort sind die zustimmenden Antworten eigens erzeugt worden: Ein Modell sollte subtil täuschen, aus 4.096 Ziehungen wurde die überzeugendste gewählt. Geurteilt hat kein Mensch, sondern das Präferenzmodell von Claude 2, gemessen gegen die beste von drei kurzen, menschlich geschriebenen Widerspruchsantworten, die dasselbe Modell ausgewählt hat. **Was die Menschen taten:** Für die menschlichen Bewerter nennt das Papier keine Zahl. Sie zogen die korrigierende Antwort überwiegend vor, mit steigender Schwierigkeit seltener; aus der Abbildung abgelesen sind es rund 3 Prozent auf der leichtesten und rund 21 Prozent auf der schwersten Stufe. Das ist die Mehrheit mehrerer Laien ohne Nachschlagemöglichkeit, der einzelne Bewerter liegt im Mittel darüber. Die Autoren nennen den Datensatz einen Machbarkeitsnachweis.

**Quelle:** Sharma, Tong u. a., „Towards Understanding Sycophancy in Language Models“, arXiv:2310.13548v4 vom 10. Mai 2025, erste Fassung 20. Oktober 2023, begutachtet und als Poster auf der ICLR 2024 angenommen · Kennzahl aus Abschnitt 4.1: 15.000 zufällig gezogene Antwortpaare aus der Helpfulness-Teilmenge von Anthropics hh-rlhf-Datensatz, 23 Merkmale, Bayessche logistische Regression, Holdout-Genauigkeit 71,3 Prozent · getestet wurden Claude 1.3, Claude 2, GPT-3.5, GPT-4 und LLaMA 2 · dazu OpenAI, „Sycophancy in GPT-4o“, 29. April 2025, und „Expanding on what we missed with sycophancy“, 2. Mai 2025; Update vom 25. April, Rücknahme ab dem 28. April ([OpenAI-Mitteilung](https://openai.com/index/sycophancy-in-gpt-4o/)) · [Zum Papier](https://arxiv.org/abs/2310.13548)

**Einstufung:** Kontrollierter Test und Herstellerdokumentation · Gruppe: Geprüfte Erhebung, Herstellerdokumentation oder Gerichtsentscheidung

**Direktlink:** https://robert-haase.de/belege.html#sykophanz

---

## markenspezifikation-wirkung

**Aussage:** Ob eine Marke als Spezifikation zu markenkonformerem KI-Output führt als ein Brand Book, ist in keiner öffentlich nachprüfbaren Messung entschieden; einen öffentlichen Benchmark dafür findet die Recherche nicht. Nachbarfelder haben solche Benchmarks: Leitlinientreue in der Medizin seit Dezember 2024, Regeltreue in Support-Dialogen seit Anfang 2026.

**Was der Befund nicht sagt:** dass es nichts gibt. Gesucht am 10. September 2026, 24 Phrasenabfragen; ungeprüft blieben Semantic Scholar (HTTP 429), die ACL Anthology, Bezahlschranken-Datenbanken und unveröffentlichte Anbieterstudien. **Gegen die eigene These:** Die allgemeine Formfrage ist gemessen. Ein Benchmark vom 31. Juli 2026 stapelt 24 maschinell prüfbare Anweisungen, darunter eine feste Tonalität, und prüft, ob dieselben Anweisungen kompiliert besser befolgt werden: bis zu 11 Prozentpunkte mehr Befolgung beim schwächsten Modell, bei starken praktisch nichts, nach eigener Angabe nie verglichen mit einem kompetent von Hand geschriebenen Prompt. „Völlig offen“ ist die Frage damit nicht. **Kein Nachbar misst Marke:** Die drei nächstliegenden Benchmarks messen Regeltreue in Support-Dialogen und die Erkennung von Verstößen durch ein Modell als Richter. Alle drei Datensätze sind maschinell erzeugt, CompliBench ein Preprint, zwei seiner acht Autoren arbeiten bei einem Contact-Center-Anbieter. Adobes Markenkonformitäts-Score ist Produktfunktion, nicht nachprüfbar. Das Gegenteil ist ebenso wenig gemessen.

**Quelle:** Eigene Recherche, 10. September 2026: arXiv-Programmierschnittstelle mit 24 Phrasenabfragen, darunter brand voice, brand guidelines, brand consistency, brand compliance, machine-readable brand, brand book, style guide, tone of voice und corporate identity; dazu OpenAlex, allgemeine Websuche und die Anbieterseiten von Adobe, Frontify, Jasper und Writer · nächstliegende gemessene Arbeit zur Formfrage: „Instruction Stacking Collapse“, arXiv:2608.02639, 31. Juli 2026, 24 verifikatorgeprüfte Anweisungen, drei Modelle ([zum Papier](https://arxiv.org/abs/2608.02639)) · nächstliegende Benchmarks zur Regeltreue: CompliBench, arXiv:2604.12312, 14. April 2026, Preprint, 318 maschinell erzeugte Dialoge ([CompliBench](https://arxiv.org/abs/2604.12312)), PluralisticBehaviorSuite, arXiv:2511.05018, 300 Verhaltensrichtlinien aus 30 Branchen, und JourneyBench, arXiv:2601.00596, 703 Gespräche · zum Vergleich Medizin: AMEGA, npj Digital Medicine 7:358, 12. Dezember 2024, und CPGBench, arXiv:2603.25196, 26. März 2026, 3.418 Leitliniendokumente

**Einstufung:** Negativbefund einer dokumentierten Recherche · Gruppe: Sachstand, Fallbericht oder Marktbeobachtung

**Direktlink:** https://robert-haase.de/belege.html#markenspezifikation-wirkung

---

## cowan-standards

**Aussage:** Ein Jahrhundert Haushaltstechnik hat die Hausarbeitszeit nicht gesenkt. Die Geräte ersetzten vor allem die Arbeit von Männern, Kindern und Dienstboten; die eingesparte Zeit ging in gestiegene Ansprüche an Sauberkeit und Versorgung. Die Erwartung, Automatisierung setze Zeit frei, hat einen dokumentierten Präzedenzfall, in dem genau das ausblieb.

**Was die Untersuchung nicht sagt:** Sie handelt von Haushalten zwischen offener Feuerstelle und Mikrowelle, nicht von Wissensarbeit und nicht von KI. Wer sie überträgt, zieht eine Analogie, keinen Beweis. **Sie taugt als Korrektiv, nicht als Prognose:** Sie zeigt, dass Arbeitsersparnis durch Technik eine Annahme ist, die historisch schon einmal nicht eingetreten ist. Dass sie wieder ausbleibt, zeigt die Untersuchung nicht.

**Quelle:** Ruth Schwartz Cowan, „More Work for Mother: The Ironies of Household Technology from the Open Hearth to the Microwave“, 1983 · ausgezeichnet mit dem Dexter Prize der Society for the History of Technology, 1984 · [Zur Übersicht](https://hss.sas.upenn.edu/content/more-work-mother-ironies-household-technology-open-hearth-microwave)

**Einstufung:** Historische Untersuchung · Gruppe: Geprüfte Erhebung, Herstellerdokumentation oder Gerichtsentscheidung

**Direktlink:** https://robert-haase.de/belege.html#cowan-standards

---

## foresight-performance

**Aussage:** Konzerne, deren Zukunftsvorbereitung 2008 als ausgeprägt eingestuft wurde, erreichten 2015 eine Profitabilität von 16 Prozent gegenüber 12 Prozent im Branchenmittel, also 33 Prozent mehr. Beim Wachstum der Marktkapitalisierung über dieselben sieben Jahre lagen sie bei 75 Prozent gegenüber 25 Prozent im Mittel. Firmen mit erkannten Defiziten lagen 37 bis 44 Prozent unter dem Durchschnitt.

**Was die vielzitierte Zahl verschweigt:** Von 83 befragten Konzernen blieben nach dem Abgleich mit Leistungsdaten **70 für die Profitabilität und nur 42 für das Marktkapitalisierungswachstum**. Die Autoren nennen das selbst eine wesentliche Einschränkung. Die „200 Prozent zusätzliches Wachstum“, die in der Foresight-Branche kursieren, stehen damit auf 42 Unternehmen. **Und es ist ein Zusammenhang, keine Ursache:** Konzerne, die sich Zukunftsarbeit leisten, unterscheiden sich auch sonst von denen, die es nicht tun.

**Quelle:** Rohrbeck und Kum, „Corporate foresight and its impact on firm performance: A longitudinal analysis“, Technological Forecasting & Social Change 129, 2018 · Vorbereitung 2008 erhoben, Leistung 2015 · [Zur Studie](https://www.sciencedirect.com/science/article/pii/S0040162517302287)

**Einstufung:** Längsschnittstudie · Gruppe: Sachstand, Fallbericht oder Marktbeobachtung

**Direktlink:** https://robert-haase.de/belege.html#foresight-performance

---

## prognose-mensch-maschine

**Aussage:** Auf der Turnier-Rangliste von ForecastBench steht der Median menschlicher Superforecaster mit 68,8 auf Rang vier, vor ihm drei Einreichungen von Google DeepMind mit Werkzeugen und Zusatzkontext. Auf der Basis-Rangliste ohne Werkzeuge führt der menschliche Median mit 67,8 vor dem besten Modell mit 62,6.

**Was die Rangliste nicht sagt:** Sie erklärt den Vorsprung der Maschinen nicht für gesichert. Die eigene Signifikanzspalte verneint einen Unterschied für die drei Spitzenplätze, p-Werte 0,71, 0,60 und 0,57, die Vertrauensbereiche überlappen fast vollständig. Der Brier Index ist trotz Prozentzeichen keine Trefferquote, die Umrechnung nichtlinear. **Bestwert aus vielen Versuchen:** Google DeepMind hält 50 der 334 Einreichungen und alle drei Plätze vor dem Menschen, der eine einzige Zeile ist. Es sind nicht dieselben Fragen: Menschen zuletzt befragt im Juli 2024, 578 Fragen gegen 790 und 1.165. **Zur Parität:** Die Betreiber führen den Gleichstand im Turnier als erreicht zum 7. Juni 2026 und projizieren ihn werkzeugfrei auf Februar 2028, Intervall Juli 2026 bis Dezember 2030; es bildet nur die Unsicherheit der Geradenanpassung ab. Prognosefragen zu datierten Ereignissen sind keine strategischen Urteile über eine Marke.

**Quelle:** ForecastBench des Forecasting Research Institute, Turnier- und Basis-Rangliste, abgerufen am 10. September 2026 · Einreichungen erscheinen erst 50 Tage nach Abgabe, die Rangliste ist kein tagesaktueller Stand · [Zur Rangliste](https://www.forecastbench.org/leaderboards/)

**Einstufung:** Laufende Messung · Gruppe: Sachstand, Fallbericht oder Marktbeobachtung

**Direktlink:** https://robert-haase.de/belege.html#prognose-mensch-maschine

---

## prognose-assistenz

**Aussage:** 991 Teilnehmende beantworteten sechs Prognosefragen, teils mit Zugang zu einem Sprachmodell. Die Assistenz verbesserte die Treffsicherheit um 24 bis 28 Prozent gegenüber der Kontrollgruppe. Bemerkenswert ist der Vergleich innerhalb der Gruppen: Auch ein bewusst überkonfident und verrauscht eingestellter Assistent half deutlich.

**Was das Ergebnis nahelegt und nicht beweist:** Dass auch der schlechte Assistent wirkte, spricht dafür, dass ein Teil des Gewinns aus dem Vorgang des Befragens stammt und nicht aus der Güte der Maschinenantwort. Bewiesen ist das nicht. Die Autoren weisen selbst darauf hin, dass Ausreißer das Bild beeinflussen und die Robustheit zu prüfen bleibt. Sechs Fragen sind eine schmale Grundlage, und es ist ein Preprint.

**Quelle:** Schoenegger, Park, Karger, Trott und Tetlock, „AI-Augmented Predictions: LLM Assistants Improve Human Forecasting Accuracy“, präregistriert, arXiv, Februar 2024 · 991 Teilnehmende · [Zur Studie](https://arxiv.org/abs/2402.07862)

**Einstufung:** Präregistriertes Experiment · Gruppe: Sachstand, Fallbericht oder Marktbeobachtung

**Direktlink:** https://robert-haase.de/belege.html#prognose-assistenz

---

## abbott-zustaendigkeit

**Aussage:** Berufe konkurrieren nach Andrew Abbotts Untersuchung nicht über die Ausführung ihrer Arbeit, sondern über deren *Definition*. Wer bestimmt, was ein Problem ist und wer dafür zuständig, hat den Wettbewerb bereits entschieden. Abbotts Befund über die Entstehung: Zuständigkeiten werden beansprucht, wenn sie frei werden. Nicht, indem man eine besetzte besser ausfüllt.

**Was die Untersuchung nicht sagt:** Sie stammt von 1988 und behandelt klassische Professionen (Medizin, Recht, Buchhaltung), nicht Beratung und nicht KI. Ihre Übertragung auf heutige Berufsbilder ist eine Deutung. **Und sie erklärt nicht, wie man eine Zuständigkeit gewinnt**, sondern beschreibt, worum konkurriert wird. Als Beleg taugt sie für die Frage, was Definitionsmacht bedeutet, und nicht als Anleitung.

**Quelle:** Andrew Abbott, „The System of Professions: An Essay on the Division of Expert Labor“, University of Chicago Press, 1988 · [Zum Verlag](https://press.uchicago.edu/ucp/books/book/chicago/S/bo5965590.html)

**Einstufung:** Standardwerk · Gruppe: Sachstand, Fallbericht oder Marktbeobachtung

**Direktlink:** https://robert-haase.de/belege.html#abbott-zustaendigkeit

---

## esposito-kommunikation

**Aussage:** Die Soziologin Elena Esposito hält den Vergleich von Algorithmen mit menschlicher Intelligenz für irreführend und schlägt einen anderen Begriff vor: künstliche *Kommunikation*. Ihr Satz dazu: Wenn Maschinen zur sozialen Intelligenz beitragen, dann nicht, weil sie gelernt haben zu denken wie wir, sondern weil wir gelernt haben, mit ihnen zu kommunizieren.

**Was das Buch nicht ist:** keine Messung, sondern ein theoretischer Vorschlag aus der Systemtheorie. Es belegt keine Zahl und lässt sich nicht widerlegen wie ein Experiment. **Und es handelt nicht von Marken:** Espositos Beispiele sind Empfehlungslisten, Profilbildung und das Recht auf Vergessen. Die Übertragung auf die Frage, ob eine Marke für Maschinen lesbar ist, ist eine Deutung: eine naheliegende, aber keine, die im Buch steht.

**Quelle:** Elena Esposito, „Artificial Communication: How Algorithms Produce Social Intelligence“, MIT Press, 24. Mai 2022 · 200 Seiten, Open-Access-Ausgabe verfügbar · [Zum Verlag](https://mitpress.mit.edu/9780262046664/artificial-communication/)

**Einstufung:** Fachbuch · Gruppe: Sachstand, Fallbericht oder Marktbeobachtung

**Direktlink:** https://robert-haase.de/belege.html#esposito-kommunikation

---

## drei-arbeitsweisen

**Aussage:** Eine Feldstudie unter 244 Unternehmensberatern fand drei Arten, mit generativer KI zu arbeiten. Sie unterscheiden sich nicht im Werkzeug, sondern darin, *wer den Ablauf steuert*. Wer die KI durchgehend einbezieht, erwirbt neue KI-Kompetenz. Wer sie gezielt für einzelne Schritte einsetzt und die Problemstellung selbst behält, vertieft die eigene Fachkompetenz. Wer den ganzen Vorgang abgibt, baut **weder das eine noch das andere** auf.

**Was die Studie nicht sagt:** Sie vergleicht *nicht* die Qualität der Ergebnisse. Im Abstract steht keine Aussage darüber, welche Arbeitsweise genauere Empfehlungen hervorbringt; **anderslautende Zusammenfassungen im Umlauf gehen über die Quelle hinaus.** Gemessen ist der Kompetenzaufbau, nicht das Ergebnis. Außerdem: ein Arbeitspapier in Entwurfsform, nicht begutachtet, und die Befragten kommen alle aus einer einzigen Beratung.

**Quelle:** Randazzo, Lifshitz, Kellogg, Dell'Acqua, Mollick, Candelon und Lakhani, „Cyborgs, Centaurs and Self-Automators“, Harvard Business School Working Paper 26-036, 2025 · 244 Berater der Boston Consulting Group · [Zum Arbeitspapier](https://www.hbs.edu/ris/Publication%20Files/26-036_e7d0e59a-904c-49f1-b610-56eb2bdfe6f9.pdf)

**Einstufung:** Feldstudie, Arbeitspapier · Gruppe: Sachstand, Fallbericht oder Marktbeobachtung

**Direktlink:** https://robert-haase.de/belege.html#drei-arbeitsweisen

---

## kompetenz-nivellierung

**Aussage:** Bei 5.179 Kundendienst-Mitarbeitenden eines Großunternehmens stieg die Zahl gelöster Anliegen pro Stunde durch einen KI-Assistenten um 14 Prozent im Schnitt. Der Durchschnitt verdeckt jedoch das Eigentliche: **Anfänger und geringqualifizierte Kräfte legten um 34 Prozent zu, bei erfahrenen und hochqualifizierten war die Wirkung „minimal“.** Die Autoren vermuten, das Modell verbreite die Praktiken der Fähigeren an die Neuen.

**Was die Zahl nicht sagt:** Kundendienst ist stark strukturierte Arbeit mit wiederkehrenden Fällen. Die Übertragung auf Strategie oder Gestaltung ist offen. **Und es ist ein Arbeitspapier**, laut Deckblatt ausdrücklich nicht begutachtet. Gemessen wurde außerdem Menge, nicht Güte: gelöste Anliegen pro Stunde, nicht wie gut sie gelöst wurden, auch wenn die Kundenstimmung sich mitverbesserte.

**Quelle:** Brynjolfsson, Li und Raymond, „Generative AI at Work“, NBER Working Paper 31161, April 2023, überarbeitet November 2023 · 5.179 Kundendienst-Mitarbeitende · [Zum Arbeitspapier](https://www.nber.org/papers/w31161)

**Einstufung:** Feldexperiment · Gruppe: Geprüfte Erhebung, Herstellerdokumentation oder Gerichtsentscheidung

**Direktlink:** https://robert-haase.de/belege.html#kompetenz-nivellierung

---

## aufwand-statt-koennen

**Aussage:** In einem präregistrierten Experiment mit 444 Fachkräften mit Hochschulabschluss sank die Bearbeitungszeit für Schreibaufgaben um 0,8 Standardabweichungen, die Qualität stieg um 0,4. Auch hier verringerte sich der Abstand zwischen den Teilnehmenden; die Schwächeren gewannen mehr. Der Befund der Autoren dazu: Das Werkzeug ersetze überwiegend *Anstrengung*, statt *Können* zu ergänzen, und verschiebe die Arbeit weg vom Rohentwurf hin zu Ideenfindung und Überarbeitung.

**Zur Zahl selbst:** Hier stehen die Werte der geprüften Arbeitspapier-Fassung vom März 2023, die ausdrücklich nicht begutachtet ist. **Die begutachtete Fassung erschien später in *Science* und trägt abweichende Angaben:** In Umlauf sind 453 Teilnehmende und „40 Prozent Zeitersparnis“; diese Fassung liegt hinter einer Bezahlschranke und wurde nicht im Original eingesehen. **Was die Zahl nicht sagt:** Es waren kurze, isolierte Schreibaufgaben, keine Projekte über Wochen.

**Quelle:** Noy und Zhang, „Experimental Evidence on the Productivity Effects of Generative Artificial Intelligence“, MIT, Arbeitspapier vom 2. März 2023 · begutachtete Fassung in Science 381, 2023, S. 187–192 · [Zur Veröffentlichung](https://www.science.org/doi/10.1126/science.adh2586)

**Einstufung:** Präregistriertes Experiment · Gruppe: Sachstand, Fallbericht oder Marktbeobachtung

**Direktlink:** https://robert-haase.de/belege.html#aufwand-statt-koennen

---

## boussioux-neuheit-wert

**Aussage:** In einem Ideenwettbewerb zur Kreislaufwirtschaft bewerteten 300 geprüfte Bewerter je 13 von 234 Lösungen, zusammen 3.900 Bewertungen: 54 von Menschen, 180 von GPT-4 mit menschlich gesteuerten Prompts. Die menschlichen galten als neuartiger (die maschinellen minus 0,140 auf einer Skala von 1 bis 5), die maschinellen als strategisch tragfähiger, ökologisch und finanziell wertvoller und insgesamt besser (plus 0,088 bis 0,160). Am oberen Rand kippt das Bild: Die Höchstnote für Neuheit bekamen die KI-Lösungen 7,9 Prozentpunkte seltener, ihr Wertvorsprung verschwand dort in allen vier Dimensionen.

**Was die Zahlen nicht sagen:** Verglichen wurde nicht Mensch gegen Maschine, sondern Menge gegen menschlich geführte KI mit eigens gebauten Prompts. Wurde das Modell iterativ zum Differenzieren angehalten, war der Rückstand im Mittel nicht mehr nachweisbar (minus 0,056) und blieb nur bei der Höchstnote. **Woran sie hängen:** Urteile über Texte, keine realisierten Ideen. Alle Bewerter sitzen in den USA. GPT-4 im Stand von Mitte 2023, ein Aufgabenfeld, je Block zehn KI- gegen drei Menschenlösungen. Zwei der fünf Autoren sind der beteiligten KI-Firma zugeordnet, Mitautor Jacimovic hat sie gegründet.

**Quelle:** Boussioux, Lane, Zhang, Jacimovic und Lakhani, „The Crowdless Future? Generative AI and Creative Problem-Solving“, Organization Science 35(5), S. 1589 bis 1607 · 234 bewertete Lösungen, 300 Bewerter, 3.900 Bewertungen, Wettbewerb 30. Januar bis 15. Mai 2023 · eingereicht 30. November 2023, überarbeitet 23. Januar, 14. Mai und 20. Juni 2024, angenommen 26. Juni 2024, online 16. August 2024, Heft September/Oktober 2024 · [Zur Quelle](https://doi.org/10.1287/orsc.2023.18430)

**Einstufung:** Kontrollierter Test · Gruppe: Geprüfte Erhebung, Herstellerdokumentation oder Gerichtsentscheidung

**Direktlink:** https://robert-haase.de/belege.html#boussioux-neuheit-wert

---

## mintzberg-muster

**Aussage:** Henry Mintzberg definierte Strategie 1978 als „ein Muster in einem Strom von Entscheidungen“: Gebildet ist sie, sobald eine Folge von Entscheidungen über die Zeit Konsistenz zeigt. Damit werden auch die Strategien untersuchbar, die sich trotz der Absichten einstellten oder ganz ohne Absicht entstanden. Gezeigt hat er das an zwei Langzeitfällen, dem Volkswagenwerk und den USA in Vietnam von 1950 bis 1973.

**Was der Aufsatz nicht misst:** Er bildet Begriffe und beschreibt. Dass eine gewachsene Strategie zu besseren Ergebnissen führt als eine geplante, belegt er nirgends. Mintzberg greift die Planungslehre durchaus an, ihre Trennung von Formulierung und Umsetzung ruhe auf zwei oft falschen Annahmen. Geprüft hat er das nicht. **Der Unterbau ist größer als das Gezeigte:** Die allgemeinen Schlüsse stützen sich auf vier finanzierte Hauptstudien und über zwanzig studentische Arbeiten; nur zwei der vier sind im Text dokumentiert, die übrigen nicht. Beide gezeigten Fälle sind historisch, liegen außerhalb der Markenführung und wurden rückblickend von derselben Forschergruppe rekonstruiert, die festlegte, was als Muster zählt.

**Quelle:** Henry Mintzberg, „Patterns in Strategy Formation“, Management Science, Vol. 24, No. 9, S. 934 bis 948 · vier vom Canada Council finanzierte Hauptstudien und über zwanzig studentische Arbeiten, davon zwei vorgeführt: Volkswagenwerk 1934 bis 1974 laut Abstract und 1920 bis 1974 laut Abschnittsüberschrift, USA in Vietnam 1950 bis 1973 · Manuskript eingegangen am 19. April 1976, gedruckt Mai 1978 · [Zur Quelle](https://doi.org/10.1287/mnsc.24.9.934)

**Einstufung:** Explorative Fallstudien, begriffsbildend · Gruppe: Sachstand, Fallbericht oder Marktbeobachtung

**Direktlink:** https://robert-haase.de/belege.html#mintzberg-muster

---

## wahrgenommene-differenzierung

**Aussage:** Über 17 Warengruppen in Australien und Großbritannien halten im Schnitt 11 Prozent der aktuellen Verwender ihre eigene Marke für anders und 10 Prozent für einzigartig; 17 Prozent nennen wenigstens eines von beidem. Gekauft wird die Marke trotzdem. Die Autoren empfehlen stattdessen Wiedererkennbarkeit.

**Was die Zahl nicht sagt:** Sie belegt nicht, dass Käufer gar keine Unterschiede sehen. Im Schnitt sprechen 54 Prozent wenigstens einer Marke der Warengruppe eines von beidem zu, bei britischen Erfrischungsgetränken 76 Prozent. Niedrig ist der Einzelwert, weil jeder Befragte nur ein oder zwei Marken nennt, und jeder andere; je Warengruppe 8 bis 36 Prozent. Befragt wurden nur Verwender; dass sie die Marke trotzdem kaufen, folgt daraus, nicht aus der Messung. **Wer erhoben und wer bezahlt hat:** Fallzahlen fehlen im zugänglichen Text. Die meisten Daten kommen samt Messverfahren von der Werbeagentur Young & Rubicam, erhoben 1999; das Institut nennt als Geldgeber unter anderem Coca-Cola, Mars und Nielsen. Über maschinelle Auswahl sagt der Aufsatz nichts, er ist älter als jeder Agent.

**Quelle:** Jenni Romaniuk, Byron Sharp und Andrew Ehrenberg, Ehrenberg-Bass-Institut, Australasian Marketing Journal 15 (2), Seiten 42 bis 54 · Befragung aktueller Markenverwender in 17 Warengruppen, die australischen per Telefon, die britischen aus dem Brand Asset Valuator von Young & Rubicam, erhoben 1999 · 2007 · [Zur Quelle](https://web.archive.org/web/20251015044426/https://marketingscience.info/wp-content/uploads/staff/2015/08/different.pdf)

**Einstufung:** Befragung · Gruppe: Sachstand, Fallbericht oder Marktbeobachtung

**Direktlink:** https://robert-haase.de/belege.html#wahrgenommene-differenzierung

---

## de-skilling

**Aussage:** In einer weltweiten Befragung von 70 Vorständen und Senior Executives beobachtet die Hälfte den Verlust von Fähigkeiten bereits im eigenen Unternehmen, mehr als 60 Prozent halten ihn binnen drei bis fünf Jahren für eine ernsthafte Bedrohung. Die fünf Fähigkeiten, die dieselben Führungskräfte als wichtigste für die langfristige Leistung einstufen, sind genau die fünf, die sie als am stärksten gefährdet sehen: Urteilen und Entscheiden, ein Problem verstehen und zuschneiden, kreatives Denken, Analyse und kausales Schließen, Lösungen entwickeln und bewerten.

**Was die Zahl nicht sagt:** Gemessen ist eine Wahrnehmung, kein Fähigkeitsverlust. Niemand hat Leistungen vorher und nachher geprüft; 70 Führungskräfte geben Selbstauskunft, ergänzt um Gespräche mit rund einem Dutzend weiteren. Die Stichprobe ist klein und nicht repräsentativ, und wer an einer Befragung zu diesem Thema teilnimmt, hat es meist schon für sich entschieden. Die Rangfolge der Fähigkeiten stammt aus Bewertungsskalen, nicht aus Tests. Erhoben und veröffentlicht hat die Studie der Thinktank einer Unternehmensberatung, die Abhilfe gegen genau diesen Befund verkauft.

**Quelle:** Sagar Goel, David Martin, Charikleia Kaffe: „When Everyone Uses AI, Companies Risk Losing Critical Skills“, Boston Consulting Group, BCG Institute, 17. Juni 2026 · weltweite Befragung von 70 Führungskräften aus C-Suite und oberer Leitungsebene, dazu Gespräche mit einem Dutzend weiterer Führungskräfte · [Zur Quelle](https://www.bcg.com/publications/2026/when-everyone-uses-ai-companies-risk-critical-skills)

**Einstufung:** Befragung · Gruppe: Sachstand, Fallbericht oder Marktbeobachtung

**Direktlink:** https://robert-haase.de/belege.html#de-skilling

---

Ende der Datei: 19 von 19 Einträgen zum Thema Urteil. Letzter Eintrag: de-skilling.
