Es gibt diese eigentümlichen historischen Momente, in denen man begreift, dass eine Epoche sich selbst missversteht. Unsere Gegenwart liebt es, sich als radikal neu zu inszenieren. Wir sind heute schlauer und innovativer als jede Generation vor uns, so die Erzählung. Überall ist von Data Analytics, Künstlicher Intelligenz, Generative AI, Agentic AI, Predictive Intelligence, Digital Twins, Real-Time Risk Intelligence, Stress Testing, Explainable AI, Decision Intelligence und evidence-based Decision Making die Rede. Das klingt nach Rechenzentren, Cloud-Infrastruktur, neuronalen Netzen und großer Innovation. Und doch beginnt die eigentliche Geschichte dieser Verfahren viel früher – in Briefwechseln über Glücksspielprobleme, in Sterbetafeln, in Teetassen, in der Frage nach dem vernünftigen Urteil unter Unsicherheit, in Marktpreisen, die wie Zufallsbewegungen aussehen, und in den harten Axiomen, die Wahrscheinlichkeiten überhaupt erst mathematisch disziplinierbar machen. Wer diese Genealogie ernst nimmt, entdeckt etwas Unerwartetes: Ein großer Teil der methodischen Grundlagen, mit denen wir heute Risiken steuern, Daten auswerten und AI-Systeme trainieren, wurde nicht im Silicon Valley gelegt, sondern über Jahrhunderte hinweg von Universalgelehrten, Mathematikern, Statistikern, Ökonomen und Philosophen vorbereitet, die oft in völlig anderen Welten lebten – aber dieselben Kernfragen stellten wie wir heute.
Von Pascal bis Kolmogorow: Die lange Geburt des Wahrscheinlichen
Bevor Unsicherheit zum Gegenstand mathematischer Analyse wurde, war der Umgang mit ihr über Jahrhunderte vor allem religiös und kosmologisch geprägt. In der alten indischen Lehre vom Karma erschien das Schicksal als Ergebnis einer festen Ordnung von Ursache und Wirkung, sodass für einen eigenständigen Begriff des Zufalls kaum Raum blieb [vgl. Romeike/Stallinger 2021, S. 8 ff.]. Auch in der griechischen Antike wurden Glück, Unglück und Schicksalsschläge überwiegend dem Wirken unterschiedlicher Gottheiten zugeschrieben. Religion stiftete Orientierung, erklärte das Unvorhersehbare und entlastete den Menschen teilweise von der Vorstellung, die Zukunft selbst steuern zu können. Dieses Denken setzte sich im mittelalterlichen Weltbild einer hierarchisch gegliederten kosmischen Ordnung fort: Gott bestimmte den Lauf der Dinge und damit letztlich auch das, was aus heutiger Sicht als Zufall oder Risiko bezeichnet würde.
Erst in der Renaissance begann sich dieses geschlossene Deutungsmuster grundlegend zu verändern. Überlieferte Autoritäten und religiöse Erklärungen wurden zunehmend infrage gestellt, während das menschliche Handeln und die diesseitige Welt stärker in den Mittelpunkt rückten [vgl. Romeike/Hager 2020, S. 2ff.]. Auch die Erfahrung der Pest, die zwischen 1346 und 1353 einen erheblichen Teil der europäischen Bevölkerung auslöschte, dürfte dazu beigetragen haben, traditionelle Gewissheiten zu erschüttern. Mit dem Rückgang einer ausschließlich religiösen Deutung von Unsicherheit entstand zugleich die Notwendigkeit, Zukunft, Zufall und mögliche Schäden mit eigenen methodischen Mitteln zu erfassen. In diesem Wandel liegen wesentliche geistesgeschichtliche Wurzeln des modernen Risikomanagements.
Der entscheidende methodische Anfang liegt dort, wo aus Intuition erstmals Rechnung wurde. Blaise Pascal und Pierre de Fermat zeigten, dass man offene Zukunftslagen nicht nur moralisch oder gefühlsmäßig, sondern rechnerisch bewerten kann. Jakob Bernoulli machte aus dieser Einsicht später mit dem Gesetz der großen Zahlen eine Theorie der Stabilisierung im Kollektiv. Laplace verwandelte Wahrscheinlichkeit in eine Wissenschaft des Unwissens unter Unsicherheit. Abraham de Moivre brachte Spielrechnungen und Sterbetafeln zusammen und öffnete damit den Weg zur Versicherungsmathematik. William Sealy Gosset zeigte, dass auch kleine Stichproben, wenn man sie richtig behandelt, belastbare Urteile ermöglichen. Ronald Aylmer Fisher verschob den Blick vom Ergebnis auf das Design der Beobachtung und lehrte, dass gute Modelle schlechte Daten nicht retten.
Bruno de Finetti bestand darauf, dass Wahrscheinlichkeit kein mystischer Stoff der Welt ist, sondern ein verantwortetes Urteil unter unvollständiger Information. Frank Ramsey zeigte, wie stark Überzeugungen, Wetten und Rationalität zusammenhängen. Andrei Kolmogorow gab der Wahrscheinlichkeit mit seinen Axiomen ihre mathematische Verfassung. Frank Knight trennte berechenbares Risiko von echter Ungewissheit. Harry Markowitz machte Diversifikation zu einer Theorie der Abhängigkeitsstruktur. Kenneth Arrow zeigte, dass Risiken oft weniger an Wahrscheinlichkeiten als an asymmetrischer Information hängen. Louis Bachelier brachte die Stochastik an die Märkte, und Benoît B. Mandelbrot zerstörte die bequeme Illusion, dass die Welt normalverteilt sei.
Man kann diese Namen als lose Galerie großer Köpfe lesen. Man kann sie aber auch als Teile eines einzigen methodischen Bauwerks verstehen. Dieses Bauwerk besteht aus einigen wenigen, immer wiederkehrenden Grundfragen: Wie geht man mit Zukunftsoffenheit um? Wie unterscheiden sich Daten, Meinung und Wissen? Wie lernt man aus wenigen oder vielen Beobachtungen? Wann darf man Wahrscheinlichkeit angeben – und wann wäre das bloße Scheingenauigkeit? Wie erkennt man Abhängigkeiten, Ausreißer, dicke Ränder, Modellfehler oder Begriffsverwirrung? Genau diese Fragen sind nicht altmodisch, sondern die elementare Tiefenstruktur des heutigen Risikomanagements.
Was Data Analytics und AI ihren Vorfahren verdanken
Auch dort, wo wir heute von Data Analytics und AI sprechen, ist die genealogische Linie erstaunlich klar. Bayesianische Modelle und probabilistische Updates sind ohne Bayes und Laplace nicht denkbar. Schätzung, Likelihood, Hypothesentests und experimentelles Design stehen tief in der Tradition von Fisher und Gosset. Die Frage, wie Überzeugungsgrade, Vorwissen und neue Evidenz zusammenwirken, trägt den Stempel von Ramsey und de Finetti. Jede Modellarchitektur, die mit Wahrscheinlichkeiten arbeitet, ruht auf kolmogorowscher Axiomatik – auch wenn ihre Nutzer nie einen Blick in die Grundbegriffe der Wahrscheinlichkeitsrechnung geworfen haben.
Selbst moderne Machine-Learning-Verfahren, die sich gern als Bruch mit der Vergangenheit präsentieren, leben in methodischer Hinsicht von alten Disziplinen. Training braucht Daten, Daten brauchen Definitionen, Definitionen brauchen saubere Beobachtung, und saubere Beobachtung braucht ein Design, das Störgrößen kontrolliert, Verzerrungen kennt und die Grenzen des eigenen Modells benennt. Wer glaubt, Rechenleistung ersetze Methode, wiederholt meist nur in schnellerer Hardware einen alten Denkfehler.
Gerade deshalb ist die Rückbesinnung auf diese Traditionslinie keine akademische Höflichkeitsübung, sondern eine Frage intellektueller Hygiene. Sie erinnert daran, dass unsere gegenwärtigen Werkzeuge eine Geschichte haben – und mit ihr auch Bedingungen, Grenzen und implizite Voraussetzungen. Die Moderne ist methodisch oft weniger erfinderisch, als sie vorgibt, und zugleich viel abhängiger von alten Fundamenten, als sie eingestehen möchte.
Strategie, Märkte und Wahrnehmungsverzerrung
Je länger ich in den vergangenen Monaten an der Reihe der "Köpfe des Risikomanagements" schrieb, desto deutlicher trat zutage, dass die methodische Tiefenstruktur der Gegenwart nicht nur aus Wahrscheinlichkeitstheorie und Statistik besteht. Mit John von Neumann und Oskar Morgenstern kam die Einsicht hinzu, dass viele Risiken strategisch sind: Sie entstehen nicht in einer leeren Welt, sondern in Situationen, in denen andere Akteure beobachten, reagieren, drohen, kooperieren oder eskalieren. Für das moderne Risikomanagement ist das unmittelbar relevant – von Preiskriegen und Verhandlungen bis zu geopolitischen Konflikten und Cyberangriffen. Wer einen Angreifer, einen Konkurrenten oder einen Regulator vor sich hat, kann Risiken nicht wie Wetterereignisse behandeln. Er muss den Gegenspieler mitdenken.
Mit Louis Bachelier, Harry Markowitz, Kenneth Arrow sowie Fischer Black, Myron Scholes und Robert C. Merton tritt ein zweiter großer Komplex hinzu: die Mathematisierung von Märkten, Portfolios und kontingenten Ansprüchen. Bachelier modellierte Preisbewegungen als stochastische Prozesse, Markowitz zeigte, dass Risiko nie nur in einzelnen Titeln, sondern in Abhängigkeitsstrukturen steckt, Arrow machte deutlich, dass Information und Risiko ökonomisch ungleich verteilt sind, und das Black-Scholes-Merton-Modell brachte die Logik der Replikation und Modellbewertung auf einen bis heute prägenden Punkt. Gerade aus der Kritik an diesem Modell – konstante Volatilität, dünne Enden der Normalverteilung, Unterschätzung von Extremereignissen – lässt sich eine weitere Lehre ziehen: Gute Modelle sind unentbehrlich, aber gefährlich, sobald ihre Annahmen vergessen werden.
Daniel Kahneman und Amos Tversky fügten der Serie schließlich jene Dimension hinzu, ohne die kein ernsthaftes Risikomanagement vollständig ist: die systematische Fehlbarkeit des menschlichen Urteils. Risiken werden nicht nur falsch modelliert, sie werden schon vorher falsch wahrgenommen. Framing, Anker, Verfügbarkeitsheuristik, Verlustaversion und die Trägheit des analytischen Denkens verzerren Schadensschätzungen, Workshop-Diskussionen, Szenarioauswahl und Managemententscheidungen. Damit stehen diese Beiträge nicht am Rand der Reihe, sondern im Zentrum ihrer eigentlichen Pointe: Modernes Risiko- und Chancenmanagement ist immer zugleich eine Frage von Modelllogik, strategischer Interaktion, Risikowahrnehmung und kognitiver Selbstkorrektur.
Wenn immer mehr Wissenschaftler immer weniger Ergebnisse liefern
Gerade an dieser Stelle hält die Gegenwart sich selbst einen unangenehmen Spiegel vor. Während die methodischen Grundlagen moderner Statistik, Risikoanalyse und Entscheidungstheorie vielfach seit Jahrzehnten oder sogar Jahrhunderten bekannt sind, wächst der personelle und finanzielle Aufwand, der erforderlich ist, um die wissenschaftliche und technologische Grenze weiter zu verschieben. Nicholas Bloom, Charles I. Jones, John Van Reenen und Michael Webb untersuchen dieses Missverhältnis in ihrer Studie "Are Ideas Getting Harder to Find?" nicht anhand der bloßen Zahl von Publikationen oder Patenten, sondern mithilfe einer ökonomischen Produktionsrechnung für Ideen. Forschungsproduktivität bezeichnet bei ihnen das Verhältnis zwischen dem erzielten Erkenntnis- beziehungsweise Produktivitätsfortschritt und dem dafür eingesetzten Forschungsaufwand. In der gesamtwirtschaftlichen Betrachtung messen sie den Output der Ideenproduktion über das Wachstum der totalen Faktorproduktivität und den Input über die effektive Zahl der Forscher, abgeleitet aus den realen Aufwendungen für Forschung und geistiges Eigentum. Diese Unterscheidung ist entscheidend: Mehr Artikel, Patente, Projekte oder Forschungsausgaben sind noch kein Beleg dafür, dass pro eingesetzter Ressource auch mehr relevante Erkenntnis entsteht.
Das gesamtwirtschaftliche Ergebnis für die Vereinigten Staaten ist bemerkenswert. Seit den 1930er Jahren erhöhte sich der effektive Forschungsaufwand nach der Basisschätzung der Autoren um den Faktor 23, was einem durchschnittlichen Wachstum von rund 4,3 Prozent pro Jahr entspricht. Gleichzeitig sank die gemessene Forschungsproduktivität um den Faktor 41 beziehungsweise durchschnittlich um rund 5,1 Prozent pro Jahr. Aus dieser jährlichen Abnahmerate ergibt sich rechnerisch eine Halbierung ungefähr alle 13 Jahre. Diese häufig zitierte Faustformel ist eine zugespitzte Übersetzung des langfristigen empirischen Trends. Besonders wichtig ist die Gegenbewegung der beiden Kurven: Relativ stabile Wachstumsraten wurden nicht durch eine konstante Produktivität der Forschung erreicht, sondern dadurch, dass der sinkende Ertrag pro Forscher durch einen immer größeren Forschungsapparat kompensiert wurde.
Abb. 01: Schematische Darstellung nach Bloom et al. – wenn sich die Forschungsproduktivität ungefähr alle 13 Jahre halbiert, sinkt der Index trotz wachsender Forschungsanstrengungen stetig ab
Am deutlichsten wird diese Logik am Beispiel des Mooreschen Gesetzes. Die Zahl der Transistoren auf einem Computerchip verdoppelte sich über Jahrzehnte annähernd im gleichen Rhythmus. Hinter dieser scheinbar stabilen technischen Regel verbarg sich jedoch ein stark wachsender Ressourceneinsatz. Bloom und seine Koautoren schätzen, dass zur Aufrechterhaltung derselben Verdopplungsrate zuletzt mehr als 18-mal so viele Forschende benötigt wurden wie zu Beginn der 1970er Jahre. Die Forschungsproduktivität in der Halbleiterentwicklung sank dabei um etwa sieben Prozent pro Jahr. Das ist kein Beleg für ein Versagen der Chipforschung. Im Gegenteil: Die Branche hielt einen außergewöhnlichen Fortschritt über Jahrzehnte aufrecht. Die Studie zeigt aber, welchen Preis diese Kontinuität hatte – immer größere Teams, komplexere Anlagen, höhere Investitionen und mehr organisatorischen Aufwand für denselben proportionalen Fortschritt.
Ein ähnliches Muster finden die Autoren in sehr unterschiedlichen Feldern. Bei der Steigerung landwirtschaftlicher Erträge von Mais, Sojabohnen, Baumwolle und Weizen sinkt die Forschungsproduktivität ihren Berechnungen zufolge um ungefähr fünf Prozent pro Jahr. Für medizinische Innovationen, gemessen an den Verbesserungen der Sterblichkeit bei Krebs und Herzerkrankungen, ergibt sich eine vergleichbare Größenordnung. Auch auf Unternehmensebene ist der Rückgang deutlich: In den Compustat-Daten fällt die Forschungsproduktivität im Durchschnitt um etwa zehn Prozent pro Jahr, in den Daten des "US Census of Manufacturing" um rund acht Prozent. Die Werte unterscheiden sich zwischen Branchen, Unternehmen und Messansätzen erheblich. Die gemeinsame Richtung bleibt jedoch auffällig: In nahezu allen von den Autoren belastbar untersuchten Bereichen steigt der Forschungsinput wesentlich schneller als der daraus abgeleitete Ideenoutput.
Der Befund darf dennoch nicht verkürzt werden. Die Studie beweist weder, dass heutige Wissenschaftler weniger intelligent oder weniger engagiert wären, noch dass keine grundlegenden Entdeckungen mehr gelingen. Sie misst auch nicht den gesamten Wert wissenschaftlicher Erkenntnis und liefert keinen unmittelbaren Nachweis dafür, dass ein bestimmter Anteil der veröffentlichten Literatur irrelevant ist. Untersucht werden vielmehr Bereiche, in denen sich sowohl der Forschungsinput als auch ein plausibler Output über längere Zeiträume quantifizieren lassen. Auch die Ursachen des Produktivitätsrückgangs werden nicht abschließend identifiziert. Denkbar sind unter anderem die wachsende Komplexität der Forschungsfront, die Ausschöpfung leichter zugänglicher Erkenntnisse, der zunehmende Umfang des bereits vorhandenen Wissens, größere und koordinationsintensivere Teams sowie steigende technische und regulatorische Anforderungen. Gerade weil die Studie diese Ursachenfrage offenlässt, sollte ihr Hauptergebnis nicht ideologisch überladen, aber auch nicht verharmlost werden.
Für Wissenschaftsorganisationen und für die Praxis des Risikomanagements folgt daraus eine unbequeme Konsequenz. Bloom et al. erinnern uns daran, dass Erkenntnisproduktion selbst einem Risiko unterliegt: dem Risiko, steigenden Aufwand mit wachsendem Fortschritt zu verwechseln.
Mehr Papers, weniger Durchbruch
Dieser Eindruck wird durch andere Arbeiten gestützt, wenn auch nicht immer widerspruchsfrei. Eine breit diskutierte Studie von Michael Park, Erin Leahey und Russell Funk kommt zu dem Ergebnis, dass wissenschaftliche Arbeiten und Patente im Zeitverlauf im Durchschnitt weniger "disruptiv" geworden sind – also seltener frühere Pfade verlassen und neue Richtungen erzwingen. Die Autoren analysierten dafür rund 45 Millionen wissenschaftliche Arbeiten und 3,5 Millionen Patente aus mehreren großen Datensätzen und fanden über sechs Jahrzehnte hinweg einen Rückgang der Wahrscheinlichkeit, dass neue Arbeiten bestehende Forschungsrichtungen wirklich aufbrechen. Die Diagnose ist umstritten und methodisch kritisiert worden; gerade das macht sie interessant. Denn selbst ihre Kritiker bestreiten selten, dass die Frage nach sinkender Originalität und wachsender Trägheit real ist.
Allerdings wäre es zu kurz gegriffen, daraus nur eine Klage über "die Wissenschaft" abzuleiten. Viele große Erkenntnisfortschritte entstanden historisch gerade nicht im abgeschlossenen Elfenbeinturm, sondern an der Grenze zwischen mathematischer Idee, technischer Aufgabe und praktischer Anwendung. Carl Friedrich Gauß ist dafür ein klassisches Beispiel. Seine Fehlerrechnung, Ausgleichungsrechnung und Methode der kleinsten Quadrate waren nicht nur abstrakte Mathematik, sondern eng mit astronomischen und geodätischen Messproblemen verbunden; bei der Vermessung des Königreichs Hannover wurden mathematische Verfahren unmittelbar zu Werkzeugen praktischer Orientierung. Auch viele andere Figuren dieser Serie zeigen diese Doppelstruktur: Bachelier kam über die Börse und das Familiengeschäft mit Kapitalmärkten in Berührung; Bronzin dachte Optionsbewertung aus der Welt der Prämien- und Termingeschäfte heraus; Markowitz entwickelte Portfoliotheorie nicht als reines Gedankenspiel, sondern an der Frage, wie Anleger unter Unsicherheit entscheiden; von Neumann arbeitete zugleich an Logik, Quantenmechanik, Rechenmaschinen und militärischen Problemen; Shannon und die Bell Labs stehen exemplarisch für eine Forschungskultur, in der Nachrichtentechnik, Elektrotechnik und mathematische Abstraktion ineinandergriffen. Der Transistor entstand 1947 ebenfalls nicht in einer seminaristischen Debatte, sondern in den Bell Labs, also in einem industriellen Forschungslabor mit konkreten technischen Problemen.
Auch die jüngere Vergangenheit zeigt, dass Durchbrüche häufig aus hybriden Räumen entstehen: aus Unternehmen, Laboren, Plattformen, Entwicklungsabteilungen und angewandten Forschungsteams. Die Transformer-Architektur, die heute vielen großen Sprachmodellen zugrunde liegt, wurde 2017 von einem Team bei Google in der Arbeit "Attention Is All You Need" vorgestellt; der eigentliche Durchbruch lag nicht nur in einer eleganten Idee, sondern in der praktischen Skalierbarkeit eines neuen Architekturprinzips. AlphaFold wiederum entstand bei DeepMind und verschob die Proteinfaltungsfrage in Richtung eines AI-gestützten Hochdurchsatzproblems; die Arbeiten von Demis Hassabis und John Jumper wurden später auch durch den Chemie-Nobelpreis 2024 gewürdigt. Und auch die Wiederverwendbarkeit von Raketenstufen wurde nicht durch eine klassische Universitätsdisziplin allein vorangetrieben, sondern durch iterative Ingenieurpraxis, Testkultur und industrielle Systemintegration, wie sie etwa SpaceX mit dem Falcon-9-System demonstrierte.
Daraus folgt keine Abwertung universitärer Wissenschaft. Im Gegenteil: Viele dieser praktischen Durchbrüche wären ohne jahrzehntelange Grundlagenforschung und öffentliche Forschungsinfrastrukturen kaum denkbar. Aber sie zeigen, dass Erkenntnis nicht automatisch dort entsteht, wo am meisten publiziert wird. Fortschritt entsteht häufig dort, wo ein echtes Problem hinreichend ernst genommen wird: ein Messfehler in der Geodäsie, ein Preisschwankungsproblem am Markt, ein Kommunikationsproblem in der Nachrichtentechnik, ein Strukturproblem der Proteinfaltung, ein Skalierungsproblem in der AI oder ein Wiederverwendungsproblem in der Raumfahrt. Die Praxis zwingt zur Bewährung. Sie duldet weniger rhetorische Umwege, weil ein Verfahren am Ende messen, tragen, rechnen, schützen, heilen oder funktionieren muss.
Was man heute in vielen Bereichen beobachten kann, ist dagegen eine eigentümliche Mischung aus Überproduktion und Relevanzmangel. Die Zahl der veröffentlichten Texte steigt, die Zahl der Verwaltungsakte rund um Forschung ebenfalls, die Zahl der Konferenzen, Calls, Begutachtungsrunden, Programme und Selbstbeschreibungen ohnehin. Doch all das ist nicht dasselbe wie Erkenntnis. Nicht wenige Artikel fügen der Welt wenig hinzu, außer der weiteren Besetzung bibliometrischer Räume. Der entscheidende Gegensatz verläuft daher nicht zwischen Universität und Unternehmen, sondern zwischen erkenntnisgetriebener Arbeit und bloßer Output-Produktion.
Gute Wissenschaft – ob in der Universität, im Forschungslabor, im Unternehmen oder in der praktischen Anwendung – beginnt nicht mit der Publikationsliste, sondern mit einem Problem, das sich der Wirklichkeit aussetzt. Genau dort berühren sich Wissenschaft, Risikomanagement und Factfulness: Nicht Ideologien, Narrative oder institutionelle Routinen sollten entscheiden, was relevant ist, sondern Evidenz, Wirkung, Fehlertoleranz, Datenqualität und die Bereitschaft, eine Hypothese an der Realität scheitern zu lassen.
Wo die Methode durch Rhetorik ersetzt wird
An diesem Punkt gewinnt Karl Popper wieder eine fast bedrückende Aktualität. Im Zusammenhang seiner Polemik gegen den Obskurantismus und die "großen Worte" wird ihm der Satz zugeschrieben: "Das Verfahren – wo die Argumente fehlen, da ersetze man sie durch den Wortschwall – war erfolgreich." Der genaue Wortlaut wird nicht immer einheitlich zitiert; aber als Verdichtung seines Angriffs auf intellektuellen Nebel trifft die Formulierung den Kern. Popper richtete sich gegen Theorien und Debattenstile, die Unklarheit nicht als Mangel, sondern als Schutzwall gegen Kritik verwenden. Gerade hier liegt ein Teil des gegenwärtigen Problems. In manchen Feldern werden Texte veröffentlicht, deren Hauptleistung nicht in empirischer Tragfähigkeit, theoretischer Strenge oder methodischer Innovation liegt, sondern im geschickten Einsatz moralisch aufgeladener Begriffe, identitärer Marker, politischer Schlagwörter oder rhetorischer Nebelmaschinen. Es geht dann weniger darum, Probleme präzise zu lösen, als symbolisch zu signalisieren, dass man auf der richtigen Seite steht. Das ist besonders unerquicklich, wenn Ideen mit großem begrifflichem Aufwand verteidigt werden, obwohl sie empirisch längst an der Realität zerschellt sind. In solchen Fällen wird Forschung nicht mehr zu einem Verfahren der Kritik, sondern zu einem Verfahren der Immunisierung. Nicht die beste Erklärung gewinnt, sondern die am schwersten angreifbare Pose. Genau gegen diese Verkehrung richtete sich Popper.
Für Popper ist Wissenschaft deshalb weder eine Sammlung endgültig bewiesener Wahrheiten noch eine gesellschaftliche Autorität, die unfehlbare Urteile verkündet. Wissenschaft lässt sich in seinem Sinne als ein methodisch organisierter Prozess verstehen, in dem vorläufige Vermutungen formuliert, möglichst strengen Prüfungen ausgesetzt und bei widersprechenden Befunden korrigiert oder verworfen werden. Wissenschaftlich ist eine empirische Theorie demnach nicht deshalb, weil sich für sie zahlreiche Bestätigungen finden lassen. Wissenschaftlich ist sie vielmehr dann, wenn sie so präzise formuliert ist, dass denkbare Beobachtungen oder Versuchsergebnisse mit ihr in Konflikt geraten könnten. Popper bezeichnete daher die Falsifizierbarkeit, Widerlegbarkeit oder Prüfbarkeit als Kriterium für den wissenschaftlichen Status einer Theorie. Eine Theorie, die mit jedem nur denkbaren Ergebnis vereinbar ist, entzieht sich der Prüfung und verliert damit ihren empirisch-wissenschaftlichen Charakter.
Vor diesem Hintergrund ist auch die häufig verwendete Formulierung "die Wissenschaft sagt" problematisch. Als sprachliche Verkürzung kann sie sinnvoll sein, etwa wenn eine große Zahl unabhängiger Untersuchungen zu vergleichbaren Ergebnissen gelangt. Sie wird jedoch irreführend, sobald sie suggeriert, Wissenschaft sei ein einheitliches Subjekt mit einer einzigen, endgültigen Stimme. Wissenschaft "sagt" im strengen Sinne nichts. Wissenschaftler formulieren Hypothesen, erheben Daten, verwenden Modelle, treffen Annahmen, schätzen Unsicherheiten ein und diskutieren konkurrierende Erklärungen. Manche Erkenntnisse sind außerordentlich robust, andere vorläufig, umstritten oder stark von Modellannahmen abhängig. Auch ein wissenschaftlicher Konsens ist daher kein Dogma. Er beschreibt den jeweils am besten begründeten Stand des Wissens, bleibt aber grundsätzlich überprüfbar und korrigierbar.
Gerade deshalb ist die Kritik wissenschaftlicher Aussagen nicht per se "wissenschaftsfeindlich". Im Gegenteil: Methodisch begründete Kritik ist ein konstitutiver Bestandteil von Wissenschaft. Wissenschaftsfeindlich wäre es vielmehr, Ergebnisse unabhängig von Daten und Argumenten zurückzuweisen oder jede Expertise unterschiedslos zu relativieren. Doch ebenso wissenschaftsfern ist es, Kritik mit Verweis auf institutionelle Autorität, Mehrheitsverhältnisse oder moralische Dringlichkeit grundsätzlich abzuwehren. Nicht jede Kritik ist gut, aber jede wissenschaftliche Aussage muss prinzipiell kritisierbar bleiben. Die angemessene Reaktion auf einen Einwand lautet daher nicht: "Die Wissenschaft hat entschieden", sondern: Welche Daten, Annahmen und Methoden tragen die Aussage? Welche Unsicherheiten bestehen? Welche Befunde würden gegen sie sprechen? Und welche alternative Erklärung besitzt eine größere empirische Tragfähigkeit?
An dieser Stelle berührt sich Poppers Kritischer Rationalismus mit Richard Feynmans berühmter Warnung vor der "Cargo-Cult Science". Feynman beschrieb damit Forschungspraktiken, die äußerlich alle Kennzeichen von Wissenschaft nachahmen: Es werden Experimente durchgeführt, Daten erhoben, statistische Verfahren eingesetzt, Fachbegriffe verwendet und Publikationen produziert. Die Form kann nahezu perfekt erscheinen – und dennoch fehlt das Entscheidende. Wie bei den von Feynman geschilderten Kulten, die Landebahnen, Kontrolltürme und Kopfhörer nachbauten, ohne damit die erhofften Flugzeuge zurückzubringen, werden die sichtbaren Rituale reproduziert, ohne die Bedingungen zu verstehen, unter denen sie tatsächlich Erkenntnisse hervorbringen.
Was einer solchen Cargo-Kult-Wissenschaft fehlt, ist nach Feynman vor allem wissenschaftliche Integrität: die aktive Anstrengung, sich nicht selbst zu täuschen. Dazu gehört, nicht nur jene Befunde zu präsentieren, die eine bevorzugte These stützen, sondern auch mögliche Fehlerquellen, alternative Erklärungen, widersprechende Ergebnisse und methodische Grenzen offenzulegen. Es genügt nicht, einzelne Aussagen formal korrekt zu formulieren, wenn durch Auswahl, Weglassen oder suggestive Darstellung ein irreführender Gesamteindruck entsteht. Wissenschaftliche Redlichkeit verlangt vielmehr, den Lesern alle relevanten Informationen zur Verfügung zu stellen, die sie benötigen, um den Wert einer Untersuchung selbst beurteilen zu können. Dazu zählt auch die Bereitschaft, negative Ergebnisse zu veröffentlichen und Theorien unabhängig davon zu prüfen, ob das Resultat den eigenen Erwartungen, Interessen oder politischen Überzeugungen entspricht.
Wissenschaft zeigt sich daher nicht primär darin, dass jemand einen akademischen Titel trägt, eine komplexe Methode verwendet oder in einer Fachzeitschrift publiziert. Sie zeigt sich in einer bestimmten intellektuellen Haltung: in der Bereitschaft, präzise Aussagen zu formulieren, Irrtumsmöglichkeiten sichtbar zu machen, Gegenargumente ernst zu nehmen, Unsicherheiten offenzulegen und die eigene Position bei besseren Gründen zu korrigieren. Der wissenschaftliche Prozess ist nicht abgeschlossen, sobald ein Ergebnis veröffentlicht oder ein Konsens formuliert wurde. Er beginnt dort vielmehr erneut. Hypothesen, Methoden, Modelle und Lösungsansätze müssen fortlaufend überprüft und bei Bedarf angepasst werden. Wissenschaftliche Stärke besteht deshalb nicht darin, niemals irren zu können, sondern darin, Irrtümer systematisch auffindbar und korrigierbar zu machen.
Wo diese Haltung verloren geht, bleibt möglicherweise noch der äußere Betrieb der Wissenschaft erhalten: Institute, Konferenzen, Kennzahlen, Zitationsnetzwerke und eine hoch spezialisierte Fachsprache. Doch ihr erkenntnistheoretischer Kern ist ausgehöhlt. Dann wird aus Wissenschaft eine Inszenierung von Gewissheit, aus Kritik ein Loyalitätstest und aus methodischen Verfahren ein dekoratives Ritual. Die Landebahn ist beleuchtet, der Kontrollturm besetzt, die Kopfhörer sind aufgesetzt – aber die Flugzeuge landen nicht. Genau vor dieser Verwechslung von wissenschaftlicher Form und wissenschaftlicher Substanz warnen Popper und Feynman auf jeweils eigene Weise.
John Ioannidis und das Elend schlechter Forschung
John P. A. Ioannidis formulierte im Jahr 2005 in PLOS Medicine eine der schärfsten Diagnosen der neueren Wissenschaftsgeschichte: "Why Most Published Research Findings Are False". Ioannidis ist Arzt, Statistiker und Epidemiologe und einer der international bekanntesten Vertreter der Metaforschung – einer Forschungsrichtung, die nicht in erster Linie einzelne Krankheiten, Technologien oder gesellschaftliche Phänomene untersucht, sondern die Wissenschaft selbst: Wie werden Forschungsfragen ausgewählt? Wie werden Studien geplant, ausgewertet und veröffentlicht? Welche Verzerrungen entstehen durch statistische Verfahren, institutionelle Anreize und Interessenkonflikte? Heute ist Ioannidis Professor für Medizin sowie für Epidemiologie und Bevölkerungsgesundheit an der Stanford University und Co-Direktor des dortigen Meta-Research Innovation Center, kurz METRICS. Seine Funktion in der Wissenschaft besteht damit nicht bloß in der Kritik einzelner Studien, sondern in der systematischen Prüfung der Verfahren, mit denen wissenschaftliches Wissen überhaupt erzeugt, verdichtet und als belastbar ausgewiesen wird.
Der provokante Titel seines Aufsatzes wird häufig missverstanden. Ioannidis behauptet nicht, dass die meisten Wissenschaftler betrügen oder dass jede einzelne veröffentlichte Aussage falsch sein müsse. Sein Argument ist methodischer und probabilistischer. Er untersucht, unter welchen Bedingungen die Wahrscheinlichkeit sinkt, dass ein formal "signifikantes" Ergebnis tatsächlich einen realen Zusammenhang abbildet. Ein niedriger p-Wert beantwortet nämlich nicht unmittelbar die Frage, wie wahrscheinlich eine Hypothese wahr ist. Dafür sind zusätzlich die Vorabwahrscheinlichkeit der Hypothese, die statistische Trennschärfe der Studie, die Größe des untersuchten Effekts, die Zahl der getesteten Hypothesen und das Ausmaß möglicher Verzerrungen entscheidend. Ioannidis richtet den Blick damit auf den positiven Vorhersagewert eines Forschungsergebnisses: Wie wahrscheinlich ist es nach Durchführung der Studie tatsächlich, dass ein berichteter Befund wahr ist?
In seinem Modell verschlechtert sich dieser Vorhersagewert insbesondere dann, wenn Studien klein und statistisch schwach sind, wenn die gesuchten Effekte nur gering ausfallen und wenn aus einer großen Zahl möglicher Zusammenhänge diejenigen ausgewählt werden, die zufällig ein auffälliges Ergebnis liefern. Hinzu kommt die sogenannte analytische Flexibilität: Forschende können unterschiedliche Definitionen, Endpunkte, Zeiträume, Untergruppen, Kontrollvariablen oder statistische Verfahren ausprobieren. Je größer dieser Entscheidungsspielraum ist, desto leichter lässt sich aus ursprünglich unauffälligen Daten ein formal positives Ergebnis erzeugen. Diese Anpassungen müssen nicht einmal in betrügerischer Absicht erfolgen. Oft entstehen sie aus ehrlicher Neugier, aus nachträglichen Erklärungsversuchen oder aus dem Wunsch, aus aufwendig erhobenen Daten doch noch eine publizierbare Erkenntnis zu gewinnen. Methodisch bleibt das Problem jedoch dasselbe: Eine Hypothese, die erst nach Betrachtung der Daten entwickelt wurde, wird behandelt, als wäre sie von Anfang an festgelegt gewesen.
Ioannidis weist außerdem darauf hin, dass Verzerrungen nicht nur aus finanziellen Interessenkonflikten entstehen. Auch wissenschaftliche Schulen, verfolgte Ideologien, persönliche Überzeugungen, Karriereinteressen, institutionelle Erwartungen und die Bindung an eine eigene Theorie können die Auswahl und Interpretation von Ergebnissen beeinflussen. Wissenschaftler investieren Jahre ihres Lebens in bestimmte Modelle und Forschungsprogramme. Es wäre unrealistisch anzunehmen, dass sie gegenüber Ergebnissen, die das eigene Lebenswerk bestätigen oder widerlegen, immer vollkommen neutral bleiben. Verstärkt wird dieser Effekt in besonders "heißen" Forschungsfeldern, in denen viele Teams gleichzeitig um Aufmerksamkeit, Fördermittel und die erste spektakuläre Publikation konkurrieren. Dort steigt der Anreiz, auffällige positive Ergebnisse schnell zu veröffentlichen, während negative, unspektakuläre oder widersprüchliche Resultate häufig in Schubladen verschwinden. Die publizierte Literatur kann dadurch wesentlich eindeutiger erscheinen als die tatsächlich vorhandene Evidenz.
Auch für die Risikoanalyse ist diese Warnung unmittelbar relevant. Auch dort können kleine Datensätze, selektiv ausgewählte Schadensfälle, flexible Szenariodefinitionen und starke Vorannahmen Ergebnisse hervorbringen, die mathematisch präzise aussehen, aber sachlich kaum belastbar sind. Wer zahlreiche Risikotreiber, Zeiträume und Modellvarianten ausprobiert, findet fast zwangsläufig einzelne auffällige Korrelationen. Wer nur erfolgreiche Prognosen dokumentiert und Fehlprognosen vergisst, überschätzt die Qualität seines Modells. Die zentrale Frage lautet daher nicht nur: Ist das Ergebnis statistisch signifikant oder formal korrekt berechnet? Sie lautet: Welche Daten, Annahmen, Auswahlentscheidungen und Anreize haben dieses Ergebnis hervorgebracht?
Damit führt Ioannidis unmittelbar zum Gedanken der Factfulness. Es bedeutet, Behauptungen an überprüfbaren Daten zu messen, Größenordnungen und Basisraten zu beachten, dramatische Einzelfälle nicht mit allgemeinen Trends zu verwechseln und Unsicherheit offen auszuweisen.
Factfulness statt Risikorhetorik
An dieser Stelle lässt sich Hans Rosling anschließen. Sein Begriff der Factfulness war kein naiver Optimismus und auch keine Aufforderung, bestehende Probleme kleinzureden. Er bezeichnet vielmehr eine methodische Disziplin des Urteilens: Wer die Welt verstehen will, soll seine Einschätzungen möglichst auf belastbare Daten, langfristige Entwicklungen, Basisraten und geeignete Vergleichsmaßstäbe stützen – und weniger auf ideologische Vorlieben, dramatische Einzelbeispiele und moralisch aufgeladene Erzählungen. Factfulness bedeutet damit nicht, die Welt positiv zu sehen, sondern sie in angemessenen Proportionen zu sehen.
Hans Rosling war dabei nicht in erster Linie der populäre "Statistikguru", als der er später häufig wahrgenommen wurde. Er war Arzt, Forscher und Professor für Internationale Gesundheit am Karolinska Institutet in Stockholm. In den späten 1970er-Jahren arbeitete er als Arzt im nördlichen Mosambik, wo er eine zuvor wissenschaftlich kaum beschriebene paralytische Erkrankung untersuchte, die später als Konzo bezeichnet wurde. Bereits während eines Studienaufenthalts in Bangalore hatte er die Erfahrung gemacht, dass seine eigenen Vorstellungen über vermeintlich "entwickelte" und "unterentwickelte" Länder von überholten und teilweise überheblichen Annahmen geprägt waren. Diese Erfahrungen führten ihn zu einer lebenslangen Beschäftigung mit der Frage, warum selbst gut ausgebildete Menschen ein systematisch verzerrtes Bild von globaler Gesundheit, Armut und gesellschaftlicher Entwicklung besitzen.
Roslings besondere Leistung lag daher nicht allein in der Präsentation großer Datenmengen. Er verband medizinische und entwicklungspolitische Erfahrung mit der Fähigkeit, langfristige Veränderungen sichtbar und verständlich zu machen. Gemeinsam mit seinem Sohn Ola Rosling und seiner Schwiegertochter Anna Rosling Rönnlund gründete er 2005 die Gapminder Foundation. Die von Ola und Anna entwickelte Visualisierungstechnik ermöglichte es, Länder nicht als statische Kategorien, sondern als sich über Jahrzehnte bewegende Datenpunkte darzustellen. Einkommen, Lebenserwartung, Kindersterblichkeit, Bildung oder Fertilität konnten dadurch gleichzeitig betrachtet werden. Sichtbar wurde eine Welt, die sich erheblich verändert hatte, während viele mentale Modelle noch auf den Verhältnissen der 1960er- oder 1970er-Jahre beruhten.
Der Begriff Factfulness selbst wurde 2014 von Ola Rosling geprägt. Das später unter diesem Titel erschienene Buch war ein gemeinsames Projekt von Hans Rosling, Ola Rosling und Anna Rosling Rönnlund. Es entstand aus dem sogenannten Ignorance Project von Gapminder. Seit 2010 hatten die Roslings systematisch getestet, welche Vorstellungen Menschen über globale Entwicklungen besitzen. Dabei zeigte sich, dass Studierende, Journalisten, Führungskräfte und politische Entscheidungsträger bei einfachen Fragen zu Armut, Gesundheit, Bildung oder Bevölkerungsentwicklung nicht nur Wissenslücken aufwiesen. Ihre Antworten waren häufig systematisch pessimistischer als die verfügbaren Daten. Die Irrtümer waren also nicht zufällig verteilt, sondern folgten wiederkehrenden Wahrnehmungsmustern. Das Buch wurde 2016 begonnen und 2018, ein Jahr nach Hans Roslings Tod, veröffentlicht.
Factfulness ist deshalb weniger eine Sammlung bestimmter Fakten als eine Methode, typische Denkfehler zu erkennen. Rosling und seine Mitautoren beschrieben zehn "dramatische Instinkte", darunter den Negativitätsinstinkt, den Angstinstinkt, den Größeninstinkt und den Dringlichkeitsinstinkt. Menschen überschätzen demnach Informationen, die emotional, neu, bildhaft und bedrohlich sind. Langsame Verbesserungen, erfolgreiche Prävention und unspektakuläre Normalverläufe erhalten dagegen wenig Aufmerksamkeit. Der menschliche Wahrnehmungsfilter bevorzugt das Außergewöhnliche. Dadurch kann eine Folge spektakulärer Nachrichten den Eindruck erzeugen, ein Risiko nehme ständig zu, obwohl Langzeitdaten eine stabile oder sogar rückläufige Entwicklung zeigen.
Der Ansatz lässt sich in einige einfache, aber anspruchsvolle Regeln übersetzen: Einzelwerte sollten mit zeitlichen Entwicklungen verglichen werden; absolute Zahlen benötigen einen geeigneten Nenner; außergewöhnliche Ereignisse müssen in Relation zu ihrer Grundhäufigkeit gesetzt werden; globale Durchschnittswerte sollten nach Regionen, Einkommensgruppen und Ursachen aufgeschlüsselt werden; und die Feststellung, dass eine Situation schlecht ist, darf nicht mit der Behauptung verwechselt werden, sie werde immer schlechter. Eine hohe Schadenzahl kann beispielsweise gleichzeitig bedeuten, dass ein Problem gravierend ist und dass sich die Lage gegenüber früher erheblich verbessert hat. "Schlecht" und "sich verbessernd" sind keine logischen Gegensätze.
Gerade für das Risikomanagement ist das ein zentraler Hinweis. Risikoszenarien sollen weder beruhigend schöngefärbt noch apokalyptisch überzeichnet werden. Sie sollen so gut wie möglich auf Evidenz beruhen. Das ist schwieriger, als es klingt. In vielen Organisationen geraten Risikoanalysen unter den Sog institutioneller Moden, politischer Narrative oder medialer Dramatisierung. Dann werden Szenarien nicht deshalb hoch bewertet, weil Daten, Referenzklassen und nachvollziehbare Wirkungsmechanismen dafür sprechen, sondern weil sie symbolisch anschlussfähig sind, moralischen Druck erzeugen oder zu vorgefassten Weltbildern passen.
Ein besonders anschauliches Beispiel liefert Roslings Analyse der Todesfälle infolge von Naturkatastrophen. In den Gapminder-Befragungen wurde danach gefragt, wie sich die jährliche Zahl der Katastrophentoten während der vergangenen hundert Jahre entwickelt habe. Zur Auswahl standen eine Verdopplung, ein annähernd unverändertes Niveau oder ein Rückgang auf weniger als die Hälfte. Nur rund zehn Prozent der Befragten entschieden sich für die richtige Antwort. Nach den von Gapminder herangezogenen Daten der internationalen Katastrophendatenbank EM-DAT starben zwischen 1907 und 1916 durchschnittlich etwa 325.000 Menschen pro Jahr durch Naturkatastrophen. Zwischen 2007 und 2016 waren es durchschnittlich rund 80.000. Die jährliche Zahl war damit um etwa 75 Prozent zurückgegangen, obwohl die Weltbevölkerung im selben Zeitraum um mehr als fünf Milliarden Menschen gewachsen war.
Für das Risikomanagement ist an diesem Beispiel nicht allein der Rückgang entscheidend. Relevant ist vor allem die Frage, warum die intuitive Risikowahrnehmung so stark von der empirischen Entwicklung abweicht. Erdbeben, Überschwemmungen oder Stürme werden intensiv und mit eindrucksvollen Bildern berichtet. Jede einzelne Katastrophe ist real, und jeder Todesfall ist tragisch. Doch die mediale Verfügbarkeit einzelner Großereignisse sagt noch nichts darüber aus, ob die langfristige Mortalität steigt oder fällt. Die Aufmerksamkeit richtet sich auf den spektakulären Schadenfall, während erfolgreiche Frühwarnsysteme, bessere Gebäude, zuverlässigere Wetterprognosen, medizinische Versorgung und organisierte Evakuierungen kaum wahrgenommen werden. Prävention erzeugt selten Bilder. Gerade deshalb wird ihre Wirkung systematisch unterschätzt.
Aus Sicht des Risikomanagements zeigt das Beispiel außerdem, dass Risiko nicht mit der bloßen Existenz einer Gefahr gleichgesetzt werden darf. Naturgefahren sind nicht verschwunden. Auch Exposition und Vermögenskonzentration können wachsen. Die tatsächlichen Folgen hängen jedoch ebenso von Vulnerabilität, Schutzmaßnahmen, Frühwarnung, Reaktionsfähigkeit und Wiederaufbaukapazitäten ab. Eine fundierte Risikoanalyse muss deshalb zwischen Gefährdung, Exposition, Verwundbarkeit und Schadenwirkung unterscheiden. Sie darf aus dem Rückgang historischer Todesfälle weder ableiten, Naturkatastrophen seien unbedeutend geworden, noch aus einzelnen Extremereignissen schließen, sämtliche Risiken entwickelten sich zwangsläufig katastrophal. Roslings Analyse liefert somit keine Entwarnung, sondern ein Argument für eine differenzierte Zerlegung des Risikos.
Dasselbe gilt für Cyberrisiken. Eine spektakuläre Ransomware-Attacke, ein öffentlich diskutiertes Datenleck oder ein politisch aufgeladenes Schlagwort sind noch kein hinreichender Ersatz für Frequenzanalysen, Schadendaten, Stresstests und transparent ausgewiesene Annahmen. Gleichzeitig darf eine durchschnittlich geringe Schadenfrequenz nicht dazu führen, seltene, aber existenzbedrohende Ereignisse auszublenden. Factfulness verlangt hier, Häufigkeit und Schadenausmaß getrennt zu betrachten. Ein Ereignis kann sehr unwahrscheinlich und dennoch strategisch relevant sein. Umgekehrt kann ein häufig berichtetes Ereignis eine geringe objektive Eintrittswahrscheinlichkeit besitzen. Gute Risikoanalyse fragt daher nach Basisraten, Verteilungen und Abhängigkeiten, nicht nur nach prominenten Fällen.
Wer Cyberrisiken ernsthaft bewerten will, benötigt Evidenz über Angriffspfade, Verwundbarkeiten, Wiederanlaufzeiten, Abhängigkeiten von Dienstleistern, Häufigkeiten bestimmter Vorfälle, Qualität der Detektion und Wirksamkeit bestehender Kontrollen. Er muss außerdem zwischen beobachteten Daten und Dunkelziffern, zwischen Durchschnittsschäden und Extremverlusten sowie zwischen historischer Erfahrung und strukturellen Veränderungen unterscheiden. Das gilt ebenso für geopolitische, operationelle und Lieferkettenrisiken. Eine Häufung negativer Nachrichten kann einen realen Trend anzeigen; sie kann aber auch aus gesteigerter Aufmerksamkeit, besserer Erfassung oder einer veränderten Berichtslogik resultieren. Erst die Analyse geeigneter Zeitreihen und Bezugsgrößen erlaubt eine belastbare Einordnung.
Eine evidenzorientierte Risikokultur fragt zunächst: Was wissen wir, was vermuten wir und welche Daten tragen diese Annahmen? Welche Grundgesamtheit und welcher Zeitraum wurden betrachtet? Handelt es sich um absolute Zahlen oder relative Häufigkeiten? Sehen wir eine kurzfristige Schwankung oder einen strukturellen Trend? Welche Gegenmaßnahmen sind bereits in den historischen Daten enthalten? Welche Korrelationen werden vorschnell als Ursachen interpretiert? Und wo endet der Bereich statistisch belastbarer Aussagen und beginnt die Zone echter Ungewissheit?
Gerade darin treffen sich Rosling, Fisher, Kahneman und die großen Wahrscheinlichkeitstheoretiker dieser Reihe: Gute Urteile entstehen nicht aus Lautstärke, sondern aus der sauberen Trennung von Befund, Interpretation und Spekulation.
Fazit und Ausblick
Genau an dieser Stelle wird die Serie über ihre historischen Figuren wieder gegenwartsnah. Die alten Denker liefern nicht bloß ehrwürdige Zitate, sondern Gegenmittel. Fisher erinnert daran, dass Design vor Rechenkunst kommt. Gosset, dass kleine Stichproben Vorsicht verlangen. Knight, dass nicht jede Unsicherheit in Wahrscheinlichkeiten übersetzt werden darf. De Finetti und Ramsey, dass Urteile explizit und kohärent sein müssen. Kolmogorow, dass selbst schlichte Wahrscheinlichkeitsaussagen konsistente Axiome brauchen. Mandelbrot, dass glatte Normalitätsannahmen gefährlich falsch sein können. Arrow, dass Informationsasymmetrien Märkte und Entscheidungen systematisch verzerren.
Mit anderen Worten: Gerade wenn die Gegenwart zu viel publiziert, zu schnell etikettiert und zu leicht in Datenfetischismus oder Modellgläubigkeit abgleitet, werden die alten Fundamente wieder akut. Sie zwingen zur Rückkehr auf den Boden der Methode: saubere Begriffe, saubere Daten, saubere Modelle, saubere Kritik. Das ist kein Rückschritt in die Vergangenheit, sondern eine Bedingung dafür, dass Data Analytics und AI nicht bloß leistungsfähige Werkzeuge bleiben, sondern Werkzeuge der Erkenntnis.
Vielleicht liegt hier die eigentliche Pointe dieser ganzen Serie. Die intellektuelle Zukunft entsteht selten aus dem Nichts. Sie entsteht meist dort, wo alte, robuste Einsichten auf neue Kontexte treffen. Wer heute Risiken modelliert, Szenarien bewertet, Bayes-Updates rechnet, kleine Stichproben interpretiert, Expertenurteile strukturiert, Portfolios aggregiert, Märkte simuliert oder "fat tails" ernst nimmt, steht fast immer auf Schultern, die sehr viel älter sind als die heutige Terminologie.
Das bedeutet nicht, dass die Gegenwart methodisch nichts Neues hervorbringt. Es bedeutet aber, dass Fortschritt in der Wissenschaft nicht mit modischer Sprache verwechselt werden darf. Wenn Forschung produktiver, klüger und relevanter werden soll, braucht sie nicht zuerst mehr Selbstbeschreibung, mehr Komiteesprache oder mehr akademische Lautstärke, sondern bessere Auswahl, härtere methodische Disziplin und mehr intellektuelle Urteilskraft.
Gerade hier lässt sich auch Richard Feynman anschließen. In seinem Vortrag "What is Science?" warnte er davor, Wissenschaft mit der verwässerten Rhetorik von Lehrbuchvorreden und methodischen Ersatzphilosophien zu verwechseln. Entscheidend sei, so Feynman, nicht bloß, dass man "Beobachtungen macht", sondern dass man ein Urteil darüber entwickelt, was überhaupt beobachtenswert ist und worauf die Aufmerksamkeit zu richten ist. Diese Bemerkung trifft den methodischen Kern der gesamten Serie. Ob bei Pascal, Bayes, de Finetti, Fisher, Knight oder Mandelbrot: Fortschritt begann nie mit Wortschwall, sondern mit der disziplinierten Auswahl der relevanten Frage, des relevanten Musters, des relevanten Gegenbeispiels.
Feynmans zweiter Gedanke ist kaum weniger wichtig. "Mathematics is looking for patterns", sagte er rückblickend über seine eigene Bildung. Genau darin liegt die tiefere Einheit zwischen historischer Wahrscheinlichkeitstheorie, modernem Risikomanagement, Data Analytics und Künstlicher Intelligenz. Alle diese Felder leben davon, in unübersichtlichen Daten, Beobachtungen und Erfahrungen tragfähige Muster zu erkennen – und zugleich zu wissen, wann ein scheinbares Muster nur Rauschen ist. Wo diese Unterscheidung verloren geht, wird Wissenschaft dekorativ; wo sie gelingt, wird sie erkenntnisfähig.
In diesem Zusammenhang wird dem Nobelpreisträger Max Perutz eine Antwort zugeschrieben. Auf die Frage, wie es ihm gelungen sei, aus seinem Labor neun Nobelpreisträger hervorzubringen, soll er gesagt haben: "Keine Politik, keine Komitees, keine Berichte, keine Gutachten, keine Interviews. Nur begabte, hoch motivierte Menschen, ausgewählt von einer kleinen Zahl von Männern mit guter Urteilskraft." Ob man den Wortlaut im letzten Detail verifizieren kann oder nicht, der Geist dieser Bemerkung trifft einen empfindlichen Punkt. Große Wissenschaft entsteht selten dort, wo Verwaltung mit Erkenntnis verwechselt wird. Sie entsteht dort, wo Methode, Mut, Kritik und Urteilskraft zusammenkommen.
Wer also aus dieser Serie eine zusammenfassende Lehre ziehen will, könnte sie so formulieren: Die Werkzeuge unserer Gegenwart sind nur dann stark, wenn ihre alten Fundamente ernst genommen werden. Und die Wissenschaft der Zukunft wird nur dann mehr sein als eine immer lautere Papiermaschine, wenn sie sich wieder stärker an jene knappe, harte und oft unmodische Tugend bindet, die fast alle großen Figuren dieser Serie verband: intellektuelle Redlichkeit.
Quellenverzeichnis sowie weiterführende Literaturhinweise:
- Arrow, Kenneth J. (1963): Uncertainty and the Welfare Economics of Medical Care. In: American Economic Review, Vol. 53, No. 5, S. 941–973.
- Bachelier, Louis (1900): Théorie de la spéculation. In: Annales scientifiques de l’École Normale Supérieure, Sér. 3, Tome 17, S. 21–86.
- Black, Fischer / Scholes, Myron (1973): The Pricing of Options and Corporate Liabilities, in: Journal of Political Economy, Vol. 81, No. 3, S. 637–654.
- Bloom, Nicholas / Jones, Charles I. / Van Reenen, John / Webb, Michael (2020): Are Ideas Getting Harder to Find? In: American Economic Review, Vol. 110, No. 4, S. 1104–1144.
- Feynman, Richard P. (1969): What is Science? In: The Physics Teacher, Vol. 7, No. 6, S. 313–320.
- Fisher, Ronald A. (1935): The Design of Experiments, Oliver & Boyd, Edinburgh.
- Ioannidis, John P. A. (2005): Why Most Published Research Findings Are False. In: PLOS Medicine, Vol. 2, No. 8, e124.
- Kahneman, Daniel / Tversky, Amos (1979): Prospect Theory: An Analysis of Decision under Risk, in: Econometrica, Vol. 47, No. 2, S. 263–291.
- Markowitz, Harry M. (1952): Portfolio Selection, in: Journal of Finance, Vol. 7, No. 1, S. 77–91.
- Merton, Robert C. (1973): Theory of Rational Option Pricing. In: Bell Journal of Economics and Management Science, Vol. 4, No. 1, S. 141–183.
- von Neumann, John / Morgenstern, Oskar (1944): Theory of Games and Economic Behavior, Princeton University Press, Princeton 1944.
- Park, Michael / Leahey, Erin / Funk, Russell J. (2023): Papers and Patents Are Becoming Less Disruptive over Time. In: Nature, Vol. 613, S. 138–144.
- Perutz, Max F. (1998): I Wish I’d Made You Angry Earlier: Essays on Science, Scientists, and Humanity. Cold Spring Harbor Laboratory Press, Cold Spring Harbor.
- Popper, Karl R. (1971): Wider die großen Worte. In: Die Zeit, 24. September 1971; später erneut in: Auf der Suche nach einer besseren Welt.
- Romeike, Frank / Hager, Peter (2020): Erfolgsfaktor Risikomanagement 4.0: Methoden, Beispiele, Checklisten – Praxishandbuch für Industrie und Handel, 4. komplett überarbeitete Auflage, Springer Verlag, Wiesbaden 2020.
- Romeike, Frank / Stallinger, Manfred (2021): Stochastische Szenariosimulation in der Unternehmenspraxis - Risikomodellierung, Fallstudien, Umsetzung in R, Springer Verlag, Wiesbaden 2021.
- Rosling, Hans / Rosling, Ola / Rosling Rönnlund, Anna (2018): Factfulness: Ten Reasons We’re Wrong About the World – and Why Things Are Better Than You Think, Sceptre, London 2018.


