Nicht alle wissenschaftlichen Studien über Lebensmittel haben denselben Wert. Die Wissenschaftsgemeinschaft ordnet die Forschung nach einer Evidenzpyramide: An der Spitze stehen die systematischen Übersichtsarbeiten randomisierter Studien, an der Basis die Untersuchungen an Zellen und Tieren. Wer „eine Studie“ zitiert, um einen Lebensmittelalarm zu stützen, schöpft fast immer aus der unteren Hälfte. Sieben Fragen genügen, um 90 % der Behauptungen zu entkräften, die über Ernährung kursieren.

Es passiert in den Gesprächen bei Tisch, in den Kommentaren unter einem Reel, in den WhatsApp-Gruppen, in denen jemand den x-ten Lebensmittelalarm geteilt hat. Irgendwann, wenn die Argumente ausgehen, kommt der Satz: „Lies die Studien.“

Das ist ein mächtiger Satz. Er beendet das Gespräch, bringt den anderen in Verlegenheit, vermittelt das Bild von dem, der Bescheid weiß, gegen den, der nicht Bescheid weiß. Er hat nur ein Problem: In den meisten Fällen hat der, der ihn ausspricht, keine einzige Studie gelesen. Er hat eine Überschrift gelesen. Er hat ein Reel gesehen. Er hat jemanden gehört, der jemanden gehört hat. Und dieser Satz, „lies die Studien“, ist keine Einladung zum Wissen. Er ist eine rhetorische Waffe. Er dient dazu, eine Diskussion zu gewinnen, nicht dazu, die Wahrheit zu suchen.

Dieser Artikel ist für alle, die beim nächsten Mal, wenn sie diesen Satz hören, das Werkzeug haben wollen, um mit einer einfachen und vernichtenden Frage zu antworten: „Welche Studie? Und wo steht sie in der Pyramide?“

Denn die Pyramide gibt es. Sie ist real. Sie ist die Art, wie die internationale Wissenschaftsgemeinschaft die Forschung nach ihrer Verlässlichkeit ordnet — also danach, wie gut sie dir sagen kann, ob eine Sache wirklich eine andere verursacht oder ob es nur ein Eindruck ist. Nicht alle Studien sind gleich. Und den Unterschied zu verstehen ist die nützlichste Kompetenz, die du dir aneignen kannst, um dich nicht von denen täuschen zu lassen, die über Essen reden, als wäre es eine Religion.

Die Pyramide hat zehn Ebenen. An der Spitze stehen die wenigen Studien, die am meisten wiegen. An der Basis steht die Masse der Arbeiten, die weniger wiegen — nicht weil sie nutzlos wären, sondern weil sie allein nichts Endgültiges beweisen können. Je höher du steigst, desto weniger Studien findest du, denn die an der Spitze kosten Millionen, dauern Jahre und brauchen Tausende von Menschen. Je tiefer du gehst, desto mehr Studien findest du, weil sie leichter und schneller durchzuführen sind. Und genau hier liegt der Punkt: Wenn ein Guru „eine Studie“ zitiert, schöpft er fast immer aus der unteren Hälfte.

Fangen wir unten an und steigen wir nach oben.

Im Erdgeschoss stehen die Untersuchungen an Zellen im Reagenzglas und an Tieren (im Fachjargon heißen sie In-vitro-Studien und Tiermodellstudien: die einen werden im Labor an isolierten Zellen durchgeführt, die anderen an Mäusen, Ratten oder anderen Tieren). Sie sind grundlegend, um zu verstehen, wie ein biologischer Mechanismus funktioniert — wie ein Stoff mit einer Zelle interagiert, was in der Leber einer Maus passiert, wenn man ihr ein bestimmtes Molekül gibt. Aber sie sagen dir nichts darüber, was bei einem Menschen passiert, der normal isst. Eine Maus ist kein Mensch. Eine Zelle in einer Schale ist kein Organismus. Und vor allem sind die Dosen in diesen Experimenten oft hundert- oder tausendmal höher als die, die du beim Essen aufnehmen würdest. Wenn dir jemand sagt „das verursacht Krebs“ und dabei eine Studie an Mäusen zitiert, macht er einen gewaltigen gedanklichen Sprung — so, als würde man sagen, weil ein Auto bei 300 km/h zerstört wird, sei es gefährlich, mit 50 zu fahren.

Eine Stufe darüber stehen die Expertenmeinungen, die narrativen Übersichtsarbeiten und die Konsenspapiere (auf Englisch: expert opinion, narrative review, consensus statement — Texte, in denen ein oder mehrere Fachleute ihren Standpunkt zu einem Thema darlegen und dabei auswählen, welche Studien sie zitieren und welche sie ignorieren, ohne eine systematische Methode für diese Auswahl). Sie haben einen Wert: Sie geben dir die Perspektive von jemandem, der das Feld kennt. Aber sie sind per Definition subjektiv. Der Experte entscheidet, was hineinkommt und was draußen bleibt. Wenn er eine starke Meinung hat — oder einen Interessenkonflikt —, wird seine Auswahl tendenziös sein. Das ist keine Wissenschaft. Das ist eine fundierte Meinung. Der Unterschied zählt.

Dann kommen die ökologischen Studien und die Fallberichte (die ökologische Studie vergleicht Daten ganzer Bevölkerungen — zum Beispiel: „Die Länder, die mehr Olivenöl verbrauchen, haben weniger Herzinfarkte“; der case report ist die detaillierte Beschreibung dessen, was bei einem einzelnen Patienten oder bei einer kleinen Gruppe passiert ist). Die ökologische Studie ist die, aus der die großen Schlagzeilen entstehen, weil die Zahlen riesig und die Schlussfolgerungen klar erscheinen. Das Problem ist, dass der Vergleich ganzer Länder tausend Variablen verdeckt: Klima, Genetik, Gesundheitssystem, Lebensstil. Dass Italien weniger Herzinfarkte hat als Nordeuropa, beweist nicht, dass das Olivenöl die Ursache ist — es könnte das Klima sein, das soziale Leben, die Art der Arbeit, hundert andere Dinge. Der Fallbericht wiederum ist nützlich, um etwas Neues oder Ungewöhnliches zu melden, aber er ist ein Einzelfall. Von einem einzigen lässt sich nicht verallgemeinern.

Steigen wir weiter. Die Querschnittsstudien (cross-sectional study: Man fotografiert eine Bevölkerung in einem bestimmten Moment und misst Exposition und Wirkung gleichzeitig) sagen dir, dass zwei Dinge nebeneinander bestehen, aber sie sagen dir nicht, welches zuerst da war. Wenn du eine Momentaufnahme machst und siehst, dass die Menschen, die mehr Gemüse essen, auch schlanker sind, kannst du daraus nicht schließen, dass Gemüse schlank macht. Es könnte umgekehrt sein: Wer schlanker ist, neigt aus tausend Gründen dazu, mehr Gemüse zu essen. Ursache und Folge sind ineinander verknäuelt, und du kannst sie nicht trennen.

Dann kommen die retrospektiven Studien und die Fall-Kontroll-Studien (retrospective cohort und case-control study: Bei der ersten nimmt man eine Gruppe von Menschen und geht in der Zeit zurück, um zu rekonstruieren, was sie gegessen haben; bei der zweiten geht man von denen aus, die bereits krank sind, und vergleicht sie mit denen, die es nicht sind, auf der Suche nach Unterschieden in der Vergangenheit). Sie sind aufschlussreicher als die Querschnittsstudien, weil sie wenigstens versuchen, eine zeitliche Abfolge zu rekonstruieren. Aber zurückzuschauen ist immer ungenauer, als nach vorn zu schauen. Die Menschen erinnern sich schlecht daran, was sie gestern gegessen haben, geschweige denn vor zehn Jahren. Und wer bereits krank ist, neigt dazu — unfreiwillig —, sich stärker an die Gewohnheiten zu erinnern, von denen er glaubt, sie könnten zur Krankheit beigetragen haben.

Die prospektive Kohortenstudie (prospective cohort study: Man nimmt eine große Gruppe gesunder Menschen, erfasst, was sie heute essen, und begleitet sie dann über Jahre — manchmal Jahrzehnte —, um zu sehen, wer erkrankt und wer nicht) ist die erste wirklich solide Ebene unter den Beobachtungsstudien. Hier greift niemand in die Ernährung der Menschen ein: Man beobachtet sie, mehr nicht. Der Vorteil ist, dass die zeitliche Abfolge klar ist — zuerst kommt die Exposition, dann die Wirkung. Die Grenze ist, dass Beobachten nicht Kontrollieren ist. Es kann tausend verborgene Faktoren geben, die das Ergebnis erklären. Wer mehr Fisch isst, ist vielleicht auch wohlhabender, gebildeter, insgesamt gesundheitsbewusster — und vielleicht ist es das, nicht der Fisch, was den Unterschied macht.

Hier kommt der Qualitätssprung. Die systematischen Übersichtsarbeiten mit Metaanalyse von Beobachtungsstudien (systematic review + meta-analysis: Eine Gruppe von Forschern sucht alle verfügbaren Studien zu einer bestimmten Frage, wählt sie nach strengen und vorab festgelegten Kriterien aus und fasst ihre Ergebnisse dann mathematisch zusammen, um eine einzige, genauere Antwort zu erhalten) nehmen alles, was es zu einem Thema gibt — Dutzende, manchmal Hunderte von Studien —, und machen daraus eine Synthese. Das ist, als würde man alle Zeugenaussagen eines Prozesses anhören statt nur eine einzige. Die Stärke liegt in der Menge und in der Methode: Du entscheidest nicht, welche Studien hineinkommen, du nimmst alle auf, die die Kriterien erfüllen. Die Grenze ist, dass die Synthese eine Beobachtungssynthese bleibt, wenn alle zugrunde liegenden Studien Beobachtungsstudien sind. Du kannst den Mittelwert von hundert schwachen Studien haben, aber ein Mittelwert schwacher Studien wird kein starker Befund.

Darüber finden wir die nicht randomisierten kontrollierten Experimente und die Interventionen an Gemeinschaften (non-randomized intervention study und cluster trial: Bei der ersten vergleicht man zwei Gruppen — eine erhält die Intervention, die andere nicht —, aber ohne zufällige Zuteilung; bei der zweiten interveniert man in ganzen Gemeinschaften, etwa einer Schule oder einem Stadtviertel, und misst die Wirkung auf kollektiver Ebene). Sie sind ein Schritt nach vorn, weil hier jemand aktiv eingreift — die Ernährung ändert, das Schulmenü, das Lebensmittelangebot —, aber das Fehlen der Zufälligkeit bei der Zuteilung macht die Ergebnisse weniger sauber.

Und wir kommen zu der Ebene, die viele als den Bezugspunkt betrachten: die randomisierte kontrollierte Studie (randomized controlled trial, abgekürzt RCT: Man nimmt die Menschen, teilt sie zufällig in zwei Gruppen, gibt der einen die Intervention — eine Ernährungsweise, ein Lebensmittel, ein Nahrungsergänzungsmittel — und der anderen nicht, und vergleicht dann die Ergebnisse). Die zufällige Aufteilung ist der entscheidende Punkt: Sie beseitigt — theoretisch — alle verborgenen Variablen, die in den Beobachtungsstudien die Ergebnisse verunreinigen. Wenn du tausend Menschen zufällig aufteilst und der einen Hälfte Olivenöl gibst und der anderen nicht, verteilen sich die Unterschiede in Einkommen, Bildung, Genetik und Lebensstil gleichmäßig auf die beiden Gruppen. Was bleibt, ist die Wirkung des Öls. Eine noch genauere Variante ist die Crossover-Studie, bei der dieselben Menschen zu verschiedenen Zeitpunkten sowohl die Behandlung als auch die Kontrolle durchlaufen — so wird jede Person zum Vergleich mit sich selbst. Die Grenze der RCT in der Ernährungsforschung ist praktischer Natur: Du kannst niemanden zwanzig Jahre lang dasselbe essen lassen, um zu sehen, ob er seltener krank wird. Sie kosten Millionen. Sie dauern sehr lange. Und oft sind sie ethisch nicht durchführbar.

An der Spitze der Pyramide stehen die systematischen Übersichtsarbeiten randomisierter kontrollierter Studien und, noch darüber, die Umbrella Reviews — Übersichtsarbeiten von Übersichtsarbeiten, also Studien, die alle vorhandenen Synthesen zu einem Thema zusammenfassen. Sie sind der höchste Grad an Sicherheit, der in der Ernährungswissenschaft verfügbar ist. Sie sind nicht unfehlbar — nichts ist das —, aber wenn eine hochwertige Umbrella Review etwas sagt, hat dieses Etwas mehr Prüfebenen durchlaufen als jede andere mögliche Aussage.

So. Das ist die Pyramide. Und jetzt kommt der Teil, auf den es wirklich ankommt.

Wenn dir jemand sagt „lies die Studien“ und du ihn fragst, welche Studie, können drei Dinge passieren. Das erste: Er kann nicht antworten, weil er keine einzige Studie gelesen hat. Das zweite: Er zitiert dir etwas aus der unteren Hälfte der Pyramide — ein Experiment an Mäusen, einen Fallbericht, die Meinung eines Experten — und stellt es dar, als wäre es ein endgültiger Beweis. Das dritte, das seltenste: Er zitiert dir tatsächlich eine solide Studie. In dem Fall: Glückwunsch. Aber auch dort lautet die nächste Frage: Passt diese Studie zum Rest der Evidenz, oder ist sie die Ausnahme, die benutzt wird, um die Regel zu streichen?

Denn die Ernährungsdesinformation funktioniert fast immer auf dieselbe Weise. Man nimmt eine einzelne Studie — vielleicht eine echte, vielleicht eine zutreffende — und reißt sie aus dem Zusammenhang. Man ignoriert alles andere. Man verwechselt Korrelation mit Ursache: Dass zwei Dinge zusammen auftreten, bedeutet nicht, dass das eine das andere auslöst. Man benutzt Labordosen, um die zu erschrecken, die normale Mengen essen. Man zitiert Zahlen, die riesig wirken, im wirklichen Leben aber fast nichts bedeuten — ein statistischer Unterschied von 0,3 % in einer Kohorte von hunderttausend Menschen ergibt eine perfekte Zeitungsschlagzeile und verändert dein persönliches Risiko um keinen Millimeter.

Wenn du dich schützen willst, genügen sieben Fragen. Es sind dieselben, die sich ein Forscher stellt, wenn er eine Arbeit liest. Es braucht keine besonderen Fachkenntnisse. Es braucht nur den Willen, sich nicht mit der Überschrift zufriedenzugeben.

Was für eine Studie ist es? An wie vielen Menschen wurde sie durchgeführt? Über welchen Zeitraum? Wurde sie an Menschen oder an Tieren durchgeführt? Wer hat sie finanziert? Sind die Ergebnisse von anderen, unabhängigen Studien bestätigt worden? Und ist die gemessene Wirkung im wirklichen Leben wirklich relevant, oder ist es ein so kleiner Unterschied, dass er an deinem Tag nichts ändert?

Diese sieben Fragen, mit Beharrlichkeit angewandt, entkräften neunzig Prozent der Behauptungen, die dir begegnen. Nicht weil die Behauptungen alle falsch wären — manche sind wahr, viele sind teilweise wahr —, sondern weil die Art, wie sie vermittelt werden, fast immer verzerrt ist. Man nimmt ein Stückchen Wahrheit und bläst es auf, bis es wie eine absolute Gewissheit aussieht. So funktioniert die Wissenschaft nicht. Die Wissenschaft funktioniert durch Anhäufung: Jede Studie fügt ein Stück hinzu, und erst wenn viele Stücke in dieselbe Richtung weisen, kann man anfangen, von solider Evidenz zu sprechen.

Und hier schließt sich der Kreis zu allem, was wir über die Etiketten, über die Apps, über die Bewertungssysteme gesagt haben. Das sind alles Werkzeuge. Die wissenschaftliche Forschung ist ein Werkzeug. Keine Studie schließt für sich allein eine Frage ab — nicht einmal die an der Spitze der Pyramide. Der Zweck aller Studien ist, Wissen anzuhäufen und Bilanz zu ziehen. Wer dir sagt „das ist bewiesen“, vereinfacht fast immer. Wer dir sagt „lies die Studien“, hat sie fast immer nicht gelesen. Und wer wirklich verstanden hat, wie die Forschung funktioniert, ist genau der, der mit der größten Vorsicht spricht — weil er weiß, dass Vorsicht keine Schwäche ist. Sie ist Kompetenz.

Eine Sache noch, die es wert ist, mitgenommen zu werden. „Hoch in der Pyramide“ bedeutet nicht automatisch wahr. Ein schlecht gemachtes kontrolliertes Experiment — mit wenigen Menschen, mit falschen Kriterien, mit einem Geldgeber, der ein Interesse an einem bestimmten Ergebnis hat — ist weniger wert als eine mit Sorgfalt durchgeführte Beobachtungsstudie an Zehntausenden von Menschen, die zwanzig Jahre lang begleitet wurden. Die Pyramide ordnet das Potenzial der Methode, nicht die Qualität der Ausführung. Und genauso bedeutet „niedrig in der Pyramide“ nicht nutzlos. Die Studien an Zellen und an Tieren sind unverzichtbar, um die Mechanismen zu verstehen und die Hypothesen zu erzeugen, auf denen dann die größeren Studien aufgebaut werden. Das Problem entsteht erst, wenn jemand sie benutzt, um dir zu sagen, was du dir auf den Teller legen sollst — und dabei alle Zwischenschritte überspringt.

Wenn du das nächste Mal „lies die Studien“ hörst, senk nicht den Blick. Heb die Frage.