并非所有关于食品的科学研究都有同样的分量。科学界按照一座证据金字塔为研究分级:顶端是随机对照试验的系统综述,底部是细胞研究和动物研究。那些引用「一项研究」来支撑某个食品警报的人,几乎总是从金字塔的下半部分取材。七个问题就足以拆解营养领域里90%的流行说法。

这发生在餐桌上的争论里,发生在某条 reel 下面的评论里,发生在有人又一次转发食品警报的 WhatsApp 群里。到了某个时刻,当论据用尽,那句话就出现了:「去读研究吧。」

这句话很有力量。它能终结对话,让对方难堪,传达出一种懂的人面对不懂的人的姿态。它只有一个问题:在大多数情况下,说这句话的人并没有读过任何研究。他读的是一个标题。他看的是一条 reel。他听来的是某个人从另一个人那里听来的说法。而那句「去读研究吧」,并不是一种求知的邀请。它是一件修辞的武器。它的用处是赢下一场争论,而不是寻找真相。

这篇文章写给那些下一次听到这句话时,希望手里握着工具、能够用一个简单而致命的问题回应的人:「哪一项研究?它在金字塔的哪一层?」

因为金字塔确实存在。它是真实的。它是国际科学界根据研究的可靠程度为其分级的方式——也就是根据它们能否告诉你一件事是否真的导致了另一件事,还是只是一种印象。并非所有研究都一样。而理解这个差别,是你能培养的最有用的能力:它让你不会被那些把食物当作宗教来谈论的人糊弄。

这座金字塔有十层。顶端是少数分量最重的研究。底部是大量分量较轻的工作——不是因为它们没有用,而是因为单靠它们无法证明任何确定的结论。越往上走,能找到的研究越少,因为顶端的研究耗资数百万、历时多年、需要数千人参与。越往下走,能找到的研究越多,因为它们做起来更容易也更快。关键正在这里:当某位大师引用「一项研究」时,他几乎总是从下半部分取材。

我们从底部开始,一层一层往上走。

最底层是试管里的细胞研究和动物研究(专业术语叫体外研究和动物模型研究:前者在实验室里用分离出来的细胞进行,后者用小鼠、大鼠或其他动物进行)。它们对于理解一种生物机制如何运作是基础性的——一种物质如何与细胞相互作用,给小鼠喂下某种分子时它的肝脏里会发生什么。但它们无法告诉你,一个正常吃饭的人身上会发生什么。小鼠不是人。培养皿里的细胞不是一个生命体。尤其是,这类实验中使用的剂量,往往比你正常吃饭所摄入的量高出几百倍甚至几千倍。当有人引用一项小鼠研究对你说「这会致癌」,他做的是一次巨大的逻辑跳跃——就像说,既然一辆车以每小时300公里行驶会撞毁,那么以每小时50公里开车就是危险的。

再上一层是专家意见、叙述性综述和共识声明(英文是 expert opinion、narrative review、consensus statement:这类文本由一位或多位专家就某个议题陈述自己的观点,自行决定引用哪些研究、忽略哪些研究,没有一套系统的筛选方法)。它们有自己的价值:它们给你一个熟悉这个领域的人的视角。但它们在定义上就是主观的。专家自己选择纳入什么、排除什么。如果他持有一个强烈的观点——或者存在利益冲突——他的筛选就会带有倾向。这不是科学。这是一种权威的看法。这个区别很重要。

接下来是生态学研究和病例报告(生态学研究比较整个人群的数据,比如「橄榄油消费更多的国家心梗更少」;病例报告则是对某一位患者或一小群患者身上所发生情况的详细描述)。生态学研究正是制造报纸大标题的那一类,因为数字看上去很惊人,结论看上去很清楚。问题在于,比较整个国家会掩盖上千个变量:气候、遗传、医疗体系、生活方式。意大利的心梗比北欧少,并不能证明橄榄油是原因——也可能是气候,是人与人之间的往来,是工作的类型,还有另外一百种可能。病例报告的用处则在于提示某种新的或不寻常的现象,但它只是一个个案。从一个个案无法推广到全体。

继续往上。横断面研究(cross-sectional study:在一个确定的时间点为一个人群拍下照片,同时测量暴露因素和结果)告诉你两件事同时存在,却不告诉你哪一件先发生。如果你拍下这张照片,看到吃蔬菜更多的人也更瘦,你不能由此得出蔬菜让人变瘦的结论。也可能正好相反:更瘦的人出于上千种理由,倾向于吃更多蔬菜。原因和结果纠缠在一起,你无法把它们分开。

接着是回顾性研究和病例对照研究(retrospective cohort 与 case-control study:前者选取一群人,回溯过去重建他们吃过什么;后者从已经患病的人出发,与没有患病的人作比较,在过去的经历中寻找差异)。它们比横断面研究更有信息量,因为至少试图重建一条时间顺序。但回头看总是比向前看更不精确。人们连昨天吃了什么都记不准,何况十年前。而已经患病的人往往会——并非有意地——更多地记起那些他认为可能导致了疾病的习惯。

前瞻性队列研究(prospective cohort study:选取一大群健康的人,记录他们今天吃什么,然后跟踪他们许多年——有时是几十年——看谁生了病、谁没有)是观察性研究中第一个真正扎实的层级。这里没有人去干预这些人的饮食:只是观察他们,仅此而已。优势在于时间顺序是清楚的——先有暴露,后有结果。局限在于,观察不等于控制。可能存在上千个隐藏因素解释了这个结果。吃鱼更多的人也许同时更富有、受教育程度更高、总体上更注意健康——造成差别的也许正是这些,而不是鱼。

质的飞跃出现在这里。观察性研究的系统综述与荟萃分析(systematic review + meta-analysis:一组研究者围绕一个具体问题检索所有可获得的研究,按照严格且预先设定的标准加以筛选,然后用数学方法合并它们的结果,得到一个更精确的统一答案)把某个议题上已有的一切——几十项、有时几百项研究——汇总成一份综合。这就像在一场审判里听取全部证词,而不是只听其中一份。它的力量在于数量和方法:不是由你来挑选纳入哪些研究,而是把所有符合标准的都纳入。局限在于,如果底层的研究全都是观察性的,那么这份综合依然是观察性的。你可以得到一百项弱研究的平均值,但弱研究的平均值不会变成一个强的结论。

再往上是非随机对照实验和社区干预研究(non-randomized intervention study 与 cluster trial:前者比较两个组,一个接受干预,一个不接受,但没有随机分配;后者对整个社区进行干预,比如一所学校或一个街区,并在集体层面测量效果)。它们是一种进步,因为这里有人主动做了干预——改变饮食,改变学校的菜单,改变食品的供应——但分配上缺少随机性,使得结果不那么干净。

于是我们来到很多人视为参照标准的层级:随机对照试验(randomized controlled trial,缩写为 RCT:选取一群人,把他们随机分成两组,一组接受干预——一种饮食、一种食物、一种补充剂——另一组不接受,然后比较结果)。随机分组是关键所在:它在理论上消除了所有那些在观察性研究中污染结果的隐藏变量。如果你把一千个人随机分开,给其中一半橄榄油,另一半不给,那么收入、教育、遗传和生活方式上的差异会平均地分布在两个组里。剩下的就是橄榄油的作用。还有一种更精确的变体是交叉试验,同一批人在不同的时间段里既接受干预也充当对照——这样每个人都成了自己的对照。营养学中随机对照试验的局限是现实层面的:你不可能让一个人连续二十年吃同样的东西,只为了看他是不是生病更少。它们耗资数百万。它们持续很久。而且常常在伦理上不可行。

金字塔的顶端是随机对照试验的系统综述,再往上是伞形综述——综述的综述,也就是把某个议题上所有已有的综合再汇总一次的研究。它们是营养科学中可获得的最高确定性。它们并非不会出错——没有什么是不会出错的——但当一篇高质量的伞形综述说出某件事时,这件事所经过的验证层级,比任何其他可能的说法都要多。

就是这样。这就是那座金字塔。现在才轮到真正重要的部分。

当有人对你说「去读研究吧」,而你问他是哪一项研究时,可能发生三件事。第一:他答不上来,因为他没有读过任何研究。第二:他引用金字塔下半部分的某样东西——一项小鼠实验、一份病例报告、一位专家的意见——并把它当作决定性的证据呈现给你。第三种最少见:他确实引用了一项扎实的研究。那样的话,值得称赞。但即便如此,下一个问题是:那项研究与其余的证据一致吗,还是一个被用来抹掉规律的例外?

因为食品信息误导几乎总是以同样的方式运作。取出单独一项研究——也许是真实存在的,也许结论本身也成立——然后把它从语境里抽离出来。忽略其余的一切。把相关性和因果混为一谈:两件事同时发生,并不意味着其中一件引起了另一件。用实验室里的剂量去吓唬那些吃着正常分量的人。引用一些看上去很惊人、在现实生活中却几乎没有任何意义的数字——在一个十万人的队列里,0.3%的统计学差异对报纸来说是一个完美的标题,却不会让你个人的风险改变一毫米。

如果你想保护自己,七个问题就够了。这也是研究者在读一篇论文时会问自己的那些问题。不需要特别的专业能力。只需要不满足于标题的意愿。

这是哪一类研究?它在多少人身上进行?持续了多长时间?做在人身上还是动物身上?谁资助了它?结果是否被其他独立的研究证实过?还有,测得的效应在现实生活中真的重要吗,还是一个小到不会改变你一天的差别?

这七个问题,如果坚持使用,能拆解你在外面遇到的百分之九十的说法。不是因为这些说法全都是假的——有些是真的,很多是部分真实的——而是因为它们被传播的方式几乎总是扭曲的。取出一小块真相,把它吹胀到看起来像一个绝对的确定。科学不是这样运作的。科学靠积累运作:每一项研究增加一块,只有当许多块指向同一个方向时,才可以开始谈论扎实的证据。

正是在这里,这个话题与我们之前谈过的食品标签、应用程序、评分系统重新连接了起来。它们都是工具。科学研究也是一件工具。没有任何一项研究能够单独了结一个问题——金字塔顶端的那些也不能。所有研究的目的是积累知识并做出总结。对你说「这已经被证明了」的人,几乎总是在简化。对你说「去读研究吧」的人,几乎总是没有读过。而真正理解研究如何运作的人,恰恰是说话最谨慎的那一个——因为他知道,谨慎不是软弱。谨慎是能力。

还有一点值得带回家。「在金字塔的上层」并不自动等于正确。一项做得很糟的对照试验——参与的人很少,标准有问题,资助研究的人对某个结果怀有利益——它的分量不如一项在几万人身上严格进行、跟踪了二十年的观察性研究。金字塔为方法的潜力分级,而不是为执行的质量分级。同样地,「在金字塔的下层」也不等于没有用。细胞研究和动物研究对于理解机制是不可或缺的,它们产生假设,更大规模的研究再建立在这些假设之上。问题只在于,当有人用它们来告诉你盘子里该放什么——跳过中间所有的步骤。

下一次你听到「去读研究吧」,不要垂下目光。抬起你的问题。