跳至主要內容

运动科学研究方法入门:如何读懂论文(教练带你看穿「研究证实」四个字)

訓練科學

运动科学研究方法入门:如何读懂论文(教练带你看穿「研究证实」四个字)

前几年带一位业余公路车手备战武岭,他每周都拿一份刚翻译完的「最新研究」来问我:「教练,这篇说喝甜菜根汁可以多出 2% 功率,我要不要囤一箱?」下一周又换成「这篇说间歇要练 30-15、不要练 4×4」。我看了看他手机里那些截屏,很多其实是同一个实验、被三个不同的健身粉专改写成三种对立的结论。那天我没有直接回答他该不该喝甜菜根汁,而是花了一个小时,教他怎么把一篇研究从头读到尾——因为在信息爆炸的年代,「会不会读论文」比「读过几篇论文」重要太多了

这篇文章,就是我这些年带学员、也带自己看文献累积下来的一套「入门读论文法」。我不会把你变成统计学家,但我希望读完之后,下次你再看到「研究证实」四个字,能够冷静地问出三个问题:这是什么等级的研究?它说的「显著」是统计显著还是真的有用?中间有没有藏着常见的陷阱?

为什么要学会自己读论文

先讲一个残酷的现实:运动科学的媒体转译,失真率高得吓人。一篇原本结论写得很保守的论文——「在这 12 位训练有素的自行车手身上,短期补充后观察到功率些微上升,但需要更大样本验证」——经过媒体、粉专、业配三手转述之后,往往变成「科学证实 XX 让你变强 2%」。

问题出在哪里?运动科学有几个先天限制,让它特别容易被过度解读:

  • 样本数普遍很小:招募愿意接受严格控制、抽血、耗竭测试的运动员很困难,很多研究只有 8 到 15 人。
  • 个体差异巨大:同一份间歇课表,有人进步 10%,有人原地踏步,甚至有人退步(这叫「反应者/无反应者」现象)。平均值会把这种差异洗掉。
  • 难以双盲:你很难让受试者不知道自己在做高强度间歇还是在休息。
  • 短期指针代替长期表现:实验室量的是 30 秒功率或乳酸阈值,但你真正在乎的是三个月后爬武岭快不快,这中间有一大段转换的鸿沟。

所以我常跟学员说:读论文不是为了找到一个圣旨照着做,而是为了培养一种「合理怀疑」的肌肉。 你不需要否定所有研究,但要知道每个结论背后的信心水准有多高。

还有一个更务实的理由:你的时间、金钱和身体都很宝贵。每一个「研究证实」的宣称,背后都可能要你付出代价——买一罐补剂、改一套课表、多受一轮苦。如果不会判读,你很可能把有限的资源,砸在那些「统计上显著、实际上没差」的东西上,反而排挤了真正该做的基本功:睡眠、规律训练、循序渐进、把补给练顺。会读论文,本质上是一种帮你分配资源的能力。

观念基础一:研究设计的证据层级

这是最重要、也最容易被忽略的一件事。不是所有「研究」的份量都一样。在实证医学里有一个广为使用的概念叫「证据层级」(hierarchy of evidence / levels of evidence),它把研究设计依照「推论因果的可信度」由低到高排列。这个金字塔已经有超过 80 种版本被提出过,细节各有出入,但大架构相当一致。

我把常见的层级整理成下面这张表,并附上运动场景的白话解读:

证据层级 研究设计 白话理解 运动场景举例
最高 系统性回顾/统合分析(Systematic Review / Meta-analysis) 把一堆设计严谨的实验搜集起来一起分析 「汇整 25 篇咖啡因对耐力表现研究」
随机对照试验(RCT) 随机分组、有对照组,能推论因果 「随机把车手分成补充组与安慰剂组」
世代研究(Cohort) 长期追踪一群人,但没随机分组 「追踪 500 位跑者五年,看谁受伤」
中低 病例对照研究(Case-control) 从结果回头找原因 「比较有无跟腱断裂者的训练习惯」
横断面研究(Cross-sectional) 某个时间点的快照 「调查现在多少人用功率计」
更低 病例报告/系列(Case report/series) 几个个案的描述 「一位选手用某方法后破 PR」
最低 动物实验/体外实验、专家意见 老鼠或细胞层级、个人看法 「小鼠实验显示某成分…」

(依据 Wikipedia: Hierarchy of evidenceUC Davis Levels of Evidence 整理)

这张表要怎么用?我教学员一个超简单的心法:看到「研究证实」四个字,先问「这是金字塔的哪一层?」 如果一个耸动的结论只来自一篇小鼠实验或一个个案报告,那它的份量跟一篇集成了 20 个 RCT 的统合分析,完全不在同一个等级。

为什么「随机」和「对照」这么关键

我用一个学员的真实情境改编来解释。假设我让十位跑者连续八周吃某款新的能量胶,结果他们平均 10 公里成绩进步了 90 秒。这证明能量胶有效吗?

不能。 因为这八周里发生了太多事:他们本来就在练、天气从酷暑转凉、他们知道自己在做实验所以更认真(安慰剂效应)、刚好避开了受伤。这些全部混在一起,我根本分不清那 90 秒是能量胶的功劳,还是其他因素。

「对照组」的意义,就是让另一群条件相似的人,做一模一样的事、只差没吃那款能量胶(或吃外观一样的安慰剂)。「随机分组」则是确保两组人一开始的体能、年龄、认真程度大致平均,不会因为我偷偷把强的都分到能量胶组而作弊。有了随机与对照,我才能比较有把握地说:两组的差异,比较可能是能量胶造成的。

这也是为什么我对「我朋友这样练有效」「某网红亲测」这类说法非常保留——不是说它们一定错,而是它们几乎不可能排除上面那一大堆干扰因素。

盲化与安慰剂:为什么「你以为的」会偷偷变强

再补一个很多人忽略的关键字:盲化(blinding)。所谓单盲,是受试者不知道自己被分到哪一组;双盲,是连量测、发放的研究人员也不知道。为什么要这么麻烦?因为人的期待本身就会影响表现。

我带过一个很生动的例子。有一次我让两位程度接近的学员做同一份阈值间歇,我「不小心」让其中一位以为他喝的运动饮料是「新配方、实验室证实能延迟疲劳」,其实两瓶一模一样。结果那位「以为喝到神饮料」的学员,主观疲劳分数明显较低,还多撑了一组。这不是他在骗人,是大脑的预期真的改变了他对痛苦的感受——这就是安慰剂效应的威力。

所以当一篇补剂或装备研究没有安慰剂对照、没有盲化时,你要非常小心:它量到的「进步」,有很大一块可能纯粹来自「受试者知道自己在用好东西」的心理加成。在耐力运动这种高度依赖主观撑不撑得下去的项目,这个效应大到不容忽视。

观念基础二:统计显著 ≠ 实际有意义

这是整篇文章我最想让你记住的一段。很多人看到论文写「p < 0.05,达统计显著」就以为「哇这很有效」。这是天大的误会。

先讲 p 值到底是什么。p 值回答的问题是:「假设这个效果实际上根本不存在(虚无假设为真),那我观察到眼前这么大、甚至更大的差异的几率有多高?」如果这个几率很低(惯例上 < 0.05),研究者就说「这个效果不太可能是零」。

请注意——p 值只告诉你「效果大概不是零」,它完全没告诉你「效果有多大」。 这是关键中的关键。

而这里藏着一个致命陷阱:只要样本数够大,任何微不足道的差异都可以达到统计显著。 统计学家常举的例子是:一个补习方案让百分制考试分数平均提高 0.5 分,只要收集够多样本,这 0.5 分也可以「p < 0.05」——但没有任何一位校长会为了 0.5 分去大改预算。(见 Statistics By Jim: Practical vs. Statistical Significance

那要看什么?效果量(Effect Size)

要知道「效果到底有多大、值不值得你改变训练」,要看的是效果量,最常见的指针叫 Cohen’s d。它把差异用标准差为单位标准化,方便跨研究比较。一个常被引用的粗略分级是:

Cohen’s d 效果大小 白话翻译
约 0.2 有差,但可能小到你根本感觉不到
约 0.5 开始值得注意
约 0.8 以上 明显、通常实务上有意义

(依据 Statistics By Jim 说明整理;APA 格式要求每个 p 值旁都要报告效果量)

所以下次读论文,养成一个习惯:先找效果量,再看 p 值。 一篇「p < 0.001 但 Cohen’s d 只有 0.15」的研究,统计上非常「显著」,实务上却可能小到不值得你多花钱或多受苦。反过来,一篇「d = 0.7 但 p = 0.08 没达显著」的小样本研究,可能只是人数太少没测出来,效果本身其实不小,值得后续更大样本去验证。

我常跟学员举例:假设一份研究说某训练法让功能性阈值功率(FTP)平均提升,如果换算下来只是从 250 瓦进步到 252 瓦——就算 p 值再漂亮,这 2 瓦对你爬武岭的实际帮助微乎其微,还不如把心力放在多睡一小时、把补给练顺。

一个把观念串起来的个案

让我用一个综合个案把「证据层级」和「效果量」串起来。去年一位准备初铁、三十多岁的女性学员拿了一则新闻来问我,标题大意是「科学证实:这样练跑步经济性大增、成绩突飞猛进」。我们一起把原文找出来,照着问了一轮:

  • 证据层级:这是一篇单一的小型介入研究,还不是统合分析,位在金字塔中段偏上,可以参考但不到「定论」。
  • 受试者:15 位训练有素的男性长跑选手,跟我这位刚起步的女性学员差很远——外部效度先打一个问号。
  • 效果量与绝对值:文中换算下来,跑步经济性的改善幅度不大,而且信赖区间偏宽,代表不确定性高。
  • 限制:作者自己在讨论段就写了「样本小、仅短期、需更大规模验证」。

问完这一轮,我们的结论不是「这篇是垃圾」,而是「这是个有意思的方向,但还不足以让一位刚入门的女性选手立刻大改课表」。我们把它记下来当作未来观察的线索,先把基础有氧和跑姿稳定练好。你看,同一篇论文,会不会读,得到的行动完全不同。

实务方法:一套可照着跑的读论文流程

观念讲完,来点能立刻用的。这是我自己读一篇运动科学论文的顺序,你可以照着跑。重点是——不要从第一个字读到最后一个字,那样又慢又容易被漂亮的措辞牵着走。

步骤 读哪个部分 你要问自己的问题
1 标题与摘要 它宣称了什么?是联想(相关)还是因果?
2 方法:受试者 几个人?什么程度?跟我像不像?
3 方法:设计 有没有对照组、有没有随机、有没有盲化?
4 结果:效果量 效果多大?不只看 p 值,看数字本身
5 结果:变异 标准差、信赖区间多宽?个体差异大不大?
6 讨论与限制 作者自己承认哪些弱点?结论有没有超译?
7 利益冲突 谁出的钱?是不是补剂厂商赞助?

步骤细节与我的实战提醒

受试者跟你像不像,决定这篇论文关不关你的事。 一篇在「训练有素的年轻男性自由车手」身上做出来的结论,套到一位 55 岁、刚开始骑车减重的女性学员身上,可能完全不适用。运动科学有严重的「受试者偏误」——大量研究用的是年轻、健康、男性、运动员,这叫外部效度(推广性)的问题。我带中高龄或女性学员时,看到任何研究都会先自问:这群受试者跟我的学员差多远?

看信赖区间比看单一数字更诚实。 如果一篇研究说「平均提升 3%」,但 95% 信赖区间是「-1% 到 7%」,代表真实效果可能从「其实有点退步」到「进步不少」都有可能,这种结论其实很不确定。区间越窄,估计越可靠。

永远读「限制」那一段。 好的研究者会诚实列出自己的弱点:样本小、追踪时间短、无法盲化、用替代指针等等。如果一篇论文的讨论写得像广告,只讲好处不提任何限制,我的警戒心会直接拉满。

查资金来源与利益冲突。 这不是阴谋论。一篇由某补剂品牌全额赞助、且作者是该品牌顾问的研究,不代表结论一定造假,但你解读时心里要放一把尺。这在补剂、机能饮料、穿戴设备的研究里特别重要。

一张「危险信号」快筛表

为了让你更快上手,我把「看到就该提高警觉」的信号整理成下面这张快筛表。你不需要每篇都跑完整流程,先扫一遍红旗,命中越多,就越该保守看待。

危险信号 为什么要警觉 建议做法
只有摘要或新闻稿,找不到原文 无法检查方法与数据 找到原始论文再判断
样本数个位数、没有对照组 几乎无法排除干扰 当成「初步线索」而非结论
只报相对百分比、不给绝对值 最容易夸大 自己换算回绝对差
只有 p 值、没有效果量 看不出实际有多大 找 Cohen’s d 或原始数字
用实验室指针宣称比赛会变快 替代指针不等于表现 降低期待,等真实表现研究
研究由卖该产品的厂商全额赞助 潜在利益冲突 心里放把尺,找独立研究对照
标题与内文口气像广告、无任何限制 通常过度简化 直接找「限制」段补课

这张表我建议你存起来,下次滑到耸动的运动科学贴文,对照一下,很多噱头会当场现形。

常见陷阱与修正

带学员读文献这些年,我发现大家最常踩的坑就那几个。我把它们列出来,并附上「修正的问法」。

陷阱一:把「相关」当成「因果」

错误范例:「研究发现睡越多的跑者受伤越少,所以多睡觉能防受伤!」

问题:这可能只是相关。也许是「本来就自律、训练安排合理的人」既睡得多、又刚好受伤少,睡眠只是那个「自律」的副产品,不一定是直接原因。横断面与世代研究能看到「一起出现」,但很难证明「谁造成谁」。

修正问法:这是观察到的关联,还是随机介入证明的因果?只有 RCT 这类介入研究,才比较有底气讲因果。

陷阱二:只看相对值、忽略绝对值

错误范例:「某补给让受伤风险『下降 50%』!」

问题:如果原本受伤率是 2%、降到 1%,那「相对下降 50%」听起来很猛,但绝对只差 1 个百分点。要嘉惠 1 个人,可能要一大群人都用。相对风险最会唬人,一定要换算回绝对数字。

修正问法:那绝对差多少?我要投入多少(金钱、时间、副作用)才换到这点好处?

陷阱三:小样本 + 挑数据(p-hacking)

问题:一个研究如果量了一大堆指针——功率、心率、乳酸、主观疲劳、睡眠、心情——然后只挑「刚好达显著」的那一两个出来写成标题,这叫多重比较问题。测的东西越多,纯靠运气蒙到一个「显著」的几率就越高。

修正问法:他们一共测了几个指针?有没有事先登记研究计划(pre-registration)?结论是不是只创建在众多指针里挑出来的那一个?

陷阱四:用短期替代指针推论长期表现

问题:实验室测到「乳酸阈值功率上升」不等于「你半年后比赛会更快」。中间隔着训练转换、比赛策略、心理、补给运行等一大堆变量。

修正问法:研究量的是实验室指针,还是真实表现(比赛成绩、完赛时间)?两者之间的桥,作者有没有帮我搭好?

陷阱五:忽略无反应者,只看平均

问题:前面提过,同一课表有人大进步、有人没反应。只报平均值会让你以为「大家都会进步这么多」,但你有可能刚好是那个无反应者。

修正问法:作者有没有报告个体差异或反应者比例?我要有心理准备:平均有效,不保证我个人有效。

陷阱六:把「没达显著」当成「证明无效」

问题:这是反过来的误读。一篇小样本研究如果「没测出显著差异」,很多人会直接说「所以这方法没用」。但**「没证据有效」不等于「证明无效」**。人数太少、量测太粗,本来就可能让真实存在的效果被淹没在杂讯里(统计检定力不足)。

修正问法:是「证明没效」,还是「这次没能测出来」?样本够大吗?效果量的方向与大小如何?

陷阱七:幸存者偏误与挑选过的个案

问题:健身内容最爱讲「用了这方法破 PR」的成功故事,却不会告诉你有多少人用了同样方法没效、甚至受伤退出。你看到的都是「活下来、讲出来」的那群,这叫幸存者偏误。

修正问法:那些用了没效的人在哪里?这是系统性追踪所有人的结果,还是只挑成功案例来讲?

给不同程度读者的行动建议

读论文这件事,不同阶段的人需要的深度不一样。我把建议分成三个层级,你对号入座。

初学者:先创建「怀疑的反射」

你不需要看得懂统计。你只要练成三个反射动作:

  • 看到「研究证实」,先问是哪一层证据(金字塔的顶还是底)。
  • 看到夸张的百分比,先问绝对值是多少、样本几人。
  • 看到补剂神效,先查是谁赞助的

光是这三招,就能帮你过滤掉市面上八成的夸大宣传。这阶段我建议你优先相信统合分析与运动营养学会之类的官方立场声明,而不是单一新研究的截屏。

高端者:学会读方法与效果量

如果你已经会骑功率、会看课表,想更上一层:

  • 练习只读摘要与方法段,判断有没有对照与随机。
  • 养成「先找效果量、再看 p 值」的习惯。
  • 读论文的「限制」段,训练自己抓弱点。
  • 遇到英文论文,善用免费的 PubMed 摘要与 Google Scholar。

资深者/教练:把文献放进整体脉络

如果你在带人,责任更重,因为你的解读会影响别人的身体:

  • 不要因为一篇新研究就大改所有学员的课表;等它被拷贝验证。
  • 把「族群适配」放第一:这研究的受试者跟我学员像不像?
  • 记住个体差异,保留调整空间,用实际数据追踪每位学员的真实反应。
  • 涉及健康与伤病时用语保守,该转介就转介。

另外,资深教练最该提防的是「确认偏误」——你已经有一套相信的训练哲学,就容易只挑支持自己的研究、对打脸自己的研究视而不见。我自己对付这件事的办法是:刻意去读反对我做法的高品质研究,如果读完还是被说服要调整,那就调整;如果站得住脚,我的信心也会更扎实。诚实面对证据,是好教练跟固执教练的分水岭。

一个台湾在地的实用提醒

我们在台湾读运动与健康研究,还要多一层在地校正。举几个例子:

  • 气候:很多耐力研究在温带、干冷环境做。台湾夏天湿热,同样的补水与电解质策略未必能照搬,实际情况通常需要更积极的降温与补水。
  • 饮食:国外营养研究常以西式饮食为背景。台湾外食族的三餐结构(便当、面食、手摇饮)不同,碳水与钠的摄取模式要自己换算,不能直接套研究里的克数。
  • 就医环境:这点其实是台湾的优势。我们有相对可近的健保与运动医学、复健科资源,遇到反复疼痛、疑似过度训练或任何内科警讯,不要拿一篇论文自我诊断,挂号给医师或物理治疗师评估,比你读十篇研究都可靠。

我常跟学员说:论文是拿来提升你问问题的品质,不是拿来取代专业评估的。 尤其牵涉到身体不适时,这条界线要守得很清楚。

  • 场地与器材:许多训练研究在标准跑步机、风阻训练台或恒温实验室进行。台湾人真实训练的场景常是河滨车道的逆风、有红绿灯的市区、湿滑的山路、闷热的操场。研究里「干净」的条件,换到真实场地要打折看待,数字不能照抄。
  • 强度与热:夏天的隐形税:台湾的湿热是一种会偷走表现的「隐形税」。同样一份在凉爽环境订出的间歇强度,到了六到九月的午后,心率往往会比平常同样配速高出不少,体感也重很多。这时候硬要达到研究里的「目标功率」,反而容易过度疲劳。我会提醒学员:夏天看研究订强度时,把「热」当成一个额外变量,该降就降、该提早补水就补水。

三个带得走的问题(随身版)

如果你只想记一件事,就记这张表。这是我要求每位学员看到任何「研究说」时,心里要跑一遍的三连问:

要问的问题 在确认什么 没过关代表
这是哪一层证据? 研究设计的可信度 只是个案或动物实验,别当定论
效果量多大、绝对值多少? 实务上值不值得 显著但可能小到没感觉
有没有藏陷阱? 相关/因果、赞助、挑数据 结论可能被高估或误导

我常跟学员说,练成这三连问,你就赢过大部分只会转发标题的人了。

常见问答(FAQ)

Q:我英文没很好,能读论文吗?
可以。先从中文的集成型科普、官方立场声明入手,练习判断证据层级。真要读原文时,PubMed 的摘要通常有结构化的背景、方法、结果、结论,配合翻译工具读摘要就能抓到七成重点,不必逐字硬啃全文。

Q:一篇新研究推翻了以前的说法,我该信哪个?
通常先信「累积证据」。单一新研究再惊人,也只是拼图的一片。等它被其他团队拷贝出来、或被纳入新的统合分析,再考虑调整做法。科学是靠拷贝验证慢慢逼近真相,不是靠最新最猛的头条。

Q:p 值到底要多小才算数?
0.05 只是惯例门槛,不是神圣数字。比起纠结 p 值本身,我更希望你养成看效果量与信赖区间的习惯。一个「刚好 p = 0.049」的结果,不会比「p = 0.051」神奇多少。

Q:那我平常训练到底该听谁的?
听你自己的数据,加上有品质的证据当框架。研究给你方向与范围,你的训练日志、功率、心率、主观感受告诉你「对你」有没有用。把研究当地图,把自己的身体回馈当 GPS,两个一起用。

Q:补剂研究我怎么快速判断可不可信?
三步:一查是不是厂商赞助、二查样本是不是跟你相似的族群、三查效果量而不是只看有没有「显著」。三关过了再考虑,通常就能滤掉大部分噱头。

Q:统合分析(meta-analysis)是不是就一定最可信?
它在证据层级的顶端,但不是免死金牌。有句话叫「垃圾进、垃圾出」——如果它汇整的那些原始研究本身品质很差、又有发表偏误(有效的研究比较容易被发表,没效的常被压在抽屉里),那结论一样会被拉歪。看统合分析时,留意作者有没有评估纳入研究的品质、有没有讨论异质性(各研究结果差多大)。

Q:我很怕看到数字就头痛,一定要懂统计才行吗?
不用。这篇从头到尾没有要你算任何东西。你要练的是「判读习惯」,不是「计算能力」。分辨证据层级、看绝对值、查赞助来源,这三件事都不需要算数学,却能帮你挡掉绝大多数的误导。统计细节,交给时间慢慢累积就好。

Q:那穿戴设备(手表、功率计)厂商的研究呢?
比照补剂处理。先看是不是厂商自己做的、样本像不像你、效果量大不大。设备研究还要多留意「量测本身准不准」——如果连传感都有误差,后面的结论自然要打折。有独立第三方验证的,可信度会高一截。

结语

回到开头那位问我要不要囤甜菜根汁的学员。那天之后,他没有立刻买,而是自己去查了那篇研究——样本只有十几人、都是训练有素的年轻车手、效果量中等、而且他发现同类研究结果其实有蛮大分歧。他最后跟我说:「教练,我决定先把睡眠和补给练好,这个之后再说。」

那一刻我觉得比他破 PR 还开心。因为他学会的不是某一个训练法,而是一种能陪他一辈子的判读能力。在这个「研究证实」满天飞的年代,会自己读、自己想、自己保留合理怀疑,才是最强的装备。

愿你从今天起,每次看到耸动标题,都能微笑着先问一句:「这是哪一层证据?效果量多大?中间有没有陷阱?」——然后才决定要不要相信。


本文为教育性内容,不能取代医师、物理治疗师或营养师的个别诊断与治疗建议。涉及任何身体不适、疾病或用药调整,请务必寻求专业医疗人员的个别化评估。

参考数据

相关主题阅读

相關影片
訂閱CT的頻道

訂閱 CT Yeh,看武嶺實測與路線攻略

北進武嶺、西進武嶺、經典百K,每條路線都親自騎過,配速、爬升、補給點全部實拍實測。

467 部影片 · 累計 838 萬次觀看