跳至主要內容

效果量与实务意义:数字背后的真相——当研究说「有效」,对你真的有用吗?

訓練科學

效果量与实务意义:数字背后的真相——当研究说「有效」,对你真的有用吗?

开场:一杯咖啡引发的争论

上个月在台北一间咖啡厅,我带的一位业余登山车手阿凯把手机推到我面前,屏幕上是一篇转贴的文章,标题斗大地写着「研究证实:某补剂能显著提升运动表现」。他眼睛发亮地问我:「教练,我是不是该吃这个?它说有『显著』效果耶!」

我没有马上回答,反而先问他一个问题:「你知道那个『显著』,可能只代表『快了 0.3 秒』吗?而且是在 300 位受试者、控制到滴水不漏的实验室里量出来的 0.3 秒。」他愣住了。

这就是我这十五年带各级选手与一般运动族群,最常要花力气去拆解的一件事:「有没有效」和「效果有多大、对你有没有意义」,是两个完全不同的问题。 前者是统计上的 p 值在讲话,后者才是你在武岭爬坡、在河滨练间歇时,真正会感受到的东西。

这篇文章,我想带你走进「效果量(effect size)」与「最小重要差异」的世界。它们听起来像是象牙塔里的统计名词,但我保证,一旦你看懂了,你以后看任何一篇运动科学研究、任何一则装备或补剂的宣传,眼睛都会变得不一样。你会从一个被数字牵着走的人,变成一个能反过来质问数字的人。


观念基础:p 值的迷思,与效果量的登场

p 值只回答一个很窄的问题

先讲一个残酷的事实:大多数人(包括不少写报导的人)都误会了 p 值。

p 值(通常我们看到 p < 0.05 就开心地说「有显著差异」)其实只在回答一个非常狭窄的问题:「假设两组其实没有差别,那我观察到现在这个结果、或更极端结果的几率有多低?」几率够低(低于 5%),我们就说「这差异不太可能是纯运气造成的」。

注意,它从头到尾都没有告诉你差异有多大

这里藏着一个很多人不知道的陷阱:只要样本数够大,几乎任何微小的差异都能变成「统计显著」。 如果我找 5000 个人来测某训练法,就算它平均只让 FTP(功能性阈值功率)提升了 1 瓦,都可能跑出 p < 0.001 这种漂亮数字。但你我都知道,1 瓦对一个 250 瓦的车手来说,根本感觉不到,连量测误差都盖过它了。

效果量:把「差多少」量化出来

效果量就是为了补上这个缺口而生的。它不管样本多大,直接回答:「这个差异,换算成标准化的尺度,到底有多大?」

最常见的效果量指针是 Cohen’s d,它的逻辑很直觉:把两组的平均值差距,除以数据的变异程度(标准差)。换句话说,它问的是「这个差异相对于个体之间本来就有的差异,算大还是算小」。

根据 Jacob Cohen 当年提出的经验性惯例(注意,是惯例,不是铁律),一般这样解读:

Cohen’s d 数值 惯例解读 白话翻译
约 0.2 小效果 存在,但要很仔细才看得出来
约 0.5 中效果 肉眼可辨、实务上开始有感
约 0.8 大效果 明显、通常值得认真看待

但我要在这里加一个非常重要的提醒:这些门槛是跨领域的粗略参考,Cohen 本人也强调要看情境。在菁英运动的世界里,游戏规则完全不同——奥运场上金牌与第四名的差距,换算成效果量可能只有 0.1 到 0.2,小到不行,但对选手而言那是登不登上凸台、有没有国光奖金的天壤之别。所以**「小效果」不等于「不重要」,「大效果」也不保证「对你重要」。** 这正是我们接下来要谈的重点。

(Cohen’s d 的门槛与解读,可参考文末列出的 Simply Psychology 与 LibreTexts 统计教材链接。)


内核概念:最小重要差异(MID / MCID)

从「统计显著」到「值得你在意」

如果说效果量是把差异标准化,那么最小重要差异(Minimal Important Difference, MID;在临床上常称 Minimal Clinically Important Difference, MCID) 就是把问题拉回到真实世界:

这个改变,要大到什么程度,你这个「人」才会真正感受到、觉得有意义?

MCID 原本是从临床医学来的概念——例如一种止痛疗法,疼痛评分平均降了多少,病人才会觉得「我真的比较不痛了」,而不只是问卷数字动一动。运动科学借用了这个思维:一项训练或介入,要让你的表现进步到超过某个门槛,才值得你付出时间、金钱与恢复成本去做。

这里有个残酷但实用的观点,我很喜欢引用:MCID 其实是一个「很低的门槛」。它代表的是「勉强有感」,而不是「效果很好」。一个介入即使跨过了 MCID,也只是说明它「值得考虑」,离「强烈推荐」还很远。(这点在文末 ScienceDirect 那篇「MCID Is a Low Bar」讲得很直白。)

三个一定要一起看的数字

我常跟学员说,看研究时脑中要同时摆三个问题,缺一不可:

你该问的问题 对应的统计概念 如果忽略会怎样
「这差异是真的,还是运气?」 p 值 / 信赖区间 被杂讯当成信号
「这差异有多大?」 效果量(Cohen’s d 等) 把 1 瓦当成 30 瓦在庆祝
「这差异大到我有感吗?」 最小重要差异(MCID) 花大钱买一个你根本感觉不到的东西

只看第一个,你会变成阿凯那样,看到「显著」就想掏钱。三个一起看,你才有能力做出成本效益合理的训练决策。

(MCID 的定义与「它是一个低门槛」的讨论,可参考文末 PubMed 综述与 ScienceDirect 链接。)

用一个对照表看懂「四种情况」

把「统计显著与否」和「效果大小是否有实务意义」两个维度交叉,你会得到四种截然不同的情况。这张表我常画在白板上给学员看,因为它一次点破了最多的误解:

效果量大、有实务意义 效果量小、无实务意义
统计显著 理想:真的有效又有感,值得采用 陷阱:样本大到把「几乎没差」也变显著,最容易被误导
不显著 可惜:可能真有效但样本太小没测出来,值得后续研究 明确:既没把握、效果又小,直接略过

最危险的格子是右上角——统计显著、但效果小到没意义。这正是大样本研究最容易制造、也最常被行销拿来断章取义的地方。你以后看到「大规模研究证实显著有效」,反而要更小心地追问效果到底多大。而左下角则提醒我们:「没测到显著」不等于「证明无效」,很可能只是样本不够、还没看清楚而已。


实务方法:把研究翻译成训练决策

理论讲完了,我知道你真正想要的是「所以我到底该怎么用」。以下是我实际带学员时,教他们的一套翻译流程。

步骤一:先问「这个效果,换算到我身上是多少?」

研究常用百分比或标准化数字报告结果。你要做的第一件事,是把它换算成你自己的绝对数字

举个实例(数字为情境举例,非引用特定研究):假设一篇研究说某间歇训练法让受试者的最大摄氧量相关指针「平均提升约 3%」。听起来好像不多?我们来换算。假设你现在爬一段熟悉的坡(例如新竹的十八尖山或风柜嘴)大约骑 20 分钟:

你的基准 提升 3% 后的估算 实务意义
20:00 的爬坡 约快 30 至 40 秒 有感,周末揪团不会被拉爆
250 瓦的 FTP 约提升 7 至 8 瓦 通常超过量测误差,值得追求
40 分钟的 10 公里跑 约快 60 至 70 秒 对业余跑者是明显进步

看到没?同样一个「3%」,换算成你熟悉的场景,突然就变得具体、可以判断了。这一步是把抽象研究接地气的关键。

步骤二:对照「量测误差」与「日常波动」

这是最多人漏掉的一步。任何量测都有误差,你的身体每天状态也在波动。如果一个宣称的效果,比你自己平常的日常波动还小,那它在现实中根本没意义。

我通常会请学员先做「自我变异度」的功课:连续几周在相同条件下(同一段路、同样睡饱、类似气温)记录同一项表现,看它自然上下摆动多少。

指针 常见的日常自然波动范围(个体差异大,仅供概念参考) 判读原则
晨起心率 上下数个 bpm 单日高几下别紧张,看趋势
同段爬坡时间 数十秒等级 小于此就别当成进步或退步
功率计读值 通常有数个百分比误差 换车、换表前后不能直接比

原则很简单:如果一个介入的效果,淹没在你自己的日常噪音里,那不管研究说得多漂亮,对你都不算数。

步骤三:估算「投入产出比」

就算效果真的超过噪音、也超过 MCID,你还得问最后一个问题:代价值不值得?

我带过一位准备参加台湾 KOM(登山王挑战)业余组的学员小林。他一度想同时尝试好几种据说「有效」的作法。我请他做了一张很土法炼钢、但超级好用的表:

介入方式 估算效果量级 需要付出的成本 我的建议
规律结构化训练(周期化) 时间、纪律 第一优先,效果最扎实
睡眠与恢复管理 中至大 生活作息调整 高投报,很多人低估
减去多余体重(在健康范围内) 中至大(爬坡尤甚) 饮食纪律 对爬坡型赛事极有效
某些边际小补剂 金钱、麻烦 前三项做好再考虑

这张表点醒了他:他一直想在「小效果、却要花钱花心力」的东西上打转,却忽略了「大效果、只要肯做」的睡眠和周期化训练。排序决策,永远先吃效果量最大、成本最低的果实。

步骤四:在自己身上做「小规模验证」

研究给你的是群体平均,但真正的答案要在你自己身上找。我教学员一套很土、但很有效的自我验证法,我称它为「一人试验」:

  1. 先固定基准。 选一个你能稳定重复的测试——例如同一段坡、同样的暖身、尽量相近的气温与睡眠。连续量几次,抓出你「不做任何改变」时的自然范围。
  2. 一次只改一件事。 想验证某个介入,就只动那一项,其他全部维持不变。同时改三件事,你永远不知道是哪一件在起作用(或互相抵消)。
  3. 给它足够时间。 很多生理适应要数周才显现,别做两天没感觉就放弃,也别做两天有感觉就当真(那可能只是状态好)。
  4. 和你的基准波动比,不是和昨天比。 只有当改变超出你原本的自然波动范围,才算数。

这套方法的精神,就是把「效果量」和「日常噪音」的概念,直接搬到你自己身上跑一遍。它不完美(没有对照组、有安慰剂效应),但对一般运动族群来说,已经比盲信广告可靠太多了。

一个具体换算示范:咖啡因与计时赛

再举一个大家常问的例子来走一遍流程(数字为概念示范,非引用特定研究)。假设有人告诉你「咖啡因能提升耐力表现约 2%」。

判读步骤 套用到你身上
换算绝对值 40 分钟的计时赛,2% 约等于快 40 多秒
对照日常波动 若你同条件下自然波动约 20 至 30 秒,那 40 秒「可能」浮出水面
超过 MCID 吗 对在意名次的你,40 秒有感;对纯休闲骑,也许无所谓
成本与风险 便宜、方便,但要注意心悸、肠胃、睡眠、个人耐受度差异
个体反应 有人反应大、有人几乎没感觉,甚至有人不适

结论不会是「一定要用」或「绝对别用」,而是:「这是一个效果量级中等、成本低、但因人而异的选项,值得你自己小规模试一次再决定。」 这就是成熟的判读该有的样子——不武断、有依据、能行动。


常见错误与修正

带学员这么多年,我看过太多人在「解读数字」这件事上跌倒。以下几个是最常见的,我一并把修正方式写给你。

错误一:把「显著」当成「效果很大」

这是头号通病。前面说过,「统计显著」只代表「大概不是运气」,跟「效果大不大」是两回事。

修正: 每次看到「显著提升」,立刻在心里追问一句——「提升了多少?换算到我身上是几秒、几瓦、几公斤?」对方答不出具体数字,或那个数字小到可笑,你就知道该打折看待。

错误二:只看平均值,忽略个体差异

研究报告的是「平均效果」,但你不是平均人。同一个介入,有人反应很大、有人几乎没反应,这叫「反应者变异」。平均进步 3%,可能是一半人进步 6%、一半人完全没动的结果。

修正: 把研究当成「值得一试的假设」,而不是「保证的承诺」。真正的验证,是在你自己身上做小规模、有纪录的试验(下面会教)。

错误三:拿实验室的完美条件套用到真实生活

研究常在高度控制的环境进行——受试者睡饱、禁咖啡因、标准化饮食。你在台湾的真实生活呢?加班、外食一个排骨便当、下班还要骑河滨、夏天闷热到爆汗。实验室量到的效果,在你混乱的日常里往往会缩水。

修正: 对研究效果自动打个折扣心理准备,尤其是那些依赖「完美运行」的介入。能在真实混乱中还撑得住的效果,才是好效果。

错误四:被「相对数字」放大情绪

「风险降低 50%!」听起来很吓人,但如果原本的绝对风险是 0.002%,降一半也只是 0.001%,实务上几乎没差。运动宣传也常用相对数字(提升 30%!)来放大感受,却不告诉你基准是多少。

修正: 永远找「绝对数字」。相对百分比没有基准值,就是耍流氓。

错误五:忽略信赖区间的宽度

一个效果量的「点估计」旁边,通常有个信赖区间。如果那个区间很宽(例如从「几乎没效」跨到「效果很大」都涵盖),代表这个结果很不确定,尤其常见于小样本研究。

修正: 看到小样本、又没报告信赖区间,或区间宽得夸张的研究,把结论的确定性再往下调。

错误六:忽略「对象是谁」的可迁移性

很多研究的受试者,跟你根本不是同一群人。用未受过训练的新手做出来的效果,套到已经训练多年的老手身上,往往会大幅缩水——因为老手的「进步空间」本来就小得多(这在运动科学里叫「训练状态」的影响)。反过来,用职业选手做的研究,也未必适用于你我这种业余上班族。

修正: 看研究时多问一句「受试者是谁?他们像我吗?」如果对象和你的训练程度、年龄、性别、生活型态差很多,效果的可迁移性就要打折。台湾常见的情境是:一堆宣传引用的是国外年轻运动员的数据,但你是四十多岁、每天外食、周末才骑车的族群,直接套用只会失望。


台湾在地情境:把概念落地

谈了这么多,我想特别把几个台湾读者最容易踩到的实务点拉出来讲,因为我们的生活条件跟实验室差很远。

闷热气候会吃掉你的效果量

台湾夏天又湿又热,这对耐力表现的影响非常大。很多国外研究是在凉爽环境测出来的漂亮效果,你在七、八月的午后河滨一骑,光是热压力就足以盖过那个介入的效果。判读时要把环境变量放进去——同样的训练,冬天和盛夏的表现差异,可能远大于任何小补剂的效果。这也是为什么夏天更该重视补水、电解质与时段选择(清晨或傍晚),这些「大效果」的基本功。

外食族的营养现实

研究里受试者常吃标准化饮食,但你我可能中午是排骨便当、晚上是卤肉饭加珍奶。当一个介入的效果,创建在「饮食控制良好」的前提上,套到外食族身上就会缩水。与其纠结某个边际补剂,不如先把「每餐有没有足够蛋白质、有没有吃够碳水支撑训练」这些效果量更大的基本盘顾好。

就医方便是你的优势

台湾健保可近性高、就医方便,这其实是我们判读健康信息时的一大优势。当你对某个补剂安全性、某个身体警讯、或某项介入是否适合自己有疑虑时,挂个号问医师、物理治疗师或营养师的成本很低。别用网络上的统计数字,去取代一次专业的个别评估。 尤其若你本身有慢性疾病(如糖尿病、高血压、心脏相关问题),任何训练或营养调整都应该先和你的主治医师讨论,用语我在这里也刻意保守——这些状况一定要个别化、要就医,不是靠读文章就能自己决定的。


给不同程度读者的行动建议

看懂概念是一回事,用出来是另一回事。我把建议分成三种程度,你对号入座。

如果你是刚入门的运动新手

你现在不需要去啃论文、算 Cohen’s d。你要做的,是先创建正确的「优先级直觉」:

  • 先把大石头放进罐子里。 规律运动、睡眠、基本营养、循序渐进,这些「效果量最大」的基本功,远比任何小撇步重要。别在还没打好地基时,就被各种补剂和装备广告分心。
  • 看到「显著」「证实有效」的宣传,先深呼吸。 问一句:「效果具体是多少?值多少钱?」答不出来就先放着。
  • 记录你自己的基准。 就算只是手机备忘录记下每次骑车的时间和感受,三个月后回头看,你自己的数据比任何研究都更贴近你。

如果你是有经验的高端运动者

你已经有训练基础,接下来是提升「解读力」:

  • 学会把研究结果换算成自己的绝对数字(回头看实务方法步骤一)。这是高端者最该练的翻译能力。
  • 创建你的「个人 MCID」概念。 想清楚:对你这个阶段的目标,表现要进步多少才值得你去追?例如你若在意破 PB,先算出破 PB 需要的秒数,再回头评估哪些介入的效果量搆得上。
  • 善用信赖区间与样本数当滤网。 小样本、宽区间的研究,当成「有趣的线索」就好,别急着改整套训练。

如果你是教练或带队者

你的每个建议都会影响一群人,责任更重:

  • 对选手沟通时,用他们听得懂的绝对数字,而不是丢一堆 p 值和 d 值。「这个做法大概能帮你在那段坡快 20 秒」远比「效果量 0.4」更能激励人。
  • 管理期待值。 提醒选手研究报的是平均,个体反应有差;把新方法当「值得试的假设」,并用小规模试验去验证谁是反应者。
  • 做决策排序时,永远先问效果量与成本。 资源有限,把它投在效果量最大、最扎实的地方(训练结构、恢复、基础营养),而不是追逐一堆边际小玩意。

一个完整的个案:把整套思维走一遍

让我用阿凯的故事收尾,把前面所有概念串起来。

那天咖啡厅之后,我没有直接叫他别买那个补剂,而是带他跑了一遍完整流程。

第一步,翻译效果。 我们找出那篇宣传背后大致的数字,换算到他身上,估出来的效果大约是在他常骑的那段河滨计时路段「可能快个几秒」。

第二步,对照噪音。 我请他翻出过去两个月同一段路的纪录,发现他自己的自然波动就有数十秒——远大于那个补剂宣称能带来的几秒。结论很清楚:那点效果,直接淹没在他的日常波动里。

第三步,算投报。 那个补剂一个月要花不少钱,还要每天记得吃。而我们一起查看他的生活后发现,他长期睡不到六小时、赛前一周还常熬夜追剧。

我跟他说:「你与其花钱买一个你根本感觉不到的几秒,不如先把睡眠从六小时拉到七个半小时。那个效果量,我保证你在坡上有感。」

三个月后,他没吃任何新补剂,只调整了睡眠和训练结构,那段河滨 PB 进步了将近一分钟。他回来跟我说的第一句话是:「教练,我以后看到『显著』两个字,都会先想:那到底几秒?」

那一刻,我知道他真的懂了。这才是我写这篇文章最想给你的东西——不是某个特定结论,而是一套能陪你一辈子的思考方式。


常见问答(FAQ)

Q:效果量的门槛(0.2 / 0.5 / 0.8)是绝对标准吗?
A:不是。那是 Cohen 提出的跨领域粗略惯例,他本人也强调要看情境。在菁英运动里,很小的效果量都可能决定胜负;在大众健身里,可能要更大的效果才值得你改变习惯。门槛是参考,不是圣经。

Q:那我以后是不是要自己算 Cohen’s d?
A:完全不用。你要学的是「思维」而非「计算」——看到结论就追问「换算到我身上是多少、超过我的日常波动吗、值不值得这个成本」。这三问,比任何公式都实用。

Q:研究说有效,但我试了没感觉,是我有问题吗?
A:很可能不是。研究报的是平均,个体反应差异很大,你完全可能是「低反应者」。这也是为什么在自己身上做小规模验证这么重要。别因为一篇论文就怀疑自己的身体。

Q:那我干脆都别信研究,靠感觉就好?
A:也不对,这会走到另一个极端。研究是很有价值的「群体层级证据」,能帮你筛掉一堆没根据的偏方。正确做法是:用研究当方向,用自己身上的纪录当验证,两者互补。

Q:健康或伤害相关的介入,也能这样自己判断吗?
A:概念可以用来帮你理解信息,但涉及疾病、伤害、用药或补剂安全时,一定要找专业人员个别评估。统计思维帮你看懂数字,但它不能取代医疗判断。台湾就医方便、健保可近性高,有疑虑时,挂号请教医师、物理治疗师或营养师,永远是最稳妥的做法。

Q:效果量和「相关系数」是同一回事吗?
A:不完全是,但相关系数(如 r)也是一种效果量的指针,用来描述两件事关联的强弱。重点一样:别只看「有没有关联」,要看「关联有多强、对实务有没有意义」。而且关联不等于因果——两件事一起变动,不代表其中一个造成另一个,这是另一个常被误用的大坑。

Q:为什么有些研究效果很大,却没被广泛采用?
A:可能原因很多:样本太小、无法在别的研究重复出来、实验设计有瑕疵、或效果只在很特定的条件下才成立。单一研究再漂亮,也只是「一个证据点」。真正可靠的结论,通常需要多个独立研究、在不同族群上都看到一致方向,才站得住脚。看到「某单一研究震撼发现」,先保守看待。

Q:那么多要注意的,我一般人记不住怎么办?
A:不用全记。你只要养成一个反射动作就够了——每次看到「有效」,就在心里问三句:「效果多大(换成我的秒数瓦数)?超过我的日常波动吗?值不值这个成本?」这三句话,就浓缩了整篇文章九成的价值。


结语:成为能质问数字的人

我们活在一个被数字轰炸的时代。打开手机,满满都是「研究证实」「显著提升」「效果惊人」。这些字眼有一种魔力,会让人不假思索地相信。

但读完这篇,我希望你已经有了一层免疫力。你知道「显著」不等于「效果大」,你知道要把研究翻译成自己的绝对数字,你知道要对照日常噪音和 MCID,你知道要算投入产出比。

最厉害的运动者,不是读最多研究的人,而是最会问问题的人。 下次再有人拿着一篇「证实有效」的文章来找你,你不会再像从前的阿凯那样眼睛发亮,而是会微笑着问一句:

「所以,效果具体是多少?对我,真的有意义吗?」

这一问,就是你从被数字牵着走,变成驾驭数字的分水岭。

我最后想再叮咛一件事:培养这套思维,不是为了让你变得愤世嫉俗、什么都不信。恰恰相反,它是为了让你把有限的时间、金钱和恢复量,投在真正划算的地方。当你不再被一堆边际小效果分心,你反而能更专注、更坚定地把那几件效果量最大的事(规律训练、充足睡眠、扎实营养、循序渐进)做好、做久。这才是长期进步的真正引擎。

数字是工具,不是主人。看懂它、质问它、然后把它为你所用——这,就是一个成熟运动者该有的姿态。

祝你在台湾的每一段坡、每一条河滨、每一场赛事上,都骑得比昨天更明白、更聪明。我们路上见。


本文为教育性内容,不能取代医师、物理治疗师或营养师的个别诊断与治疗建议。涉及疾病(如糖尿病、高血压、心脏病等)、伤害或补剂安全时,请务必寻求专业医疗人员的个别化评估与协助。

参考数据

相关主题阅读

相關影片
訂閱CT的頻道

訂閱 CT Yeh,看武嶺實測與路線攻略

北進武嶺、西進武嶺、經典百K,每條路線都親自騎過,配速、爬升、補給點全部實拍實測。

467 部影片 · 累計 838 萬次觀看