跳至主要內容

운동과학 연구방법 입문: 논문 읽는 법 (코치가 알려주는 '연구로 입증됨'이라는 말의 실체)

訓練科學

운동과학 연구방법 입문: 논문을 읽는 법 (코치가 알려주는 '연구로 입증됨'이라는 네 글자 꿰뚫어보기)

몇 년 전 아마추어 로드 사이클리스트 한 명이 우링(武嶺) 대회를 준비하고 있었습니다. 그는 매주 갓 번역된 '최신 연구’를 들고 와서 물었습니다. “코치님, 이 논문에 따르면 비트 주스를 마시면 파워가 2% 늘어난다는데, 한 박스 쟁여둘까요?” 다음 주에는 "이 논문은 인터벌을 30-15로 해야 하고 4x4는 하지 말라고 합니다"라고 바꿔 말하기도 했습니다. 그가 휴대폰에 저장해 둔 스크린샷들을 보니, 사실 대부분 같은 실험을 세 개의 서로 다른 피트니스 페이스북 페이지가 서로 상반된 결론으로 각색해 놓은 것이었습니다. 그날 저는 그에게 비트 주스를 마셔야 하는지 말아야 하는지 직접 답해 주는 대신, 한 시간을 들여 연구 논문 한 편을 처음부터 끝까지 읽는 법을 가르쳐 주었습니다. 정보가 넘쳐나는 시대에 '논문을 읽을 줄 아는 능력’이 '논문을 몇 편 읽었는지’보다 훨씬 중요하기 때문입니다.

이 글은 제가 그동안 선수들을 지도하고, 또 제 스스로 문헌을 검토하면서 쌓아 온 '입문자를 위한 논문 읽기 방법’입니다. 제가 여러분을 통계학자로 만들어 드리지는 못하겠지만, 이 글을 다 읽고 나면 다음에 '연구로 입증됨’이라는 네 글자를 봤을 때 냉정하게 세 가지 질문을 던질 수 있게 될 것입니다. 이건 어느 등급의 연구인가? 여기서 말하는 '유의미함’은 통계적 유의미함인가, 아니면 실제로 효과가 있다는 뜻인가? 그 사이에 흔한 함정이 숨어 있지는 않은가?

왜 스스로 논문을 읽는 법을 배워야 하는가

먼저 냉혹한 현실 하나를 말씀드리겠습니다. 운동과학이 미디어를 통해 전달될 때 왜곡률이 무시무시하게 높습니다. 원래 결론이 매우 보수적으로 쓰여 있던 논문—“훈련된 사이클리스트 12명을 대상으로 한 이 연구에서 단기 섭취 후 파워가 약간 상승하는 것이 관찰되었으나, 더 큰 표본을 통한 검증이 필요하다”—이 미디어, 페이스북 페이지, 협찬 광고 등 세 번의 전달을 거치면 흔히 "과학이 XX가 당신을 2% 강하게 만든다는 것을 입증했다"로 둔갑합니다.

문제는 어디에 있을까요? 운동과학에는 선천적인 한계가 몇 가지 있어서 과도한 해석에 특히 취약합니다.

  • 표본 수가 일반적으로 매우 작음: 엄격한 통제, 채혈, 탈진 테스트를 기꺼이 받아들일 운동선수를 모집하는 것은 어렵습니다. 많은 연구가 8명에서 15명에 불과합니다.
  • 개인차가 엄청남: 같은 인터벌 훈련 프로그램을 수행해도 어떤 사람은 10% 향상되고, 어떤 사람은 제자리걸음이며, 심지어 퇴보하는 사람도 있습니다 (이를 ‘반응자/무반응자’ 현상이라고 합니다). 평균값은 이러한 차이를 지워버립니다.
  • 이중 맹검 적용이 어려움: 피험자들이 자신이 고강도 인터벌을 하고 있는지, 휴식을 취하고 있는지 모르게 하는 것은 매우 어렵습니다.
  • 단기 지표가 장기적인 성과를 대체함: 실험실에서 측정하는 것은 30초 파워나 젖산 역치이지만, 여러분이 정말로 관심 있는 것은 3개월 후 우링(武嶺)을 오르는 속도가 빨라졌는지입니다. 그 사이에는 전환의 큰 간극이 존재합니다.

그래서 저는 항상 선수들에게 이렇게 말합니다. 논문을 읽는 것은 성경 말씀처럼 그대로 따르기 위한 것이 아니라, '합리적 의심’이라는 근육을 키우기 위한 것입니다. 모든 연구를 부정할 필요는 없지만, 각 결론 뒤에 숨겨진 신뢰 수준이 어느 정도인지는 알아야 합니다.

더 실용적인 이유도 있습니다. 여러분의 시간, 돈, 그리고 몸은 모두 소중합니다. 모든 '연구로 입증됨’이라는 주장 뒤에는 대가를 치러야 할 가능성이 있습니다—보충제 한 통을 사거나, 훈련 프로그램을 바꾸거나, 한 번 더 고생을 하거나. 판독 능력이 없다면, 여러분은 제한된 자원을 ‘통계적으로는 유의미하지만 실질적으로는 차이가 없는’ 것들에 쏟아부어, 정작 해야 할 기본기—수면, 규칙적인 훈련, 점진적 과부하, 영양 섭취 훈련—을 밀어낼 가능성이 높습니다. 논문을 읽을 줄 아는 능력은 본질적으로 자원을 배분하는 능력입니다.

기본 개념 1: 연구 설계의 근거 수준

이것은 가장 중요하면서도 가장 쉽게 간과되는 부분입니다. 모든 '연구’의 비중이 같은 것은 아닙니다. 근거 중심 의학에는 ‘근거 수준’(hierarchy of evidence / levels of evidence)이라는 널리 사용되는 개념이 있습니다. 이는 연구 설계를 '인과 관계 추론의 신뢰도’에 따라 낮은 수준에서 높은 수준으로 배열합니다. 이 피라미드의 버전은 80가지가 넘게 제안되었으며 세부 사항은 조금씩 다르지만, 큰 틀은 상당히 일관됩니다.

제가 일반적인 수준을 아래 표로 정리하고, 운동 현장에서의 쉬운 해석을 덧붙였습니다.

근거 수준 연구 설계 쉬운 이해 운동 현장 예시
최상 체계적 고찰/메타분석 (Systematic Review / Meta-analysis) 설계가 엄격한 여러 실험을 모아 함께 분석 “카페인이 지구력 수행에 미치는 영향에 대한 25편의 연구를 종합”
높음 무작위 대조 시험 (RCT) 무작위 배정, 대조군 존재, 인과 관계 추론 가능 “사이클리스트를 무작위로 보충제 섭취군과 위약군으로 배정”
중간 코호트 연구 (Cohort) 한 집단을 장기간 추적하지만 무작위 배정은 없음 “러너 500명을 5년간 추적하여 누가 부상을 당하는지 확인”
중간-낮음 환자-대조군 연구 (Case-control) 결과에서 원인을 거슬러 찾아감 “아킬레스건 파열 유무에 따른 훈련 습관 비교”
낮음 단면 연구 (Cross-sectional) 특정 시점의 스냅샷 “현재 파워미터를 사용하는 사람이 얼마나 되는지 조사”
더 낮음 증례 보고/시리즈 (Case report/series) 몇몇 개별 사례에 대한 기술 “한 선수가 특정 방법을 사용한 후 PR을 경신”
최하 동물 실험/체외 실험, 전문가 의견 쥐나 세포 수준, 개인적 견해 “생쥐 실험에서 특정 성분이…”

(Wikipedia: Hierarchy of evidenceUC Davis Levels of Evidence 참고로 정리)

이 표를 어떻게 사용할까요? 제가 선수들에게 가르치는 아주 간단한 핵심 원칙이 있습니다. '연구로 입증됨’이라는 네 글자를 보면, 먼저 '이건 피라미드의 어느 층에 해당하는가?'라고 물어보세요. 자극적인 결론이 단 한 편의 생쥐 실험이나 단일 증례 보고에서 나온 것이라면, 그 비중은 20개의 RCT를 통합한 메타분석과는 완전히 다른 수준입니다.

'무작위’와 '대조’가 왜 그렇게 중요한가

제가 선수의 실제 상황을 각색한 예로 설명하겠습니다. 제가 러너 10명에게 8주 연속으로 새로운 에너지젤을 먹게 했다고 가정해 봅시다. 그 결과 그들의 평균 10km 기록이 90초 향상되었습니다. 이것이 에너지젤이 효과가 있다는 것을 증명할까요?

아닙니다. 왜냐하면 그 8주 동안 너무 많은 일이 일어났기 때문입니다. 그들은 원래 훈련을 하고 있었고, 날씨가 무더위에서 서늘함으로 바뀌었고, 실험에 참여하고 있다는 것을 알기에 더 열심히 했으며(위약 효과), 부상을 우연히 피했습니다. 이러한 모든 요소가 뒤섞여 있어서, 그 90초가 에너지젤 덕분인지 다른 요인 때문인지 전혀 구분할 수 없습니다.

'대조군’의 의미는 조건이 비슷한 다른 집단이 동일한 일을 하되 에너지젤만 먹지 않게(또는 외형이 동일한 위약을 먹게) 하는 것입니다. '무작위 배정’은 두 집단이 처음부터 체력, 나이, 성실도가 대체로 비슷하도록 보장하여, 제가 몰래 강한 선수들을 에너지젤 군에 몰아넣는 부정행위를 방지합니다. 무작위 배정과 대조군이 있어야만 두 집단의 차이가 에너지젤 때문일 가능성이 높다고 어느 정도 확신을 가지고 말할 수 있습니다.

이것이 제가 “제 친구가 이렇게 훈련해서 효과를 봤어요”, "어떤 인플루언서가 직접 해봤다"와 같은 말에 매우 신중한 태도를 취하는 이유입니다—그것들이 반드시 틀렸다고 말하는 것이 아니라, 위의 수많은 교란 요인들을 배제하는 것이 거의 불가능하기 때문입니다.

맹검과 위약: '내가 믿는 것’이 어떻게 은밀히 성과를 높이는가

많은 사람들이 간과하는 또 다른 핵심 용어를 하나 더 추가하겠습니다: 맹검(blinding). 단일 맹검은 피험자가 자신이 어느 집단에 배정되었는지 모르는 것이고, 이중 맹검은 측정 및 배포를 담당하는 연구자조차 모르는 것입니다. 왜 이렇게 번거롭게 해야 할까요? 인간의 기대 자체가 수행 능력에 영향을 미치기 때문입니다.

제가 겪은 아주 생생한 예가 하나 있습니다. 어느 날 저는 실력이 비슷한 두 선수에게 동일한 역치 인터벌 훈련을 시키면서, 한 명에게는 '새로운 포뮬러, 실험실에서 피로 지연 효과가 입증된 스포츠 음료’라고 ‘실수로’ 믿게 했습니다. 실제로 두 병은 완전히 동일했습니다. 결과적으로 ‘신비의 음료를 마셨다고 생각한’ 선수는 주관적 피로 점수가 눈에 띄게 낮았고, 한 세트를 더 버텨냈습니다. 그가 거짓말을 한 것이 아니라, 뇌의 기대가 실제로 고통에 대한 인식을 바꾼 것입니다—이것이 위약 효과의 힘입니다.

따라서 보충제나 장비 연구에 위약 대조군이 없거나, 맹검이 적용되지 않았다면 매우 조심해야 합니다. 측정된 '향상’의 상당 부분은 순전히 '피험자가 자신이 좋은 제품을 사용하고 있다는 것을 아는 것’에서 오는 심리적 효과일 수 있습니다. 지구력 스포츠처럼 주관적으로 '버틸 수 있는지 없는지’에 크게 의존하는 종목에서는 이 효과가 무시할 수 없을 정도로 큽니다.

개념 기초 2: 통계적 유의 ≠ 실제적 의미

이 글 전체에서 제가 가장 기억해 두길 바라는 부분입니다. 많은 사람들이 논문에 "p < 0.05, 통계적으로 유의함"이라고 쓰여 있으면 "와, 이거 효과가 크네"라고 생각합니다. 이것은 큰 오해입니다.

먼저 p값이 무엇인지 설명하겠습니다. p값이 답하는 질문은 이것입니다: “만약 이 효과가 실제로 전혀 존재하지 않는다면(귀무가설이 참이라면), 내가 관찰한 이 정도 크기 또는 그보다 더 큰 차이를 볼 확률이 얼마나 될까?” 이 확률이 매우 낮다면(관례상 < 0.05), 연구자는 "이 효과가 0일 가능성은 거의 없다"고 말합니다.

주의하세요 — p값은 단지 "효과가 0은 아닐 것"만 알려줄 뿐, "효과가 얼마나 큰지"는 전혀 알려주지 않습니다. 이것이 핵심 중의 핵심입니다.

그리고 여기에 치명적인 함정이 숨어 있습니다: 표본 수가 충분히 크기만 하면, 아무리 사소한 차이라도 통계적으로 유의해질 수 있습니다. 통계학자들이 자주 드는 예는: 어떤 보습 프로그램이 100점 만점 시험에서 평균 0.5점을 올렸다고 할 때, 표본을 충분히 많이 모으면 이 0.5점도 "p < 0.05"가 될 수 있습니다 — 하지만 0.5점 때문에 예산을 크게 바꿀 교장은 아무도 없습니다. (Statistics By Jim: Practical vs. Statistical Significance 참조)

그럼 무엇을 봐야 하나? 효과 크기(Effect Size)

"효과가 실제로 얼마나 크고, 훈련을 바꿀 가치가 있는지"를 알기 위해 봐야 할 것은 효과 크기이며, 가장 흔한 지표는 Cohen’s d입니다. 이것은 차이를 표준편차 단위로 표준화하여 연구 간 비교를 용이하게 합니다. 자주 인용되는 대략적인 등급은 다음과 같습니다:

Cohen’s d 효과 크기 쉽게 풀어서
약 0.2 작음 차이는 있지만, 느끼지 못할 정도로 작을 수 있음
약 0.5 중간 주목할 가치가 생기기 시작함
약 0.8 이상 뚜렷하고, 보통 실무적으로 의미가 있음

(Statistics By Jim 설명을 정리한 것; APA 형식은 모든 p값 옆에 효과 크기를 보고하도록 요구합니다)

그러니 다음에 논문을 읽을 때는 이런 습관을 기르세요: 효과 크기를 먼저 찾고, 그다음 p값을 보세요. “p < 0.001이지만 Cohen’s d가 0.15에 불과한” 연구는 통계적으로 매우 "유의"하지만, 실무적으로는 돈을 더 쓰거나 고생을 더 할 가치가 없을 만큼 작을 수 있습니다. 반대로, “d = 0.7이지만 p = 0.08로 유의하지 않은” 소표본 연구는 단지 인원이 너무 적어서 검출되지 않았을 뿐, 효과 자체는 작지 않아 더 큰 표본으로 검증할 가치가 있습니다.

저는 수강생들에게 자주 이런 예를 듭니다: 어떤 연구가 특정 훈련법이 기능적 역치 파워(FTP)를 평균적으로 향상시킨다고 주장한다고 가정해 봅시다. 환산해 보니 250와트에서 252와트로의 향상에 불과하다면 — p값이 아무리 훌륭해도, 이 2와트가 우링(武嶺) 등반에 실질적으로 주는 도움은 미미하며, 차라리 한 시간 더 자거나 보급 훈련을 매끄럽게 하는 데 힘을 쏟는 편이 낫습니다.

개념을 하나로 엮는 사례

"증거 수준"과 "효과 크기"를 하나로 엮기 위해 종합적인 사례를 하나 들어 보겠습니다. 작년에 첫 철인3종 경기를 준비하던 30대 여성 수강생이 뉴스 하나를 가지고 와서 물어봤습니다. 제목은 대략 "과학적으로 입증: 이렇게 훈련하면 러닝 이코노미가 크게 향상되고 기록이 비약적으로 발전한다"는 내용이었습니다. 우리는 함께 원문을 찾아내고, 다음과 같은 질문들을 차례로 던졌습니다:

  • 증거 수준: 이것은 단일 소규모 중재 연구로, 메타분석이 아니며 피라미드 중상단에 위치합니다. 참고할 만하지만 “결론” 수준은 아닙니다.
  • 연구 대상자: 훈련된 남성 장거리 주자 15명으로, 이제 막 시작한 이 여성 수강생과는 거리가 멉니다 — 외적 타당도에 먼저 물음표를 붙였습니다.
  • 효과 크기와 절대값: 본문에서 환산해 보면 러닝 이코노미 개선 폭은 크지 않았고, 신뢰 구간도 상당히 넓어 불확실성이 높다는 뜻입니다.
  • 제한점: 저자 자신도 논의 섹션에서 "표본이 작고, 단기적이며, 더 큰 규모의 검증이 필요하다"고 썼습니다.

이 한 바퀴를 돌린 후 우리의 결론은 "이 논문은 쓰레기다"가 아니라 "흥미로운 방향이지만, 이제 막 입문한 여성 선수가 바로 훈련 계획을 크게 바꿀 만한 수준은 아니다"였습니다. 우리는 이것을 향후 관찰을 위한 단서로 기록해 두고, 먼저 기초 유산소와 안정적인 주법을 다지기로 했습니다. 보시다시피, 같은 논문이라도 읽는 법에 따라 얻는 행동이 완전히 달라집니다.

실무 방법: 그대로 따라 할 수 있는 논문 읽기 프로세스

개념 설명은 끝났으니, 바로 쓸 수 있는 것을 알려드리겠습니다. 이것은 제가 운동과학 논문 한 편을 읽는 순서이며, 여러분도 그대로 따라 할 수 있습니다. 핵심은 — 첫 글자부터 마지막 글자까지 읽지 말라는 것입니다. 그렇게 하면 느리고, 화려한 문구에 휩쓸리기 쉽습니다.

단계 어느 부분을 읽나 스스로에게 물어야 할 질문
1 제목과 초록 무엇을 주장하는가? 연관(상관)인가 인과인가?
2 방법: 연구 대상자 몇 명인가? 어떤 수준인가? 나와 비슷한가?
3 방법: 설계 대조군이 있는가? 무작위 배정인가? 눈가림이 되었는가?
4 결과: 효과 크기 효과가 얼마나 큰가? p값만 보지 말고 숫자 자체를 보라
5 결과: 변산성 표준편차, 신뢰 구간이 얼마나 넓은가? 개인차가 큰가?
6 논의와 제한점 저자가 스스로 인정한 약점은 무엇인가? 결론이 과장되었는가?
7 이해관계 충돌 누가 자금을 댔는가? 보충제 업체 후원인가?

단계별 세부 사항과 실전 팁

연구 대상자가 나와 얼마나 비슷한지가 이 논문이 나와 관련이 있는지를 결정합니다. "훈련된 젊은 남성 사이클리스트"를 대상으로 한 결론을, 55세에 막 자전거로 체중 감량을 시작한 여성 수강생에게 적용하는 것은 전혀 맞지 않을 수 있습니다. 운동과학에는 심각한 "연구 대상자 편향"이 있습니다 — 대다수 연구가 젊고 건강하며 남성인 운동선수를 대상으로 하며, 이것이 외적 타당도(일반화 가능성)의 문제입니다. 저는 중장년이나 여성 수강생을 지도할 때 어떤 연구를 보든 먼저 스스로 묻습니다: 이 연구 대상자들은 내 수강생과 얼마나 다른가?

단일 숫자보다 신뢰 구간을 보는 것이 더 정직합니다. 연구가 "평균 3% 향상"을 주장하지만 95% 신뢰 구간이 "-1% ~ 7%"라면, 실제 효과가 "사실상 약간 퇴보"부터 "상당한 진전"까지 모두 가능하다는 뜻이며, 이런 결론은 사실 매우 불확실합니다. 구간이 좁을수록 추정이 더 신뢰할 만합니다.

항상 “제한점” 부분을 읽으세요. 좋은 연구자는 자신의 약점을 정직하게 나열합니다: 표본이 작음, 추적 기간이 짧음, 눈가림 불가, 대리 지표 사용 등. 논문의 논의 부분이 광고처럼 좋은 점만 말하고 어떤 제한점도 언급하지 않는다면, 제 경계심은 바로 최고조에 달합니다.

자금 출처와 이해관계 충돌을 확인하세요. 이것은 음모론이 아닙니다. 특정 보충제 브랜드가 전액 후원하고 저자가 해당 브랜드의 자문위원인 연구는 결론이 반드시 조작되었다는 뜻은 아니지만, 해석할 때 마음속에 저울을 하나 두어야 합니다. 이것은 보충제, 기능성 음료, 웨어러블 기기 연구에서 특히 중요합니다.

「위험 신호」 빠른 선별표

더 빨리 익숙해지도록, “보이면 경계심을 높여야 하는” 신호를 아래 빠른 선별표로 정리했다. 모든 글마다 전체 과정을 거칠 필요 없이, 먼저 위험 신호를 훑어보고 해당되는 항목이 많을수록 더 보수적으로 판단하면 된다.

위험 신호 경계해야 하는 이유 권장 대처법
초록이나 보도자료만 있고 원문을 찾을 수 없음 방법과 데이터를 확인할 수 없음 원본 논문을 찾은 후 판단
표본 수가 한 자릿수이고 대조군이 없음 교란 요인을 배제하기 거의 불가능 '초기 단서’로만 간주하고 결론으로 삼지 말 것
상대 백분율만 제시하고 절대값을 주지 않음 과장되기 가장 쉬움 직접 절대 차이로 환산
p 값만 있고 효과 크기가 없음 실제 효과가 얼마나 큰지 알 수 없음 Cohen’s d나 원자료를 찾아볼 것
실험실 지표로 경기력 향상을 주장함 대리 지표는 실제 경기력과 같지 않음 기대치를 낮추고 실제 경기력 연구를 기다릴 것
연구가 해당 제품을 판매하는 업체의 전액 후원을 받음 잠재적 이해상충 가능성 기준을 세우고 독립 연구와 대조해볼 것
제목과 본문 어조가 광고 같고 한계점 언급이 전혀 없음 지나치게 단순화된 경우가 많음 ‘한계점’ 부분을 찾아 직접 확인

이 표는 저장해두길 권한다. 다음에 자극적인 스포츠 과학 게시물을 보게 되면 대조해보라. 많은 과장이 그 자리에서 드러날 것이다.

흔한 함정과 수정법

학생들과 함께 논문을 읽어온这些年, 사람들이 가장 자주 빠지는 함정은 몇 가지로 정리된다. 그것들을 나열하고 '수정된 질문 방식’을 함께 제시한다.

함정 1: '상관관계’를 '인과관계’로 오해

잘못된 예시: “연구 결과 잠을 많이 자는 러너일수록 부상이 적다고 한다. 그러니 잠을 많이 자면 부상을 예방할 수 있다!”

문제: 이것은 단지 상관관계일 수 있다. 어쩌면 '원래 자기관리가 철저하고 훈련 계획이 합리적인 사람’이 잠도 많이 자고 부상도 적었을 뿐, 수면은 그 '자기관리’의 부산물일 수 있으며 직접적인 원인은 아닐 수 있다. 횡단 연구와 코호트 연구는 '함께 나타나는 현상’을 보여줄 수 있지만, '누가 누구를 야기하는지’를 증명하기는 어렵다.

수정된 질문: 이것은 관찰된 연관성인가, 아니면 무작위 중재로 증명된 인과관계인가? RCT와 같은 중재 연구만이 인과관계를 말할 수 있는 근거가 된다.

함정 2: 상대값만 보고 절대값을 무시

잘못된 예시: “어떤 보충제가 부상 위험을 '50% 감소’시킨다!”

문제: 원래 부상률이 2%에서 1%로 줄었다면, '상대적 50% 감소’는 굉장히 대단해 보이지만 절대적으로는 단 1%포인트 차이다. 한 사람에게 혜택이 돌아가려면 아주 많은 사람이 사용해야 할 수도 있다. 상대위험도가 가장 사람을 속이기 쉽다. 반드시 절대 수치로 환산해야 한다.

수정된 질문: 그렇다면 절대 차이는 얼마인가? 이 정도의 이점을 얻기 위해 얼마나 투자해야 하는가(금전, 시간, 부작용)?

함정 3: 작은 표본 + 데이터 골라내기(p-hacking)

문제: 연구에서 파워, 심박수, 젖산, 주관적 피로, 수면, 기분 등 수많은 지표를 측정한 다음, 그중 ‘우연히 유의미하게 나온’ 한두 개만 골라 제목으로 쓰는 경우를 다중 비교 문제라고 한다. 측정하는 항목이 많을수록 순전히 운으로 ‘유의미한’ 결과 하나를 건질 확률이 높아진다.

수정된 질문: 총 몇 개의 지표를 측정했는가? 사전에 연구 계획을 등록했는가(pre-registration)? 결론이 수많은 지표 중에서 골라낸 단 하나에만 근거하고 있지 않은가?

함정 4: 단기 대리 지표로 장기 경기력을 추론

문제: 실험실에서 '젖산 역치 파워 상승’을 측정했다고 해서 '6개월 후 경기에서 더 빨라진다’는 뜻은 아니다. 그 사이에는 훈련 전환, 경기 전략, 심리, 보급 실행 등 수많은 변수가 존재한다.

수정된 질문: 연구가 측정한 것은 실험실 지표인가, 아니면 실제 경기력(경기 기록, 완주 시간)인가? 그 둘 사이의 다리를 저자가 제시해 주었는가?

함정 5: 무반응자를 무시하고 평균만 봄

문제: 앞서 언급했듯이, 같은 훈련 계획에도 크게 발전하는 사람이 있는 반면 전혀 반응이 없는 사람도 있다. 평균값만 보면 '모두가 이만큼 발전할 것’이라고 착각하게 되지만, 자신이 바로 그 무반응자일 수도 있다.

수정된 질문: 저자가 개인차나 반응자 비율을 보고했는가? 평균적으로 효과가 있다고 해서 나에게도 효과가 있다는 보장은 없다는 점을 마음에 새겨야 한다.

함정 6: '유의미하지 않음’을 '효과 없음의 증거’로 오해

문제: 이것은 반대 방향의 오독이다. 표본이 작은 연구에서 ‘유의미한 차이를 측정하지 못했다면’ 많은 사람이 "그러니까 이 방법은 효과가 없다"고 단정한다. 하지만 '효과에 대한 증거가 없다’는 것은 '효과 없음이 증명되었다’는 뜻이 아니다. 표본이 너무 적거나 측정이 너무 조잡하면 실제로 존재하는 효과가 노이즈에 묻힐 수 있다(통계적 검정력 부족).

수정된 질문: '효과 없음이 증명된 것’인가, 아니면 '이번에는 측정해내지 못한 것’인가? 표본이 충분히 큰가? 효과 크기의 방향과 크기는 어떠한가?

함정 7: 생존자 편향과 선별된 사례

문제: 피트니스 콘텐츠는 '이 방법으로 PR을 갱신했다’는 성공담을 가장 좋아하지만, 같은 방법을 썼지만 효과를 보지 못했거나 부상으로 그만둔 사람이 얼마나 되는지는 알려주지 않는다. 우리가 보는 것은 모두 ‘살아남아서 이야기를 전하는’ 집단이다. 이것을 생존자 편향이라고 한다.

수정된 질문: 효과를 보지 못한 사람들은 어디에 있는가? 이것은 모든 사람을 체계적으로 추적한 결과인가, 아니면 성공 사례만 골라서 이야기하는 것인가?

수준별 독자를 위한 행동 제안

논문 읽기는 단계에 따라 필요한 깊이가 다르다. 제안을 세 단계로 나누었으니 자신에게 맞는 단계를 찾아보라.

초보자: 먼저 '의심하는 반사 신경’을 기르자

통계를 이해할 필요는 없다. 세 가지 반사 동작만 익히면 된다.

  • '연구가 입증했다’는 말을 보면, 먼저 어느 수준의 증거인지 묻는다(피라미드의 꼭대기인지 바닥인지).
  • 과장된 백분율을 보면, 먼저 절대값이 얼마인지, 표본이 몇 명인지 묻는다.
  • 보충제의 신화적 효능을 보면, 먼저 누가 후원했는지 확인한다.

이 세 가지만으로도 시중에 넘쳐나는 과장 광고의 80%는 걸러낼 수 있다. 이 단계에서는 메타분석이나 스포츠 영양 학회 같은 공식 입장문을 우선 신뢰하길 권한다. 단일 신규 연구의 스크린샷보다는.

중급자: 방법과 효과 크기를 읽는 법을 익히자

이미 파워 미터를 다룰 줄 알고 훈련 계획을 볼 줄 안다면, 한 단계 더 나아가기 위해:

  • 초록과 방법 부분만 읽고 대조군과 무작위 배정이 있는지 판단하는 연습을 한다.
  • ‘효과 크기를 먼저 찾고, 그다음 p 값을 보는’ 습관을 기른다.
  • 논문의 ‘한계점’ 부분을 읽으며 약점을 찾는 훈련을 한다.
  • 영어 논문을 만나면 무료로 제공되는 PubMed 초록과 Google Scholar를 활용한다.

고급자/코치: 문헌을 전체적인 맥락에 놓자

사람을 지도하는 입장이라면 책임이 더 크다. 자신의 해석이 다른 사람의 몸에 영향을 미치기 때문이다.

  • 새로운 연구 하나 때문에 모든 선수의 훈련 계획을 크게 바꾸지 말고, 반복 검증될 때까지 기다린다.
  • '집단 적합성’을 최우선으로: 이 연구의 피험자가 내 선수와 얼마나 비슷한가?
  • 개인차를 기억하고 조정의 여지를 남기며, 실제 데이터로 각 선수의 진짜 반응을 추적한다.
  • 건강과 부상 관련해서는 표현을 보수적으로 하고, 필요하면 전문가에게 의뢰한다.

또한, 고급 코치가 가장 경계해야 할 것은 '확증 편향’이다. 이미 믿는 훈련 철학이 있으면 자신을 지지하는 연구만 골라 보고, 자신을 반박하는 연구는 외면하기 쉽다. 내가 이 문제를 다루는 방법은 내 방식에 반대하는 고품질 연구를 일부러 읽는 것이다. 읽고 나서도 조정이 필요하다고 판단되면 조정하고, 논리가 굳건하다면 자신감도 더 단단해진다. 증거를 정직하게 대하는 것이 좋은 코치와 고집 센 코치를 가르는 분기점이다.

대만 현지에서의 실용적인 주의사항

우리가 대만에서 스포츠와 건강 연구를 읽을 때는, 한 겹 더 현지에 맞게 보정해야 합니다. 몇 가지 예를 들어보겠습니다:

  • 기후: 많은 지구력 연구가 온대·건조하고 서늘한 환경에서 이루어집니다. 대만의 여름은 덥고 습해서, 동일한 수분·전해질 보충 전략을 그대로 적용하기 어렵습니다. 실제 상황에서는 대개 더 적극적인 체온 저하와 수분 보충이 필요합니다.
  • 식습관: 해외 영양 연구는 주로 서양식 식단을 배경으로 합니다. 대만의 외식족 식사 구조(도시락, 면 요리, 수제 음료)는 다르기 때문에, 탄수화물과 나트륨 섭취 패턴은 스스로 환산해야 하며 연구의 그램 수를 그대로 적용할 수 없습니다.
  • 의료 환경: 이 점은 사실 대만의 강점입니다. 우리는 비교적 접근성이 좋은 건강보험과 스포츠의학·재활의학과 자원이 있습니다. 반복되는 통증, 과훈련 의심, 또는 어떤 내과적 경고 신호가 있을 때 논문 한 편으로 스스로 진단하지 말고, 의사나 물리치료사에게 진료를 받아 평가받는 것이 논문 열 편을 읽는 것보다 훨씬 믿을 만합니다.

저는 자주 회원분들에게 말합니다: 논문은 질문의 질을 높이는 데 쓰는 것이지, 전문적인 평가를 대체하는 데 쓰는 것이 아닙니다. 특히 몸에 이상이 있을 때는 이 경계선을 분명하게 지켜야 합니다.

  • 장소와 장비: 많은 훈련 연구가 표준 러닝머신, 풍저항 트레이너, 또는 항온 실험실에서 이루어집니다. 대만 사람들의 실제 훈련 현장은 흔히 강변 자전거 도로의 맞바람, 신호등이 있는 시내, 미끄러운 산길, 후텁지근한 운동장입니다. 연구의 ‘깨끗한’ 조건은 실제 현장에 적용할 때 할인해서 봐야 하며, 수치를 그대로 적용하면 안 됩니다.
  • 강도와 더위: 여름의 보이지 않는 세금: 대만의 덥고 습한 기후는 경기력을 훔쳐가는 '보이지 않는 세금’입니다. 서늘한 환경에서 설정한 동일한 인터벌 강도라도, 6월부터 9월까지의 오후에는 평소 같은 페이스보다 심박수가 훨씬 높아지고 체감 강도도 훨씬 무겁습니다. 이때 무리하게 연구의 '목표 파워’를 맞추려고 하면 오히려 과도한 피로가 오기 쉽습니다. 저는 회원분들에게 여름에 연구를 보고 강도를 정할 때 '더위’를 하나의 추가 변수로 생각하고, 내려야 할 때는 내리고, 일찍 수분을 보충해야 할 때는 보충하라고 당부합니다.

가지고 갈 세 가지 질문(휴대용 버전)

한 가지만 기억하고 싶다면, 이 표를 기억하세요. 이것은 제가 모든 회원분께 '연구에서 말한다’는 말을 볼 때마다 머릿속으로 한 번씩 돌려보라고 요구하는 세 가지 연속 질문입니다:

물어볼 질문 무엇을 확인하는가 통과하지 못하면 의미하는 것
이건 어느 수준의 증거인가? 연구 설계의 신뢰도 단지 사례 보고나 동물 실험일 뿐이면, 정설로 받아들이지 말 것
효과 크기는 얼마나 크고, 절대값은 얼마인가? 실무적으로 가치가 있는지 유의미하지만 너무 작아서 느낄 수 없을 수도 있음
숨은 함정이 있는가? 상관/인과, 후원, 데이터 선별 결론이 과대평가되거나 오도될 수 있음

저는 자주 회원분들에게 이 세 가지 연속 질문을 익히면, 제목만 공유하는 대부분의 사람들을 이길 수 있다고 말합니다.

자주 묻는 질문(FAQ)

Q: 영어를 잘 못하는데 논문을 읽을 수 있을까요?
읽을 수 있습니다. 먼저 중국어로 된 통합형 과학 대중화 자료나 공식 입장문부터 시작해서 증거 수준을 판단하는 연습을 하세요. 실제로 원문을 읽어야 할 때는 PubMed의 초록이 보통 구조화된 배경, 방법, 결과, 결론으로 되어 있어서, 번역 도구와 함께 초록만 읽어도 핵심의 70%는 파악할 수 있습니다. 전문을 한 글자씩 억지로 읽을 필요는 없습니다.

Q: 새로운 연구 하나가 이전의 주장을 뒤집었는데, 무엇을 믿어야 하나요?
보통 '누적된 증거’를 먼저 믿으세요. 단일 신규 연구가 아무리 놀랍다 해도 퍼즐의 한 조각일 뿐입니다. 다른 팀에 의해 재현되거나 새로운 메타분석에 포함된 다음에야 행동을 조정할지 고려하세요. 과학은 복제와 검증을 통해 천천히 진실에 접근하는 것이지, 가장 새롭고 가장 자극적인 헤드라인으로 접근하는 것이 아닙니다.

Q: p값은 도대체 얼마나 작아야 인정받나요?
0.05는 관례적인 기준일 뿐, 신성한 숫자가 아닙니다. p값 자체에 집착하기보다는 효과 크기와 신뢰구간을 보는 습관을 기르길 바랍니다. '겨우 p = 0.049’인 결과가 'p = 0.051’인 결과보다 그렇게 더 신기한 것은 아닙니다.

Q: 그럼 평소 훈련은 누구 말을 들어야 하나요?
자신의 데이터를 듣고, 여기에 질 좋은 증거를 프레임워크로 사용하세요. 연구는 방향과 범위를 제시하고, 훈련 일지, 파워, 심박수, 주관적 느낌은 ‘당신에게’ 효과가 있는지 알려줍니다. 연구를 지도로, 자신의 신체 피드백을 GPS로 삼아 둘을 함께 사용하세요.

Q: 보충제 연구의 신뢰성을 빠르게 판단하려면 어떻게 해야 하나요?
세 단계입니다: 첫째, 제조사 후원인지 확인하고, 둘째, 표본이 자신과 비슷한 집단인지 확인하고, 셋째, '유의미함’만 보지 말고 효과 크기를 확인하세요. 세 관문을 모두 통과한 후에 고려하면, 대부분의 과대광고를 걸러낼 수 있습니다.

Q: 메타분석이면 반드시 가장 신뢰할 수 있나요?
증거 수준의 최상위에 있지만, 면죄부는 아닙니다. '쓰레기를 넣으면 쓰레기가 나온다’는 말이 있습니다. 만약 그것이 종합한 원본 연구들의 질이 낮고 출판 편향(효과가 있는 연구는 발표되기 쉽고, 효과가 없는 연구는 서랍에 묻히기 쉬움)이 있다면, 결론도 왜곡될 수 있습니다. 메타분석을 볼 때는 저자들이 포함된 연구의 질을 평가했는지, 이질성(각 연구 결과의 차이가 얼마나 큰지)을 논의했는지留意하세요.

Q: 숫자만 보면 머리가 아픈데, 꼭 통계를 알아야 하나요?
아닙니다. 이 글은 처음부터 끝까지 아무것도 계산하라고 요구하지 않습니다. 여러분이 익혀야 할 것은 '계산 능력’이 아니라 '판독 습관’입니다. 증거 수준을 구분하고, 절대값을 보고, 후원 출처를 확인하는 이 세 가지는 수학 계산이 전혀 필요 없지만, 대부분의 오도를 막아줍니다. 통계적 세부 사항은 시간이 지나면서 천천히 쌓아가면 됩니다.

Q: 그럼 웨어러블 기기(시계, 파워미터) 제조사의 연구는요?
보충제와 동일하게 처리하세요. 먼저 제조사가 직접 했는지, 표본이 자신과 비슷한지, 효과 크기가 큰지 확인하세요. 기기 연구는 '측정 자체가 정확한지’도 추가로留意해야 합니다. 센서에 오차가 있다면 그 뒤의 결론도 당연히 할인해서 봐야 합니다. 독립적인 제3자 검증이 있는 것은 신뢰도가 한 단계 더 높습니다.

맺음말

처음에 비트 주스(beetroot juice)를 사둬야 하는지 물어본 회원분에게로 돌아가 보겠습니다. 그날 이후, 그는 바로 사지 않고 스스로 그 연구를 찾아보았습니다. 표본은 십여 명에 불과하고, 모두 훈련이 잘 된 젊은 사이클리스트였으며, 효과 크기는 중간 정도였고, 같은 종류의 연구 결과들이 사실 꽤 큰 차이를 보인다는 것도 발견했습니다. 그가 마지막에 저에게 말했습니다: “코치님, 저는 일단 수면과 영양 보충부터 제대로 하고, 이건 나중에 다시 보겠습니다.”

그 순간 저는 그가 PR(개인 최고 기록)을 갱신했을 때보다 더 기뻤습니다. 그가 배운 것은 특정 훈련법이 아니라, 평생 함께할 수 있는 판독 능력이었기 때문입니다. '연구로 입증됨’이라는 말이 넘쳐나는 이 시대에, 스스로 읽고, 스스로 생각하고, 합리적인 의심을 유지하는 것이 가장 강력한 장비입니다.

오늘부터 선정적인 제목을 볼 때마다 미소를 지으며 먼저 이렇게 물어보시길 바랍니다: “이건 어느 수준의 증거인가? 효과 크기는 얼마나 큰가? 중간에 함정은 없는가?” — 그런 다음에 믿을지 결정하세요.


본문은 교육용 콘텐츠로, 의사, 물리치료사 또는 영양사의 개별 진단 및 치료 권고를 대체할 수 없습니다. 신체적 불편, 질환 또는 약물 조정과 관련된 사항은 반드시 전문 의료진의 개별화된 평가를 받으시기 바랍니다.

참고 자료

관련 주제 읽기

相關影片
訂閱CT的頻道

訂閱 CT Yeh,看武嶺實測與路線攻略

北進武嶺、西進武嶺、經典百K,每條路線都親自騎過,配速、爬升、補給點全部實拍實測。

467 部影片 · 累計 838 萬次觀看