여러분은 현재 작성 중인 R을 이용한 인과 추론의 초판본을 읽고 계십니다. 이 장은 거의 완성되었으나, 작은 수정이나 문구 교정이 있을 수 있습니다.
1 일상에서 인과로
1.1 일상적인 추론 (Casual inference)
인과 분석의 핵심은 인과적 질문입니다. 이 질문은 우리가 어떤 데이터를 분석할지, 어떻게 분석할지, 그리고 우리의 추론이 어떤 인구 집단에 적용될지를 결정합니다. 이 책은 성격상 실무에 중점을 두고 있으며, 주로 인과 추론의 분석 단계(analysis stage)를 다룹니다. 좋은 인과적 질문을 명시하는 복잡성에 비하면, 분석 단계는 상당히 간단합니다. 이 책의 처음 6장에서는 인과적 질문이 무엇인지, 질문을 어떻게 개선할 수 있는지 논의하고 몇 가지 사례를 살펴볼 것입니다.
인과적 질문은 데이터 과학의 주요 과업인 묘사(description), 예측(prediction), 인과 추론(causal inference)과 관련된 통계적 기술로 던질 수 있는 더 넓은 범위의 질문 중 일부입니다 (Hernán, Hsu, 와/과 Healy 2019). 불행히도 이러한 과업들은 우리가 사용하는 기술(예를 들어 회귀 분석은 세 가지 과업 모두에 유용합니다)과 그것들을 이야기하는 방식 때문에 종종 뒤섞이곤 합니다. 연구자들이 무작위 배정되지 않은 데이터로부터 인과 추론에 관심을 가질 때, 인과 효과를 추정하려는 의도를 명확히 밝히는 대신 “연관성(association)”과 같은 완곡한 표현을 사용하는 경우가 많습니다 (Hernán 2018).
예를 들어, 최근 역학 연구의 분석 언어에 대한 연구에 따르면, 추정된 효과를 설명하는 가장 일반적인 어근은 “associate(연관시키다)”였지만, 많은 연구자는 “associate”가 적어도 어느 정도의 인과 효과를 암시한다고 느꼈습니다 (그림 1.1) (Haber 기타 2022). 분석된 연구 중 약 1%만이 “cause(원인)”라는 어근을 전혀 사용했습니다. 그럼에도 불구하고 연구의 1/3은 행동 권고안(action recommendations)을 담고 있었으며, 연구자들은 이러한 권고안의 80%가 적어도 어느 정도의 인과적 함의를 가지고 있다고 평가했습니다. 종종 이러한 연구들은 효과에 대한 설명(“associate”나 “compare”와 같은 어근)에서 암시하는 것보다 더 강력한 행동 권고(인과 효과를 암시함)를 내놓습니다. 많은 연구가 목표가 인과 추론임을 암시했음에도 불구하고, 이 책에서 논의하는 것과 같은 공식적인 인과 모델을 사용한 연구는 약 4%에 불과했습니다. 그러나 대부분은 그러한 원인이 이전 연구나 이론에 의해 어떻게 정당화될 수 있는지 논의했습니다.
1.1.1 묘사 (Description)
묘사적 분석(Descriptive analysis)은 변수의 분포를 설명하는 것을 목표로 하며, 종종 주요 관심 변수에 따라 층화(stratified)됩니다. 이와 밀접한 관련이 있는 개념으로 탐색적 데이터 분석(EDA)이 있지만, 묘사적 연구는 대개 EDA보다 더 명확한 목표를 가집니다.
묘사적 분석은 일반적으로 중심 경향성(평균, 중앙값)과 퍼짐 정도(최솟값, 최댓값, 사분위수)와 같은 통계적 요약에 기반하지만, 가끔 회귀 모델링과 같은 기술을 사용하기도 합니다. 회귀와 같은 고급 기술을 적용하는 목표는 묘사적 분석에서 예측이나 인과 연구와는 다릅니다. 묘사적 분석에서 변수를 “조정(adjusting)”한다는 것은 그 변수의 연관 효과를 제거한다는 것(따라서 질문을 바꾸는 것)을 의미하며, 교란(confounding)을 통제한다는 의미가 아닙니다.
역학에서 묘사적 분석의 유용한 개념은 “사람, 장소, 시간”입니다. 즉, 누가 어떤 질병을 앓고 있는지, 어디서, 언제 발생하는지를 따지는 것입니다. 이 개념은 다른 분야의 묘사적 분석에도 좋은 템플릿이 됩니다. 일반적으로 우리는 묘사하려는 대상 인구가 누구인지 명확히 하고 싶어 하므로 가능한 한 구체적이어야 합니다. 인간의 건강은 관련 인물, 위치 및 기간을 묘사하는 것이 모두 중요합니다. 다시 말해, 데이터에 대한 이해를 생성하는 첫 번째 원칙에 집중하고 그에 따라 데이터를 묘사하십시오.
1.1.1.1 사례
사건의 수를 세는 것은 우리가 데이터로 할 수 있는 가장 좋은 일 중 하나입니다. EDA는 예측 및 인과 분석 모두에 도움이 되지만, 묘사적 분석은 다른 분석 과업과 독립적으로 가치가 있습니다. 복잡한 머신러닝 모델을 개발할 줄 알았는데 대부분의 시간을 대시보드 제작에 쓰고 있다는 사실을 깨달은 데이터 과학자에게 물어보십시오. 데이터의 분포, 특히 핵심 분석 목표(예: 산업계의 KPI 또는 역학의 질병 발생률)에 대한 분포를 이해하는 것은 많은 유형의 의사 결정에 매우 중요합니다.
최근 묘사적 분석의 가장 좋은 사례 중 하나는 코로나19 팬데믹에서 나타났습니다 (Fox 기타 2022). 2020년, 특히 팬데믹 초기 몇 달 동안 묘사적 분석은 위험을 이해하고 자원을 배분하는 데 필수적이었습니다. 코로나바이러스는 다른 호흡기 질환과 유사하기 때문에 위험을 줄이기 위한 많은 공중보건 도구(예: 거리두기, 이후의 마스크 착용)가 있었습니다. 지역별 사례의 묘사 통계는 지역 정책과 그 정책의 강도를 결정하는 데 필수적이었습니다.
팬데믹 기간 중 더 복잡한 묘사적 분석의 훌륭한 사례는 여러 국가 및 지역의 기대 사망자 수와 관찰된 사망자 수를 비교한 파이낸셜 타임즈(Financial Times)의 지속적인 보고서였습니다1. 기대 사망자 수 계산은 대부분의 묘사 통계보다 약간 더 정교하지만, 인과 효과를 풀지 않고도(예: 사망이 직접적으로 코로나19 때문인가? 접근 불가능한 의료 서비스 때문인가? 코로나 이후의 심혈관 사건 때문인가?) 현재 사망에 대한 엄청난 양의 정보를 제공했습니다. 2020년 7월의 차트를 (단순화하여) 재현한 이 그래프에서 팬데믹 초기 몇 달 동안의 충격적인 영향을 볼 수 있습니다.
다음은 묘사적 분석의 다른 훌륭한 사례들입니다.
- 전 세계의 삼림 벌채. Our World in Data (Ritchie 와/과 Roser 2021)는 다양한 주제를 사려 깊게 다루며 대개 묘사적인 보고서를 생성하는 데이터 저널리즘 조직입니다. 이 보고서에서 그들은 산림 면적의 절대적 변화(산림 전이)와 상대적 변화(삼림 벌채 또는 재조림)를 시각화하여 보여주며, 기초 통계와 임업 이론을 사용하여 시간 경과에 따른 산림 상태를 보여주는 유용한 정보를 제공합니다.
- 클라미디아 및 임균 감염의 유병률 (Miller 2004). 질병 유병률(현재 얼마나 많은 사람이 질병을 앓고 있는지를 인구당 비율로 나타낸 것)을 측정하는 것은 기초 공중보건(자원, 예방, 교육)과 과학적 이해에 도움이 됩니다. 이 연구에서 저자들은 미국의 모든 고등학교(대상 인구)를 대표하도록 설계된 복잡한 설문 조사를 실시했습니다. 그들은 질문과 관련된 다양한 요인을 다루기 위해 설문 가중치(survey weights)를 사용한 다음 유병률 및 기타 통계를 계산했습니다. 나중에 보겠지만, 가중치는 인과 추론에서도 동일한 이유, 즉 특정 인구 집단을 대상으로 하기 위해 유용합니다. 그렇긴 하지만 모든 가중치 기술이 본질적으로 인과적인 것은 아니며, 이 사례도 그러했습니다.
- 인종 및 민족별 자궁 적출술 불평등 추정 (Gartner 기타 2020). 묘사적 기술은 경제학이나 역학 같은 분야의 격차를 이해하는 데에도 도움이 됩니다. 이 연구에서 저자들은 인종 또는 민족 배경에 따라 자궁 적출술의 위험이 다른지 물었습니다. 분석이 주요 변수에 의해 층화되어 있기는 하지만 여전히 묘사적입니다. 이 논문의 또 다른 흥미로운 점은 연구가 올바른 대상 인구에 대한 질문에 답하도록 보장하려는 저자들의 노력이었습니다. 그들의 분석은 여러 데이터 소스를 결합하여 실제 인구 유병률을 더 잘 추정했습니다(흔히 제시되는 병원 내 유병률 대신). 그들은 또한 자궁 적출술의 유병률을 조정했습니다. 예를 들어, 실제로 자궁 적출술을 받을 수 있는 사람들(즉, 아직 받지 않은 사람들) 사이에서만 발생률(신규 사례 비율)을 계산했습니다.
1.1.1.2 타당성 (Validity)
묘사적 분석에는 두 가지 중요한 타당성 문제가 있습니다: 측정 오차와 표본 추출 오차입니다.
측정 오차(Measurement error)는 하나 이상의 변수를 어떤 용량으로든 잘못 측정했을 때 발생합니다. 묘사적 분석에서 사물을 잘못 측정한다는 것은 질문에 대한 답을 얻지 못할 수도 있음을 의미합니다. 그러나 그 정도가 어느 정도인지는 측정 오차의 심각성과 질문 자체에 달려 있습니다.
표본 추출 오차(Sampling error)는 묘사적 분석에서 좀 더 미묘한 주제입니다. 이는 우리가 분석하는 인구(분석이 누구에 대한 묘사를 생성해야 하는가)와 불확실성(우리가 데이터를 가진 사람들에 대한 묘사가 우리가 묘사하려는 인구를 대표한다는 것을 얼마나 확신하는가)과 관련이 있습니다.
우리의 데이터가 나온 인구와 우리가 묘사하려는 인구는 유효한 묘사를 제공하기 위해 동일해야 합니다. 온라인 설문 조사로 생성된 데이터셋을 생각해 보십시오. 이 질문에 답하는 사람들은 누구이며, 우리가 묘사하고 싶은 사람들과 어떤 관계가 있습니까? 많은 분석에서 설문 조사에 시간을 내어 응답하는 사람들은 우리가 묘사하고 싶은 사람들과 다릅니다. 예를 들어, 설문 조사를 작성하는 사람들의 그룹은 그렇지 않은 사람들과 변수의 분포가 다를 수 있습니다. 이와 같은 데이터의 결과는 기술적으로 편향(bias)된 것이 아닙니다. 표본 크기와 관련된 불확실성과 측정 오차를 제외하면 묘사는 정확하기 때문입니다. 단지 올바른 사람들의 집단에 대한 것이 아닐 뿐입니다! 다시 말해, 우리는 잘못된 질문에 대한 답을 얻은 것입니다.
특히, 때때로 우리의 데이터가 전체 인구를 나타내거나(또는 그에 충분히 가까워) 표본 추출 오차가 무의미한 경우가 있습니다. 자사 서비스를 사용하는 모든 고객에 대한 특정 데이터를 가진 회사를 생각해 보십시오. 많은 분석에서 이것은 우리가 정보를 원하는 전체 인구(현재 고객)를 나타냅니다. 마찬가지로 전 국민 건강 등록부가 있는 국가에서는 특정 실용적 목적을 위해 사용 가능한 데이터가 전체 인구에 충분히 가까워 표본 추출이 필요하지 않습니다(비록 연구자들이 더 간단한 계산을 위해 표본 추출을 사용할 수는 있지만). 이러한 경우 불확실성이라는 것은 거의 존재하지 않습니다. 모든 것이 잘 측정되었다고 가정할 때, 우리가 생성하는 요약 통계는 인구 내의 모든 사람으로부터 정보를 가지고 있기 때문에 본질적으로 편향이 없고 정밀합니다. 물론 실제로는 최선의 상황에서도 측정 오차, 결측 데이터 등이 섞여 있기 마련입니다.
묘사적 분석의 한 가지 결정적인 세부 사항은 이 책의 주요 관심사 중 하나인 교란 편향(confounding bias)이 정의되지 않는다는 점입니다. 교란은 인과적인 관심사이기 때문입니다. 묘사적 분석은 관계 뒤에 있는 메커니즘이 아니라 관계 있는 그대로의 통계적 묘사이기 때문에 교란될 수 없습니다.
1.1.1.3 인과 추론과의 관계
인간은 패턴을 매우 잘 봅니다. 패턴 찾기는 우리 뇌의 유용한 기능이지만, 그것을 유효하게 할 수 있는 데이터나 방법으로 작업하지 않을 때 추론의 위험한 길로 이끌 수도 있습니다. 목표가 묘사일 때 가장 주의해야 할 점은 (암시적으로든 명시적으로든) 묘사에서 인과 관계로 도약하는 것입니다.
하지만 물론 인과 효과를 추정하고 있을 때도 묘사적 분석은 도움이 됩니다. 그것은 우리가 작업하는 인구, 결과의 분포, 노출(우리가 인과적일 수 있다고 생각하는 변수), 그리고 교란 요인(노출에 대한 편향되지 않은 인과 효과를 얻기 위해 고려해야 하는 변수)을 이해하는 데 도움을 줍니다. 또한 Chapter 7에서 보게 되겠지만, 우리가 사용하는 데이터 구조가 답하려는 질문과 일치하는지 확인하는 데에도 도움을 줍니다. 인과 연구를 수행할 때는 항상 데이터에 대한 묘사적 분석을 수행해야 합니다.
마지막으로, Chapter 6에서 보겠지만, 기초 통계로 인과 추론을 할 수 있는 특정 상황들이 있습니다. 여기서도 인과적 질문과 묘사적 구성 요소 사이의 구분에 주의하십시오. 동일한 계산(예: 평균 차이)을 사용한다고 해서 생성할 수 있는 모든 묘사가 인과적인 것은 아닙니다. 묘사적 분석이 인과적 분석과 겹치는지 여부는 데이터와 질문의 함수입니다.
1.1.2 예측 (Prediction)
예측의 목표는 데이터를 사용하여 변수를, 대개 새로운 데이터를 정확하게 예측하는 것입니다. 이것이 무엇을 의미하는지는 질문, 도메인 등에 따라 다릅니다. 예측 모델은 동료 검토를 거친 임상 모델부터 소비자 기기에 내장된 맞춤형 머신러닝 모델에 이르기까지 상상할 수 있는 거의 모든 환경에서 사용됩니다. ChatGPT의 기반이 되는 것과 같은 대규모 언어 모델조차도 예측 모델입니다. 즉, 프롬프트에 대한 응답이 어떻게 생겼을지를 예측하는 것입니다.
예측 모델링은 일반적으로 이 책에서 제시할 인과 모델링을 위한 워크플로와는 다른 워크플로를 사용합니다. 예측의 목표는 대개 새로운 데이터에 대한 예측을 하는 것과 관련이 있기 때문에, 이 유형의 모델링 워크플로는 새로운 데이터에 대한 일반화 능력을 유지하면서 예측 정확도를 최대화하는 데 중점을 둡니다. 이를 종종 편향-분산 트레이드오프(bias-variance trade-off)라고 합니다. 실무에서 이는 데이터를 훈련 세트(모델을 구축하는 데이터 부분)와 테스트 세트(모델을 평가하는 부분, 새로운 데이터에서 어떻게 수행될지에 대한 대리인)로 나누는 것을 의미합니다. 일반적으로 데이터 과학자들은 훈련 세트에 모델이 과적합(overfitting)되는 위험을 더욱 줄이기 위해 교차 검증(cross-validation)이나 다른 샘플링 기술을 사용합니다.
예측 모델링에 관한 훌륭한 텍스트들이 많이 있으므로, 기술의 목표와 방법을 더 깊이 탐구하려면 관련 문헌들을 참조하시길 바랍니다 (Kuhn 와/과 Johnson 2013; Harrell 2001; Kuhn 와/과 Silge 2022; James 기타 2022).
1.1.2.1 사례
예측은 데이터 과학에서 가장 인기 있는 주제이며, 이는 주로 산업계의 머신러닝 응용 덕분입니다. 물론 예측은 통계학에서 오랜 역사를 가지고 있으며, 오늘날 인기 있는 많은 모델이 학계 안팎에서 수십 년 동안 사용되어 왔습니다.
코로나19에 대한 예측 사례를 살펴봅시다2. 2021년, 연구자들은 급성 코로나19에 대한 심각한 부작용 결과를 예측하기 위한 임상 예후 모델인 ISARIC 4C 악화 모델(ISARIC 4C Deterioration model)을 발표했습니다 (Gupta 기타 2021). 저자들은 이 모델이 개발된 인구 집단, 특히 결과와 후보 예측 변수의 분포를 이해하기 위해 묘사적 분석을 포함했습니다. 이 모델의 유용한 점 중 하나는 코로나 관련 입원 첫날에 흔히 측정되는 항목들을 사용한다는 것입니다. 저자들은 영국의 지역별 교차 검증을 사용하여 이 모델을 구축한 다음, 제외된 지역의 데이터로 모델을 테스트했습니다. 최종 모델에는 11개 항목과 모델 속성, 결과와의 관계 등에 대한 설명이 포함되었습니다. 특히 저자들은 후보 변수를 선택하기 위해 임상 도메인 지식을 사용했지만, 모델 계수를 인과적으로 해석하려는 유혹에 빠지지 않았습니다. 의심할 여지 없이, 이 모델의 예측 가치 중 일부는 결과와 관련된 변수들의 인과 구조에서 비롯되지만, 연구자들은 이 모델로 완전히 다른 목표를 가지고 있었고 그것을 고수했습니다.
예측 분야의 다른 좋은 사례들은 다음과 같습니다:
예측 모델링에서 가장 흥미로운 작업 중 일부는 산업계에서 이루어집니다. 넷플릭스(Netflix)는 정기적으로 그들의 모델링 성공 사례와 새로운 전략에 대한 세부 정보를 연구 블로그에 공유합니다. 그들은 또한 최근 추천 시스템(이 경우에는 사용자에게 쇼와 영화를 추천함)을 위한 딥러닝 모델 사용을 검토하는 논문을 발표했습니다 (Steck 기타 2021). 저자들은 모델을 사용한 실험, 그 모델의 세부 사항, 그리고 그들이 직면한 많은 과제를 설명하며 그러한 모델 사용 실무 가이드를 제시했습니다.
2020년 초, 건강 연구의 예측 및 예후 모델링 경험이 풍부한 연구자들은 코로나19의 진단 및 예후를 위한 모델들에 대한 리뷰를 발표했습니다 (Wynants 기타 2020). 이 리뷰는 그 폭이 넓을 뿐만 아니라 품질이 좋지 않다고 평가된 모델의 수가 엄청나다는 점에서도 흥미롭습니다: “[232개의] 모델들이 편향의 위험이 높거나 불분명하다고 평가되었는데, 이는 주로 대조군 환자의 비대표적 선택, 연구 종료 시까지 관심 사건을 경험하지 않은 환자의 제외, 모델 과적합의 높은 위험, 그리고 불분명한 보고 때문이었습니다.” 이 연구는 또한 지속적으로 업데이트되는 리뷰(living review)입니다.
1.1.2.2 타당성 (Validity)
예측 모델링에서 타당성의 핵심 척도는 예측 정확도이며, 이는 평균 제곱근 오차(RMSE), 평균 절대 오차(MAE), 곡선 아래 면적(AUC) 등 여러 방법으로 측정될 수 있습니다. 예측 모델링의 편리한 세부 사항은 우리가 맞았는지 자주 평가할 수 있다는 점입니다. 이는 데이터의 일부만 가지고 있는 묘사 통계나 실제 인과 구조를 알지 못하는 인과 추론에서는 맞지 않는 말입니다. 항상 진실을 평가할 수 있는 것은 아니지만, 초기 예측 모델을 적합시키기 위해서는 거의 항상 요구됩니다3.
측정 오차 또한 예측 모델링의 관심사입니다. 정확한 예측을 위해서는 대개 정확한 데이터가 필요하기 때문입니다. 흥미롭게도 측정 오차와 결측은 예측 환경에서 정보를 제공할 수 있습니다. 인과적 환경에서는 이것이 편향을 유발할 수 있지만, 예측 모델은 문제없이 그 정보를 소비할 수 있습니다. 예를 들어 유명한 넷플릭스 프라이즈(Netflix Prize)에서 우승한 모델들은 추천 시스템을 개선하기 위해 고객이 영화를 평가했는지 여부에 대한 정보를 활용했습니다.
묘사적 분석과 마찬가지로 교란은 예측 모델링에서 정의되지 않습니다. 예측 모델의 계수는 교란될 수 없습니다. 우리는 변수가 예측 정보를 제공하는지 여부에만 관심이 있지, 그 정보가 인과 관계 때문인지 아니면 다른 것 때문인지는 상관하지 않기 때문입니다.
1.1.2.3 인과 추론과의 관계
예측에서 가장 큰 위험은 모델의 특정 계수가 인과적으로 해석될 수 있다고 가정하는 것입니다. 그렇지 않을 가능성이 큽니다. 모델이 예측은 잘할 수 있지만 인과적인 관점에서는 완전히 편향된 계수를 가질 수도 있습니다. 이 내용은 섹션 1.1.4 및 이 책의 나머지 부분에서 더 자세히 다룰 것입니다.
종종 사람들은 예측 모델을 위한 특징(변수) 선택 방법을 인과 모델의 교란 요인을 선택하는 데 잘못 사용하곤 합니다. 과적합의 위험은 차치하더라도, 이러한 방법은 예측 모델에는 적절하지만 인과 모델에는 적절하지 않습니다. 예측 메트릭은 질문의 인과 구조를 결정할 수 없으며, 결과에 대한 예측 가치가 있다고 해서 변수가 교란 요인이 되는 것은 아닙니다. 일반적으로 (예측이나 연관 통계가 아닌) 배경 지식이 인과 모델을 위한 변수를 선택하는 데 도움이 되어야 합니다 Robins 와/과 Wasserman (1999). 우리는 sec-dags장 및 sec-building-models장에서 이 과정을 자세히 논의할 것입니다.
그럼에도 불구하고 예측은 인과 추론에 필수적입니다. 철학적 관점에서 우리는 서로 다른 만약에(what if) 시나리오의 예측을 비교하고 있습니다: 한 가지 일이 일어났을 때와 다른 일이 일어났을 때 결과가 어떠할 것인가? 우리는 이 주제, 특히 sec-counterfactuals장에서 많은 시간을 보낼 것입니다. 또한 실무적 관점에서의 예측도 많이 이야기할 것입니다. 예측 및 일부 묘사에서와 마찬가지로, 인과적 질문에 답하기 위해 모델링 기술을 사용할 것이기 때문입니다. 성향 점수(propensity score) 방법과 g-추정(g-computation)과 같은 기술은 인과적 질문에 답하기 위해 모델 예측을 사용하지만, 모델 자체를 구축하고 해석하는 워크플로는 상당히 다릅니다.
1.1.3 인과 추론 (Causal Inference)
인과 추론의 목표는 노출(exposure)이라고 불리는 변수가 결과(outcome)라고 불리는 다른 변수에 미치는 영향을 이해하는 것입니다. “노출”과 “결과”는 우리가 관심을 갖는 인과 관계를 설명하기 위해 이 책에서 사용할 용어입니다. 중요한 것은 우리의 목표가 이 질문에 명확하고 정확하게 답하는 것이라는 점입니다. 실무에서 이는 연구 설계(예: 무작위 시험) 또는 통계적 방법(예: 성향 점수)과 같은 기술을 사용하여 결과에 대한 노출의 편향되지 않은 효과를 계산하는 것을 의미합니다.
예측 및 묘사와 마찬가지로, 명확하고 정확한 답을 얻기 위해서는 명확하고 정확한 질문으로 시작하는 것이 좋습니다. 통계학 및 데이터 과학에서, 특히 현대 세계의 데이터 바다를 헤엄쳐 갈 때, 우리는 종종 질문 없는 답을 얻게 됩니다(예: 42). 이것은 당연히 답의 해석을 어렵게 만듭니다. sec-diag에서는 인과적 질문의 구조를 논의할 것입니다. sec-counterfactuals장에서는 질문을 날카롭게 다듬는 철학적, 실무적 방법에 대해 논의할 것입니다.
일부 저자들은 “인과 추론”과 “설명”이라는 문구를 혼용하여 사용합니다. 우리는 그 점을 조금 더 신중하게 다룹니다. 인과 추론은 항상 설명과 관계가 있지만, 우리는 한 가지가 다른 것에 미치는 영향을 그것이 어떻게 일어나는지 이해하지 못하더라도 정확하게 추정할 수 있습니다.
소위 역학의 아버지라고 불리는 존 스노우(John Snow)를 생각해 보십시오. 1854년, 스노우는 런던의 콜레라 발병을 조사하여 특정 수원이 질병의 원인임을 밝혀낸 것으로 유명합니다. 그가 옳았습니다. 오염된 물이 콜레라 전파의 메커니즘이었습니다. 하지만 그는 어떻게 그렇게 되는지 설명할 충분한 정보가 없었습니다. 콜레라를 일으키는 박테리아인 콜레라균(Vibrio cholerae)은 그로부터 거의 30년이 지나서야 발견되었기 때문입니다.
1.1.3.1 사례
이 책에서 인과 추론의 많은 사례를 보게 되겠지만, 코로나19와 관련된 사례를 계속 살펴봅시다. 팬데믹이 지속되고 백신과 항바이러스 치료제 같은 도구들이 사용 가능해짐에 따라 보편적 마스크 착용과 같은 정책들도 바뀌기 시작했습니다. 2022년 2월, 미국의 매사추세츠주는 공립학교에서의 보편적 마스크 착용을 의무화하는 주 차원의 정책을 철회했습니다 (Cowger 기타 2022). 보스턴 대도시 지역에서는 일부 학군이 정책을 유지한 반면 다른 학군들은 중단했습니다. 중단한 학군들도 정책 변경 후 몇 주에 걸쳐 서로 다른 시점에 중단했습니다. 이러한 정책의 차이는 연구자들이 이 기간 동안 학군 정책의 차이를 활용하여 보편적 마스크 착용이 코로나19 사례에 미치는 영향을 연구할 수 있게 해주었습니다. 연구자들은 코로나19와 관련된 요인들 및 기타 건강 결정 요인들의 분포를 이해하기 위해 학군들의 묘사적 분석을 포함했습니다. 사례에 미치는 보편적 마스크 착용의 효과를 추정하기 위해, 저자들은 정책 관련 인과 추론에서 흔히 쓰이는 이중 차분법(difference-in-differences)이라는 기술을 사용하여 이 효과를 추정했습니다(장 23 에서 논의할 것입니다). 저자들은 마스크 착용을 지속한 학군들이 그렇지 않은 학군들보다 훨씬 적은 수의 사례를 보였음을 발견했습니다. 그들의 분석은 정책 변화로 인해 거의 12,000건의 추가 사례가 발생했으며, 이는 15주간의 연구 기간 동안 그 학군들에서 발생한 사례의 거의 30%에 해당한다고 결론지었습니다.
다음은 몇 가지 다른 흥미로운 사례들입니다:
넷플릭스는 업무에서 정기적으로 인과 추론을 사용합니다. 2022년에 그들은 자신들이 참여한 일부 인과적 과업을 요약한 블로그 포스트를 게시했습니다. 한 가지 흥미로운 사례는 현지화(localization)입니다. 전 세계적인 서비스를 제공하는 넷플릭스는 자막과 더빙을 통해 콘텐츠를 현지화합니다. 무작위 실험은 사용자에게 콘텐츠 제공을 보류하는 것을 의미하므로 좋지 않은 아이디어였고, 그래서 넷플릭스의 연구자들은 잠재적 교란을 해결하면서 현지화의 가치를 이해하기 위해 여러 접근 방식을 사용했습니다. 한 가지 사례는 팬데믹으로 인한 더빙 지연의 영향을 연구하는 것이었습니다. 연구자들은 합성 대조군(synthetic controls, 장 23)을 사용하여 이러한 지연이 있을 때와 없을 때의 시청률에 미치는 영향을 시뮬레이션했습니다. 아마도 팬데믹 관련 지연의 타이밍은 일반적으로 더빙 프로세스와 관련된 많은 요인과 무관했을 것이며, 따라서 잠재적 교란의 일부를 줄였을 것입니다.
터스키기 연구(Tuskegee Study)는 현대 역사에서 가장 악명 높은 의료 남용 사례 중 하나입니다. 이는 흑인 미국인들이 의료계를 불신하게 된 원인으로 흔히 지목됩니다. 보건 경제학 연구자들은 터스키기 연구가 불신과 기대 수명에 미치는 효과를 평가하기 위해 이중 차분법 기술의 변형을 사용하여 노년층 흑인 남성들을 조사했습니다 (Alsan 와/과 Wanamaker 2017). 결과는 중요하면서도 충격적입니다: “우리는 1972년 그 연구가 공개된 것이 노년층 흑인 남성의 의료적 불신과 사망률 증가, 그리고 외래 및 입원 의사와의 상호작용 감소와 상관관계가 있음을 발견했습니다. 우리의 추정치는 연구 공개에 대한 반응으로 흑인 남성의 45세 시점 기대 수명이 최대 1.5년 감소했음을 시사하며, 이는 1980년 흑인 남성과 백인 남성 간 기대 수명 격차의 약 35%, 남성과 여성 간 격차의 25%를 차지합니다.”
1.1.3.2 타당성 (Validity)
유효한 인과 추론을 하기 위해서는 섹션 3.3 에서 논의할 몇 가지 가정이 필요합니다. 예측과 달리, 우리는 일반적으로 우리의 인과 모델이 정확한지 확인할 수 없습니다. 다시 말해, 우리가 해야 하는 대부분의 가정은 검증 불가능합니다. 우리는 이 책에서 이러한 가정의 기초부터 실무적인 의사 결정, 모델의 문제점 조사에 이르기까지 이 주제로 계속해서 돌아올 것입니다.
1.1.4 왜 올바른 인과 모델이 단순히 최고의 예측 모델이 아닐까요?
이쯤 되면 왜 올바른 인과 모델이 단순히 최고의 예측 모델이 아닌지 궁금할 수 있습니다. 두 모델이 관련이 있다는 것은 일리가 있습니다. 당연히 다른 것의 원인이 되는 것은 예측 변수가 될 것이기 때문입니다. 결국 모든 것은 인과 관계이므로, 모든 예측 정보는 우리가 예측하려는 대상의 인과 구조와 어떤 용량으로든 관련이 있습니다. 예측을 잘하는 모델이 인과적이기도 하다는 것이 타당해 보이지 않나요? 일부 예측 모델이 훌륭한 인과 모델이 될 수 있고 그 반대도 가능하다는 것은 사실입니다. 불행히도 항상 그런 것은 아닙니다. 인과 효과가 반드시 예측을 특별히 잘해야 하는 것은 아니며, 좋은 예측 변수가 반드시 인과적으로 편향되지 않아야 하는 것도 아닙니다 (Shmueli 2010). 데이터만으로는 알 방법이 없으며, 이것이 장 5 의 주제입니다.
먼저 인과적 관점을 살펴봅시다. 이쪽이 조금 더 간단하기 때문입니다. 결과 및 노출과 관련된 변수들만 포함하는, 노출에 대해 인과적으로 편향되지 않은 모델을 생각해 보십시오. 다시 말해, 이 모델은 관심 있는 노출에 대해 올바른 답을 제공하지만 결과의 다른 예측 변수들은 포함하지 않습니다(이는 장 6 에서 논의한 것처럼 때때로 좋은 아이디어가 될 수 있습니다). 결과에 많은 원인이 있다면, 단일 노출과의 관계를 정확하게 설명하는 모델은 결과를 매우 잘 예측하지는 못할 것입니다. 마찬가지로, 결과에 대한 노출의 실제 인과 효과가 작다면 예측 가치를 거의 가져다주지 못할 것입니다. 즉, 모델의 예측 능력이 높든 낮든 간에 모델이 우리에게 정답을 주고 있는지 구별하는 데 도움이 되지 않습니다. 물론 낮은 예측력은 인과 효과가 응용 관점에서 큰 소용이 없음을 나타낼 수도 있지만, 그것은 여러 통계적 요인에 달려 있습니다.
예측 모델이 항상 편향되지 않은 인과 모델이 되지는 않는 데에는 두 가지 더 복잡한 이유가 있습니다. 첫 번째 이유로, 인과적 관점에서 정확한 모델을 생각해 보십시오. 이 모델은 결과에 미치는 효과를 추정하며, 이러한 모든 효과는 편향되지 않았습니다. 이러한 이상적인 환경에서도 다른 모델을 사용하여 더 나은 예측을 얻을 수 있습니다. 그 이유는 예측 모델링의 편향-분산 트레이드오프와 관련이 있습니다. 효과가 작거나, 데이터에 노이즈가 많거나, 예측 변수들 사이에 상관관계가 높거나, 데이터가 많지 않을 때, 페널티 회귀(penalized regression)와 같은 편향된 모델을 사용하는 것이 합리적일 수 있습니다. 이러한 모델들은 데이터 외(out-of-data) 예측에서 분산을 개선하는 대신 의도적으로 편향을 도입합니다. 예측과 인과 추론의 목표가 다르기 때문에(정확한 예측, 대개 데이터 외 관측치에 대한 것 vs. 편향되지 않은 효과), 추론을 위한 최선의 모델이 반드시 최선의 예측 모델인 것은 아닙니다.
둘째, 인과적 관점에서 편향된 변수들이 종종 예측력을 동반하곤 합니다. 모델에 어떤 변수를 포함하고 포함하지 말아야 할지는 장 4 에서 논의하겠지만, 간단한 예를 들어보겠습니다. 교란된 관계의 유명한 사례 중 하나는 여름철 아이스크림 판매량과 범죄율입니다. 묘사적으로 아이스크림 판매량과 범죄는 관련이 있지만, 이 관계는 날씨에 의해 교란됩니다. 예를 들어, 날씨가 더워지면 아이스크림 판매량과 범죄가 모두 증가합니다. (물론 날씨 자체가 범죄를 일으키는 것은 아니기 때문에 이는 단순화된 것이지만, 인과 경로상에 있습니다.)
여러분이 어두운 방에 있는 사고 실험을 해보십시오. 여러분의 목표는 범죄를 예측하는 것이지만 날씨나 시기는 모릅니다. 하지만 여러분에게는 아이스크림 판매량에 대한 정보가 있습니다. 범죄에 대한 아이스크림 판매량 모델은 인과적 관점에서 편향될 것입니다. 아이스크림 판매가 범죄를 일으키지 않음에도 불구하고 모델은 효과를 보여줄 것이기 때문입니다. 하지만 이 모델은 여러분의 범죄 모델에 약간의 예측 가치를 제공할 것입니다. 이 두 조건의 이유는 동일합니다. 날씨와 아이스크림 판매량은 상관관계가 있고, 날씨와 범죄도 마찬가지이기 때문입니다. 아이스크림 판매량은 완벽하지는 않더라도 날씨에 대한 대리인(proxy) 역할을 성공적으로 수행할 수 있습니다. 그 결과 범죄에 대한 아이스크림 판매의 인과적 영향에 대해서는 편향된 효과 추정치가 나오지만, 범죄에 대해서는 부분적으로 효과적인 예측이 가능해집니다. 인과적 관점에서 유효하지 않은 다른 변수들도, 그 자체가 편향되었거나 인과 효과 추정치에 편향을 도입함으로써 종종 좋은 예측 가치를 제공합니다. 따라서 예측 정확도는 인과 관계의 좋은 척도가 아닙니다.
이와 밀접한 관련이 있는 개념으로 표 2의 오류(Table Two Fallacy)가 있습니다. 건강 연구 논문에서 묘사적 분석은 종종 표 1에 제시되고, 회귀 모델은 종종 표 2에 제시되기 때문에 붙여진 이름입니다 (Westreich 와/과 Greenland 2013). 표 2의 오류는 연구자가 교란 요인과 기타 비노출 변수들을 제시하면서, 특히 그러한 계수들을 마치 인과적인 것처럼 해석할 때 발생합니다. 문제는 어떤 상황에서는 한 변수의 편향되지 않은 효과를 추정하기 위한 모델이 다른 변수의 편향되지 않은 효과를 추정하기 위한 모델과 다를 수 있다는 점입니다. 다시 말해, 교란 요인들의 효과는 그들 자체가 원래 노출과 무관한 다른 변수에 의해 교란될 수 있기 때문에 인과적으로 해석할 수 없습니다.
묘사적, 예측적, 인과적 분석은 항상 서로의 측면을 어느 정도 포함하고 있습니다. 예측 모델은 결과의 인과 구조로부터 예측력의 일부를 얻고, 인과 모델은 결과에 대한 정보를 포함하고 있기 때문에 어느 정도의 예측력을 가집니다. 하지만 동일한 데이터에서 동일한 모델을 사용하더라도 목표가 다르면 그 목표에 따라 유용성도 달라집니다.
1.2 인과적 주장 다이어그램 그리기
묘사적이든, 예측적이든, 추론적이든 각 분석 과업은 명확하고 정확한 질문에서 시작해야 합니다. (우리가 다시 집중할) 인과적 질문의 구조를 더 잘 이해하기 위해 다이어그램을 그려봅시다. 문장 다이어그램(Diagramming sentences)은 문장의 구조를 시각적으로 표현하기 위해 사용되는 문법적 방법으로, 가끔 초등학교에서 교육되기도 합니다. 이 기술에서는 문장을 주어, 동사, 목적어, 수식어와 같은 구성 요소로 해체한 다음 일련의 선과 기호를 사용하여 표시합니다. 다이어그램에서 이러한 요소들의 배열은 그들의 구문적 역할과 문장의 전체 구조 내에서 어떻게 상호 작용하는지를 반영합니다. 문장을 이러한 시각적 표현으로 분해함으로써, 다이어그램 그리기는 학습자가 문장 구성의 미묘한 차이를 파악하고, 문법적 오류를 식별하며, 단어들 사이의 복잡한 연결을 이해하는 데 도움을 줄 수 있습니다. 인과적 주장에도 비슷한 아이디어를 적용할 수 있습니다. 다음은 인과적 주장을 어떻게 다이어그램으로 그릴 수 있는지에 대한 예시입니다. 우리는 원인(cause), 효과(effect), 주체(subject) (누구를 위해?), 그리고 시기(timing) (언제?)를 뽑아냈습니다.
기본적인 인과적 질문부터 시작해 봅시다: 흡연은 폐암을 유발하는가?
여기서 인과적 주장은 흡연이 폐암을 유발한다는 것이 될 수 있습니다. 그림 1.4 는 이 인과적 주장의 잠재적 다이어그램을 보여줍니다.
좀 더 구체적으로 들어가 봅시다. 2005년 JAMA(미국 의학 협회 저널)에 “흡연 감소가 폐암 위험에 미치는 효과”라는 제목의 연구가 발표되었습니다. 이 연구는 다음과 같이 결론지었습니다: “하루에 15개비 이상의 담배를 피우는 사람들 중에서, 흡연량을 50% 줄이면 폐암 위험이 유의미하게 감소한다.” (Godtfredsen, Prescott, 와/과 Osler 2005) 이 연구는 연구된 기간을 5~10년으로 설명합니다. 이 인과적 주장을 다이어그램으로 그려봅시다. 여기서 우리는 선정 기준(eligibility criteria)과 추정된 인과 효과의 대상 인구(target population)가 동일하다고 가정합니다(하루에 15개비 이상의 담배를 피우는 사람들). 이것이 항상 같아야 하는 것은 아닙니다. 장 10 에서는 다른 잠재적 대상 인구에 대해 논의할 것입니다.
이 아이디어를 좋은 인과적 질문을 던지는 것으로 바꾸어 보면, 이 책 전체에서 보게 될 다음 용어들을 이러한 다이어그램에 매핑할 수 있습니다: 노출(exposure) (원인), 결과(outcome) (효과), 선정 기준(eligibility criteria) (누구를 위해?), 시점 제로(time zero) (참가자들에 대한 추적이 언제 시작되었는가?), 대상 인구(target population) (누구에 대해 결과 효과를 추정할 수 있는가?), 그리고 추적 관찰 기간(follow-up period) (언제?).
좋은 인과적 질문을 던진다는 것은 질문을 관찰 가능한 증거에 매핑한다는 것을 의미합니다. 다시 흡연 사례로 돌아가 봅시다. 우리의 초기 질문은 다음과 같았습니다: 흡연은 폐암을 유발하는가?; 연구의 증거는 하루에 15개비 이상의 담배를 피우는 사람들의 경우, 흡연량을 50% 줄이면 5~10년에 걸쳐 폐암 위험이 감소한다는 것을 보여줍니다. 답이 질문과 일치합니까? 그다지 일치하지 않습니다. 질문을 연구가 실제로 보여준 것과 일치하도록 업데이트해 봅시다: 하루에 15개비 이상의 담배를 피우는 사람들의 경우, 흡연량을 50% 줄이는 것이 5~10년에 걸쳐 폐암 위험을 줄이는가? 이 기술 — 답할 수 있는 인과적 질문을 던지는 것 — 을 연마하는 것은 필수적이며 이 책 전체에서 논의할 주제입니다.
John Burn-Murdoch은 이러한 많은 시각화를 담당했으며 이 주제를 다룬 매혹적인 강연을 했습니다.↩︎
여기서 자연스러운 모델은 확진자 수를 예측하는 것이겠지만, 감염병 모델링은 복잡하며 대개 일반적인 예측 모델링 워크플로 밖의 기술을 사용합니다.↩︎
모델을 단수로 말하지만, 일반적으로 데이터 과학자들은 실험을 위해 많은 모델을 적합시키며, 종종 최고의 예측 모델은 여러 모델의 예측을 결합한 것이며 이를 스택 모델(stacked model)이라고 부릅니다.↩︎