두 변수 X와 Y의 상관계수를 계산할 때, 한 변수의 극단적인 값(이상치)이 존재하면 상관계수에 미치는 영향… | 마이메르시 MyMerci
상관 및 회귀분석
문제

두 변수 X와 Y의 상관계수를 계산할 때, 한 변수의 극단적인 값(이상치)이 존재하면 상관계수에 미치는 영향은?

예를 들어, 대부분의 데이터가 낮은 값에 모여있으나 한 두 개의 매우 높은 값이 포함된 경우를 생각해보시오.
해설
이상치는 상관계수 계산에 큰 영향을 미쳐, 실제 관계보다 강한 상관이 있는 것처럼(절대값 증가) 또는 반대 방향의 관계가 있는 것처럼 보이게 할 수 있다.

심화 해설

보건행정 핵심 해설 이 문제는 보건통계 및 연구 방법론에서 매우 중요한 상관계수(Correlation Coefficient)의 특성과 이상치(Outlier)의 영향을 묻고 있어요. 보건행정 분야에서는 병원 성과 지표 분석, 환자 만족도와 재원일수의 관계, 의료비 지출 패턴 분석 등 다양한 데이터 분석 시 상관관계를 자주 활용하기 때문에, 데이터의 질이 결과에 미치는 영향을 정확히 이해하는 것이 필수적이에요. 핵심 개념 분석 (Key Concept): 상관계수(r)는 -1에서 +1 사이의 값을 가지며, 두 변수 간 선형 관계의 방향과 강도를 나타내는 지표예요. 핵심! 피어슨 상관계수(Pearson Correlation Coefficient)는 계산 과정에서 평균과 표준편차를 사용하며, 데이터 포인트들이 평균으로부터 얼마나 떨어져 있는지(편차)의 곱에 기반해요. 따라서 평균에서 크게 벗어난 극단적인 값, 즉 이상치는 이 편차의 곱을 극단적으로 크게 만들어 전체 계산에 과도한 영향을 미치게 돼요. 정답 근거 (Answer Rationale): 정답은 ① 상관계수의 절대값을 인위적으로 증가시킨다입니다. 문제에서 제시된 시나리오처럼 "대부분의 데이터가 낮은 값에 모여있으나 한 두 개의 매우 높은 값이 포함된 경우", 그 높은 값들은 X와 Y 모두에서 평균을 크게 벗어난 큰 편차를 만들어냅니다. 상관계수 공식의 분자(공분산)는 이러한 큰 편차들의 곱으로 인해 급격히 커지고, 이는 전체 상관계수의 절대값을 실제 존재하는 관계보다 훨씬 강하게(또는 약하게, 경우에 따라) 보이게 하는 결과를 초래해요. 즉, 이상치는 상관계수를 왜곡시켜 데이터의 실제 패턴을 오해하게 할 위험이 있어요. 오답 분석 (Distractor Analysis):
혼동 주의! ②번 '상관계수의 부호를 반대로 바꾼다': 이상치가 부호를 반대로 바꿀 수도 있지만, 그것은 매우 특수한 경우(예: 이상치가 다른 사분면에 위치하여 전체 관계의 방향을 뒤집는 경우)에 해당해요. 일반적으로는 문제에서 묻는 "대부분 낮은 값 + 극단적 높은 값" 상황에서는 절대값을 증가시키는 영향이 더 일반적이고, 부호 반전은 필수적인 결과가 아니에요.
③번 '상관계수의 절대값을 인위적으로 감소시킨다': 이는 이상치가 관계의 강도를 약화시키는 경우로, 일반적인 영향이 아니에요. 대부분의 경우 이상치는 관계를 과장시키는 방향으로 작용해요.
④번 '상관계수에 거의 영향을 미치지 않는다': 이는 명백히 틀린 설명이에요. 피어슨 상관계수는 이상치에 매우 민감한 지표로 잘 알려져 있어요. 데이터 분석 시 산점도(Scatter plot)를 먼저 그려 이상치를 확인하는 이유가 바로 여기에 있어요.
⑤번 '상관계수의 계산 자체를 불가능하게 만든다': 이상치가 존재한다고 해서 수학적 계산이 불가능해지지는 않아요. 계산은 가능하지만, 그 결과가 신뢰할 수 없게 될 뿐이에요. 연관 개념 정리 (Related Concepts): - 스피어만 순위 상관계수(Spearman's Rank Correlation Coefficient): 데이터의 순위에 기반한 비모수적 상관계수로, 이상치에 덜 민감해요. 원자료가 아닌 순위를 사용하기 때문이에요. - 산점도(Scatter plot) 검토: 상관분석을 수행하기 전에 반드시 산점도를 통해 데이터의 분포, 선형성, 이상치 존재 여부를 시각적으로 확인해야 해요. - 회귀분석(Regression Analysis)에서도 이상치는 회귀선의 기울기와 절편을 크게 왜곡시킬 수 있어, 회귀 분석 전에 반드시 이상치 탐색 및 처리가 필요해요. 개념 정리
용어의미보건행정에서의 중요성
상관계수 (r)두 연속형 변수 간 선형 관계의 방향과 강도 (-1 ~ +1)병원 경영 지표(입원율 vs 매출), 공중보건 요인(흡연율 vs 폐암 발생률) 간 관계 분석
이상치 (Outlier)다른 관측치들과 현저히 다른 극단적인 값의료비 데이터 오기입, 희귀 중증 환자 기록, 조사 오류로 인해 발생. 분석 결과 왜곡의 주원인.
피어슨 상관계수가장 일반적인 상관계수. 평균, 표준편차 사용. 이상치에 민감.정규분포를 따르는 데이터의 관계 분석에 적합. 보건통계 기본 도구.
스피어만 상관계수순위 기반 상관계수. 비모수적 방법. 이상치에 덜 민감.정규분포를 따르지 않거나 순서형(Ordinal) 데이터(예: 만족도 점수)의 관계 분석에 적합.
한눈에 비교!
구분피어슨 상관계수 (Pearson r)스피어만 순위 상관계수 (Spearman ρ)
기반원자료의 공분산과 표준편차자료의 순위(Rank)
가정선형성, 정규성, 등분산성단조 관계(Monotonic relationship). 비모수적.
이상치 영향매우 민감 (결과 왜곡 큼)상대적으로 덜 민감
보건행정 적용 예환자 연령과 수술 시간의 관계 (정규분포 가정 가능 시)병원 만족도 설문 점수(1-5점)와 재방문 의향 점수의 관계
실무 포인트 보건행정가나 보건정보관리사가 병원 데이터를 분석할 때: 1. 분석 전 필수 확인: 상관관계나 회귀분석을 실행하기 전에, 반드시 핵심! 산점도를 그려 이상치를 눈으로 확인하세요. 통계 소프트웨어의 이상치 탐지 기능도 활용하세요. 2. 이상치 처리 절차: - 확인: 데이터 입력 오류인가? (예: 키 250cm) → 수정 - 분석: 실제 현상인가? (예: 극히 고액의 의료비) → 제외 또는 별도 분석 - 보고: 이상치를 제외한 분석 결과와 포함한 결과를 모두 명시하여 투명하게 보고하세요. 3. 대체 방법 고려: 데이터에 이상치가 많거나 정규분포를 크게 벗어난다면, 피어슨 대신 스피어만 상관계수를 사용하는 것이 더 안정적인 결과를 줄 수 있어요. 암기 팁 - "**이**상치는 **상**관계수를 **과**장시킨다" → **이상과** (이상치 → 상관계수 과장) - 피어슨은 "**피**하기 힘든 **이**상치 영향" → **피어슨 = 이상치 민감** - 스피어만은 "**스**마트하게 **순**위로 버틴다" → **스피어만 = 순위 기반 = 이상치 강건(Robust)** 국시 빈출 포인트 이 주제는 보건의료정보관리사 시험의 '보건정보학' 또는 '보건통계학' 파트에서, 병원행정사 시험의 '병원경영학' 또는 '연구방법론' 파트에서 단골로 출제돼요. 출제 형태는: 1. 이상치가 상관계수에 미치는 영향에 대한 직접적인 질문 (본 문제와 동일). 2. 이상치에 덜 민감한 상관계수는 무엇인가? (정답: 스피어만 순위 상관계수). 3. 상관계수 해석 관련 문제 (예: r=0.85인데 산점도 확인 시 한 개의 극단값 제거 후 r=0.45로 떨어짐 → 이는 무엇을 의미하는가?). 기출 변형 주의! - 사례형

임상 시나리오

: "A 병원에서 직원 만족도 조사 점수와 이직률 데이터를 분석했더니 상관계수가 -0.9로 나왔다. 그러나 데이터를 살펴보니 한 부서의 만족도 점수는 매우 낮은데 이직률이 오히려 0%인 이상치가 발견되었다. 이 이상치를 제거하면 상관계수는 어떻게 변할 것으로 예상되는가?" (정답: 절대값이 감소할 것이다 / 0에 가까워질 것이다) - 용어 연결형: "이상치의 영향을 최소화하면서 두 변수 간 단조 관계를 측정하고자 할 때 사용하는 상관계수는?" (정답: 스피어만 순위 상관계수) (qn_case): 보건행정 실무 가이드 실무 시나리오 (Practical Scenario): "보건정보팀에서 지역 내 일차의료기관(Primary Care Clinic)의 의사 1인당 외래 환자 수와 병원의 예방접종률 데이터를 수집해 상관관계를 분석했어요. 분석 결과, 상관계수 r이 -0.75로 나와 '의사가 바쁠수록 예방접종률이 낮아진다'는 강한 음의 상관이 있는 것처럼 보였어요. 하지만 산점도를 그려보니, 대부분의 병원은 비슷한 범위에 모여있는데, 한 곳의 의사 1인당 외래 환자 수가 극도로 많고(이상치), 그 병원의 예방접종률 데이터가 누락되어 0%로 처리된 것이 발견되었어요." 행정 중재 전략 (Admin Intervention): 1. 상황 파악: 우선, 그 이상치 데이터의 정확성을 확인해요. 의사 1인당 환자 수가 극단적으로 높은 것은 입력 오류(예: 월 데이터를 일 데이터로 잘못 입력)일 수 있어요. 예방접종률 0%는 데이터 미제출로 인한 결측치(Missing value)를 0으로 대체한 오류일 수 있어요. 2. 법적/규정 검토: 보건의료데이터 분석 시, 핵심! 데이터 품질 관리(Data Quality Management) 원칙에 따라 오류 데이터는 수정하고, 결측치는 적절한 방법(삭제, 대체)으로 처리해야 해요. 무조건 0으로 처리하는 것은 왜곡을 초래해요. 3. 대응 및 처리: - 해당 병원에 직접 연락하여 데이터 정정을 요청해요. - 정정이 어렵다면, 해당 이상치 쌍을 분석에서 제외하고 다시 상관계수를 계산해요. - 또는, 이상치에 덜 민감한 스피어만 상관계수를 추가로 계산하여 결과를 비교해요. 4. 사후 기록/보고: 최종 보고서에는 "초기 분석 시 발견된 이상치를 확인 및 처리한 과정"과 "이상치 제거 전/후의 상관계수 비교 결과"를 반드시 명시하여, 분석의 투명성과 신뢰성을 높여야 해요. 법적 안전 및 주의사항 (Precautions): - 데이터를 함부로 삭제하거나 수정해서는 안 돼요. 모든 처리 과정은 추적 가능하도록 문서화해야 해요. - 혼동 주의! 상관관계는 인과관계(Causation)를 의미하지 않아요. "의사가 바쁘기 때문에 예방접종률이 낮다"고 결론지을 수 없어요. 제3의 변수(예: 지역의 의료 자원 접근성)가 영향을 줄 수 있어요. 보고 시 이 점을 명확히 언급하세요. 업무 프로토콜 상관관계 분석 시 이상치 대응 프로토콜 1. 시각적 검토: 분석 전 반드시 산점도 생성. 2. 이상치 식별: 통계적 방법(예: Z-score > 3 또는 IQR 방법) 또는 시각적 방법으로 이상치 후보 표시. 3. 원인 조사: 각 이상치가 데이터 오류인지, 실제 극단적인 관측치인지 확인. - 오류: 출처 확인 후 수정. - 실제 값: 해당 관측치의 특성 기록. 4. 분석 전략 수립: - 기본 분석: 모든 데이터 포함. - 민감도 분석(Sensitivity Analysis): 이상치 제외 후 분석. - 대체 분석: 스피어만 상관계수 등 다른 방법 적용. 5. 결과 보고: 모든 분석 결과와 이상치 처리 내역을 병기하여 보고. 선배의 한마디 "데이터는 거짓말을 하지 않지만, 잘못 해석된 데이터는 무서운 거짓말을 할 수 있어요. 상관계수 하나만 믿고 결론 내리기 전에, 항상 데이터를 '눈으로' 확인하는 습관을 들이세요. 이상치를 발견하는 것은 문제가 아니라, 더 정확한 진실에 다가가는 첫걸음이에요. 보건행정가의 역할은 숫자를 나열하는 것이 아니라, 숫자 뒤에 숨은 이야기를 제대로 읽어내는 거랍니다!"

마이메르시로 국가고시 완벽 대비

기출문제와 상세 해설을 무료로. 내 약점을 분석하고 진도를 관리하며 더 똑똑하게 공부하세요.

무료로 시작하기

학습 참고용입니다. 실제 임상은 최신 지침과 소속 기관 프로토콜을 따르세요.