보건행정 핵심 해설
이 문제는 보건통계 및 연구 방법론에서 매우 중요한 개념인
다중공선성(Multicollinearity)을 묻고 있어요. 병원 경영 데이터 분석, 건강보험 요인 분석, 역학 연구 등에서 회귀분석을 사용할 때 반드시 점검해야 할 핵심 가정 중 하나입니다.
핵심 개념 분석 (Key Concept)
핵심! 다중공선성(Multicollinearity)은 회귀모형에 포함된 두 개 이상의 독립변수(예: 환자 나이와 투약 기간, 병상 수와 의사 수)가 서로 높은 상관관계를 보여, 각 변수가 종속변수(예: 입원일수, 치료비)에 미치는 고유한 효과를 분리해내기 어려워지는 현상을 말해요. 이로 인해 회귀계수의 추정치가 매우 불안정해지고(분산이 커지고), 계수의 부호가 직관과 반대가 될 수도 있어 해석이 어려워집니다.
정답 근거 (Answer Rationale)
문제에서 명시한 "독립변수들 간의 높은 상관관계로 인해 회귀계수의 추정이 불안정해지는 문제"는
다중공선성의 정의와 정확히 일치해요. 보건행정 연구에서 예를 들면, '병원 매출액'을 예측하는 모델에 '외래 환자 수'와 '총 진료 건수'를 함께 독립변수로 넣으면, 이 두 변수는 매우 높은 상관관계를 가질 가능성이 커 다중공선성 문제가 발생할 수 있어요.
오답 분석 (Distractor Analysis)
혼동 주의! 다른 선택지들은 회귀분석의 다른 가정 위반이나 문제점을 지칭하는 용어들이에요.
①
이상치(Outlier): 데이터의 전체적인 패턴에서 벗어난 극단적인 관측치를 말해요. 회귀선에 과도한 영향을 미쳐 추정을 왜곡시킬 수 있지만, 변수 간 상관관계 문제는 아니에요.
②
정규성 위배(Non-normality): 오차항(잔차)이 정규분포를 따르지 않는 문제예요. 주로 가설검정의 유효성에 영향을 미쳐요.
③
자기상관(Autocorrelation): 시계열 데이터에서 시간적으로 인접한 오차항들 사이에 상관관계가 존재하는 문제예요. 주로 시간의 흐름에 따른 데이터(예: 월별 감염자 수) 분석 시 발생해요.
⑤
이분산성(Heteroscedasticity): 오차항의 분산이 모든 독립변수 값에 대해 일정하지 않고 변하는 문제예요. 회귀계수의 표준오차 추정을 비효율적으로 만들 수 있어요.
연관 개념 정리 (Related Concepts)
다중공선성을 탐지하는 방법에는
분산팽창지수(Variance Inflation Factor, VIF) 계산이 가장 흔히 사용돼요. 일반적으로 VIF가 10을 초과하면 심각한 다중공선성이 있다고 판단해요. 해결 방법으로는 상관관계가 높은 변수 중 하나를 제거하거나, 주성분분석(PCA)을 통해 새로운 변수를 생성하는 방법 등이 있어요.
개념 정리
| 용어 | 정의 | 주요 영향 |
| 다중공선성 | 독립변수 간 높은 선형 상관관계 | 회귀계수 추정 불안정, 해석 곤란 |
| 이분산성 | 오차항의 분산이 일정하지 않음 | 표준오차 추정 비효율, 가설검정 신뢰도 하락 |
| 자기상관 | 시계열 데이터에서 인접 오차항 간 상관관계 | 표준오차 과소 추정, 유의미성 과대평가 |
한눈에 비교!
| 문제 유형 | 관련 대상 | 주요 탐지/해결 도구 |
| 다중공선성 | 독립변수들 사이의 관계 | 상관행렬, VIF(Variance Inflation Factor), 변수 제거 |
| 이분산성 | 오차항의 분산과 독립변수의 관계 | 잔차 플롯(Residual Plot), White Test, 가중최소제곱법(WLS) |
| 자기상관 | 시간 순서상의 오차항들 사이의 관계 | Durbin-Watson 통계량, 시차 잔차 플롯(Lag Plot) |
실무 포인트
보건행정 실무에서 데이터 분석(예: 입원일수 영향 요인 분석, 지역별 보건지표 비교)을 할 때, 소프트웨어(Excel, R, SPSS 등)로 회귀분석을 실행한 후에는 반드시
다중공선성 진단(VIF 값 확인)을 해야 해요. 변수 선택 시 사전에 상관관계가 너무 높은 변수들은 함께 투입하지 않는 것이 좋아요. 예를 들어, '총 병상 수'와 '입원 병상 수'를 동시에 모델에 넣기보다는, '병상 가동률' 같은 새로운 지표를 생성하는 것이 더 나은 해법이 될 수 있어요.
암기 팁
"
다중 변수가
공히
선을 타고(높은 상관) 있으면
성능(계수 추정)이 나빠진다"고 연상하세요! 또는 "변수들이 뭉치면(공선) 해석이
다중으로 곤란하다"고 외우는 것도 좋아요.
국시 빈출 포인트
보건의료정보관리사/병원행정사 시험에서는 통계 파트에서
다중공선성의
정의, 영향, 탐지 방법(VIF)을 직접 묻거나, 다른 회귀 가정 위반(이분산성, 자기상관)과 비교하여 출제되는 경우가 매우 많아요. 정의를 정확히 구분할 수 있도록 준비하세요.
기출 변형 주의!
이 개념은 다음과 같이 변형 출제될 수 있어요:
- 사례형: "A 연구자가 환자의 재원일수를 예측하는 모델을 만들었습니다. 독립변수로 '나이', '혈압', '콜레스테롤 수치'를 사용했는데, 혈압과 콜레스테롤 수치가 높은 상관관계를 보였습니다. 이로 인해 발생할 수 있는 문제는?"
- 계산/판단형: "다중공선성을 진단하기 위해 계산하는 지표는? (분산팽창지수)"