보건행정 핵심 해설
이 문제는 보건통계 및 병원 경영 데이터 분석에서 매우 중요한
다중공선성(Multicollinearity)의 개념과 그 영향에 대해 묻고 있어요. 특히,
다중회귀분석(Multiple Regression Analysis)은 병원의 재무 예측, 환자 만족도 분석, 의료 자원 효율성 평가 등 다양한 분야에서 활용되는 핵심 분석 도구이기 때문에, 그 결과를 올바르게 해석할 수 있어야 해요.
핵심 개념 분석 (Key Concept)
핵심! 다중공선성이란 회귀모형에 포함된 두 개 이상의 설명변수(독립변수)들이 서로 높은 상관관계를 가지고 있어, 각 변수의 독립적인 영향력을 분리하여 추정하기 어려워지는 현상을 말해요. 이는 통계 분석의 신뢰성을 크게 떨어뜨리는 주요 문제 중 하나예요.
정답 근거 (Answer Rationale)
정답은
① "개별 회귀계수의 표준오차가 커져 통계적 유의성 판단이 어려워진다."입니다.
다중공선성이 심해지면, 회귀계수 추정치의
분산(Variance)과
표준오차(Standard Error)가 비정상적으로 커져요. 표준오차가 커지면 t-통계량의 값이 작아지고, 결과적으로 p-value가 커져 해당 변수가 통계적으로 유의하지 않다는 결론(기각)을 내릴 가능성이 높아져요. 즉, 실제로는 중요한 변수일지라도 다중공선성 때문에 "통계적으로 유의미하지 않다"는 잘못된 판단을 할 위험이 생기는 거예요.
오답 분석 (Distractor Analysis)
혼동 주의! 각 오답이 왜 틀린지, 어떤 개념과 혼동할 수 있는지 분석해볼게요.
② "종속변수의 분산이 증가한다.": 다중공선성은 주로
설명변수들 간의 관계에서 발생하는 문제이며, 종속변수의 분산 자체를 직접 증가시키지는 않아요. 종속변수의 분산은 모형의 설명력(R²)과 관련이 있어요.
③ "잔차의 정규성 가정이 위반된다.": 잔차의 정규성 위반은 다중공선성과 직접적인 관련이 없는 별도의 회귀 가정 위반 문제예요. 이분산성(Heteroscedasticity)이나 자기상관(Autocorrelation)과 함께 다중공선성은 회귀분석의 3대 문제로 꼽히지만, 각각 다른 가정을 위반해요.
④ "회귀모형의 설명력이 과소평가된다.": 오히려 반대의 경우가 많아요. 다중공선성이 있더라도 모형 전체의 설명력(예: R²)은 높게 나올 수 있어요. 문제는 개별 변수의 기여도를 평가하는 데 있어요. 설명력은 과소평가되지 않을 뿐더러, 심한 경우 변수를 추가해도 R²가 거의 변하지 않는 현상이 나타나요.
⑤ "모형의 적합도 지표가 항상 1에 가까워진다.": 적합도 지표(예: R²)가 1에 가까운 것은 모형이 데이터를 완벽하게 설명한다는 의미인데, 다중공선성의 존재 유무와는 직접적인 인과 관계가 없어요. 오히려 불필요한 변수가 많아져 모형이 복잡해지면 과적합(Overfitting) 문제가 발생할 수 있어요.
연관 개념 정리 (Related Concepts)
다중공선성을 진단하는 방법에는
분산팽창지수(VIF, Variance Inflation Factor) 계산(보통 10 이상이면 문제 있음), 설명변수 간의 상관행렬(Correlation Matrix) 확인,
공차한계(Tolerance) 검사 등이 있어요. 해결 방법으로는 상관성이 높은 변수 중 하나를 제거하거나, 주성분 분석(PCA)을 통해 새로운 변수를 생성하는 방법, 능형회귀(Ridge Regression) 등의 정규화(Regularization) 기법을 사용할 수 있어요.
개념 정리
| 용어 | 의미 | 주요 영향 |
| 다중공선성 | 설명변수들 간의 상관관계가 높은 상태 | 회귀계수 추정의 불안정, 해석의 어려움 |
| 표준오차 증가 | 계수 추정치의 변동성이 커짐 | 통계적 유의성(t-test) 판단 왜곡 |
| 분산팽창지수(VIF) | 다중공선성 심각도를 측정하는 지표 | VIF ≥ 10이면 심각한 공선성 존재 |
한눈에 비교!
| 회귀분석 문제 | 위반하는 가정/원인 | 주요 증상/영향 |
| 다중공선성 | 설명변수 간 독립성 | 개별 계수의 표준오차 ↑, p-value ↑, 계수 해석 불가 |
| 이분산성 | 잔차의 등분산성 | 표준오차 추정의 비효율성, 가중최소제곱법 필요 |
| 자기상관 | 잔차의 독립성(시계열) | 표준오차 과소평가, 회귀계수 유의성 과대평가 |
실무 포인트
병원 경영 데이터(예: 입원일수 예측 모형에 '나이'와 '동반 질환 수' 변수를 함께 사용)를 분석할 때, 두 변수가 강하게 연관되어 있다면 다중공선성을 의심해야 해요. 분석 전 상관행렬을 꼭 확인하고, VIF를 계산하는 것이 전문적인 보고서 작성의 첫걸음이에요. 단순히 p-value만 보고 변수를 제거하는 결정은 잘못된 결론으로 이어질 수 있어요.
암기 팁
"
공선성 있으면 오차 커져서 의미 없어져"라고 연상해보세요. '공선성' → '표준오차 커짐' → '통계적 유의성(p-value) 판단 어려워짐'의 흐름을 기억하세요.
국시 빈출 포인트
보건의료정보관리사/병원행정사 시험에서는
다중공선성의 정의, 진단 방법(VIF), 주요 결과(계수 추정의 불안정성)를 직접 묻거나, 사례를 통해 어떤 상황이 다중공선성 문제를 일으키는지 판단하도록 출제돼요.
기출 변형 주의!
"다중공선성이 있을 때,
분산팽창지수(VIF)는 어떻게 변화하는가?" (정답: 증가한다), "다중공선성 문제를 해결하기 위한 방법이 아닌 것은?" (정답: 표본 크기를 줄인다) 등의 형태로 변형 출제될 수 있어요.