다중 선형회귀모형에서 독립변수들 간에 높은 상관관계가 존재할 때 발생하는 주요 문제는? | 마이메르시 MyMerci
상관 및 회귀분석
문제

다중 선형회귀모형에서 독립변수들 간에 높은 상관관계가 존재할 때 발생하는 주요 문제는?

해설
다중공선성은 독립변수들 간에 강한 상관관계가 있을 때 발생하며, 이는 개별 회귀계수의 분산(표준오차)을 증가시켜 계수 추정의 불안정성과 해석의 어려움을 초래한다.

심화 해설

보건행정 핵심 해설 이 문제는 보건통계 및 병원 경영 데이터 분석에서 매우 중요한 다중공선성(Multicollinearity)의 개념과 그 영향을 묻고 있어요. 특히 병원 경영 성과 분석(예: 입원일수에 영향을 미치는 요인 분석)이나 의료비 예측 모델을 구축할 때 반드시 점검해야 할 사항이에요. 핵심 개념 분석 (Key Concept): 다중공선성은 회귀분석에서 두 개 이상의 독립변수(예: 환자 연령, 체중, 혈압 수치 등)가 서로 높은 상관관계를 보여, 정보가 중복되는 현상을 말해요. 이는 모형의 예측력 자체에는 큰 영향을 미치지 않을 수 있지만, 개별 독립변수의 영향력을 정확히 평가하는 데 심각한 방해가 돼요. 정답 근거 (Answer Rationale): 핵심! 다중공선성이 존재하면, 회귀계수의 분산(Variance)이 커지게 되어 표준오차(Standard Error)가 불필요하게 증가해요. 이로 인해 t-통계량의 값이 작아져, 실제로는 유의미한 변수도 "통계적으로 유의하지 않다"는 결론을 내릴 위험이 생깁니다. 따라서 정답은 "회귀계수의 표준오차가 불필요하게 커진다."인 ②번이에요. 오답 분석 (Distractor Analysis):
혼동 주의! ①번 '종속변수의 분산이 감소한다': 다중공선성은 독립변수 간의 문제지, 종속변수의 분산을 직접적으로 감소시키지 않아요. 모형의 설명력(R²)은 높게 유지될 수 있어요.
③번 '모형의 F-통계량이 항상 유의해진다': F-통계량은 모형 전체의 유의성을 검정하는데, 다중공선성으로 인해 F-통계량이 오히려 비유의적으로 나올 수도 있어요. "항상"이라는 표현이 틀려요.
④번 '결정계수(R²) 값이 0에 가까워진다': 오히려 독립변수들이 중복 정보를 제공하므로, 모형의 전체 설명력인 R²는 높게 유지되는 경우가 많아요. R²가 낮아지는 것은 모형에 관련 없는 변수를 넣었을 때 발생할 수 있어요.
⑤번 '잔차의 정규성 가정이 위반된다': 다중공선성은 회귀분석의 기본 가정 중 '독립변수 간 상관관계가 없어야 한다'는 가정을 위반하는 것이지, 잔차의 정규성, 등분산성 가정을 직접 위반시키지는 않아요. 연관 개념 정리 (Related Concepts): 다중공선성을 탐지하는 방법에는 분산팽창지수(VIF, Variance Inflation Factor) 계산(보통 10 이상이면 문제 있음), 상관행렬(Correlation Matrix) 확인, 조건지수(Condition Index) 검토 등이 있어요. 처리 방법으로는 변수 제거, 주성분 분석(PCA) 적용, 능형회귀(Ridge Regression) 등의 정규화(Regularization) 기법을 사용할 수 있어요. 개념 정리
용어의미주요 영향
다중공선성
(Multicollinearity)
회귀모형의 독립변수들 간에 높은 선형 상관관계가 존재하는 상태개별 회귀계수의 표준오차 증가, 계수 추정 불안정, 해석 곤란
분산팽창지수
(VIF)
다중공선성의 심각성을 수치화한 지표 (1에 가까울수록 좋음)VIF > 10 이면 심각한 다중공선성 존재로 판단
표준오차
(Standard Error)
회귀계수 추정치의 변동성(불확실성)을 나타내는 지표다중공선성으로 인해 불필요하게 커짐
한눈에 비교!
문제 현상원인주요 결과
다중공선성독립변수(X)들 간의 높은 상관개별 계수의 표준오차 ↑, t-값 ↓ (유의미한 변수가 비유의적으로 보일 수 있음)
이분산성
(Heteroscedasticity)
잔차의 분산이 일정하지 않음표준오차 추정이 부정확해져, 가설검정의 신뢰도 하락
자기상관
(Autocorrelation)
시계열 데이터에서 잔차들 간의 상관표준오차를 과소평가하여, t-값을 과대평가할 위험 (유의하지 않은 변수가 유의해 보일 수 있음)
실무 포인트 병원 경영 데이터(예: 평균재원일수, 의료비, 환자 만족도)를 분석할 때, '병상 수'와 '전체 직원 수' 같은 변수들은 서로 높은 상관을 가질 수 있어 다중공선성을 의심해봐야 해요. 분석 시 VIF를 확인하고, 높은 변수는 하나를 제거하거나 새로운 합성 변수(예: '병상당 직원 수')를 만들어 사용하는 전략이 효과적이에요. 암기 팁 "공선성 있으면 오차 커져"라고 기억하세요! 독립변수들끼리 뭉쳐있어(공선성) 정보가 중복되니, 각 변수의 고유한 영향력을 잴 때 불확실성(표준오차)이 커진다는 거예요. 국시 빈출 포인트 다중공선성의 정의와 주된 영향(표준오차 증가)을 묻는 기본 문제가 가장 많이 출제돼요. VIF의 기준값(10)이나 탐지 방법을 함께 묻는 경우도 있어요. 기출 변형 주의! "다중공선성이 있을 때, 회귀계수의 추정치에 대한 신뢰구간은 어떻게 되는가?" → 더 넓어진다 (표준오차가 커지므로).
"다중공선성 문제를 해결하기 위한 방법이 아닌 것은?" → 보기 중에 샘플 수를 줄이는 방법은 오히려 문제를 악화시킬 수 있어 정답이 될 수 있어요.

임상 시나리오

보건행정 실무 가이드 실무 시나리오 (Clinical Scenario): "병원 기획팀에서 최근 1년간 외래 환자 수를 예측하는 모델을 만들고 있어요. 독립변수로 '지역 인구 수', '경쟁 병원 수', '마케팅 예산', '의사 수'를 넣었는데, '의사 수'와 '마케팅 예산'의 회귀계수가 통계적으로 유의하지 않게 나왔어요. 그런데 두 변수를 각각 단독으로 모델에 넣으면 매우 유의미한 결과가 나옵니다. 무슨 문제일까요?" 행정 중재 전략 (Admin Intervention): 1. 상황 파악: 두 변수('의사 수'와 '마케팅 예산')가 병원 규모를 반영하는 유사한 지표일 가능성이 높아요. 실제로 상관분석을 해보면 높은 상관계수가 나올 거예요. 2. 법적/규정 검토: 통계적 모델링에는 법규는 없지만, 핵심! 잘못된 분석 결과에 기반한 경영 의사결정은 큰 리스크에요. 따라서 분석의 타당성을 검증하는 절차가 필수적이에요. 3. 대응 및 처리: VIF를 계산해봐요. 두 변수의 VIF가 10을 넘는다면 다중공선성이 원인입니다. 해결책으로는 (a) 두 변수 중 하나(예: '의사 수')만 모델에 남기거나, (b) 두 변수를 결합한 '규모 지수'를 새로 만들거나, (c) 능형회귀(Ridge Regression) 같은 정규화 기법을 적용할 수 있어요. 4. 사후 기록/보고: 최종 분석 보고서에 "다중공선성 검토(VIF 값 포함)" 항목을 반드시 포함하고, 변수 선택 또는 처리에 대한 근거를 명시해야 해요. 법적 안전 및 주의사항 (Precautions): 통계 모델의 오류에서 직접적인 법적 제재는 없지만, 이 모델을 기반으로 한 잘못된 자원 배분(예: 의사 채용 중단, 마케팅 예산 삭감)은 병원 경영에 실질적인 손해를 끼칠 수 있어요. 분석의 투명성과 재현 가능성을 확보하는 것이 전문가의 책임이에요. 업무 프로토콜 회귀분석 후 다중공선성 점검 프로토콜 1. 상관행렬 확인: 모든 독립변수 쌍의 상관계수를 봐서 0.7~0.8 이상인 쌍을 찾는다. 2. VIF 계산: 통계 소프트웨어로 각 변수의 VIF를 산출한다. 3. 판단 기준: VIF > 10 이면 심각한 다중공선성으로 판단한다. 4. 대응 실행: 문제 변수 제거, 변수 변환, 정규화 기법 적용 중 선택한다. 5. 결과 기록: 분석 일지에 점검 과정과 조치 사항을 상세히 기록한다. 선배의 한마디 "보건행정에서 데이터는 '증거'에요. 다중공선성을 무시한 분석은 마치 중복된 증인만 데려와 재판하는 것과 같아요. 각 요인의 고유한 영향력을 정확히 따져보는 것이 과학적인 관리의 첫걸음이에요. 통계 툴을 쓸 때는 '왜 이런 결과가 나왔지?'라는 질문을 끊임없이 던져보세요!"

마이메르시로 국가고시 완벽 대비

기출문제와 상세 해설을 무료로. 내 약점을 분석하고 진도를 관리하며 더 똑똑하게 공부하세요.

무료로 시작하기

학습 참고용입니다. 실제 임상은 최신 지침과 소속 기관 프로토콜을 따르세요.