다중회귀분석에서 설명변수들 간의 상관계수가 매우 높은 경우 발생하는 주요 문제는? | 마이메르시 MyMerci
상관 및 회귀분석
문제

다중회귀분석에서 설명변수들 간의 상관계수가 매우 높은 경우 발생하는 주요 문제는?

해설
설명변수들 간에 높은 상관관계가 존재하면 다중공선성 문제가 발생한다. 이는 회귀계수의 분산을 증가시켜 추정치가 불안정해지고, 개별 변수의 효과를 분리해 해석하기 어렵게 만든다.

심화 해설

보건행정 핵심 해설 이 문제는 보건통계 및 병원 경영 데이터 분석에서 매우 중요한 다중공선성(Multicollinearity)의 개념과 그 영향에 대해 묻고 있어요. 특히, 다중회귀분석(Multiple Regression Analysis)은 병원의 재무 예측, 환자 만족도 분석, 의료 자원 효율성 평가 등 다양한 분야에서 활용되는 핵심 분석 도구이기 때문에, 그 결과를 올바르게 해석할 수 있어야 해요. 핵심 개념 분석 (Key Concept) 핵심! 다중공선성이란 회귀모형에 포함된 두 개 이상의 설명변수(독립변수)들이 서로 높은 상관관계를 가지고 있어, 각 변수의 독립적인 영향력을 분리하여 추정하기 어려워지는 현상을 말해요. 이는 통계 분석의 신뢰성을 크게 떨어뜨리는 주요 문제 중 하나예요. 정답 근거 (Answer Rationale) 정답은 ① "개별 회귀계수의 표준오차가 커져 통계적 유의성 판단이 어려워진다."입니다. 다중공선성이 심해지면, 회귀계수 추정치의 분산(Variance)표준오차(Standard Error)가 비정상적으로 커져요. 표준오차가 커지면 t-통계량의 값이 작아지고, 결과적으로 p-value가 커져 해당 변수가 통계적으로 유의하지 않다는 결론(기각)을 내릴 가능성이 높아져요. 즉, 실제로는 중요한 변수일지라도 다중공선성 때문에 "통계적으로 유의미하지 않다"는 잘못된 판단을 할 위험이 생기는 거예요. 오답 분석 (Distractor Analysis) 혼동 주의! 각 오답이 왜 틀린지, 어떤 개념과 혼동할 수 있는지 분석해볼게요.
② "종속변수의 분산이 증가한다.": 다중공선성은 주로 설명변수들 간의 관계에서 발생하는 문제이며, 종속변수의 분산 자체를 직접 증가시키지는 않아요. 종속변수의 분산은 모형의 설명력(R²)과 관련이 있어요.
③ "잔차의 정규성 가정이 위반된다.": 잔차의 정규성 위반은 다중공선성과 직접적인 관련이 없는 별도의 회귀 가정 위반 문제예요. 이분산성(Heteroscedasticity)이나 자기상관(Autocorrelation)과 함께 다중공선성은 회귀분석의 3대 문제로 꼽히지만, 각각 다른 가정을 위반해요.
④ "회귀모형의 설명력이 과소평가된다.": 오히려 반대의 경우가 많아요. 다중공선성이 있더라도 모형 전체의 설명력(예: R²)은 높게 나올 수 있어요. 문제는 개별 변수의 기여도를 평가하는 데 있어요. 설명력은 과소평가되지 않을 뿐더러, 심한 경우 변수를 추가해도 R²가 거의 변하지 않는 현상이 나타나요.
⑤ "모형의 적합도 지표가 항상 1에 가까워진다.": 적합도 지표(예: R²)가 1에 가까운 것은 모형이 데이터를 완벽하게 설명한다는 의미인데, 다중공선성의 존재 유무와는 직접적인 인과 관계가 없어요. 오히려 불필요한 변수가 많아져 모형이 복잡해지면 과적합(Overfitting) 문제가 발생할 수 있어요. 연관 개념 정리 (Related Concepts) 다중공선성을 진단하는 방법에는 분산팽창지수(VIF, Variance Inflation Factor) 계산(보통 10 이상이면 문제 있음), 설명변수 간의 상관행렬(Correlation Matrix) 확인, 공차한계(Tolerance) 검사 등이 있어요. 해결 방법으로는 상관성이 높은 변수 중 하나를 제거하거나, 주성분 분석(PCA)을 통해 새로운 변수를 생성하는 방법, 능형회귀(Ridge Regression) 등의 정규화(Regularization) 기법을 사용할 수 있어요. 개념 정리
용어의미주요 영향
다중공선성설명변수들 간의 상관관계가 높은 상태회귀계수 추정의 불안정, 해석의 어려움
표준오차 증가계수 추정치의 변동성이 커짐통계적 유의성(t-test) 판단 왜곡
분산팽창지수(VIF)다중공선성 심각도를 측정하는 지표VIF ≥ 10이면 심각한 공선성 존재
한눈에 비교!
회귀분석 문제위반하는 가정/원인주요 증상/영향
다중공선성설명변수 간 독립성개별 계수의 표준오차 ↑, p-value ↑, 계수 해석 불가
이분산성잔차의 등분산성표준오차 추정의 비효율성, 가중최소제곱법 필요
자기상관잔차의 독립성(시계열)표준오차 과소평가, 회귀계수 유의성 과대평가
실무 포인트 병원 경영 데이터(예: 입원일수 예측 모형에 '나이'와 '동반 질환 수' 변수를 함께 사용)를 분석할 때, 두 변수가 강하게 연관되어 있다면 다중공선성을 의심해야 해요. 분석 전 상관행렬을 꼭 확인하고, VIF를 계산하는 것이 전문적인 보고서 작성의 첫걸음이에요. 단순히 p-value만 보고 변수를 제거하는 결정은 잘못된 결론으로 이어질 수 있어요. 암기 팁 "공선성 있으면 오차 커져서 의미 없어져"라고 연상해보세요. '공선성' → '표준오차 커짐' → '통계적 유의성(p-value) 판단 어려워짐'의 흐름을 기억하세요. 국시 빈출 포인트 보건의료정보관리사/병원행정사 시험에서는 다중공선성의 정의, 진단 방법(VIF), 주요 결과(계수 추정의 불안정성)를 직접 묻거나, 사례를 통해 어떤 상황이 다중공선성 문제를 일으키는지 판단하도록 출제돼요. 기출 변형 주의! "다중공선성이 있을 때, 분산팽창지수(VIF)는 어떻게 변화하는가?" (정답: 증가한다), "다중공선성 문제를 해결하기 위한 방법이 아닌 것은?" (정답: 표본 크기를 줄인다) 등의 형태로 변형 출제될 수 있어요.

임상 시나리오

보건행정 실무 가이드 실무 시나리오 (Clinical Scenario) "병원 기획팀에서 최근 1년간 외래 환자 수를 예측하는 모델을 개발 중이에요. 설명변수로 '평균 기온', '강수량', '미세먼지 농도'를 사용했는데, 이 세 기상 변수들이 서로 강한 상관관계를 보여 분석 결과가 매우 불안정하게 나왔어요. '미세먼지 농도'의 회귀계수 p-value가 0.9로 나와 '이 변수는 환자 수에 전혀 영향이 없다'는 결론을 내리려고 합니다. 이 분석 결과를 어떻게 검토하고 보고해야 할까요?" 행정 중재 전략 (Admin Intervention) 1. 상황 파악: 우선 변수들 간의 상관행렬과 VIF 값을 계산하여 다중공선성의 존재를 공식적으로 확인해야 해요. 2. 법적/규정 검토: 통계 분석 보고의 정확성과 투명성은 의사결정의 신뢰성과 직결됩니다. 잘못된 분석은 병원의 자원 배분 계획을 왜곡할 수 있어요. 3. 대응 및 처리: 다중공선성이 확인되면, "미세먼지 농도가 무의미하다"는 결론은 성급해요. 대신, (a) 상관성이 가장 높은 변수들 중 하나를 제거하거나, (b) 세 기상 변수를 통합한 '기상 악화 지수' 같은 새로운 변수를 생성하는 방법을 모색해야 해요. 분석 결과 보고서에는 "다중공선성 문제가 발견되어 변수 선택/통합 과정을 거쳤음"을 명시해야 해요. 4. 사후 기록/보고: 최종 모델의 VIF 값이 모두 허용 기준(예: 5 또는 10 미만) 이내인지 확인하고, 이를 보고서의 부록이나 방법론 섹션에 포함시켜 분석의 엄격성을 입증하세요. 법적 안전 및 주의사항 (Precautions) 데이터 분석 결과를 바탕으로 한 예산 편성이나 정책 제안은 큰 금전적 영향과 법적 책임을 수반할 수 있어요. 핵심! 분석 방법론의 결함(다중공선성 미처리)으로 인해 잘못된 결론을 도출하고, 이로 인해 병원에 재정적 손실이 발생할 경우, 해당 업무 담당자에게 직무상 과실 책임이 물어질 수 있어요. 업무 프로토콜 1. 회귀분석 수행 전 필수 체크리스트: 상관행렬 확인 → VIF 계산. 2. VIF ≥ 10인 변수 발견 시 대응: 변수 제거 / 주성분 분석(PCA) 적용 / 정규화 회귀 모델 검토. 3. 보고서 작성 시 포함 사항: 사용된 변수 목록, 다중공선성 검정 결과(VIF 표), 문제 발생 시 취한 조치. 선배의 한마디 "통계 숫자는 거짓말을 하지 않지만, 통계를 잘못 사용하는 사람은 거짓말을 할 수 있어요. 다중공선성은 그런 '잘못된 사용'을 유발하는 대표적인 함정이에요. 보건행정가로서 데이터를 다룰 때는 단순히 소프트웨어에서 나온 p-value에 의존하기보다, '데이터가 말하려는 진짜 이야기'를 들을 수 있는 통계적 소양을 키우는 게 중요해요. 복잡한 병원 데이터의 인과 관계를 파헤치는 것은 매우 흥미로운 일이 될 거예요!"

마이메르시로 국가고시 완벽 대비

기출문제와 상세 해설을 무료로. 내 약점을 분석하고 진도를 관리하며 더 똑똑하게 공부하세요.

무료로 시작하기

학습 참고용입니다. 실제 임상은 최신 지침과 소속 기관 프로토콜을 따르세요.