보건행정 핵심 해설
이 문제는 보건통계학과 병원 경영 데이터 분석에서 핵심 도구인
다중 선형회귀분석(Multiple Linear Regression)의 기본 가정을 묻고 있어요. 보건행정 현장에서는 의료 서비스 이용량 예측, 병원 비용 분석, 환자 만족도 영향 요인 규명 등 다양한 연구와 의사결정에 회귀분석이 활용되기 때문에, 그 가정을 정확히 이해하는 것이 올바른 분석과 결과 해석의 출발점이에요.
핵심 개념 분석 (Key Concept)
다중 선형회귀모형은 여러 개의 독립변수(예: 환자 나이, 입원 기간, 수술 유형)가 하나의 종속변수(예: 총 진료비, 재원일수)에 미치는 영향을 분석하는 통계 모형이에요. 이 모형이 타당한 추정과 검정을 제공하기 위해 만족해야 하는 몇 가지 기본 가정이 존재해요.
정답 근거 (Answer Rationale)
정답은
②번 "독립변수들은 서로 상관관계가 없어야 한다."입니다.
핵심! 다중 선형회귀의 핵심 가정은 독립변수들 간에
완전한 무상관(상관계수 0)을 요구하지 않아요. 실제 보건 데이터에서는 변수들 간에 어느 정도의 상관관계가 존재하는 것이 일반적이에요 (예: 나이와 만성질환 수). 문제는 독립변수들 간에
지나치게 높은 상관관계, 즉
다중공선성(Multicollinearity)이 존재할 때 발생해요. 다중공선성은 회귀계수 추정의 불안정성과 해석의 어려움을 초래하므로, 분석 시 진단하고 관리해야 할 문제이지만, 모형의
필수 전제 가정은 아니에요.
오답 분석 (Distractor Analysis)
①
혼동 주의! "독립변수는 확률변수가 아니어야 한다."는
옳은 설명입니다. 고전적 회귀분석에서 독립변수는 고정된 값(fixed values)으로 가정하며, 확률변수로 취급하지 않아요. 이는 오차항에 대한 가정을 명확히 하기 위한 것이에요.
③ "독립변수와 종속변수 사이에는 선형 관계가 존재한다."는
옳은 설명입니다. 이는
선형성(Linearity) 가정으로, 모형의 기본 구조를 정의하는 가장 중요한 가정 중 하나예요.
④ "오차항은 평균이 0이고 분산이 일정한 정규분포를 따른다."는
옳은 설명입니다. 이는
정규성(Normality)과
등분산성(Homoscedasticity) 가정을 포함하고 있어요. 오차항의 분산이 일정하지 않으면
이분산성(Heteroscedasticity) 문제가 발생해요.
⑤ "오차항들은 서로 독립이다."는
옳은 설명입니다. 이는
독립성(Independence) 가정으로, 한 관측치의 오차가 다른 관측치의 오차에 영향을 주지 않아야 함을 의미해요. 시계열 데이터나 군집 데이터에서 이 가정이 위배될 수 있어요.
연관 개념 정리 (Related Concepts)
회귀분석 가정 위반 시 문제점과 검정 방법도 함께 알아두세요.
-
선형성 위반: 예측력 저하. 산점도나 잔차도를 통해 확인.
-
독립성 위반: 표준오차 추정 오류. Durbin-Watson 통계량 등으로 검정.
-
등분산성 위반: 회귀계수 검정의 비효율성. White test나 Breusch-Pagan test로 검정.
-
정규성 위반: 표본이 크면 중심극한정리(Central Limit Theorem)에 의해 큰 문제가 되지 않을 수 있음. Q-Q plot, Shapiro-Wilk test로 검정.
-
다중공선성: VIF(Variance Inflation Factor) 지표(보통 10 이상)나 상태지수(Condition Index)로 진단.
개념 정리
다중 선형회귀의 기본 가정은
CLINE 또는
LINE으로 외울 수 있어요.
C: 독립변수는 확률변수가 아님 (고정값, Fixed)
L: 선형성 (Linear Relationship)
I: 오차항의 독립성 (Independence of Errors)
N: 오차항의 정규성 (Normality of Errors)
E: 오차항의 등분산성 (Equal Variance of Errors, Homoscedasticity)
한눈에 비교!
| 구분 | 다중공선성(Multicollinearity) | 가정 위반(Assumption Violation) |
| 성격 | 독립변수들 간의 문제 | 모형의 필수 전제 조건 불만족 |
| 관계 | 가정이 아님. 분석 시 진단 및 처리 대상 | L, I, N, E는 반드시 검토해야 할 기본 가정 |
| 주요 영향 | 계수 추정 불안정, 해석 곤란 | 추정의 편의(Bias), 검정의 유효성 상실 |
| 해결 방안 | 변수 제거, 주성분 분석(PCA), 능형회귀(Ridge) | 변수 변환, 가중회귀, 일반화선형모형(GLM) 등 모형 변경 |
실무 포인트
병원 경영 데이터(예: 진료비 데이터)를 회귀분석할 때는 먼저 산점도 행렬(Scatterplot Matrix)과 상관관계 행렬을 확인하여 변수 간 관계와 잠재적 다중공선성을 파악하세요. 분석 후에는 반드시 잔차 분석(Residual Analysis)을 통해 등분산성, 정규성, 독립성 가정이 충족되는지 시각적/통계적으로 검증해야 해요. 가정이 심각하게 위배된 분석 결과는 잘못된 정책 결정으로 이어질 수 있어요.
암기 팁
가정을
"오차는 LINE을 따라 걷는다"고 생각해보세요.
Linearity (선형성),
Independence (독립성),
Normality (정규성),
Equal variance (등분산성). 이 LINE을 벗어나는 오차는 문제가 있는 거예요! 그리고 독립변수는 이 LINE을 만드는 '고정된 설계도'라고 기억하세요(C).
국시 빈출 포인트
회귀분석 가정은
서술형 또는 OX 문제로 자주 출제돼요. "다중공선성이 회귀분석의 기본 가정이다"라는 문장이
거짓임을 정확히 알아야 해요. 또한, 각 가정의 이름(예: 등분산성)과 그 위반 시 발생하는 문제점(예: 이분산성)을 연결 지어 출제되기도 해요.
기출 변형 주의!
같은 개념을 다음과 같이 변형하여 출제할 수 있어요.
-
사례형: "병원 만족도 조사 데이터를 회귀분석한 결과, 잔차도에서 특정 패턴이 관찰되었다. 이는 어떤 가정 위반을 시사하는가?" (패턴에 따라 등분산성 또는 독립성 위반)
-
선택지 변형: 오답 선택지에 "독립변수와 종속변수는 정규분포를 따라야 한다" 같은 함정을 넣을 수 있어요. 정규분포를 따라야 하는 것은
오차항이지 변수 자체가 아니라는 점을 주의하세요!