보건행정 핵심 해설
이 문제는
보건통계학과
병원 경영 데이터 분석의 핵심 도구인
다중 선형회귀분석(Multiple Linear Regression)에서, 분석 결과를 해석하고 모델의 유용성을 판단하는
평가 지표에 대한 이해를 묻고 있어요. 보건행정 현장에서는 의료 서비스 이용량 예측, 병원 비용 분석, 환자 만족도 영향 요인 분석 등 다양한 연구와 정책 평가에 회귀분석이 활용되기 때문에, 어떤 지표가 무엇을 의미하는지 정확히 아는 것이 중요해요.
핵심 개념 분석 (Key Concept)
핵심! "모형의 적합도(goodness-of-fit)"란, 우리가 만든 회귀 모형이 실제 데이터를 얼마나 잘 설명하고 예측하는지를 나타내는 척도예요. 즉, 독립변수들이 종속변수의 변동을 얼마나 잘 설명하는지를 평가하는 것이죠. 이는 모형 전체의 성능을 보는 '글로벌(global)' 평가에 해당해요.
정답 근거 (Answer Rationale)
정답은
② 독립변수 간의 상관계수 행렬이에요. 왜냐하면 이 지표는 모형의 적합도를 평가하는 것이 아니라,
모형 구축 전의 가정 검토 또는 문제 진단에 사용되기 때문이에요.
-
독립변수 간의 상관계수 행렬: 이는
다중공선성(Multicollinearity)을 탐지하기 위해 살펴보는 도구예요. 독립변수들끼리 높은 상관관계가 있으면, 개별 변수의 영향력을 정확히 추정하기 어렵고 회귀계수가 불안정해질 수 있어요. 따라서 이는
모형을 적용하기 전에 확인해야 할 '전제조건'이나 '문제점'을 파악하는 진단 도구이며, 모형이 데이터에 얼마나 잘 '맞는지(fit)'를 수치화하여 평가하는 적합도 지표는 아니에요.
오답 분석 (Distractor Analysis)
혼동 주의! 나머지 선택지들은 모두 모형 적합도를 평가하는 데 직접적으로 사용되는 대표적인 지표들이에요.
-
① 개별 회귀계수의 t-통계량: 이는
각 독립변수가 종속변수에 유의미한 영향을 미치는지를 검정하는 지표예요. 모형 내 특정 변수의 '부분적(partial)' 기여도를 평가한다는 점에서 모형 전체 적합도 평가와 연결됩니다.
-
③ 잔차제곱합(Residual Sum of Squares, RSS): 모형이 예측한 값과 실제 관측값 사이의 오차(잔차)를 제곱하여 모두 더한 값이에요. 이 값이 작을수록 모형이 데이터를 잘 설명한다고 볼 수 있어요. 결정계수(R-squared)를 계산하는 데 직접 사용되는 핵심 요소죠.
-
④ F-통계량(F-statistic):
핵심! 이는
모형 전체의 유의성을 검정하는 지표예요. "모든 회귀계수가 0이다(즉, 모형이 의미 없다)"는 귀무가설을 검정합니다. F-통계량이 크고 유의확률(p-value)이 작으면, 적어도 하나의 독립변수가 유의미하다는 결론을 내리게 되어 모형의 전반적 적합도를 평가하는 데 필수적이에요.
-
⑤ 수정된 결정계수(Adjusted R-squared): 일반적인 결정계수(R²)는 변수를 무조건 추가하면 증가하는 단점이 있어요. 수정된 결정계수는
모형의 복잡도(변수의 개수)를 고려하여 조정한 값으로, 변수를 추가할 때 진정으로 설명력이 향상되는지 판단하는 데 더 적합한 지표예요.
연관 개념 정리 (Related Concepts)
-
결정계수(R-squared): 종속변수의 총 변동 중에서 회귀모형으로 설명되는 비율을 나타냅니다. 0에서 1 사이의 값을 가지며, 1에 가까울수록 적합도가 높아요.
-
다중공선성 진단: 상관계수 행렬 외에도 분산팽창지수(Variance Inflation Factor, VIF)를 주로 사용해요. VIF가 10을 넘으면 다중공선성이 심각하다고 판단합니다.
개념 정리
| 지표 | 용도 | 비고 |
| t-통계량 | 개별 독립변수의 유의성 검정 | 부분적 기여도 평가 |
| F-통계량 | 회귀모형 전체의 유의성 검정 | 전체적 적합도 평가의 핵심 |
| 잔차제곱합(RSS) | 모형의 예측 오차 총량 | 작을수록 좋음, R² 계산 기초 |
| 수정된 R² | 변수 개수를 고려한 설명력 | 모형 비교 시 유용 |
| 상관계수 행렬 | 다중공선성 탐지 (진단 도구) | 적합도 지표 아님! |
한눈에 비교!
| 분류 | 주요 지표 | 목적 |
모형 적합도 평가 (Goodness-of-fit) | F-통계량, 결정계수(R²), 수정된 R², RSS | 만들어진 모형이 데이터를 얼마나 잘 설명하는가? |
변수 유의성 평가 (Variable Significance) | t-통계량 (및 p-value) | 각 독립변수가 종속변수에 영향을 미치는가? |
모형 가정 진단 (Model Assumption Diagnosis) | 잔차 분석, 상관계수 행렬/VIF(다중공선성), Durbin-Watson 통계량(자기상관) | 회귀분석의 기본 가정이 충족되는가? |
실무 포인트
병원 경영 데이터(예: 월간 외래 환자 수)를 분석할 때, 여러 요인(광고비, 계절, 의사 수 등)의 영향을 회귀분석으로 살펴본다면:
1. 먼저 상관계수 행렬을 보고 변수들 간의 강한 상관관계가 있는지 확인하세요 (다중공선성 예방).
2. 분석 후, F-통계량의 p-value가 0.05 미만인지 확인하여 모형 전체가 유의미한지 판단하세요.
3. 수정된 R² 값을 확인해 모형의 설명력을 파악하세요.
4. 중요한 변수를 찾기 위해 각 변수의 t-통계량과 p-value를 검토하세요.
암기 팁
"적합도는 F와 R²가 본다!"라고 기억하세요. F(전체 검정)와 R²(설명력)는 모형 적합도의 양대 산맥이에요. 상관계수 행렬은 모형을 만들기 전에 변수들을 '살펴보는' 진단용 도구라고 생각하면 구분하기 쉬워요.
국시 빈출 포인트
통계 방법론의 평가 지표는 개념을 정확히 구분하는 문제로 자주 출제돼요. 특히 "적합도 평가 vs. 가정 검정 vs. 변수 선택"을 혼동시키는 선택지를 많이 내요. "다중공선성 검출" 관련 지표(VIF, 상관계수)가 적합도 지표가 아니라는 점을 꼭 기억하세요.
기출 변형 주의!
- 사례형: "병원 만족도 조사 데이터를 다중 회귀분석한 결과, 수정된 R²는 0.65이고 F-검정은 유의하였으나 한 변수의 VIF가 15로 나왔다. 이 결과를 해석하시오." → 적합도는 괜찮지만(VIF, R²), 다중공선성 문제가 있음을 지적해야 함.
- 계산형: 잔차제곱합(RSS)이나 결정계수(R²)를 주고 다른 통계량을 유도하도록 할 수 있어요.