보건행정 핵심 해설
이 문제는 보건통계 및 병원 경영 분석에서 핵심 도구인
다중 선형회귀분석(Multiple Linear Regression Analysis)의 모형 평가 지표에 대한 이해를 묻고 있어요. 특히, 단순 결정계수(R²)와 수정된 결정계수(Adjusted R²)의 차이와 사용 이유를 명확히 구분하는 것이 중요해요.
핵심 개념 분석 (Key Concept)
핵심! 결정계수(R-squared, R²)는 회귀 모형이 종속변수(예: 병원 재원일수, 의료비)의 변동을 얼마나 잘 설명하는지를 나타내는 지표예요. 값의 범위는 0에서 1 사이이며, 1에 가까울수록 모형의 설명력이 높아요. 그러나 R²에는 한계가 있어요. 독립변수(예: 환자 연령, 중증도, 수술 유무)의 수를 무작정 늘리면, 표본 데이터에 우연히 맞춰지는 '과적합(Overfitting)' 현상이 발생하더라도 R² 값은 항상 증가하거나 최소한 감소하지 않아요. 이는 모형의 진정한 예측력이나 설명력을 과대평가할 위험이 있죠.
정답 근거 (Answer Rationale)
정답 ④번은 바로 이 문제점을 해결하기 위한
수정된 결정계수(Adjusted R²)의 존재 이유를 정확히 지적하고 있어요. Adjusted R²는 R² 공식에
독립변수의 개수(p)와
표본 크기(n)를 패널티 항으로 도입해요. 변수를 의미 없이 추가하면 Adjusted R² 값이 오히려 감소할 수 있어, 연구자가 진정으로 설명력 있는 변수들로만 구성된 간명한 모형을 선택하도록 유도하는 지표 역할을 해요. 따라서 보건행정 연구나 병원 성과 분석에서 모형 비교 시 R²보다 Adjusted R²를 더 우선적으로 살펴봐야 해요.
오답 분석 (Distractor Analysis)
혼동 주의!
① "잔차의 분포가 정규분포를 따르지 않을 때 사용하기 위해": 이는 회귀분석의 기본 가정(잔차의 정규성) 위반 문제와 관련있어요. 이러한 경우에는 변수 변환(로그 변환 등)이나 비모수적 방법을 고려하며, Adjusted R²의 주된 용도가 아니에요.
② "종속변수의 측정 단위를 표준화하기 위해": 측정 단위 표준화는
표준화 회귀계수(Beta Coefficient)를 계산할 때 주로 사용되며, Adjusted R²와는 직접적인 관련이 없어요.
③ "회귀계수의 통계적 유의성을 직접 검정하기 위해": 회귀계수의 유의성 검정은
t-검정(t-test)이나
p-value를 통해 이루어지며, Adjusted R²는 모형 전체의 설명력을 평가하는 지표예요.
⑤ "다중공선성의 정도를 정량화하기 위해": 다중공선성(Multicollinearity) 진단에는
분산팽창지수(VIF, Variance Inflation Factor)나
공차한계(Tolerance)를 사용해요. Adjusted R²는 다중공선성을 직접 보정하거나 측정하는 지표가 아니에요.
연관 개념 정리 (Related Concepts)
-
F-검정(F-test): 회귀 모형 전체의 통계적 유의성을 검정합니다. (귀무가설: 모든 회귀계수 = 0)
-
AIC/BIC(Akaike/Bayesian Information Criterion): Adjusted R²와 유사하게 변수 수에 패널티를 주는 모형 선택 지표로, 값이 작을수록 좋은 모형입니다.
개념 정리
| 지표 | 정의 | 특징/용도 | 한계 |
| 결정계수 (R²) | 회귀 모형이 종속변수 변동을 설명하는 비율 | 모형 적합도 평가의 기본 지표 | 변수 수 증가 시 무조건 증가 (과대평가 위험) |
| 수정된 결정계수 (Adjusted R²) | 변수 수(p)와 표본 크기(n)를 고려하여 보정한 R² | 다른 변수 수를 가진 모형 간 공정한 비교, 과적합 방지 | R²보다 항상 작거나 같음 |
한눈에 비교!
| 분석 목적 | 사용 지표/방법 | 비고 |
| 모형 전체 설명력 평가 | Adjusted R², F-test (p-value) | Adjusted R²는 크기, F-test는 유의성 확인 |
| 개별 변수의 영향력/유의성 평가 | 회귀계수(B), t-test (p-value), 표준화 계수(Beta) | Beta는 변수 간 상대적 영향력 비교 시 |
| 다중공선성 진단 | VIF(Variance Inflation Factor), 공차한계(Tolerance) | VIF > 10이면 다중공선성 문제 의심 |
| 최적 모형 선택(변수 선택) | Adjusted R², AIC, BIC | 값이 높은(Adj. R²) 또는 낮은(AIC/BIC) 모형 선택 |
실무 포인트
병원 경영기획팀이나 QI(Quality Improvement) 팀에서 입원일수 감소 프로젝트를 분석할 때, 다양한 요인(연령, 중증도, 진단군, 의사별 차이)을 독립변수로 넣어 회귀분석을 실시해요. 이때 변수를 너무 많이 넣어 복잡한 모형을 만들기보다, Adjusted R²가 가장 높게 나오는
간명하면서도 설명력 높은 모형을 찾는 것이 실무적 판단의 핵심이에요. 불필요한 변수를 제거하면 해석이 쉬워지고, 향후 개입 정책을 수립하는 데도 도움이 돼요.
암기 팁
"
R²는 거짓말을 해, 변수만 늘리면 커져(과대평가). Adjusted R²는 벌칙을 줘, 쓸데없는 변수는 빼!" 라고 생각하세요. Adjusted R²는 변수 수(p)에 대한 '벌칙(Penalty)'을 주는 공식을 사용한다는 점이 포인트예요.
국시 빈출 포인트
보건의료정보관리사/병원행정사 시험에서는 통계 파트에서
R² vs Adjusted R²의 차이점이 매우 자주 출제돼요. 특히 "왜 Adjusted R²를 쓰는가?"에 대한 이유를 묻거나, 변수 수가 증가했을 때 두 지표의 값 변화 방향을 묻는 문제가 많아요.
기출 변형 주의!
-
계산형 변형: "표본 크기(n)=100, 독립변수 수(k)=5, R²=0.80일 때 Adjusted R²는?" (공식: 1 - [(1-R²)*(n-1)/(n-k-1)] 적용)
-
참/거짓 판단형: "다중회귀분석에서 독립변수를 추가하면 Adjusted R²는 항상 증가한다. (X)" -> 변수가 유의미하지 않으면 감소할 수 있음.