다중 선형회귀분석에서 수정된 결정계수(Adjusted R²)를 사용하는 주된 이유는? | 마이메르시 MyMerci
상관 및 회귀분석
문제

다중 선형회귀분석에서 수정된 결정계수(Adjusted R²)를 사용하는 주된 이유는?

해설
일반 R²는 독립변수의 수가 증가하면 무조건 증가하는 특성이 있다. 수정된 R²는 변수의 수와 표본 크기를 고려하여 모형의 진정한 설명력을 평가하도록 보정한 지표이다.

심화 해설

보건행정 핵심 해설 이 문제는 보건통계 및 병원 경영 분석에서 핵심 도구인 다중 선형회귀분석(Multiple Linear Regression Analysis)의 모형 평가 지표에 대한 이해를 묻고 있어요. 특히, 단순 결정계수(R²)와 수정된 결정계수(Adjusted R²)의 차이와 사용 이유를 명확히 구분하는 것이 중요해요. 핵심 개념 분석 (Key Concept) 핵심! 결정계수(R-squared, R²)는 회귀 모형이 종속변수(예: 병원 재원일수, 의료비)의 변동을 얼마나 잘 설명하는지를 나타내는 지표예요. 값의 범위는 0에서 1 사이이며, 1에 가까울수록 모형의 설명력이 높아요. 그러나 R²에는 한계가 있어요. 독립변수(예: 환자 연령, 중증도, 수술 유무)의 수를 무작정 늘리면, 표본 데이터에 우연히 맞춰지는 '과적합(Overfitting)' 현상이 발생하더라도 R² 값은 항상 증가하거나 최소한 감소하지 않아요. 이는 모형의 진정한 예측력이나 설명력을 과대평가할 위험이 있죠. 정답 근거 (Answer Rationale) 정답 ④번은 바로 이 문제점을 해결하기 위한 수정된 결정계수(Adjusted R²)의 존재 이유를 정확히 지적하고 있어요. Adjusted R²는 R² 공식에 독립변수의 개수(p)표본 크기(n)를 패널티 항으로 도입해요. 변수를 의미 없이 추가하면 Adjusted R² 값이 오히려 감소할 수 있어, 연구자가 진정으로 설명력 있는 변수들로만 구성된 간명한 모형을 선택하도록 유도하는 지표 역할을 해요. 따라서 보건행정 연구나 병원 성과 분석에서 모형 비교 시 R²보다 Adjusted R²를 더 우선적으로 살펴봐야 해요. 오답 분석 (Distractor Analysis) 혼동 주의! ① "잔차의 분포가 정규분포를 따르지 않을 때 사용하기 위해": 이는 회귀분석의 기본 가정(잔차의 정규성) 위반 문제와 관련있어요. 이러한 경우에는 변수 변환(로그 변환 등)이나 비모수적 방법을 고려하며, Adjusted R²의 주된 용도가 아니에요.
② "종속변수의 측정 단위를 표준화하기 위해": 측정 단위 표준화는 표준화 회귀계수(Beta Coefficient)를 계산할 때 주로 사용되며, Adjusted R²와는 직접적인 관련이 없어요.
③ "회귀계수의 통계적 유의성을 직접 검정하기 위해": 회귀계수의 유의성 검정은 t-검정(t-test)이나 p-value를 통해 이루어지며, Adjusted R²는 모형 전체의 설명력을 평가하는 지표예요.
⑤ "다중공선성의 정도를 정량화하기 위해": 다중공선성(Multicollinearity) 진단에는 분산팽창지수(VIF, Variance Inflation Factor)공차한계(Tolerance)를 사용해요. Adjusted R²는 다중공선성을 직접 보정하거나 측정하는 지표가 아니에요. 연관 개념 정리 (Related Concepts) - F-검정(F-test): 회귀 모형 전체의 통계적 유의성을 검정합니다. (귀무가설: 모든 회귀계수 = 0)
- AIC/BIC(Akaike/Bayesian Information Criterion): Adjusted R²와 유사하게 변수 수에 패널티를 주는 모형 선택 지표로, 값이 작을수록 좋은 모형입니다. 개념 정리
지표정의특징/용도한계
결정계수 (R²)회귀 모형이 종속변수 변동을 설명하는 비율모형 적합도 평가의 기본 지표변수 수 증가 시 무조건 증가 (과대평가 위험)
수정된 결정계수 (Adjusted R²)변수 수(p)와 표본 크기(n)를 고려하여 보정한 R²다른 변수 수를 가진 모형 간 공정한 비교, 과적합 방지R²보다 항상 작거나 같음
한눈에 비교!
분석 목적사용 지표/방법비고
모형 전체 설명력 평가Adjusted R², F-test (p-value)Adjusted R²는 크기, F-test는 유의성 확인
개별 변수의 영향력/유의성 평가회귀계수(B), t-test (p-value), 표준화 계수(Beta)Beta는 변수 간 상대적 영향력 비교 시
다중공선성 진단VIF(Variance Inflation Factor), 공차한계(Tolerance)VIF > 10이면 다중공선성 문제 의심
최적 모형 선택(변수 선택)Adjusted R², AIC, BIC값이 높은(Adj. R²) 또는 낮은(AIC/BIC) 모형 선택
실무 포인트 병원 경영기획팀이나 QI(Quality Improvement) 팀에서 입원일수 감소 프로젝트를 분석할 때, 다양한 요인(연령, 중증도, 진단군, 의사별 차이)을 독립변수로 넣어 회귀분석을 실시해요. 이때 변수를 너무 많이 넣어 복잡한 모형을 만들기보다, Adjusted R²가 가장 높게 나오는 간명하면서도 설명력 높은 모형을 찾는 것이 실무적 판단의 핵심이에요. 불필요한 변수를 제거하면 해석이 쉬워지고, 향후 개입 정책을 수립하는 데도 도움이 돼요. 암기 팁 "R²는 거짓말을 해, 변수만 늘리면 커져(과대평가). Adjusted R²는 벌칙을 줘, 쓸데없는 변수는 빼!" 라고 생각하세요. Adjusted R²는 변수 수(p)에 대한 '벌칙(Penalty)'을 주는 공식을 사용한다는 점이 포인트예요. 국시 빈출 포인트 보건의료정보관리사/병원행정사 시험에서는 통계 파트에서 R² vs Adjusted R²의 차이점이 매우 자주 출제돼요. 특히 "왜 Adjusted R²를 쓰는가?"에 대한 이유를 묻거나, 변수 수가 증가했을 때 두 지표의 값 변화 방향을 묻는 문제가 많아요. 기출 변형 주의! - 계산형 변형: "표본 크기(n)=100, 독립변수 수(k)=5, R²=0.80일 때 Adjusted R²는?" (공식: 1 - [(1-R²)*(n-1)/(n-k-1)] 적용)
- 참/거짓 판단형: "다중회귀분석에서 독립변수를 추가하면 Adjusted R²는 항상 증가한다. (X)" -> 변수가 유의미하지 않으면 감소할 수 있음.

임상 시나리오

보건행정 실무 가이드 실무 시나리오 (Clinical Scenario) "병원 경영진이 외래 환자 만족도 조사 데이터를 분석해 달라고 요청했어요. 만족도(종속변수)에 영향을 미치는 요인으로 대기시간, 의사 설명 충분성, 청결도, 접근성, 주차 편의성 등 10개의 문항 점수(독립변수)를 모두 회귀분석에 넣었더니 R²가 0.85로 매우 높게 나왔어요. 하지만, 실제로 '주차 편의성' 점수는 만족도와 큰 상관이 없을 것 같은데, 이 모형을 그대로 보고해도 될까요?" 행정 중재 전략 (Admin Intervention) 1. 상황 파악: R²가 높지만, 의미 없는 변수가 포함되어 과적합되었을 가능성이 있어요.
2. 법적/규정 검토: 통계학적 모형 선택 원칙에 따라, Adjusted R²를 확인해야 해요. 또한, 각 변수의 p-value를 검토해 유의하지 않은 변수(p > 0.05)를 식별해요.
3. 대응 및 처리: 핵심! 단계적 회귀분석(Stepwise Regression)이나 Adjusted R², AIC 기준으로 변수를 하나씩 제거하며 최적 모형을 찾아요. 예를 들어 '주차 편의성' 변수를 제거했을 때 Adjusted R²가 오히려 증가한다면, 그 변수는 모형에서 제외하는 것이 바람직해요.
4. 사후 기록/보고: 최종 보고서에는 "R²=0.83, Adjusted R²=0.82"와 같이 두 값을 모두 명시하고, "Adjusted R²를 기준으로 8개의 유의미한 변수를 선정한 모형"이라고 설명하면, 분석의 신뢰도와 전문성이 크게 향상돼요. 법적 안전 및 주의사항 (Precautions) 통계 분석 결과를 근거로 병원 정책(예: 대기시간 단축 프로젝트에 예산 집중)을 수립할 때, 잘못된 모형(과적합된 모형)을 사용하면 자원의 비효율적 배분이라는 경영상 리스크를 초래할 수 있어요. Adjusted R² 등 적절한 지표를 사용해 타당하고 재현 가능한 분석 결과를 도출하는 것이 전문 행정가의 책임이에요. 업무 프로토콜 회귀분석 결과 검토 및 보고 프로토콜 1. 1차 모형 적합: 모든 후보 변수 포함.
2. 모형 진단: Adjusted R², 각 변수의 p-value, VIF(다중공선성) 확인.
3. 모형 수정: p-value가 높은 변수 제거 또는 VIF가 높은 변수 중 하나 제거.
4. 모형 비교: 수정 전후 Adjusted R² 변화 확인. 증가하면 수정 모형 채택.
5. 최종 보고: 최종 모형의 Adjusted R², 유의한 변수 목록 및 해석, 정책 제언 제시. 선배의 한마디 "보건행정에서 통계는 단순한 숫자 놀이가 아니에요. 데이터 속에 숨은 '진짜 이야기'를 찾아내어 병원 운영을 개선하고, 궁극적으로 환자 치료 결과를 향상시키는 데 쓰이는 강력한 도구예요. Adjusted R² 같은 개념을 이해하면, '보이는 숫자(R²)'에 현혹되지 않고 '진짜 설명력'을 가진 핵심 요인을 찾는 통찰력을 기를 수 있어요. 이는 국가고시를 넘어, 데이터 기반 의사결정(Data-Driven Decision Making)이 중요한 현장에서 큰 힘이 될 거예요!"

핵심 개념

마이메르시로 국가고시 완벽 대비

기출문제와 상세 해설을 무료로. 내 약점을 분석하고 진도를 관리하며 더 똑똑하게 공부하세요.

무료로 시작하기

학습 참고용입니다. 실제 임상은 최신 지침과 소속 기관 프로토콜을 따르세요.