다중선형회귀모형에 새로운 독립변수를 추가했을 때 일반적으로 발생하는 현상은? | 마이메르시 MyMerci
상관 및 회귀분석
문제

다중선형회귀모형에 새로운 독립변수를 추가했을 때 일반적으로 발생하는 현상은?

해설
설명변수를 추가하면 모형이 데이터에 더 잘 적합되므로(과적합 위험 있음) 결정계수 R²는 항상 증가하거나 최소한 감소하지 않는다. 수정된 결정계수는 불필요한 변수 추가를 억제하기 위해 변수 수에 대해 패널티를 준다.

심화 해설

보건행정 핵심 해설 이 문제는 보건통계 및 연구방법론에서 핵심 도구인 다중선형회귀분석(Multiple Linear Regression)의 기본 원리를 묻고 있어요. 병원 경영 데이터 분석, 의료 서비스 만족도 연구, 질병 위험 요인 분석 등 보건행정 전반에서 널리 활용되는 기법이니 원리를 확실히 이해해야 해요. 핵심 개념 분석 (Key Concept): 결정계수(R², Coefficient of Determination)는 회귀모형이 종속변수(예: 입원 기간, 의료비)의 변동을 얼마나 잘 설명하는지를 나타내는 지표예요. 0에서 1 사이의 값을 가지며, 1에 가까울수록 모형의 설명력이 높아요. 정답 근거 (Answer Rationale): 핵심! 통계학의 기본 원리에 따르면, 기존 모형에 새로운 독립변수(설명변수)를 추가하면, 추가된 변수가 아무런 설명력이 없더라도(계수가 0이라도) 표본 결정계수(R²)는 절대 감소하지 않고 항상 증가하거나 동일하게 유지돼요. 이는 수학적으로 증명된 성질이에요. 모형이 데이터에 '더 꼭 맞게' 적합되기 때문이죠. 하지만 이것이 모형의 예측력이 항상 좋아진다는 의미는 아니라는 점이 중요해요. (과적합(Overfitting) 위험) 오답 분석 (Distractor Analysis):
혼동 주의! ②번 '기존 변수들의 회귀계수는 변하지 않는다'는 틀린 설명이에요. 새로운 변수가 추가되면, 기존 변수들과의 상관관계에 따라 기존 변수들의 회귀계수는 변할 수 있어요. 이는 공선성(Multicollinearity) 문제와도 연결되는 중요한 개념이에요.
③번 '모형의 F-통계량은 항상 감소한다'도 옳지 않아요. F-통계량은 모형 전체의 유의성을 검정하는데, 의미 없는 변수를 추가하면 일반적으로 감소할 수 있지만, 유의미한 변수를 추가하면 오히려 증가할 수 있어요. '항상'이라는 단어가 틀린 포인트예요.
④번 '수정된 결정계수(Adjusted R²)는 항상 감소한다'는 정반대에요. 수정된 결정계수는 불필요한 변수 추가를 억제하기 위해 변수의 개수(k)에 대해 패널티를 주어 계산해요. 따라서 의미 없는 변수를 추가하면 수정된 결정계수는 감소할 수 있지만, 의미 있는 변수를 추가하면 증가할 수도 있어요. '항상'이 틀린 키워드예요.
⑤번 '잔차제곱합(Residual Sum of Squares, RSS)은 항상 증가한다'도 틀렸어요. 잔차제곱합은 모형이 설명하지 못하는 오차의 양이에요. 새로운 변수를 추가하면 모형의 설명력이 (아주 조금이라도) 향상되므로, 잔차제곱합은 감소하거나 최소한 유지될 뿐 절대 증가하지 않아요. 연관 개념 정리 (Related Concepts): - 수정된 결정계수(Adjusted R²): 변수 개수에 따른 패널티를 적용한 결정계수. 모형 비교 시 R²보다 더 유용한 지표. - 과적합(Overfitting): 표본 데이터에 지나치게 맞춰져 새로운 데이터에 대한 예측력이 떨어지는 현상. 변수를 무분별하게 추가하면 발생 위험이 커져요. - 모형 선택 기준: AIC(Akaike Information Criterion), BIC(Bayesian Information Criterion) 등은 변수 수에 대한 패널티를 주어 최적의 모형을 선택하는 기준이에요. 개념 정리
용어의미새 변수 추가 시 변화
결정계수 (R²)모형의 설명력 (0~1)항상 증가 또는 유지
수정된 결정계수 (Adjusted R²)변수 수 패널티를 고려한 설명력의미 있는 변수면 증가, 불필요하면 감소
잔차제곱합 (RSS)모형이 설명하지 못한 오차의 합감소 또는 유지
F-통계량모형 전체의 유의성 검정 통계량변동 가능 (항상X)
실무 포인트 보건행정 실무에서, 예를 들어 '입원 환자 만족도'를 예측하는 모형을 만들 때, 처음에는 '의사 설명 만족도', '간호 서비스 만족도' 두 변수만 사용했다가, '병실 청결도' 변수를 추가했다고 가정해볼게요. 이때 통계 프로그램 출력 결과에서 R² 값은 반드시 이전보다 높게 나와야 해요. 만약 낮게 나온다면 데이터나 분석 과정에 문제가 있을 가능성이 높아요. 하지만, 수정된 R²를 함께 확인하여 새 변수의 추가가 정말 유용한지 판단하는 것이 현명한 분석가의 자세예요. 암기 팁 "R²는 무조건 Up, 잔차(RSS)는 무조건 Down"이라고 외우세요! 새로운 변수를 추가하면 모형의 '적합력'은 무조건 좋아지기(표본 내에서) 때문에 설명력(R²)은 올라가고, 설명 못하는 오차(RSS)는 줄어드는 게 당연하죠. 하지만 이건 '표본 내' 이야기이고, '표본 외' 예측을 생각하면 다른 얘기가 됩니다. 국시 빈출 포인트 회귀분석 관련 지식은 보건정보학 또는 연구방법론 영역에서 자주 출제돼요. 결정계수(R²)와 수정된 결정계수의 차이, 변수 추가 시 각 통계량의 변화 방향을 묻는 문제가 매우 빈번해요. '항상'이라는 절대적인 표현이 들어간 선택지를 주의 깊게 살펴보세요.

임상 시나리오

보건행정 실무 가이드 실무 시나리오 (Clinical Scenario): "병원 기획팀에서 지역 내 우리 병원의 외래 환자 수를 예측하는 모델을 개발 중이에요. 초기 모델에는 '경쟁 병원 수'와 '지역 인구' 변수만 사용했어요. 동료가 '지역 평균 소득' 변수를 추가하자고 제안했을 때, 분석 결과를 어떻게 해석해야 할까요?" 행정 중재 전략 (Admin Intervention): 1. 상황 파악: 새 변수 추가 제안을 받음. 2. 법적/규정 검토: 통계적 원리 적용. 분석을 실행하면 R²는 반드시 증가했을 거예요. 이것만으로 변수 추가가 타당하다고 결론 내리면 안 돼요. 3. 대응 및 처리: 핵심! 반드시 수정된 결정계수(Adjusted R²)와 새 변수의 p-value(유의확률)를 함께 확인해야 해요. 수정된 R²가 증가하고, 새 변수의 p-value가 0.05 미만으로 유의미하다면, 변수 추가가 타당하다고 판단할 수 있어요. 4. 사후 기록/보고: 분석 결과 보고서에 R²의 변화, 수정된 R², 각 변수의 계수와 유의성을 명시하여 의사결정 근거를 투명하게 제시하세요. 법적 안전 및 주의사항 (Precautions): 통계 모형의 결과를 병원 경영 전략 수립에 활용할 때, 혼동 주의! '상관관계는 인과관계를 의미하지 않는다(Correlation does not imply causation)'는 원칙을 잊지 마세요. 모형이 좋다고 해서 변수 간 인과 관계가 있다고 단정하면 안 돼요. 업무 프로토콜 1. 모형 구축 목적 설정 (예측? 설명?) 2. 변수 후보 수집 및 이론적 근거 마련 3. 회귀분석 수행 (소프트웨어: R, SPSS, SAS 등) 4. 결과 해석 순서: ① 모형 F-검정 유의성 → ② 수정된 R² 확인 → ③ 개별 변수 t-검정 유의성(p-value) → ④ 공선성(VIF) 진단 5. 최종 모형 선정 및 보고 선배의 한마디 "통계는 숫자 놀음이 아니라, 데이터 속에 숨은 이야기를 읽는 도구예요. R²가 올라갔다고 좋아하기 전에, '왜 올라갔을까?', '이 변수가 정말 의미가 있을까?'를 항상 질문하세요. 보건행정가에게 통계적 사고력은 문제를 과학적으로 해결하는 강력한 무기랍니다!"

핵심 개념

마이메르시로 국가고시 완벽 대비

기출문제와 상세 해설을 무료로. 내 약점을 분석하고 진도를 관리하며 더 똑똑하게 공부하세요.

무료로 시작하기

학습 참고용입니다. 실제 임상은 최신 지침과 소속 기관 프로토콜을 따르세요.