다중 선형회귀분석에서 모형의 적합도를 평가하는 지표로 가장 적절하지 않은 것은? | 마이메르시 MyMerci
상관 및 회귀분석
문제

다중 선형회귀분석에서 모형의 적합도를 평가하는 지표로 가장 적절하지 않은 것은?

해설
독립변수 간의 상관계수 행렬은 다중공선성(multicollinearity)을 진단하는 데 사용되며, 모형의 적합도(goodness-of-fit)를 직접 평가하는 지표는 아니다.

심화 해설

보건행정 핵심 해설 이 문제는 보건통계학병원 경영 데이터 분석의 핵심 도구인 다중 선형회귀분석(Multiple Linear Regression)에서, 분석 결과를 해석하고 모델의 유용성을 판단하는 평가 지표에 대한 이해를 묻고 있어요. 보건행정 현장에서는 의료 서비스 이용량 예측, 병원 비용 분석, 환자 만족도 영향 요인 분석 등 다양한 연구와 정책 평가에 회귀분석이 활용되기 때문에, 어떤 지표가 무엇을 의미하는지 정확히 아는 것이 중요해요. 핵심 개념 분석 (Key Concept) 핵심! "모형의 적합도(goodness-of-fit)"란, 우리가 만든 회귀 모형이 실제 데이터를 얼마나 잘 설명하고 예측하는지를 나타내는 척도예요. 즉, 독립변수들이 종속변수의 변동을 얼마나 잘 설명하는지를 평가하는 것이죠. 이는 모형 전체의 성능을 보는 '글로벌(global)' 평가에 해당해요. 정답 근거 (Answer Rationale) 정답은 ② 독립변수 간의 상관계수 행렬이에요. 왜냐하면 이 지표는 모형의 적합도를 평가하는 것이 아니라, 모형 구축 전의 가정 검토 또는 문제 진단에 사용되기 때문이에요. - 독립변수 간의 상관계수 행렬: 이는 다중공선성(Multicollinearity)을 탐지하기 위해 살펴보는 도구예요. 독립변수들끼리 높은 상관관계가 있으면, 개별 변수의 영향력을 정확히 추정하기 어렵고 회귀계수가 불안정해질 수 있어요. 따라서 이는 모형을 적용하기 전에 확인해야 할 '전제조건'이나 '문제점'을 파악하는 진단 도구이며, 모형이 데이터에 얼마나 잘 '맞는지(fit)'를 수치화하여 평가하는 적합도 지표는 아니에요. 오답 분석 (Distractor Analysis) 혼동 주의! 나머지 선택지들은 모두 모형 적합도를 평가하는 데 직접적으로 사용되는 대표적인 지표들이에요. - ① 개별 회귀계수의 t-통계량: 이는 각 독립변수가 종속변수에 유의미한 영향을 미치는지를 검정하는 지표예요. 모형 내 특정 변수의 '부분적(partial)' 기여도를 평가한다는 점에서 모형 전체 적합도 평가와 연결됩니다. - ③ 잔차제곱합(Residual Sum of Squares, RSS): 모형이 예측한 값과 실제 관측값 사이의 오차(잔차)를 제곱하여 모두 더한 값이에요. 이 값이 작을수록 모형이 데이터를 잘 설명한다고 볼 수 있어요. 결정계수(R-squared)를 계산하는 데 직접 사용되는 핵심 요소죠. - ④ F-통계량(F-statistic): 핵심! 이는 모형 전체의 유의성을 검정하는 지표예요. "모든 회귀계수가 0이다(즉, 모형이 의미 없다)"는 귀무가설을 검정합니다. F-통계량이 크고 유의확률(p-value)이 작으면, 적어도 하나의 독립변수가 유의미하다는 결론을 내리게 되어 모형의 전반적 적합도를 평가하는 데 필수적이에요. - ⑤ 수정된 결정계수(Adjusted R-squared): 일반적인 결정계수(R²)는 변수를 무조건 추가하면 증가하는 단점이 있어요. 수정된 결정계수는 모형의 복잡도(변수의 개수)를 고려하여 조정한 값으로, 변수를 추가할 때 진정으로 설명력이 향상되는지 판단하는 데 더 적합한 지표예요. 연관 개념 정리 (Related Concepts) - 결정계수(R-squared): 종속변수의 총 변동 중에서 회귀모형으로 설명되는 비율을 나타냅니다. 0에서 1 사이의 값을 가지며, 1에 가까울수록 적합도가 높아요. - 다중공선성 진단: 상관계수 행렬 외에도 분산팽창지수(Variance Inflation Factor, VIF)를 주로 사용해요. VIF가 10을 넘으면 다중공선성이 심각하다고 판단합니다. 개념 정리
지표용도비고
t-통계량개별 독립변수의 유의성 검정부분적 기여도 평가
F-통계량회귀모형 전체의 유의성 검정전체적 적합도 평가의 핵심
잔차제곱합(RSS)모형의 예측 오차 총량작을수록 좋음, R² 계산 기초
수정된 R²변수 개수를 고려한 설명력모형 비교 시 유용
상관계수 행렬다중공선성 탐지 (진단 도구)적합도 지표 아님!
한눈에 비교!
분류주요 지표목적
모형 적합도 평가
(Goodness-of-fit)
F-통계량, 결정계수(R²), 수정된 R², RSS만들어진 모형이 데이터를 얼마나 잘 설명하는가?
변수 유의성 평가
(Variable Significance)
t-통계량 (및 p-value)각 독립변수가 종속변수에 영향을 미치는가?
모형 가정 진단
(Model Assumption Diagnosis)
잔차 분석, 상관계수 행렬/VIF(다중공선성), Durbin-Watson 통계량(자기상관)회귀분석의 기본 가정이 충족되는가?
실무 포인트 병원 경영 데이터(예: 월간 외래 환자 수)를 분석할 때, 여러 요인(광고비, 계절, 의사 수 등)의 영향을 회귀분석으로 살펴본다면: 1. 먼저 상관계수 행렬을 보고 변수들 간의 강한 상관관계가 있는지 확인하세요 (다중공선성 예방). 2. 분석 후, F-통계량의 p-value가 0.05 미만인지 확인하여 모형 전체가 유의미한지 판단하세요. 3. 수정된 R² 값을 확인해 모형의 설명력을 파악하세요. 4. 중요한 변수를 찾기 위해 각 변수의 t-통계량과 p-value를 검토하세요. 암기 팁 "적합도는 F와 R²가 본다!"라고 기억하세요. F(전체 검정)와 R²(설명력)는 모형 적합도의 양대 산맥이에요. 상관계수 행렬은 모형을 만들기 전에 변수들을 '살펴보는' 진단용 도구라고 생각하면 구분하기 쉬워요. 국시 빈출 포인트 통계 방법론의 평가 지표는 개념을 정확히 구분하는 문제로 자주 출제돼요. 특히 "적합도 평가 vs. 가정 검정 vs. 변수 선택"을 혼동시키는 선택지를 많이 내요. "다중공선성 검출" 관련 지표(VIF, 상관계수)가 적합도 지표가 아니라는 점을 꼭 기억하세요. 기출 변형 주의! - 사례형: "병원 만족도 조사 데이터를 다중 회귀분석한 결과, 수정된 R²는 0.65이고 F-검정은 유의하였으나 한 변수의 VIF가 15로 나왔다. 이 결과를 해석하시오." → 적합도는 괜찮지만(VIF, R²), 다중공선성 문제가 있음을 지적해야 함. - 계산형: 잔차제곱합(RSS)이나 결정계수(R²)를 주고 다른 통계량을 유도하도록 할 수 있어요.

임상 시나리오

보건행정 실무 가이드 실무 시나리오 (Clinical Scenario) 보건소에서 지역 주민의 당뇨병 관리 프로그램 참여율을 높이기 위한 연구를 합니다. 참여율(종속변수)에 영향을 미칠 것으로 예상되는 연령, 소득수준, 거리, 사전 건강정보 접근성(독립변수) 데이터를 수집해 다중 선형회귀분석을 실시했어요. 분석 결과 리포트를 검토할 때, 어떤 지표에 집중해서 모형의 유용성을 판단하고 정책 제언을 해야 할까요? 행정 중재 전략 (Admin Intervention) 1. 상황 파악: 분석팀으로부터 통계 출력 결과(상관계수 행렬, 회귀계수, t값, F값, R² 등)를 받았어요. 2. 법적/규정 검토: 통계적 유의성 기준(일반적으로 p-value < 0.05)을 적용해요. 3. 대응 및 처리: - 첫째, 핵심! F-통계량과 그 p-value를 확인해요. 유의하지 않다면, 선택한 변수들로는 참여율을 설명하는 의미 있는 모형을 만들지 못한 것이므로 변수 재선택이나 다른 분석 방법을 고려해야 해요. - 둘째, 모형이 유의하다면, 수정된 R²를 봐요. 값이 0.3이라면 변수들이 참여율 변동의 30%를 설명한다는 의미로, 설명력이 어느 정도인지 파악할 수 있어요. - 셋째, 개별 변수의 t-통계량과 p-value를 보고, 어떤 요인(예: '거리' 변수)이 통계적으로 유의미한 영향을 미치는지 찾아요. 이를 바탕으로 "의료시설 접근성 향상" 같은 구체적 정책을 제안할 수 있어요. - 넷째, 상관계수 행렬이나 VIF 값을 재점검해요. 만약 '소득수준'과 '건강정보 접근성' 변수가 매우 높은 상관관계를 보여 다중공선성 경고가 뜬다면, 두 변수 중 하나를 모형에서 제외하는 등의 조치를 고려해야 해요. 4. 사후 기록/보고: 분석 결과와 위의 평가 지표들을 근거로 한 정책 제안서를 작성해 보고합니다. 법적 안전 및 주의사항 (Precautions) 연구 결과를 공표하거나 정책 근거로 사용할 때는 통계적 유의성만이 아닌 실제적 유의성(Effect Size)도 함께 고려해야 해요. 통계적으로 유의미해도 회귀계수의 크기가 매우 작으면 정책적 영향은 미미할 수 있어요. 또한, 인과관계를 주장할 때는 회귀분석만으로는 한계가 있음을 명시해야 합니다. 업무 프로토콜 회귀분석 결과 검토 체크리스트 1. 모형 전체 유의성: F-statistic의 p-value < 0.05? 2. 모형 설명력: 수정된 R² 값은 얼마? (보건 분야는 0.2~0.5도 의미 있을 수 있음) 3. 다중공선성: 모든 변수의 VIF < 10? 4. 유의미한 변수: p-value < 0.05인 변수는 무엇? 계수 부호는 예상과 일치? 5. 잔차 가정: 잔차의 정규성, 등분산성 가정을 위반하지는 않는가? (고급) 선배의 한마디 "보건행정에서 데이터는 말을 해요. 하지만 그 목소리를 제대로 듣기 위해서는 통계 도구를 정확히 이해해야 해요. 회귀분석은 강력한 도구지만, 마치 블랙박스처럼 결과 숫자만 받아들이면 안 되고, 각 지표가 무엇을 의미하는지 꼼꼼히 따져보는 습관이 전문가와 아마추어를 가르는 기준이에요. 상관계수 행렬이 적합도 지표가 아니라는 이 문제의 포인트처럼, '용도가 다른 도구'를 구분하는 눈을 키우세요!"

마이메르시로 국가고시 완벽 대비

기출문제와 상세 해설을 무료로. 내 약점을 분석하고 진도를 관리하며 더 똑똑하게 공부하세요.

무료로 시작하기

학습 참고용입니다. 실제 임상은 최신 지침과 소속 기관 프로토콜을 따르세요.