최소제곱법(Ordinary Least Squares, OLS)을 이용한 회귀계수 추정의 기본 가정으로 옳지 … | 마이메르시 MyMerci
상관 및 회귀분석
문제

최소제곱법(Ordinary Least Squares, OLS)을 이용한 회귀계수 추정의 기본 가정으로 옳지 않은 것은?

해설
OLS 추정의 기본 가정은 오차항에 대한 가정(평균 0, 등분산성, 독립성, 정규성)이다. 독립변수들 간의 상관관계가 없어야 한다는 것은 다중공선성 문제와 관련되지만, OLS 추정 자체의 필수 가정은 아니다.

심화 해설

보건행정 핵심 해설 이 문제는 보건통계학 및 병원 경영 데이터 분석에서 핵심 도구인 최소제곱법(OLS)의 기본 가정을 묻고 있어요. OLS는 병원 재무 예측, 환자 수 추세 분석, 의료 서비스 만족도 영향 요인 분석 등 다양한 분야에서 회귀분석의 기초가 되는 방법이죠. 핵심 개념 분석 (Key Concept): OLS는 선형 회귀 모델에서 오차(잔차)의 제곱합을 최소화하는 방식으로 회귀계수를 추정해요. 이 추정량이 핵심! BLUE(Best Linear Unbiased Estimator, 최량 선형 불편 추정량)의 성질을 가지기 위해서는 몇 가지 기본 가정이 충족되어야 해요. 이 가정들은 주로 오차항(Error Term)의 특성에 관한 것입니다. 정답 근거 (Answer Rationale): 정답은 ③번이에요. OLS의 기본 가정은 다음과 같은 4가지 오차항에 대한 가정입니다: 1. 선형성(Linearity): 모델이 매개변수에 대해 선형이다. (문제에는 명시되지 않았지만 중요한 가정) 2. 외생성(Exogeneity) / 평균 0: 오차항의 조건부 기대값이 0이다. → ①번 "오차항의 평균은 0이다."에 해당. 3. 등분산성(Homoscedasticity): 오차항의 분산이 모든 관측치에서 동일하다. → ②번 "오차항의 분산은 일정하다."에 해당. 4. 비자기상관(Non-autocorrelation): 서로 다른 관측치의 오차항 간에 상관관계가 없다. → ④번 "오차항은 서로 독립이다."에 해당. 5. 정규성(Normality): 오차항이 정규분포를 따른다. (표본이 크면 중심극한정리에 의해 완화 가능) → ⑤번 "오차항은 정규분포를 따른다."에 해당. 반면, ③번 "독립변수들은 서로 상관관계가 없어야 한다."는 OLS 추정의 핵심! 필수 가정이 아니에요. 독립변수들 간의 높은 상관관계는 다중공선성(Multicollinearity) 문제를 일으켜 계수 추정의 분산을 크게 만들고 해석을 어렵게 할 수 있지만, OLS 추정 자체는 여전히 가능하며, 계수 추정값은 여전히 불편(Unbiased)합니다. 다중공선성은 모델의 실용적 문제이지, 이론적 가정 위반은 아니랍니다. 오답 분석 (Distractor Analysis): 혼동 주의! ①, ②, ④, ⑤번은 모두 OLS의 고전적 가정으로 정확한 내용이에요. 특히 ⑤번 '정규성'은 표본이 작을 때 가설검정을 위해 필요하지만, 대표본에서는 중심극한정리 덕분에 필수는 아니라는 점을 알아두세요. 그러나 문제에서는 "기본 가정"으로 제시되었으므로 옳은 지문입니다. 연관 개념 정리 (Related Concepts): - BLUE: 위 가정들이 모두 충족될 때 OLS 추정량이 가지는 최적의 성질. - 다중공선성: 독립변수 간 상관관계가 높아 발생. VIF(Variance Inflation Factor)로 진단. - 이분산성(Heteroscedasticity): ②번 가정 위반. 가중최소제곱법(WLS)으로 해결. - 자기상관(Autocorrelation): ④번 가정 위반. 시계열 데이터에서 흔히 발생.
개념 정리
OLS 기본 가정 (고전적 가정)내용위반 시 문제점
선형성모델이 매개변수에 대해 선형추정 자체가 부적합
외생성 (평균 0)E(ε|X) = 0계수 추정치 편향 발생
등분산성Var(ε|X) = σ² (상수)표준오차 추정 비효율, 검정 신뢰도 하락
비자기상관 (독립성)Cov(εi, εj) = 0 (i≠j)표준오차 과소 추정
정규성 (선택적)ε ~ N(0, σ²)소표본 시 검정 오류

한눈에 비교!
구분OLS 기본 가정 (필수)다중공선성 (문제점)
관계오차항(ε)의 특성에 관한 것독립변수(X)들 간의 관계에 관한 것
필수 여부BLUE 성질을 보장하기 위해 필수OLS 추정을 막지는 않음. 실용적 문제
위반 시 영향추정량의 불편성, 효율성 등 근본적 성질 훼손계수 추정치의 분산 증가, 해석 불안정
해결 방법WLS, GLS, 모형 변환 등변수 제거, 주성분 분석(PCA), 능형 회귀(Ridge)

실무 포인트 병원 경영 데이터(예: 월별 외래 환자 수, 재원일수, 병원비 지출)를 분석할 때 회귀모델을 사용한다면, 분석 후 반드시 잔차 분석(Residual Plot)을 통해 OLS 가정 위반 여부를 확인해야 해요. SPSS나 R 같은 통계 프로그램에서 쉽게 확인할 수 있답니다. 가정이 위반된 모델로 예측하면 신뢰할 수 없는 결과가 나와 잘못된 경영 판단으로 이어질 수 있어요.
암기 팁 OLS 가정은 오차항(ε)에 관한 것! "평(0)등독정"으로 외우세요: 균 0, 분산, 립, 규분포. 독립변수(X)끼리의 관계는 이 가정에 포함되지 않아요.
국시 빈출 포인트 보건의료정보관리사/병원행정사 시험에서 통계 파트는 OLS 가정, p-value 의미, 표본추출 방법 등이 단골 출제돼요. OLS 가정은 혼동 주의! "옳은 것" 고르기 vs "옳지 않은 것" 고르기 형태로 자주 나오니, 각 지문이 가정인지 아닌지 정확히 구분하는 훈련이 필요해요.
기출 변형 주의! 이 개념은 다음과 같이 변형 출제될 수 있어요: - 사례형: "병원 만족도 조사 데이터를 회귀분석한 후 잔차도를 보니 패턴이 있다. 어떤 OLS 가정이 위반된 것으로 의심되는가?" (→ 이분산성 위반) - 계산/해석형: "다중공선성이 있는 모델에서 특정 변수의 회귀계수 p-value는 유의하지만, VIF 값이 10을 넘는다. 이 변수의 영향에 대해 어떻게 해석해야 하는가?"

임상 시나리오

보건행정 실무 가이드 실무 시나리오 (Clinical Scenario): "보건소에서 지역 주민의 당뇨병 관리 프로그램 효과를 분석하고자 해요. 참여 횟수(X1), 교육 시간(X2), 초기 혈당치(X3)를 독립변수로, 프로그램 종료 후 혈당 감소량(Y)을 종속변수로 설정해 회귀분석을 실시했어요. 분석 결과, 참여 횟수와 교육 시간 변수의 계수가 예상과 달리 매우 불안정하고 표준오차가 큽니다. 무엇을 확인해야 할까요?" 행정 중재 전략 (Admin Intervention): 1. 상황 파악: 회귀계수의 불안정성과 큰 표준오차는 다중공선성을 강력히 시사해요. 2. 법적/규정 검토: 통계 분석에는 법적 규정보다 방법론적 정확성이 중요합니다. 잘못된 분석은 프로그램 효과를 과대/과소 평가해 예산 배분의 오류로 이어질 수 있어요. 3. 대응 및 처리: - 먼저 상관행렬(Correlation Matrix)을 확인해 X1과 X2의 상관계수가 매우 높은지 봅니다. - VIF(Variance Inflation Factor) 값을 계산합니다. 일반적으로 VIF > 10이면 심각한 다중공선성으로 판단합니다. - 해결 방법: 두 변수를 결합해 하나의 지표(예: '총 프로그램 노출량')로 만들거나, 주성분 회귀(PCR)능형 회귀(Ridge Regression) 같은 방법을 고려합니다. 4. 사후 기록/보고: 최종 분석 보고서에 사용된 방법, 다중공선성 진단 결과 및 이를 해결하기 위해 취한 조치를 명시적으로 기록해야 합니다. 법적 안전 및 주의사항 (Precautions): 공공 보건 프로그램 평가 결과는 예산 증감, 정책 지속 여부 등 중요한 결정에 사용됩니다. 핵심! 통계적 결함이 있는 분석 결과를 근거로 보고하면, 이는 자원의 비효율적 배분을 초래할 뿐만 아니라, 프로그램에 대한 신뢰도를 떨어뜨리는 행정적 실패로 이어질 수 있어요. 항상 분석의 타당성(Validity)과 신뢰도(Reliability)를 점검하는 태도가 필요합니다.
업무 프로토콜 회귀분석 실시 및 검증 프로토콜 1. 모델 설정: 이론적 근거에 기반한 변수 선택. 2. OLS 추정: 통계 소프트웨어로 기본 회귀분석 실시. 3. 가정 검증: - 잔차 vs 적합값 그림: 등분산성 확인. - Q-Q 그림 또는 Shapiro-Wilk 검정: 정규성 확인. - Durbin-Watson 통계량: 자기상관 확인. - VIF 계산: 다중공선성 확인. 4. 문제 해결: 가정 위반 시 적절한 방법(변수 변환, WLS, 시계열 모델 등) 적용. 5. 보고서 작성: 분석 방법, 검증 결과, 해석 및 한계점 명시.
선배의 한마디 "보건행정에서 데이터는 말을 해요. 하지만 그 말을 제대로 듣기 위해서는 통계라는 '귀'가 정확해야 한답니다. OLS 가정은 그 통계적 분석의 기본 문법과 같아요. 문법을 무시하고 글을 쓰면 뜻이 통하지 않듯이, 가정을 무시한 분석은 오해의 소지가 큰 결과를 만들어내요. 복잡한 공식보다 '왜 이런 가정이 필요할까?'를 생각하며 공부하면, 데이터 속에 숨은 보건의료의 진짜 이야기를 들을 수 있을 거예요!"

마이메르시로 국가고시 완벽 대비

기출문제와 상세 해설을 무료로. 내 약점을 분석하고 진도를 관리하며 더 똑똑하게 공부하세요.

무료로 시작하기

학습 참고용입니다. 실제 임상은 최신 지침과 소속 기관 프로토콜을 따르세요.