보건행정 핵심 해설
이 문제는 보건통계학에서 가장 기초적이면서도 중요한 개념인
표본분산의 자유도와
불편추정량(Unbiased Estimator)에 대한 원리를 묻고 있어요. 보건행정에서 데이터 분석, 연구 설계, 정책 효과 평가 시 반드시 이해해야 할 통계적 기초입니다.
핵심 개념 분석 (Key Concept): 표본분산은 모집단의 분산(모분산)을 추정하기 위해 사용하는 통계량이에요. 만약 표본분산을 계산할 때 편차 제곱합을 표본 크기
n으로 나누면, 그 기대값(E)은 모분산(σ²)보다 작아지는 경향이 있어요. 이는 표본 평균(\(\bar{x}\))이 모평균(μ)의 추정치로 사용되면서 발생하는 내재적인 편향 때문입니다. 이 편향을 보정하기 위해 자유도
n-1로 나누는 것이죠.
정답 근거 (Answer Rationale):
핵심! 정답 ④번 "
모분산에 대한 불편추정량을 얻기 위함이다."가 맞습니다. 불편추정량이란 추정량의 기대값이 추정하려는 모수와 정확히 일치하는 통계량을 말해요. 수식으로 표현하면, \(E[s^2] = σ^2\) (여기서 \(s^2 = \frac{Σ(x_i - \bar{x})^2}{n-1}\))이 성립합니다. 반면 n으로 나눈 분산(\(s_n^2\))의 기대값은 \(E[s_n^2] = \frac{n-1}{n}σ^2\)이 되어 항상 모분산보다 작아지죠. 따라서 n-1로 나누어야 편향(Bias)이 없는(unbiased) 추정이 가능해집니다.
오답 분석 (Distractor Analysis):
①
혼동 주의! "단위를 원래 자료와 맞추기 위함이다.": 단위를 맞추는 것은 분산에 제곱근을 씌워 표준편차(Standard Deviation)를 구할 때의 목적이에요. 분산 자체의 계산 목적이 아닙니다.
② "계산을 간편하게 하기 위함이다.": n-1로 나누는 것이 n으로 나누는 것보다 계산이 더 복잡해질 수 있어요. 간편함과는 무관합니다.
③ "극단값의 영향을 줄이기 위함이다.": 극단값(Outlier)의 영향을 줄이는 것은 분산 계산 자체의 특성보다는 로버스트(Robust) 통계량(예: 중앙값, 사분위범위)을 사용하거나 데이터 변환 등의 방법으로 해결해요.
⑤ "음수 값을 방지하기 위함이다.": 편차를 제곱하는 과정에서 이미 모든 값이 0 또는 양수가 되기 때문에, 나누는 수와는 무관하게 음수 값은 발생하지 않아요.
연관 개념 정리 (Related Concepts):
-
자유도(Degrees of Freedom): 추정에 사용된 독립적인 정보의 수. 표본평균 \(\bar{x}\)을 먼저 계산했기 때문에, n개의 관측치 중 n-1개는 자유롭게 변할 수 있고, 마지막 하나는 제약을 받게 됩니다.
-
편향(Bias) vs
효율성(Efficiency): 불편추정량은 편향이 없지만, 분산이 가장 작은(가장 효율적인) 추정량은 아닐 수 있어요. 최소분산불편추정량(Minimum Variance Unbiased Estimator, MVUE)이 이상적입니다.
- 보건 분야 적용: 역학 연구에서 표본으로부터 질병 발생률의 변동성을 추정하거나, 치료법 간 효과 차이의 분산을 비교할 때 이 원리가 적용됩니다.
개념 정리
| 용어 | 의미 | 공식 (표본) | 비고 |
| 표본분산 (Sample Variance) | 표본 데이터의 흩어짐 정도 측정. 모분산 추정용. | \(s^2 = \frac{Σ(x_i - \bar{x})^2}{n-1}\) | 불편추정량 |
| 모분산 (Population Variance) | 모집단 전체 데이터의 흩어짐 정도. | \(σ^2 = \frac{Σ(x_i - μ)^2}{N}\) | 모평균(μ) 사용 |
| 불편추정량 (Unbiased Estimator) | 추정량의 기대값이 모수와 일치. | \(E[\hat{θ}] = θ\) | 통계적 추론의 핵심 |
| 자유도 (Degrees of Freedom) | 독립적으로 변할 수 있는 값의 수. | n - (추정된 모수의 수) | 표본평균 추정 시 1개 소모 |
한눈에 비교!
| 구분 | n으로 나눈 분산 (\(s_n^2\)) | n-1로 나눈 분산 (\(s^2\)) |
| 공식 | \(\frac{Σ(x_i - \bar{x})^2}{n}\) | \(\frac{Σ(x_i - \bar{x})^2}{n-1}\) |
| 기대값 | \(E[s_n^2] = \frac{n-1}{n}σ^2\) | \(E[s^2] = σ^2\) |
| 특성 | 편향 있음 (과소추정) | 불편추정량 |
| 주용도 | 표본 자체의 분산 기술 (드물게 사용) | 모분산 추정 (일반적) |
실무 포인트
보건행정 실무에서 표본조사(예: 지역주민 건강설문, 병원 만족도 조사) 데이터를 분석할 때, 통계 패키지(SPSS, R, SAS)는 기본적으로
n-1로 나눈 표본분산과 표준편차를 출력해요. 보고서나 논문 작성 시 "분산"이라고 언급하면 일반적으로 이 불편추정량을 의미한다는 점을 기억하세요. 작은 표본(n이 작을수록)일 때 n으로 나눈 값과의 차이가 커지므로 더욱 주의해야 합니다.
암기 팁
"
불편하게
하나 빠진다!" →
불편추정량을 만들려면 분모에서
1을 빼야 한다(n-1).
국시 빈출 포인트
이 주제는
보건의료정보관리사 시험의 '보건정보학/통계' 영역에서,
병원행정사 시험의 '병원관리학/연구방법론' 영역에서 단골 출제돼요. "불편추정량의 정의", "자유도 n-1을 사용하는 이유", "표본분산 공식"을 직접 묻거나, 다른 추정 개념(점추정, 구간추정)과 함께 통합적으로 출제됩니다.
기출 변형 주의!
-
사례형: "어느 보건소에서 30명의 주민 혈압 데이터를 수집해 분산을 계산했다. 이 분산값으로 전체 지역 주민의 혈압 변동성을 추정할 때, 공식의 분모로 무엇을 사용해야 하는지 그 이유와 함께 설명하시오."
-
역접형: "표본분산을 n으로 나누어 계산하는 경우는 언제인가?" (답: 모집단 전체 데이터를 가지고 있을 때, 즉 기술통계량으로만 사용할 때)