# 표본분산을 계산할 때, 편차 제곱합을 (n-1)로 나누는 주된 이유는?

> source: MyMerci (mymerci.kr)  
> url: https://mymerci.kr/pages/nclex_q.php?qn_id=290894  
> language: ko  
> subject: 기술통계

## 문제

표본분산을 계산할 때, 편차 제곱합을 (n-1)로 나누는 주된 이유는?

## 보기

1. 단위를 원래 자료와 맞추기 위함이다.
2. 계산을 간편하게 하기 위함이다.
3. 극단값의 영향을 줄이기 위함이다.
4. 모분산에 대한 불편추정량을 얻기 위함이다. **✔ 정답**
5. 음수 값을 방지하기 위함이다.

**정답: 4**

## 해설

표본분산을 계산할 때 자유도(n-1)로 나누면 그 기대값이 모분산과 일치하는 불편추정량이 된다. n으로 나눈 표본분산은 모분산을 과소추정하는 경향이 있다.

## 심화 해설

보건행정 핵심 해설
이 문제는 보건통계학에서 가장 기초적이면서도 중요한 개념인 표본분산의 자유도와 불편추정량(Unbiased Estimator)에 대한 원리를 묻고 있어요. 보건행정에서 데이터 분석, 연구 설계, 정책 효과 평가 시 반드시 이해해야 할 통계적 기초입니다.

**핵심 개념 분석 (Key Concept)**: 표본분산은 모집단의 분산(모분산)을 추정하기 위해 사용하는 통계량이에요. 만약 표본분산을 계산할 때 편차 제곱합을 표본 크기 n으로 나누면, 그 기대값(E)은 모분산(σ²)보다 작아지는 경향이 있어요. 이는 표본 평균(\(\bar{x}\))이 모평균(μ)의 추정치로 사용되면서 발생하는 내재적인 편향 때문입니다. 이 편향을 보정하기 위해 자유도 n-1로 나누는 것이죠.

**정답 근거 (Answer Rationale)**: 핵심! 정답 ④번 "모분산에 대한 불편추정량을 얻기 위함이다."가 맞습니다. 불편추정량이란 추정량의 기대값이 추정하려는 모수와 정확히 일치하는 통계량을 말해요. 수식으로 표현하면, \(E[s^2] = σ^2\) (여기서 \(s^2 = \frac{Σ(x_i - \bar{x})^2}{n-1}\))이 성립합니다. 반면 n으로 나눈 분산(\(s_n^2\))의 기대값은 \(E[s_n^2] = \frac{n-1}{n}σ^2\)이 되어 항상 모분산보다 작아지죠. 따라서 n-1로 나누어야 편향(Bias)이 없는(unbiased) 추정이 가능해집니다.

**오답 분석 (Distractor Analysis)**:

① 혼동 주의! "단위를 원래 자료와 맞추기 위함이다.": 단위를 맞추는 것은 분산에 제곱근을 씌워 표준편차(Standard Deviation)를 구할 때의 목적이에요. 분산 자체의 계산 목적이 아닙니다.

② "계산을 간편하게 하기 위함이다.": n-1로 나누는 것이 n으로 나누는 것보다 계산이 더 복잡해질 수 있어요. 간편함과는 무관합니다.

③ "극단값의 영향을 줄이기 위함이다.": 극단값(Outlier)의 영향을 줄이는 것은 분산 계산 자체의 특성보다는 로버스트(Robust) 통계량(예: 중앙값, 사분위범위)을 사용하거나 데이터 변환 등의 방법으로 해결해요.

⑤ "음수 값을 방지하기 위함이다.": 편차를 제곱하는 과정에서 이미 모든 값이 0 또는 양수가 되기 때문에, 나누는 수와는 무관하게 음수 값은 발생하지 않아요.

**연관 개념 정리 (Related Concepts)**:
- 자유도(Degrees of Freedom): 추정에 사용된 독립적인 정보의 수. 표본평균 \(\bar{x}\)을 먼저 계산했기 때문에, n개의 관측치 중 n-1개는 자유롭게 변할 수 있고, 마지막 하나는 제약을 받게 됩니다.
- 편향(Bias) vs 효율성(Efficiency): 불편추정량은 편향이 없지만, 분산이 가장 작은(가장 효율적인) 추정량은 아닐 수 있어요. 최소분산불편추정량(Minimum Variance Unbiased Estimator, MVUE)이 이상적입니다.
- 보건 분야 적용: 역학 연구에서 표본으로부터 질병 발생률의 변동성을 추정하거나, 치료법 간 효과 차이의 분산을 비교할 때 이 원리가 적용됩니다.

개념 정리

| 용어 | 의미 | 공식 (표본) | 비고 |
| --- | --- | --- | --- |
| 표본분산 (Sample Variance) | 표본 데이터의 흩어짐 정도 측정. 모분산 추정용. | \(s^2 = \frac{Σ(x_i - \bar{x})^2}{n-1}\) | 불편추정량 |
| 모분산 (Population Variance) | 모집단 전체 데이터의 흩어짐 정도. | \(σ^2 = \frac{Σ(x_i - μ)^2}{N}\) | 모평균(μ) 사용 |
| 불편추정량 (Unbiased Estimator) | 추정량의 기대값이 모수와 일치. | \(E[\hat{θ}] = θ\) | 통계적 추론의 핵심 |
| 자유도 (Degrees of Freedom) | 독립적으로 변할 수 있는 값의 수. | n - (추정된 모수의 수) | 표본평균 추정 시 1개 소모 |

한눈에 비교!

| 구분 | n으로 나눈 분산 (\(s_n^2\)) | n-1로 나눈 분산 (\(s^2\)) |
| --- | --- | --- |
| 공식 | \(\frac{Σ(x_i - \bar{x})^2}{n}\) | \(\frac{Σ(x_i - \bar{x})^2}{n-1}\) |
| 기대값 | \(E[s_n^2] = \frac{n-1}{n}σ^2\) | \(E[s^2] = σ^2\) |
| 특성 | 편향 있음 (과소추정) | 불편추정량 |
| 주용도 | 표본 자체의 분산 기술 (드물게 사용) | 모분산 추정 (일반적) |

실무 포인트
보건행정 실무에서 표본조사(예: 지역주민 건강설문, 병원 만족도 조사) 데이터를 분석할 때, 통계 패키지(SPSS, R, SAS)는 기본적으로 **n-1로 나눈 표본분산과 표준편차**를 출력해요. 보고서나 논문 작성 시 "분산"이라고 언급하면 일반적으로 이 불편추정량을 의미한다는 점을 기억하세요. 작은 표본(n이 작을수록)일 때 n으로 나눈 값과의 차이가 커지므로 더욱 주의해야 합니다.

암기 팁
"**불편**하게 **하나** 빠진다!" → 불편추정량을 만들려면 분모에서 1을 빼야 한다(n-1).

국시 빈출 포인트
이 주제는 **보건의료정보관리사** 시험의 '보건정보학/통계' 영역에서, **병원행정사** 시험의 '병원관리학/연구방법론' 영역에서 단골 출제돼요. "불편추정량의 정의", "자유도 n-1을 사용하는 이유", "표본분산 공식"을 직접 묻거나, 다른 추정 개념(점추정, 구간추정)과 함께 통합적으로 출제됩니다.

기출 변형 주의!
- **사례형**: "어느 보건소에서 30명의 주민 혈압 데이터를 수집해 분산을 계산했다. 이 분산값으로 전체 지역 주민의 혈압 변동성을 추정할 때, 공식의 분모로 무엇을 사용해야 하는지 그 이유와 함께 설명하시오."
- **역접형**: "표본분산을 n으로 나누어 계산하는 경우는 언제인가?" (답: 모집단 전체 데이터를 가지고 있을 때, 즉 기술통계량으로만 사용할 때)

## 임상 시나리오

보건행정 실무 가이드
**실무 시나리오 (Clinical Scenario)**: "병원 경영지원실에서 신규 간호사 업무 만족도 조사를 실시했습니다. 50명의 간호사에게 5점 척도로 설문을 받아 데이터를 수집했어요. 이 데이터의 변동성(분산)을 계산하여 '업무 부담 감소 프로그램' 도입 전후의 만족도 변화를 통계적으로 검정하려고 합니다. 이때, 표본분산을 계산하는 공식은 무엇을 사용해야 할까요?"

**행정 중재 전략 (Admin Intervention)**:
1. **상황 파악**: 50명의 표본 데이터로부터 전체 간호사(모집단)의 만족도 분산을 추정해야 합니다.
2. **법적/규정 검토**: 통계학적 원리에 따르면, 모수를 추정할 때는 불편추정량을 사용해야 유효한 추론이 가능합니다.
3. **대응 및 처리**: 데이터 분석 담당자(또는 사용하는 소프트웨어)에게 "표본분산 계산 시 분모를 n-1(즉, 49)로 설정해야 한다"는 점을 명확히 지시합니다. Excel의 `VAR.S` 함수나 R의 `var()` 함수가 이에 해당합니다.
4. **사후 기록/보고**: 최종 분석 보고서에 "표본분산은 불편추정량으로 계산되었음"을 명시하여 결과의 통계적 타당성을 강조합니다.

**법적 안전 및 주의사항 (Precautions)**:
보건행정에서 연구나 평가 보고서를 작성할 때 통계 방법의 오용은 결과 해석의 오류로 이어져 잘못된 정책 결정을 초래할 수 있어요. 특히, 표본 크기가 작은 연구(n

## 같은 주제 문제

- [다음 중 자료의 산포 정도를 나타내는 지표가 아닌 것은?](https://mymerci.kr/pages/nclex_q.php?qn_id=290890)
- [분산의 단점을 보완하기 위해 제곱근을 취하여 원래 자료의 단위와 일치시킨 산포도 지표는?](https://mymerci.kr/pages/nclex_q.php?qn_id=290891)
- [두 집단의 평균이 크게 다른 경우, 평균의 차이를 보정하여 순수한 산포 정도를 비교할 수 있는 지표는?](https://mymerci.kr/pages/nclex_q.php?qn_id=290892)
- [극단값(outlier)의 영향을 가장 덜 받는 산포도 측정치는?](https://mymerci.kr/pages/nclex_q.php?qn_id=290893)
- [모든 관측값이 동일한 값을 가질 때, 다음 산포도 지표 중 0이 아닌 값을 가지는 것은?](https://mymerci.kr/pages/nclex_q.php?qn_id=290895)
- [정규분포를 따르는 자료에서 평균 ± 1표준편차 범위 내에 포함되는 자료의 비율은 약 얼마인가?](https://mymerci.kr/pages/nclex_q.php?qn_id=290896)
- [다음 중 산포도가 가장 큰 자료 집단을 판별하는 직접적인 방법으로 가장 적절한 것은?](https://mymerci.kr/pages/nclex_q.php?qn_id=290897)
- [체계적으로 변화하는 시계열 자료의 산포도를 평가할 때, 순수한 무작위 변동을 추정하기 위해 사용하는 지표는?](https://mymerci.kr/pages/nclex_q.php?qn_id=290898)

---

More free questions: [기출문제](https://mymerci.kr/)

_학습 참고용입니다. 실제 임상은 최신 지침과 소속 기관 프로토콜을 따르세요._

