핵심 해설
이 문제는
기술통계학(Descriptive Statistics)에서 연속형 자료의
중심경향(Central Tendency)을 나타내는 대표값들의 특징을 비교하는 문제예요. 특히
극단값(Outlier)에 얼마나 민감하게 반응하는지가 핵심 포인트입니다.
핵심 개념 분석: 자료의 중심을 설명하는 대표값으로는
평균(Mean),
중앙값(Median),
최빈값(Mode)이 있어요. 이 중
중앙값은 자료를 크기 순서대로 나열했을 때 정가운데 위치한 값으로, 양 끝에 있는 비정상적으로 크거나 작은 값의 영향을 받지 않고 오로지 순서상의 위치에만 의존합니다.
정답 근거:
핵심! 극단값이 있으면 평균은 그 쪽으로 크게 치우치지만, 중앙값은 순서만 고려하기 때문에 흔들리지 않아요. 예를 들어 소득 데이터처럼 일부 최상위 값이 전체 평균을 왜곡시키는 경우,
중앙값이 더 대표성을 가집니다.
오답 분석: ①
범위(Range)는 최댓값과 최솟값의 차이로, 극단값이 존재하면 가장 크게 영향을 받는 산포도 지표예요. ②
평균은 모든 자료 값을 더해 개수로 나누기 때문에, 하나의 극단값만 있어도 대표값이 왜곡되기 쉬워요. ③
최빈값은 가장 빈번하게 관찰되는 값으로 극단값의 영향을 덜 받을 수 있지만, 연속형 자료에서는 여러 개 존재하거나 대표성이 떨어질 수 있어 중심경향의 대표값으로는 부적합한 경우가 많아요. ⑤
표준편차(Standard Deviation)는 중심경향이 아니라 자료가 평균을 중심으로 얼마나 퍼져 있는지 나타내는 산포도 지표입니다.
연관 개념 정리:
혼동 주의! 평균은
모수적 검정(Parametric test), 중앙값은
비모수적 검정(Non-parametric test)과 연결되는 개념이므로 통계 방법 선택 시에도 중요한 기준이 됩니다.
개념 정리
| 구분 | 평균 (Mean) | 중앙값 (Median) | 최빈값 (Mode) |
|---|
| 계산 | 모든 값 합산 ÷ 개수 | 순서상 중앙 위치 | 가장 높은 빈도 |
| 극단값 영향 | 매우 큼 | 거의 없음 | 적음 |
| 적합 자료 | 정규분포 연속형 | 비대칭 분포 연속형 | 명목형, 이산형 |
암기 팁
'평균은 다 더해서 나누니 한 방에 무너지고, 중앙은 순서만 보니 버틴다'로 기억하세요. 소득, 집값처럼 양극화된 데이터에서 평균이 '착시'를 일으키기 쉬우니, 중앙값의 의미를 떠올리면 됩니다.