극단값에 강한 대표값, 중앙값(median)
이 문제는 연속형 자료를 요약하는 방법 가운데 '중심경향(central tendency)을 나타내는 값'과 '흩어진 정도(산포)를 나타내는 값'을 구별하고, 중심경향 값 중에서도 이상값에 흔들리지 않는 것이 무엇인지 묻습니다. 보건통계에서는 입원일수, 진료비, 대기시간처럼 소수의 매우 큰 값 때문에 분포가 오른쪽으로 길게 늘어지는 자료가 흔하므로, 어떤 대표값을 쓰느냐에 따라 결론이 달라질 수 있습니다.
보기 4번
중앙값은 자료를 크기순으로 나열했을 때 한가운데 위치한 값입니다. 값 자체의 크기가 아니라 순서(순위)만 사용하기 때문에, 가장 큰 값이 10배로 커져도 중앙값은 그대로입니다. 반면 산술평균은 모든 값을 더해서 나누므로 극단값 하나가 합계를 크게 움직입니다. 오른쪽으로 치우친 자료에서는 긴 꼬리가 평균을 끌어당기는 반면 중앙값이 대표값으로 더 적절하다는 점이 통계 방법론 논문에서도 지적됩니다.
[1] 같은 이유로 치우침이나 이상값이 있는 자료의 집단 비교에는 중앙값을 기반으로 한 강건한(robust) 비모수 검정이 쓰이며, Mood의 중앙값 검정이 그 예입니다.
[2]
보기별 해설
1번: 범위(range) — 최댓값에서 최솟값을 뺀 값으로 산포도 지표입니다. 중심경향이 아니며, 오히려 양 끝값 두 개만으로 정해지므로 극단값에 가장 민감합니다.
2번: 평균 — 모든 관측값을 반영하므로 극단값의 영향을 가장 크게 받는 대표값입니다. 정규분포에 가까운 자료에서는 효율적이지만 치우친 자료에서는 대표성이 떨어집니다.
3번: 기하평균 — 값들을 곱해 n제곱근을 취한 값으로, 로그를 취한 자료의 평균과 같습니다. 항체가나 세균 수처럼 곱셈 구조의 자료에서 쓰며 큰 값의 영향이 산술평균보다는 줄지만, 여전히 모든 값을 계산에 사용하므로 극단값의 영향에서 자유롭지 않습니다.
5번: 표준편차 — 평균 둘레에서 값들이 퍼진 정도를 나타내는 산포도 지표입니다. 편차를 제곱해 계산하기 때문에 극단값이 있으면 오히려 크게 부풀어 오릅니다. 문제는 '중심경향' 값을 묻고 있으므로 범위와 표준편차는 처음부터 후보에서 제외할 수 있습니다.
시험 포인트
국가시험에서는 대표값을 세 가지로 묶어 외웁니다. 평균은 극단값에 민감하고, 중앙값은 극단값에 둔감하며, 최빈값은 가장 자주 나타나는 값입니다. 오른쪽으로 치우친 분포(양의 비대칭)에서는 '평균 > 중앙값 > 최빈값' 순으로 크고, 왼쪽으로 치우친 분포에서는 반대 순서가 됩니다. 소득, 재원일수, 진료비처럼 오른쪽 꼬리가 긴 자료를 요약하라는 상황이 나오면 중앙값과 사분위수 범위를 짝으로 기억해 두십시오. 임상 현장에서 환자의 재활 입원 기간을 보고할 때도 평균 한 줄보다 중앙값과 사분위수를 함께 제시하는 편이 실제 환자 경험을 더 정확히 전달합니다.
정리하면, 중심경향 값 중에서 극단값의 영향을 가장 적게 받는 것은 순서에만 의존하는 중앙값이며, 범위와 표준편차는 산포도이므로 이 질문의 대상이 아닙니다. 정답은 4번입니다.
참고 문헌 (논문 출처)
- [1]
Robust median regression for count data with general lower truncation using a contaminated discrete Weibull model.일반논문Burger DA, van Niekerk J, Lesaffre E. (2026) · DOI: 10.1515/ijb-2025-0066
- [2]
A Design-Based Mood’s Median Test for Complex Survey Data일반논문Vilakati S. (2026) · DOI: 10.20944/preprints202610.0485.v1