사분위수범위(IQR)를 쓰는 이유
자료에 유난히 큰 값이나 작은 값이 섞여 있으면 평균과 표준편차는 그 값에 크게 흔들립니다. 예를 들어 병동 환자들의 평균 재원일수를 구할 때 한 분이 90일 넘게 입원해 계시면, 전체 평균이 실제보다 길어 보이는 것과 같습니다.
사분위수범위(IQR)는 이런 문제를 피하려고 자료를 크기순으로 늘어놓은 뒤,
가운데 50%에 해당하는 값들만으로 퍼진 정도를 재는 방법입니다. 아래쪽 25% 지점(Q1)과 위쪽 75% 지점(Q3)의 차이로 계산하므로, 양 끝에 있는 극단값은 계산에서 아예 빠집니다
[1][3].
핵심! IQR은 ‘자료의 중간 50%가 얼마나 넓게 퍼져 있는가’만 보여 줍니다. 따라서 한 사람의 값이 아무리 커도 Q3를 넘어가는 이상치는 Q3 바깥에 있기 때문에 IQR 값 자체는 변하지 않습니다. 이 때문에
극단값의 영향을 덜 받는 산포도(robust measure of spread)라고 부릅니다. [1][3]
보기별로 살펴보면,
2번 ‘모든 값을 평균과 견준다’는 표준편차나 분산의 특징입니다. 평균은 극단값에 민감하므로 표준편차도 함께 흔들립니다
[4].
3번 ‘가장 큰 값과 가장 작은 값의 차이’는 범위(range)의 정의입니다. 범위는 단 두 개의 값만 쓰기 때문에 극단값의 영향을 가장 크게 받습니다
[1].
4번 ‘단위가 다른 두 자료의 흩어진 정도를 견준다’는 변동계수(CV)의 용도입니다. 다만 CV는 평균과 표준편차를 쓰므로 역시 이상치에 취약합니다
[4].
5번 ‘정규분포일 때에만 쓸 수 있다’는 사실이 아닙니다. IQR은 분포 형태와 무관하게 쓸 수 있는 비모수적 방법이며, 오히려 분포가 치우쳤을 때 요약값으로 더 유용합니다
[2][3].
| 산포도 | 계산 기준 | 극단값의 영향 |
|---|
| 범위(range) | 최댓값 - 최솟값 | 가장 큼 |
| 표준편차(SD) | 모든 값과 평균의 차이 | 큼 |
| 사분위수범위(IQR) | Q3 - Q1 (가운데 50%) | 거의 없음 |
혼동 주의! IQR이 극단값을 ‘찾는’ 데도 쓰인다는 점을 기억하세요. 흔히 Q1 − 1.5×IQR보다 작거나 Q3 + 1.5×IQR보다 큰 값을 이상치로 봅니다. 즉 IQR은 극단값의 영향을 피해 산포를 요약하는 동시에, 극단값을 정의하는 기준도 됩니다
[1][3]. 다만 연구에 따라 IQR 기반 방법보다 더 민감한 이상치 탐지법이 제안되기도 하므로, 자료의 분포와 분석 목적에 따라 방법을 선택해야 합니다
[2].
참고 문헌 (논문 출처)
- [1]
Empirical Evaluation of the Relative Range for Detecting Outliers.일반논문Dallah D, Sulieman H, Zaatreh AA, Kamalov F (2025) · DOI: 10.3390/e27070731
- [2]
A note on detecting statistical outliers in psychophysical data.일반논문Jones PR (2019) · DOI: 10.3758/s13414-019-01726-3
- [3]
Detecting potential outliers in longitudinal data with time-dependent covariates.일반논문Mramba LK, Liu X, Lynch KF, Yang J, Aronsson CA, Hummel S (2024) · DOI: 10.1038/s41430-023-01393-6
- [4]
Robust analogs to the coefficient of variation.일반논문Arachchige CNPG, Prendergast LA, Staudte RG (2022) · DOI: 10.1080/02664763.2020.1808599