보건의료통계 개념 및 용어 | 마이메르시 MyMerci
제안하기
0 / 2000

보건의료통계 개념 및 용어

part17. 보건의료통계 개념 및 용어

1. 통계의 기초 개념

(1) 통계학의 구분

① 기술통계와 추론통계

기술통계는 수집한 자료를 정리하고 요약하여 그 특성을 나타내는 통계다.

평균, 표준편차, 빈도표, 그래프가 기술통계에 해당한다.

추론통계는 표본에서 얻은 결과로 모집단의 특성을 추정하거나 가설을 검정하는 통계다.

추정과 가설검정이 추론통계에 해당한다.

② 모집단과 표본

모집단은 관심의 대상이 되는 전체 집단이다.

표본은 모집단에서 뽑아 실제로 관찰한 일부다.

모수는 모집단의 특성을 나타내는 값이다.

통계량은 표본에서 계산한 값으로 모수를 추정하는 데 쓰인다.

전수조사는 모집단 전체를 조사하는 것이고 표본조사는 표본만 조사하는 것이다.

③ 확률표본추출

확률표본추출은 모집단의 각 대상이 뽑힐 확률을 알 수 있도록 무작위로 뽑는 방법이다.

단순무작위추출은 모집단의 모든 대상이 뽑힐 확률이 같도록 무작위로 뽑는 방법이다.

계통추출은 첫 대상을 무작위로 정한 뒤 일정한 간격으로 뽑는 방법이다.

층화추출은 모집단을 성별이나 연령과 같은 층으로 나눈 뒤 각 층에서 뽑는 방법이다.

집락추출은 모집단을 집락으로 나눈 뒤 일부 집락을 뽑아 그 안을 모두 조사하는 방법이다.

층화추출은 층 안이 비슷하고 층 사이가 다를 때, 집락추출은 집락 안이 다양하고 집락 사이가 비슷할 때 효율적이다.

④ 계통추출의 절차

첫째, 모집단의 모든 대상에 일련번호를 부여한다.

둘째, 추출간격(K)을 모집단의 크기(N)를 표본의 크기(n)로 나누어 정한다.

셋째, 1부터 K까지 가운데 하나를 무작위로 뽑아 시작번호로 정한다.

넷째, 시작번호에서 K만큼씩 더해 가며 표본을 추출한다.

⑤ 비확률표본추출

비확률표본추출은 각 대상이 뽑힐 확률을 알 수 없는 방법이다.

편의추출은 조사자가 접근하기 쉬운 대상을 뽑는 방법이다.

유의추출은 조사자의 판단으로 적합하다고 여기는 대상을 뽑는 방법이다.

할당추출은 특성별로 표본 수를 미리 정해 두고 그 수만큼 임의로 뽑는 방법이다.

눈덩이추출은 뽑힌 대상에게 다음 대상을 소개받아 표본을 늘려 가는 방법이다.

비확률표본추출은 모집단에 대한 대표성을 확보할 수 없고 표본오차를 추정할 수 없다.

⑥ 핵심 비교표

구분방법내용
확률표본추출단순무작위추출모든 대상이 같은 확률로 뽑히도록 무작위 추출
확률표본추출계통추출첫 대상을 무작위로 정하고 일정 간격으로 추출
확률표본추출층화추출층으로 나눈 뒤 각 층에서 추출
확률표본추출집락추출집락을 뽑아 그 안을 모두 조사
비확률표본추출편의 · 유의 · 할당 · 눈덩이뽑힐 확률을 알 수 없어 대표성 확보 불가

(2) 변수와 척도

① 변수의 종류

질적변수는 값이 범주로 나타나는 변수로 성별, 혈액형, 진료과가 그 예다.

양적변수는 값이 수로 나타나는 변수로 나이, 체온, 재원일수가 그 예다.

양적변수 가운데 셀 수 있는 값만 갖는 것을 이산변수, 연속된 값을 갖는 것을 연속변수라 한다.

② 측정 척도

명목척도는 구분만 하는 척도로 성별, 혈액형이 그 예다.

순서척도는 순서는 있으나 간격이 일정하지 않은 척도로 중증도 등급, 만족도가 그 예다.

구간척도는 간격이 일정하나 절대영점이 없는 척도로 섭씨온도가 그 예다.

비율척도는 간격이 일정하고 절대영점이 있는 척도로 체중, 재원일수, 연령이 그 예다.

절대영점이 없으면 배수 관계를 말할 수 없으므로 섭씨 20도가 10도의 두 배 온도라고 말할 수 없다.

③ 핵심 비교표

척도특성
명목척도구분만 함성별, 혈액형, 진료과
순서척도순서는 있으나 간격이 일정하지 않음중증도 등급, 만족도
구간척도간격이 일정하나 절대영점이 없음섭씨온도
비율척도간격이 일정하고 절대영점이 있음체중, 재원일수, 연령

📌 실전 체크 포인트!

기술통계는 자료의 요약, 추론통계는 모집단에 대한 추정과 검정이다.

모집단의 값은 모수, 표본의 값은 통계량이다.

척도 네 가지: 명목 → 순서 → 구간 → 비율. 절대영점의 유무가 구간과 비율을 가른다.

층화추출은 층 사이가 다를 때, 집락추출은 집락 사이가 비슷할 때 효율적이다.

계통추출: 일련번호 부여 → 추출간격 K = N ÷ n → 시작번호 무작위 선정 → K 간격 추출

편의 · 유의 · 할당 · 눈덩이추출은 비확률표본추출이다.

2. 자료의 요약

(1) 대표값

① 평균

산술평균은 모든 값을 더하여 개수로 나눈 값이다.

모든 값을 반영한다는 장점이 있으나 극단적으로 크거나 작은 값에 크게 영향을 받는다.

기하평균은 n개의 값을 모두 곱한 뒤 n제곱근을 구한 값이다.

항체가나 잠복기처럼 한쪽으로 크게 치우친 자료의 대표값으로 사용한다.

② 중앙값과 최빈값

중앙값은 값을 크기 순으로 늘어놓았을 때 가운데에 오는 값이다.

자료의 개수가 짝수이면 가운데 두 값의 평균이 중앙값이다.

극단값의 영향을 받지 않으므로 분포가 한쪽으로 치우친 자료에서 대표값으로 적합하다.

최빈값은 가장 많이 나타나는 값이며 명목척도 자료의 대표값으로 사용할 수 있다.

③ 재원일수의 예

재원일수는 소수의 장기 입원 환자 때문에 오른쪽으로 길게 늘어지는 분포를 보이는 경우가 많다.

이때 평균 재원일수는 실제보다 길게 나타나므로 중앙값을 함께 보아야 한다.

(2) 산포도

① 범위와 사분위수

범위는 최댓값에서 최솟값을 뺀 값이다.

사분위수범위는 제3사분위수에서 제1사분위수를 뺀 값으로 가운데 50퍼센트가 흩어진 정도를 나타낸다.

사분위수범위는 극단값의 영향을 받지 않는다.

사분위편차는 사분위수범위를 2로 나눈 값이다.

② 분산과 표준편차

분산은 각 값과 평균의 차이를 제곱하여 평균한 값이다.

모분산은 편차제곱의 합을 자료의 개수(N)로 나누어 구한다.

표본분산은 편차제곱의 합을 자료의 개수에서 1을 뺀 값(n-1)으로 나누어 구하며 이때 n-1을 자유도라 한다.

표준편차는 분산의 제곱근으로 원래 자료와 같은 단위를 갖는다.

표준편차가 클수록 자료가 넓게 흩어져 있다.

③ 변이계수

변이계수는 표준편차를 평균으로 나눈 뒤 100을 곱하여 백분율로 나타낸 값이다.

단위가 다르거나 평균의 크기가 크게 다른 두 집단의 산포를 비교할 때 사용한다.

(3) 분포의 모양

① 정규분포

정규분포는 평균을 중심으로 좌우가 대칭인 종 모양의 분포다.

정규분포에서는 평균, 중앙값, 최빈값이 모두 같다.

② 치우친 분포

분포가 좌우 대칭에서 벗어난 정도를 왜도라 한다.

오른쪽으로 꼬리가 긴 분포를 양의 왜도라 하며 최빈값 < 중앙값 < 평균의 순서가 된다.

왼쪽으로 꼬리가 긴 분포를 음의 왜도라 하며 평균 < 중앙값 < 최빈값의 순서가 된다.

재원일수와 진료비는 대개 오른쪽으로 꼬리가 긴 분포를 보인다.

③ 핵심 요약표

구분대표값산포도
대칭에 가까운 자료산술평균표준편차
치우친 자료·극단값이 있는 자료중앙값사분위수범위
명목척도 자료최빈값해당 없음

(4) 자료의 표현

① 도수분포표

도수분포표는 자료를 몇 개의 계급으로 나누고 각 계급에 속하는 자료의 수를 정리한 표다.

계급에 속한 자료의 수를 도수, 도수를 전체로 나눈 값을 상대도수라 한다.

첫 계급부터 해당 계급까지 도수를 더한 값을 누적도수라 한다.

② 히스토그램과 막대그래프

히스토그램은 연속형 자료의 분포를 나타내는 그래프로 계급 구간이 이어지므로 막대 사이를 붙여 그린다.

막대그래프는 범주형 자료의 크기를 나타내는 그래프로 막대 사이를 띄워 그린다.

두 그래프의 차이는 자료가 연속형인지 범주형인지에 있다.

③ 그 밖의 그래프

선그래프는 시간에 따른 값의 추이를 나타낸다.

원그래프는 전체에서 각 항목이 차지하는 구성비를 나타낸다.

산점도는 두 연속형 변수 사이의 관계를 점으로 나타낸다.

상자그림은 최솟값, 제1사분위수, 중앙값, 제3사분위수, 최댓값과 극단값을 함께 나타낸다.

파레토그래프는 항목별 빈도를 큰 순서로 배열하고 누적 백분율을 함께 나타낸다.

관리도는 시간에 따른 값의 변동을 관리한계선과 함께 나타낸다.

④ 핵심 비교표

그래프용도
히스토그램연속형 자료의 분포, 막대 사이를 붙임
막대그래프범주형 자료의 크기 비교, 막대 사이를 띄움
선그래프시간에 따른 추이
원그래프구성비
산점도두 연속형 변수의 관계
상자그림중앙값과 사분위수, 극단값

📌 실전 체크 포인트!

평균은 극단값의 영향을 받고 중앙값은 받지 않는다.

재원일수와 진료비는 오른쪽으로 꼬리가 긴 분포이므로 중앙값을 함께 본다.

단위가 다른 집단의 산포 비교에는 변이계수를 쓴다.

히스토그램은 연속형 자료로 막대를 붙이고, 막대그래프는 범주형 자료로 막대를 띄운다.

오른쪽 꼬리(양의 왜도)는 최빈값 < 중앙값 < 평균, 왼쪽 꼬리(음의 왜도)는 그 반대다.

표본분산은 n-1(자유도)로 나누고, 변이계수는 표준편차 ÷ 평균 × 100이다.

3. 비 · 분율 · 율

(1) 세 가지의 구별

① 비

비(ratio)는 두 수를 서로 나눈 값으로 분자가 분모에 포함되지 않는다.

남녀 성비, 병상 대비 의사 수가 비의 예다.

② 분율

분율(proportion)은 전체 가운데 일부가 차지하는 몫으로 분자가 분모에 포함된다.

값은 0과 1 사이이며 백분율로 나타내기도 한다.

병상이용률과 사망률의 일부가 분율에 해당한다.

시점유병률은 어느 한 시점의 인구 가운데 환자가 차지하는 몫이므로 분율에 해당한다.

③ 율

율(rate)은 일정 기간 동안 특정 사건이 발생한 정도를 나타내는 값으로 시간의 개념이 들어간다.

발생률과 조사망률이 율의 예다.

관찰한 사람과 관찰 기간을 곱한 인시(person-time)를 분모로 하는 평균발생률이 율의 전형이다.

율에는 관찰 기간과 인구 단위가 함께 제시되어야 한다.

④ 핵심 비교표

구분분자와 분모의 관계
비(ratio)분자가 분모에 포함되지 않음성비, 병상당 의사 수
분율(proportion)분자가 분모에 포함됨병상이용률, 구성비
율(rate)분율에 시간의 개념이 더해짐발생률, 조사망률

(2) 율의 표준화

① 조율의 한계

조율은 인구 전체를 대상으로 계산한 율이다.

두 집단의 연령 구성이 다르면 조율을 그대로 비교할 수 없다.

노인이 많은 지역은 사망률이 높게 나타나므로 연령의 영향을 제거할 필요가 있다.

② 직접표준화법

직접표준화법은 표준인구를 정하고 비교 집단의 연령별 율을 표준인구에 적용하여 기대되는 사건 수를 구한 뒤 표준화율을 계산하는 방법이다.

비교 집단의 연령별 율을 알 수 있을 때 사용한다.

③ 간접표준화법

간접표준화법은 표준인구의 연령별 율을 비교 집단의 인구에 적용하여 기대되는 사건 수를 구한 뒤 실제 관찰된 수와 비교하는 방법이다.

비교 집단의 연령별 율을 알기 어려울 때 사용한다.

실제 관찰된 사망 수를 기대 사망 수로 나눈 값을 표준화사망비(SMR)라 한다.

표준화사망비는 1을 기준으로 나타내거나 100을 곱하여 100을 기준으로 나타낸다.

표준화사망비가 1(100)보다 크면 표준인구보다 사망이 많다는 뜻이다.

표준화사망비가 1(100)보다 작으면 표준인구보다 사망이 적다는 뜻이다.

④ 핵심 비교표

구분적용하는 것필요한 자료결과
직접표준화법비교 집단의 연령별 율을 표준인구에 적용비교 집단의 연령별 율표준화율
간접표준화법표준인구의 연령별 율을 비교 집단 인구에 적용비교 집단의 연령별 인구와 총 사건 수표준화사망비(SMR)

📌 실전 체크 포인트!

비는 분자가 분모에 포함되지 않고, 분율은 포함되며, 율은 분율에 시간이 더해진 것이다.

연령 구성이 다른 집단을 비교할 때는 표준화가 필요하다.

직접표준화법은 비교 집단의 연령별 율이 필요하고, 간접표준화법은 그것이 없을 때 사용한다.

SMR = 관찰 사망 수 ÷ 기대 사망 수. 1(100)보다 크면 표준인구보다 사망이 많다.

시점유병률은 분율, 인시를 분모로 하는 발생률은 율이다.

4. 보건의료통계의 자료원과 관리

(1) 자료원

① 기관 내부의 자료

의무기록은 진단, 처치, 재원일수와 같은 임상 자료의 원천이다.

원무자료는 환자의 인적사항, 입퇴원, 진료비의 원천이다.

검사와 영상 시스템의 자료는 검사 결과와 판독 정보의 원천이다.

② 기관 외부의 자료

요양급여비용 청구자료는 전 국민의 의료 이용을 담고 있다.

인구동태 신고자료는 출생과 사망의 원천이다.

국민건강영양조사와 지역사회건강조사는 건강행태와 건강수준의 원천이다.

국가암등록자료와 감염병 신고자료는 특정 질환의 발생을 담고 있다.

(2) 통계 자료의 품질

① 갖추어야 할 조건

정확성은 자료의 값이 사실과 일치하는 것이다.

완전성은 필요한 항목이 빠짐없이 수집되는 것이다.

일관성은 같은 항목이 같은 기준으로 수집되는 것이다.

적시성은 필요한 때에 산출되어 제공되는 것이다.

비교 가능성은 기간과 기관을 넘어 비교할 수 있도록 정의와 산출 기준이 통일되는 것이다.

② 지표 정의의 중요성

같은 이름의 지표라도 분자와 분모의 정의가 다르면 값이 달라진다.

따라서 지표마다 분자, 분모, 대상 기간, 제외 기준을 문서로 정해 두어야 한다.

통계의 산출 기준을 바꾸었을 때에는 그 사실과 시점을 함께 기록한다.

③ 보건의료정보관리자의 역할

통계의 산출에 필요한 항목이 기록에 남아 있는지 확인한다.

분류의 정확성을 관리하여 질병별 통계의 신뢰성을 확보한다.

지표의 정의를 문서로 관리하고 산출 결과를 검증한다.

산출한 통계를 관련 부서와 위원회에 제공한다.

📌 실전 체크 포인트!

같은 이름의 지표라도 분자·분모의 정의가 다르면 값이 달라진다.

통계 자료의 조건: 정확성 · 완전성 · 일관성 · 적시성 · 비교 가능성

산출 기준을 바꾸면 그 사실과 시점을 함께 기록한다.

다음 이론을 계속 학습하려면 로그인하세요.

로그인하고 계속 학습
컨텐츠를 그만볼래?

필기노트, 하이라이터, 메모는 잘 쓰고 있어?

내보내줘
어떤 폴더에 저장할래?

컨텐츠 노트에는 총 0개의 폴더가 있어!

폴더 만들기
컨텐츠 만들기
만들기
신고했어요.

운영진이 검토할게요!

해당 유저를 차단했어요.

마이페이지에서 차단한 회원을 관리할 수 있어요.