기술통계와 확률분포 | 마이메르시 MyMerci
제안하기
0 / 2000

기술통계와 확률분포

1. 기술통계와 확률분포 [의약품품질과학]

(1) 기술통계의 기본 개념과 대표값

① 모집단과 표본, 모수와 통계량

모집단은 관심 대상이 되는 전체 집합을 뜻하고 표본은 그중 실제로 측정한 일부를 가리킨다.

모집단의 특성값을 모수라 부르고 표본에서 계산한 값을 통계량이라 부르며, 통계량으로 모수를 추정한다.

의약품 품질관리에서는 로트 전체를 측정할 수 없으므로 대표성 있는 표본의 통계량이 판정 근거가 된다.

표본 크기가 커질수록 통계량은 모수에 가까워지므로 추정의 불확실성은 감소한다.

② 중심경향치와 산포도

중심경향치에는 평균, 중앙값, 최빈값이 있으며 자료가 모이는 대표 위치를 나타낸다.

극단값이 섞이면 평균은 그쪽으로 크게 끌려가지만 중앙값은 거의 변하지 않아 치우친 분포에서 유리하다.

산포도는 범위, 분산, 표준편차로 표현하며 분산의 양의 제곱근이 표준편차다.

변동계수(CV)는 상대표준편차(RSD)와 같은 개념으로 표준편차를 평균으로 나눈 백분율이며 단위가 없다.

평균이 커지면 같은 표준편차라도 변동계수는 감소하므로 CV와 RSD는 상대적 정밀도의 지표로 쓰인다.

(2) 확률분포와 표본분포

① 정규분포와 표준정규분포

정규분포는 평균을 중심으로 좌우 대칭인 종 모양이며 평균과 표준편차 두 모수로 완전히 결정된다.

표준정규분포는 평균 0, 표준편차 1이 되도록 변환한 분포이고 z값은 관측값에서 평균을 뺀 뒤 표준편차로 나눈 값이다.

68-95-99.7 법칙에 따라 평균 ±1σ, ±2σ, ±3σ 구간에 각각 약 68%, 95%, 99.7%의 자료가 들어간다.

z값이 커질수록 그 값이 중심에서 멀다는 뜻이므로 이탈 여부 판정의 직접적 근거가 된다.

② 표본평균의 분포와 신뢰구간

중심극한정리는 모집단이 정규분포가 아니어도 표본 크기가 커지면 표본평균의 분포가 정규분포에 가까워진다는 원리다.

표준오차는 표본평균의 산포를 나타내며 SE=s/√n으로 계산하고 s는 표본표준편차, n은 표본 크기를 뜻한다.

표본 크기 n이 증가하면 표준오차는 감소하고, n을 4배로 늘리면 표준오차는 절반으로 줄어든다.

95% 신뢰구간(95% CI)은 표본평균에 t값 또는 z값과 표준오차의 곱을 더하고 뺀 범위로 산출한다.

95% 신뢰구간은 같은 방식을 반복했을 때 구간이 모수를 포함할 비율이 95%라는 해석이다.

③ 검정용 분포와 이산형 확률분포

t분포는 모표준편차를 모르고 표본이 작을 때 평균 추정과 검정에 쓰며 자유도가 커질수록 표준정규분포에 접근한다.

카이제곱분포는 분산에 관한 검정과 적합도 검정에, F분포는 두 분산의 비를 다루는 검정과 분산분석에 사용한다.

이항분포는 합격과 불합격처럼 결과가 둘뿐인 시행을 반복할 때 불량 개수의 확률을 설명한다.

포아송분포는 정해진 단위 안에서 드물게 나타나는 결점 수를 다루며 평균과 분산이 같다는 특징이 있다.

④ 확률분포 용도 요약표

분포주된 용도
정규 · 표준정규연속형 자료, z값 이탈 평가
t분포소표본 평균 검정 · 신뢰구간
카이제곱분포분산 검정, 적합도 검정
F분포분산비 검정, 분산분석
이항분포불량 개수의 확률
포아송분포단위당 결점 수의 확률

(3) 측정오차와 자료 처리 원칙

① 측정오차와 정확도 · 정밀도

계통오차는 한쪽 방향으로 치우쳐 반복되는 오차로 기기 교정이나 시험법 개선으로 줄일 수 있다.

우연오차는 방향이 무작위인 오차이므로 반복 측정과 평균화로 그 영향을 줄인다.

정확도는 측정값이 참값에 얼마나 가까운지를, 정밀도는 반복 측정값끼리 얼마나 모여 있는지를 뜻한다.

계통오차가 커지면 정확도가 떨어지고 우연오차가 커지면 정밀도가 떨어지므로 두 개념을 구분한다.

유효숫자는 측정의 신뢰 범위를 나타내며 계산 결과는 가장 자릿수가 적은 측정값에 맞춰 정리한다.

② 이상치 검정과 데이터 시각화

이상치(outlier)는 다른 관측값과 뚜렷이 동떨어진 값으로 Grubbs 검정이나 Dixon 검정으로 통계적 판정을 한다.

통계적으로 이상치로 판정되어도 원인 조사 없이 임의로 제외하지 않는 것이 처리 원칙이다.

히스토그램은 분포 모양을, 상자그림은 중앙값과 사분위 범위 및 이상치를, 산점도는 두 변수의 관계를 보여 준다.

정규성 검정으로 정규분포 가정을 확인하고 어긋나면 로그 변환 같은 변환 후 분석한다.

표본 크기 결정은 허용오차, 유의수준, 검출하려는 차이의 크기를 함께 고려해 산출한다.

📌 실전 체크 포인트!

수치: 68-95-99.7 법칙에서 ±2σ가 약 95%, ±3σ가 약 99.7%이며 ±1σ 68%와 짝지어 외운다.

감별: 표준편차는 개별값의 산포, 표준오차 SE=s/√n은 표본평균의 산포이므로 n이 커지면 SE만 감소한다.

방향: 평균이 커지면 변동계수(CV · RSD)는 감소하고 표준편차가 커지면 증가한다.

감별: 계통오차는 정확도를 떨어뜨리고 우연오차는 정밀도를 떨어뜨린다.

순서: 이상치는 Grubbs · Dixon 검정으로 판정하되 원인 조사 없이 삭제하지 않는다.

다음 이론을 계속 학습하려면 로그인하세요.

로그인하고 계속 학습
컨텐츠를 그만볼래?

필기노트, 하이라이터, 메모는 잘 쓰고 있어?

내보내줘
어떤 폴더에 저장할래?

컨텐츠 노트에는 총 0개의 폴더가 있어!

폴더 만들기
컨텐츠 만들기
만들기
신고했어요.

운영진이 검토할게요!

해당 유저를 차단했어요.

마이페이지에서 차단한 회원을 관리할 수 있어요.