보건의료데이터 분석에서 연령과 혈압 수치 간의 상관계수를 계산하려고 한다. 연령 데이터에 '20대', '30… | 마이메르시 MyMerci
상관 및 회귀분석
문제

보건의료데이터 분석에서 연령과 혈압 수치 간의 상관계수를 계산하려고 한다. 연령 데이터에 '20대', '30대', '40대'와 같은 범주형 값이 포함되어 있다면 어떤 조치가 필요한가?

해설
'20대'와 같은 범주형 데이터는 구간의 대표값(예: 20대는 25세)이나 중앙값을 부여하여 연속형 변수로 변환한 후, 피어슨 상관계수를 계산하는 방법이 적절할 수 있다. 또는 순위척도로 간주하여 스피어만 상관계수를 사용할 수도 있다.

심화 해설

보건행정 핵심 해설 이 문제는 보건통계 및 데이터 분석에서 변수의 척도(Scale)와 적절한 통계 기법 선택의 원리를 묻고 있어요. 특히, 상관분석(Correlation Analysis)을 수행할 때 데이터의 특성에 맞는 전처리와 방법론 선택이 얼마나 중요한지 보여주는 좋은 예시예요. 핵심 개념 분석 (Key Concept) 문제의 핵심은 "범주형 데이터(Categorical Data)"를 어떻게 연속형 변수(Continuous Variable)와의 관계 분석에 활용할 수 있느냐입니다. '20대', '30대'와 같은 데이터는 혼동 주의! 서열척도(Ordinal Scale)로 볼 수 있어요. 각 범주에 순서(20대 < 30대 < 40대)가 있지만, 그 사이의 간격이 동일하지 않을 수 있고, 숫자 그대로의 산술 연산이 불가능합니다. 반면, 피어슨 상관계수(Pearson Correlation Coefficient)는 두 연속형 변수 간의 선형 관계 강도를 측정하는 지표로, 데이터가 등간척도(Interval Scale) 이상이어야 정확한 해석이 가능해요. 정답 근거 (Answer Rationale) 정답인 ④번 '핵심! 연령을 중앙값으로 변환한 후 상관계수를 계산한다'는 서열척도 데이터를 분석에 활용하는 실무적이고 타당한 방법 중 하나예요. * **법리/원리**: '20대'를 25세(중앙값), '30대'를 35세 등으로 변환하면, 이제 연령은 근사적인 연속형 변수가 되어 피어슨 상관계수 계산이 가능해집니다. 이는 범주에 내재된 순서 정보를 보존하면서도 수치적 분석을 가능하게 하는 기법이에요. * **대안적 정답 해석**: 엄밀히 말해, 서열척도 데이터 간의 관계 분석에는 스피어만 순위 상관계수(Spearman's Rank Correlation Coefficient)가 더 적합한 방법론입니다. 따라서 ①번도 통계학적으로는 매우 타당한 답변이 될 수 있어요. 다만, 이 문제는 "연령과 혈압 수치 간의" 상관계수를 계산하는 상황에서, 범주형 연령 데이터를 어떻게 처리해야 하는지에 초점을 맞추고 있으며, 가장 일반적이고 실용적인 조치로 "중앙값 변환"을 제시한 것으로 보여요. 국가고시에서는 이러한 실무적 접근법을 묻는 경우가 많습니다. 오답 분석 (Distractor Analysis) * ②번 '연령 데이터를 분석에서 제외한다': 연령은 혈압과의 관계를 분석하는 데 매우 중요한 변수입니다. 의미 있는 변수를 무조건 제외하는 것은 분석의 가치를 떨어뜨리는 잘못된 접근이에요. * ③번 '연령을 더 세분화된 명목변수로 변환한다': '20대'를 '20-24', '25-29'로 세분화해도 여전히 범주형(명목 또는 서열)입니다. 오히려 순서 정보를 잃을 수 있는 위험이 있으며, 피어슨 상관계수 계산을 위한 근본적 해결책이 되지 못해요. * ⑤번 '피어슨 상관계수를 그대로 계산한다': 범주형 데이터에 피어슨 상관계수를 직접 적용하면 통계적 가정을 위반하여 의미 없는 결과가 나올 수 있어요. 이는 방법론적 오류입니다. 연관 개념 정리 (Related Concepts) * **변수의 척도**: 명목척도(Nominal, 성별), 서열척도(Ordinal, 교육수준), 등간척도(Interval, 온도), 비율척도(Ratio, 키, 체중). * **상관계수 종류**: 피어슨(연속형-연속형), 스피어만(서열척도 이상), 점이연상관(이분변수-연속형). * **데이터 변환(Transformation)**: 더미변수화(Dummy Coding), 구간화(Binning), 대표값 할당(중앙값, 평균). 개념 정리
구분피어슨 상관계수스피어만 상관계수
적용 데이터두 변수 모두 연속형 (등간/비율척도)두 변수 모두 서열척도 이상 (순위가 있는 데이터)
측정 관계선형(Linear) 관계의 강도단조(Monotonic) 관계의 강도 (함수적 증가/감소)
본 문제 적용연령을 중앙값 등으로 변환해 연속형으로 가정 후 사용 가능'20대', '30대' 자체를 순위 데이터로 보고 직접 사용 가능
한눈에 비교!
데이터 처리 방식설명장점단점/주의점
중앙값 변환 후 피어슨범주(20대) → 대표 수치(25세) 할당해석이 직관적, 다른 연속형 분석과 호환性好범주 내 분산 정보 손실, 할당값에 따른 결과 민감
스피어만 계수 직접 사용범주 자체에 순위 부여(1위, 2위...) 후 계산서열 정보 완전 보존, 비모수적 방법으로 강건(Robust)선형 관계보다는 단조 관계 측정, 절대적 크기 정보 무시
더미변수화 후 회귀분석범주를 여러 개의 0/1 변수로 분해범주 간 효과 정밀 비교 가능, 가장 일반적인 방법상관계수 하나로 요약 불가, 변수 수 증가
실무 포인트 병원에서 의무기록 데이터를 분석할 때(예: 수술 후 회복 기간에 영향을 미치는 요인 분석), '연령대', '동반 질환 수(0개, 1-2개, 3개 이상)'와 같은 서열 데이터는 흔히 등장해요. 보건정보관리사는 이를 분석에 포함시키기 위해: 1. **분석 목적 확인**: 예측 모형 만들기(회귀분석) vs. 관계 탐색(상관분석). 2. **적절한 방법 선택**: 목적에 따라 중앙값 변환, 스피어만 계수, 더미변수화 중 선택. 3. **결과 해석 시 주의**: 변환 방법을 보고서에 명시하고, 해석의 한계를 기술해야 합니다. 암기 팁 * **"피연스(Pea-Conti)"**: 어슨은 속형-케일 데이터에! * **"스서(Sp-Ord)"**: 피어만은 열척도 데이터에! 국시 빈출 포인트 * 변수 척도와 적합한 통계기법 연결하기 (예: 카이제곱검정은 명목변수, t-검정은 연속변수). * 피어슨 vs. 스피어만 상관계수의 차이를 구분하는 문제. * 범주형 데이터를 분석에 포함시키는 방법(더미변수, 순위부여)을 묻는 문제. 기출 변형 주의! * **사례형**: "환자 만족도 조사에서 '매우 불만족'부터 '매우 만족'까지 5점 리커트 척도로 측정된 만족도 점수와 재원일수 간의 관계를 분석하려면 어떤 상관계수를 사용해야 하는가?" → **정답: 스피어만 순위 상관계수** (둘 다 서열척도로 해석 가능). * **계산/개념형**: "다음 중 피어슨 상관계수의 가정으로 옳지 않은 것은? ① 선형성 ② 등분산성 ③ 정규성 ④ 독립성" → **정답: ② 등분산성** (이는 회귀분석의 가정).

임상 시나리오

보건행정 실무 가이드 실무 시나리오 (Clinical Scenario) "병원 기획팀에서 지역 주민의 주요 건강 지표를 분석하는 프로젝트를 진행 중입니다. 기존 통계에 '연령대'별 고혈압 유병률 데이터는 있지만, '연령'과 '평균 수축기 혈압'의 정량적 관계는 분석된 적이 없습니다. 데이터베이스에는 연령이 '20-29세', '30-39세'와 같이 10세 단위 구간으로만 저장되어 있습니다. 보건정보관리사로서 이 데이터를 활용해 연령과 혈압의 관계를 수치화하여 보고서에 담아야 합니다." 행정 중재 전략 (Admin Intervention) 1. **상황 파악**: 분석 목표는 '연령 증가에 따른 혈압 상승 경향성 파악'입니다. 핵심 장애물은 연령 데이터가 구간형 범주(Categorical, Interval)라는 점입니다. 2. **법적/규정 검토**: 통계 분석에는 엄격한 법규보다는 방법론의 타당성과 결과의 신뢰성이 더 중요합니다. 하지만, 연구윤리심의위원회(IRB) 승인을 받은 데이터라면 원본 변경에 주의해야 합니다. 3. **대응 및 처리**: * 핵심! **방법 A (보수적)**: 스피어만 순위 상관계수를 계산합니다. 각 연령대에 순위(1,2,3...)를 부여하고 혈압 데이터와의 순위 일치도를 분석합니다. 이는 데이터 원형을 변경하지 않는 가장 안전한 방법입니다. * **방법 B (실용적)**: 각 연령대의 중앙값(24.5세, 34.5세...)을 새로운 연령 변수로 생성한 후, 피어슨 상관계수를 계산합니다. 이 방법은 결과 해석이 매우 직관적("연령이 10세 증가할 때 혈압은 약 X mmHg 상승")이라는 장점이 있습니다. * **결합 보고**: 두 방법을 모두 시도해보고 결과가 유사한지 확인한 후, 보고서에는 사용한 방법과 그 근거(예: "구간 데이터의 특성을 고려하여 중앙값 대체 후 피어슨 상관계수 산출")를 반드시 명시합니다. 4. **사후 기록/보고**: 분석 코드, 변환 기준(중앙값 기준표), 산출된 상관계수와 p-값을 체계적으로 문서화하여 재현 가능성을 확보합니다. 업무 프로토콜 1. **데이터 확인**: 변수 척도, 결측치 확인. 2. **방법론 회의**: 분석 목적에 따라 통계 전문가(또는 담당자)와 함께 최적의 변환/분석 방법 결정. 3. **데이터 전처리**: 선택한 방법에 따라 변환 작업 수행 (예: SQL 또는 R/Python 코드 실행). 4. **분석 수행 및 검증**: 상관계수 계산 후, 산점도(Scatter Plot)를 그려 시각적으로 관계 확인. 5. **결과 문서화 및 보고**. 선배의 한마디 "보건의료데이터는 이상적인 실험실 데이터가 아니에요. 불완전하고, 구간화되어 있고, 결측치가 많죠. 훌륭한 보건정보관리사는 '완벽한 데이터'를 기다리기보다, '있는 데이터'를 현명하게 가공하고 적절한 방법으로 분석해 의미를 끌어내는 사람이에요. '연령대' 데이터를 보면 '아, 이건 서열척도구나. 스피어만을 쓰거나 중앙값을 넣어볼 수 있겠다'라는 생각이 바로 전문성이에요. 통계는 도구일 뿐, 그 도구를 현실의 데이터에 맞게 사용하는 지혜가 더 중요해요!"

마이메르시로 국가고시 완벽 대비

기출문제와 상세 해설을 무료로. 내 약점을 분석하고 진도를 관리하며 더 똑똑하게 공부하세요.

무료로 시작하기

학습 참고용입니다. 실제 임상은 최신 지침과 소속 기관 프로토콜을 따르세요.