보건행정 조사에서 수집된 자료를 분석할 때, 결측값(Missing data)을 처리하는 방법으로 가장 적절하… | 마이메르시 MyMerci
마이메르시 — 문제와 상세 해설까지 전부 무료 무료로 시작하기
자료 분석 및 보고서 작성
문제

보건행정 조사에서 수집된 자료를 분석할 때, 결측값(Missing data)을 처리하는 방법으로 가장 적절하지 않은 것은?

해설
연구자의 주관적 판단에 의한 임의의 값 대체는 편향을 유발할 가능성이 매우 높아 지양해야 한다. 평균 대체, 완전 제외(Listwise deletion), 변수 삭제, 회귀 대체 등은 상황에 따라 사용될 수 있는 결측값 처리 방법이다.
같은 주제 다음 문제조사보고서 작성 시 서론(Introduction)에 포함되어야 할 가장 적절한 내용은?

심화 해설

핵심 해설 이 문제는 보건의료 데이터 분석 시 결측값(Missing Data) 처리의 기본 원칙을 묻는 문제예요. 결측값 처리는 분석 결과의 신뢰도를 좌우하는 매우 중요한 과정으로, 연구자의 혼동 주의! 주관적 판단을 배제하고 통계적 이론에 근거한 객관적인 방법을 적용해야 해요. 핵심 개념 분석 (Key Concept):
결측값이란 조사 과정에서 응답 거부, 설문 문항 누락, 자료 입력 오류 등으로 인해 특정 변수에 대한 값이 존재하지 않는 상태를 말해요. 이러한 결측값을 적절히 처리하지 않으면 분석 결과에 선택 편향(Selection Bias)이 발생할 수 있어요. 정답 근거 (Answer Rationale):
정답은 2번 '연구자의 주관적 판단에 따라 임의의 값으로 채워 넣는 방법'이에요. 핵심! 연구자의 자의적 판단으로 데이터를 조작하는 행위는 과학적 연구 방법론에 완전히 위배돼요. 이는 데이터를 왜곡하여 잘못된 결론을 도출하게 만들고, 연구의 재현성을 심각하게 훼손하기 때문에 절대 사용해서는 안 되는 방법이에요. 오답 분석 (Distractor Analysis):
평균값 대체(Mean Imputation): 결측된 변수의 전체 평균으로 대체하는 방법이에요. 간단하고 쉽게 적용할 수 있지만, 변수의 분산을 과소 추정하는 단점이 있어요. 하지만 통계적으로 널리 사용되는 방법이므로 적절한 처리법이에요. ③ 회귀 대체(Regression Imputation): 다른 변수들을 이용해 회귀모형을 구축하고 결측값을 예측하여 대체하는 방법이에요. 평균 대체보다 진보된 방법으로, 변수 간의 상관관계를 반영할 수 있다는 장점이 있어 적절한 방법이에요. ④ 완전 제거(Listwise/Complete-case Deletion): 결측값이 있는 사례(행) 전체를 분석에서 제외하는 방법이에요. 가장 단순한 방법이지만, 결측이 많을 경우 표본 수가 급격히 줄어 분석력이 떨어질 수 있어요. 그럼에도 불구하고 적절한 방법 중 하나예요. ⑤ 변수 삭제(Pairwise/Feature Deletion): 결측이 과도하게 많은 변수(열) 자체를 분석 모형에서 제외하는 방법이에요. 분석의 초점이 아닌 변수거나 결측률이 너무 높아 대체가 무의미한 경우 고려할 수 있는 적절한 전략이에요. 연관 개념 정리 (Related Concepts):
최근에는 다중대체법(Multiple Imputation, MI)이 가장 권장되는 방법이에요. 이는 결측값을 한 번이 아닌 여러 번 대체하여 여러 개의 완성된 데이터 세트를 만들고, 각 데이터 세트를 분석한 후 결과를 통합하는 방법으로, 결측값으로 인한 불확실성까지 추정량에 반영할 수 있어요. 개념 정리
분류결측 메커니즘설명
MCAR완전 무작위 결측결측 발생이 관측된 값이나 결측된 값 자체와 아무런 관련 없이 순수하게 무작위로 발생한 상태
MAR무작위 결측결측 발생이 관측된 다른 변수들에 의해 설명될 수 있지만, 결측된 값 자체와는 관련이 없는 상태. 예: 남성일수록 우울증 설문에 무응답할 확률이 높음
MNAR비무작위 결측결측 발생이 결측된 값 자체와 직접적으로 관련된 상태. 예: 소득이 높은 사람일수록 소득 문항에 무응답할 확률이 높음. 가장 처리하기 어려운 경우
한눈에 비교!
처리 방법원리장점단점
완전 제거사례(행) 삭제구현이 간단함통계적 검정력 감소, 편향 발생 가능
평균 대체평균값 삽입구현이 간단하고 직관적임분산을 과소 추정하여 표준오차 왜곡
회귀 대체회귀식으로 예측변수 간 상관관계 반영결측값의 불확실성을 반영하지 못함
다중대체법(MI)여러 번 대체 후 결과 통합불확실성까지 반영, 가장 타당한 방법구현과 해석이 상대적으로 복잡함
주관적 임의 대체연구자 자의 판단장점 없음편향 유발, 데이터 왜곡, 연구 부정 행위 가능성
국시 빈출 포인트 보건행정 및 의료정보관리사 시험에서는 보건통계 또는 보건정보학 파트에서 결측값 처리 방법의 적절성을 자주 물어봐요. 특히 '임의 대체'나 '마지막 관측값 이월(LOCF, Last Observation Carried Forward)' 같은 초보적이거나 잘못된 방법을 고르는 문제가 빈출되니, 어떤 방법이 편향을 유발하는지 정확히 구분해야 해요. 암기 팁 "주관은 편향을 낳고, 객관은 신뢰를 낳는다!" 연구자가 데이터에 손을 대는 순간 그 연구는 과학이 아닌 허구가 돼요. 결측값 처리는 항상 통계 패키지의 공식 함수나 검증된 알고리즘을 이용해야 한다는 점을 잊지 마세요.

임상 시나리오

보건행정 실무 가이드 실무 시나리오 (Practice Scenario):
당신은 한 종합병원의 보건의료정보관리사예요. 병원에서 자체 시행한 환자 만족도 조사 데이터를 분석하던 중, '진료 대기 시간' 항목에서 약 30%의 결측값이 발생한 것을 발견했어요. 이 데이터를 바탕으로 진료 프로세스 개선 보고서를 작성해야 하는데, 주변 동료가 "어차피 대부분 대기 시간이 길었을 거니까, 느낌대로 40분 정도로 대충 채워 넣어서 분석해"라고 조언해요. 행정 중재 전략 (Admin Intervention):
이러한 조언은 절대 따라 해서는 안 되는 매우 위험한 발상이에요. 핵심! 연구자의 주관으로 데이터를 조작하는 행위는 분석 결과를 심각하게 왜곡해요. 이 경우 다음과 같은 객관적인 절차를 따라야 해요.
1. 상황 파악: 먼저 결측이 왜 발생했는지(결측 메커니즘) 파악해요. 진료 대기 시간이 길어서 설문을 완료하지 않고 귀가한 환자들이 많다면 이는 MNAR(비무작위 결측) 가능성이 높아요.
2. 규정/방법론 검토: MNAR 의심 시, 평균 대체는 오히려 대기 시간을 과소 추정하게 돼요. 대신 민감도 분석(Sensitivity Analysis)을 하거나, 결측값을 예측할 수 있는 다른 변수(예: 예약 시간과 접수 시간의 차이)를 활용한 대체 모형을 검토해야 해요.
3. 대응 및 처리: 결측률이 매우 높다면 변수 자체를 주 분석에서 제외하거나, 원 데이터의 한계를 보고서에 명확히 밝히는 것이 올바른 처리 방법이에요.
4. 사후 기록/보고: 최종 보고서에는 반드시 '결측값 처리 방법'을 상세히 기술해야 해요. "결측값이 30% 이상이므로 이 항목은 참고용으로만 해석해야 한다"는 식의 정직한 보고가 신뢰도를 높여요. 선배의 한마디 "보건의료 데이터는 사람의 건강과 생명, 그리고 병원의 중요한 의사 결정에 직결되는 소중한 정보예요. 데이터를 분석하는 사람의 가장 기본적인 덕목은 정직함이에요. 데이터가 불완전할수록 더 엄격하고 객관적인 방법론으로 접근하는 습관을 길러야 해요. 여러분이 다루는 숫자 하나가 병원의 정책을 바꿀 수 있다는 책임감을 항상 가져주세요!"

핵심 개념

조사방법론 85 문제 · 로그인 없이 바로 볼 수 있어요

마이메르시로 국가고시 완벽 대비

기출문제와 상세 해설을 무료로. 내 약점을 분석하고 진도를 관리하며 더 똑똑하게 공부하세요.

무료로 시작하기

학습 참고용입니다. 실제 임상은 최신 지침과 소속 기관 프로토콜을 따르세요.