# 보건행정 조사에서 수집된 자료를 분석할 때, 결측값(Missing data)을 처리하는 방법으로 가장 적절하지 않은 것은?

> source: MyMerci (mymerci.kr)  
> url: https://mymerci.kr/pages/nclex_q.php?qn_id=445034  
> language: ko  
> subject: 자료 분석 및 보고서 작성

## 문제

보건행정 조사에서 수집된 자료를 분석할 때, 결측값(Missing data)을 처리하는 방법으로 가장 적절하지 않은 것은?

## 보기

1. 결측이 발생한 변수에 대해 평균값으로 대체하는 방법
2. 연구자의 주관적 판단에 따라 임의의 값으로 채워 넣는 방법 **✔ 정답**
3. 회귀모형을 이용하여 결측값을 예측하여 대체하는 방법
4. 결측이 발생한 해당 사례를 분석에서 완전히 제외하는 방법
5. 결측이 발생한 변수를 분석 모형에서 아예 삭제하는 방법

**정답: 2**

## 해설

연구자의 주관적 판단에 의한 임의의 값 대체는 편향을 유발할 가능성이 매우 높아 지양해야 한다. 평균 대체, 완전 제외(Listwise deletion), 변수 삭제, 회귀 대체 등은 상황에 따라 사용될 수 있는 결측값 처리 방법이다.

## 심화 해설

핵심 해설
이 문제는 보건의료 데이터 분석 시 결측값(Missing Data) 처리의 기본 원칙을 묻는 문제예요. 결측값 처리는 분석 결과의 신뢰도를 좌우하는 매우 중요한 과정으로, 연구자의 혼동 주의! 주관적 판단을 배제하고 통계적 이론에 근거한 객관적인 방법을 적용해야 해요.

**핵심 개념 분석 (Key Concept)**:

결측값이란 조사 과정에서 응답 거부, 설문 문항 누락, 자료 입력 오류 등으로 인해 특정 변수에 대한 값이 존재하지 않는 상태를 말해요. 이러한 결측값을 적절히 처리하지 않으면 분석 결과에 선택 편향(Selection Bias)이 발생할 수 있어요.

**정답 근거 (Answer Rationale)**:

정답은 **2번 '연구자의 주관적 판단에 따라 임의의 값으로 채워 넣는 방법'**이에요. 핵심! 연구자의 자의적 판단으로 데이터를 조작하는 행위는 과학적 연구 방법론에 완전히 위배돼요. 이는 데이터를 왜곡하여 잘못된 결론을 도출하게 만들고, 연구의 재현성을 심각하게 훼손하기 때문에 절대 사용해서는 안 되는 방법이에요.

**오답 분석 (Distractor Analysis)**:

① 평균값 대체(Mean Imputation): 결측된 변수의 전체 평균으로 대체하는 방법이에요. 간단하고 쉽게 적용할 수 있지만, 변수의 분산을 과소 추정하는 단점이 있어요. 하지만 통계적으로 널리 사용되는 방법이므로 적절한 처리법이에요.
③ 회귀 대체(Regression Imputation): 다른 변수들을 이용해 회귀모형을 구축하고 결측값을 예측하여 대체하는 방법이에요. 평균 대체보다 진보된 방법으로, 변수 간의 상관관계를 반영할 수 있다는 장점이 있어 적절한 방법이에요.
④ 완전 제거(Listwise/Complete-case Deletion): 결측값이 있는 사례(행) 전체를 분석에서 제외하는 방법이에요. 가장 단순한 방법이지만, 결측이 많을 경우 표본 수가 급격히 줄어 분석력이 떨어질 수 있어요. 그럼에도 불구하고 적절한 방법 중 하나예요.
⑤ 변수 삭제(Pairwise/Feature Deletion): 결측이 과도하게 많은 변수(열) 자체를 분석 모형에서 제외하는 방법이에요. 분석의 초점이 아닌 변수거나 결측률이 너무 높아 대체가 무의미한 경우 고려할 수 있는 적절한 전략이에요.

**연관 개념 정리 (Related Concepts)**:

최근에는 다중대체법(Multiple Imputation, MI)이 가장 권장되는 방법이에요. 이는 결측값을 한 번이 아닌 여러 번 대체하여 여러 개의 완성된 데이터 세트를 만들고, 각 데이터 세트를 분석한 후 결과를 통합하는 방법으로, 결측값으로 인한 불확실성까지 추정량에 반영할 수 있어요.

개념 정리

| 분류 | 결측 메커니즘 | 설명 |
| --- | --- | --- |
| MCAR | 완전 무작위 결측 | 결측 발생이 관측된 값이나 결측된 값 자체와 아무런 관련 없이 순수하게 무작위로 발생한 상태 |
| MAR | 무작위 결측 | 결측 발생이 관측된 다른 변수들에 의해 설명될 수 있지만, 결측된 값 자체와는 관련이 없는 상태. 예: 남성일수록 우울증 설문에 무응답할 확률이 높음 |
| MNAR | 비무작위 결측 | 결측 발생이 결측된 값 자체와 직접적으로 관련된 상태. 예: 소득이 높은 사람일수록 소득 문항에 무응답할 확률이 높음. 가장 처리하기 어려운 경우 |

한눈에 비교!

| 처리 방법 | 원리 | 장점 | 단점 |
| --- | --- | --- | --- |
| 완전 제거 | 사례(행) 삭제 | 구현이 간단함 | 통계적 검정력 감소, 편향 발생 가능 |
| 평균 대체 | 평균값 삽입 | 구현이 간단하고 직관적임 | 분산을 과소 추정하여 표준오차 왜곡 |
| 회귀 대체 | 회귀식으로 예측 | 변수 간 상관관계 반영 | 결측값의 불확실성을 반영하지 못함 |
| 다중대체법(MI) | 여러 번 대체 후 결과 통합 | 불확실성까지 반영, 가장 타당한 방법 | 구현과 해석이 상대적으로 복잡함 |
| 주관적 임의 대체 | 연구자 자의 판단 | 장점 없음 | 편향 유발, 데이터 왜곡, 연구 부정 행위 가능성 |

국시 빈출 포인트
보건행정 및 의료정보관리사 시험에서는 보건통계 또는 보건정보학 파트에서 결측값 처리 방법의 적절성을 자주 물어봐요. 특히 '임의 대체'나 '마지막 관측값 이월(LOCF, Last Observation Carried Forward)' 같은 초보적이거나 잘못된 방법을 고르는 문제가 빈출되니, 어떤 방법이 편향을 유발하는지 정확히 구분해야 해요.

암기 팁
"**주관은 편향을 낳고, 객관은 신뢰를 낳는다**!" 연구자가 데이터에 손을 대는 순간 그 연구는 과학이 아닌 허구가 돼요. 결측값 처리는 항상 통계 패키지의 공식 함수나 검증된 알고리즘을 이용해야 한다는 점을 잊지 마세요.

## 임상 시나리오

보건행정 실무 가이드
**실무 시나리오 (Practice Scenario)**:

당신은 한 종합병원의 보건의료정보관리사예요. 병원에서 자체 시행한 환자 만족도 조사 데이터를 분석하던 중, '진료 대기 시간' 항목에서 약 30%의 결측값이 발생한 것을 발견했어요. 이 데이터를 바탕으로 진료 프로세스 개선 보고서를 작성해야 하는데, 주변 동료가 "어차피 대부분 대기 시간이 길었을 거니까, 느낌대로 40분 정도로 대충 채워 넣어서 분석해"라고 조언해요.

**행정 중재 전략 (Admin Intervention)**:

이러한 조언은 절대 따라 해서는 안 되는 매우 위험한 발상이에요. 핵심! 연구자의 주관으로 데이터를 조작하는 행위는 분석 결과를 심각하게 왜곡해요. 이 경우 다음과 같은 객관적인 절차를 따라야 해요.

1. **상황 파악**: 먼저 결측이 왜 발생했는지(결측 메커니즘) 파악해요. 진료 대기 시간이 길어서 설문을 완료하지 않고 귀가한 환자들이 많다면 이는 MNAR(비무작위 결측) 가능성이 높아요.

2. **규정/방법론 검토**: MNAR 의심 시, 평균 대체는 오히려 대기 시간을 과소 추정하게 돼요. 대신 민감도 분석(Sensitivity Analysis)을 하거나, 결측값을 예측할 수 있는 다른 변수(예: 예약 시간과 접수 시간의 차이)를 활용한 대체 모형을 검토해야 해요.

3. **대응 및 처리**: 결측률이 매우 높다면 변수 자체를 주 분석에서 제외하거나, 원 데이터의 한계를 보고서에 명확히 밝히는 것이 올바른 처리 방법이에요.

4. **사후 기록/보고**: 최종 보고서에는 반드시 '결측값 처리 방법'을 상세히 기술해야 해요. "결측값이 30% 이상이므로 이 항목은 참고용으로만 해석해야 한다"는 식의 정직한 보고가 신뢰도를 높여요.

선배의 한마디
"보건의료 데이터는 사람의 건강과 생명, 그리고 병원의 중요한 의사 결정에 직결되는 소중한 정보예요. 데이터를 분석하는 사람의 가장 기본적인 덕목은 정직함이에요. 데이터가 불완전할수록 더 엄격하고 객관적인 방법론으로 접근하는 습관을 길러야 해요. 여러분이 다루는 숫자 하나가 병원의 정책을 바꿀 수 있다는 책임감을 항상 가져주세요!"

## 핵심 개념

- **결측값(Missing Data)** — 조사 또는 실험에서 변수에 대한 관측값이나 응답값이 기록되지 않은 상태를 말하며, 분석 전에 반드시 적절한 처리가 필요해요.
- **다중대체법(Multiple Imputation)** — 결측값을 여러 번 대체하여 복수의 완전한 데이터 세트를 만들고 분석 결과를 통합하는 방법으로, 결측값의 불확실성을 보완하는 통계적 기법이에요.
- **완전 무작위 결측** — 결측 발생이 관측된 값이나 결측된 값 자체와 아무런 관련 없이 완전히 무작위로 발생한 상태를 말해요.
- **선택 편향(Selection Bias)** — 분석 대상이 되는 표본이 모집단을 제대로 대표하지 못해 발생하는 오류로, 잘못된 결측값 처리가 원인이 될 수 있어요.
- **민감도 분석(Sensitivity Analysis)** — 데이터의 불확실성이나 분석 방법의 가정 변경이 최종 결과에 얼마나 큰 영향을 미치는지 평가하는 분석 방법이에요.

## 같은 주제 문제

- [조사보고서 작성 시 서론(Introduction)에 포함되어야 할 가장 적절한 내용은?](https://mymerci.kr/pages/nclex_q.php?qn_id=445029)
- [양적 자료 분석에서 'p값(p-value)'에 대한 설명으로 옳은 것은?](https://mymerci.kr/pages/nclex_q.php?qn_id=445030)
- [다음 중 질적 자료 분석 방법에 해당하는 것은?](https://mymerci.kr/pages/nclex_q.php?qn_id=445031)
- [조사 결과를 표로 제시할 때 지켜야 할 일반적인 원칙으로 가장 적절한 것은?](https://mymerci.kr/pages/nclex_q.php?qn_id=445032)
- [연구보고서 작성 시 '연구의 제한점(Limitations)'에 포함되어야 할 가장 적절한 내용은?](https://mymerci.kr/pages/nclex_q.php?qn_id=445033)
- [연구 결과의 통계적 유의성(Statistical significance)과 임상적 유의성(Clinical significance)에 대한 설명으로 옳은 것은?](https://mymerci.kr/pages/nclex_q.php?qn_id=445035)
- [질적 연구 보고서의 질을 평가하는 기준으로, 연구 결과가 연구 참여자의 경험과 관점을 얼마나 충실히 반영하는지에 대한 개념은?](https://mymerci.kr/pages/nclex_q.php?qn_id=445036)
- [설문조사 결과를 분석한 후, 연구자가 보고서에 제시해야 할 내용의 우선순위로 가장 적절한 것은?](https://mymerci.kr/pages/nclex_q.php?qn_id=445037)

---

More free questions: [기출문제](https://mymerci.kr/)

_학습 참고용입니다. 실제 임상은 최신 지침과 소속 기관 프로토콜을 따르세요._

