# 칫솔질 수행평가 체크리스트에서 평가자마다 점수가 크게 다르다. 우선 개선할 것은?

> source: MyMerci (mymerci.kr)  
> url: https://mymerci.kr/pages/nclex_q.php?qn_id=625586  
> language: ko  
> subject: 치위생학1

## 문제

칫솔질 수행평가 체크리스트에서 평가자마다 점수가 크게 다르다. 우선 개선할 것은?

## 보기

1. 문항 수만 늘린다
2. 행동기준을 구체화하고 평가자 훈련을 한다 **✔ 정답**
3. 평가자를 매번 바꾼다
4. 관찰을 중단하고 만족도만 조사한다
5. 점수를 임의로 평균낸다

**정답: 2**

## 해설

행동기준을 관찰 가능하게 정의하고 평가자 훈련·보정을 시행하면 평가자 간 신뢰도를 높일 수 있다.

## 심화 해설

칫솔질 수행평가는 관찰 기반 임상 술기 평가의 전형적인 형태입니다. 평가자 간 점수 차이가 크게 발생하는 원인은 평가 항목 자체의 부족보다 평가자 간 신뢰도(inter-rater reliability)가 확보되지 않았기 때문일 가능성이 높습니다. 체크리스트의 각 항목이 무엇을 관찰해야 하는지 모호하면, 평가자마다 자신의 임상 경험이나 주관적 인상에 따라 점수를 부여하게 됩니다.

관찰 기반 임상 수행평가에서 점수의 일관성과 방어 가능성을 높이기 위해 평가자 훈련과 보정(calibration)이 널리 권장됩니다. 시뮬레이션 기반 관찰 임상 역량 평가(SOCCAs)를 대상으로 한 범위 문헌고찰에서도 평가자 훈련과 보정이 채점 일관성과 방어 가능성을 개선하기 위한 핵심 중재로 다루어지고 있습니다 [2]. 이는 칫솔질 수행평가처럼 구조화된 체크리스트를 사용하는 평가에서도 동일하게 적용되는 원리입니다.

또한 칫솔질 수행 자체가 개인 내에서 비교적 안정적인 습관성 운동 패턴을 보일 수 있다는 점도 고려해야 합니다 [1]. 즉, 평가 대상자의 수행이 크게 변하지 않는데 평가자마다 점수가 다르게 나온다면, 이는 측정 도구보다 평가자 요인에서 비롯된 오차일 가능성이 큽니다. 따라서 문항 수를 늘리거나 평가자를 자주 교체하는 것은 오히려 측정 오차를 증가시킬 수 있습니다.

혼동 주의! 문항 수 증가는 내용 타당도를 높일 수는 있지만, 평가자 간 신뢰도가 낮은 상태에서는 오차만 반복 확대할 뿐입니다. 핵심! 우선 각 문항의 행동 기준을 조작적으로 정의하고, 평가자들이 동일한 기준으로 관찰하도록 훈련과 보정 과정을 거친 뒤 점수를 산출해야 합니다. 평가자 훈련에는 예시 동영상을 활용한 기준 점수 합의, 평가자 간 토의, 주기적 재보정이 포함될 수 있습니다 [2].참고 문헌 (논문 출처)

- [1]Subject-specific stability of toothbrushing performance: insights from dynamic time warping and phenotype analysis.일반논문Jung K, Ganss C, Ressel EM. (2026) · DOI: 10.1007/s00784-026-06997-3

- [2]Examiner training and calibration for simulated clinical examinations: A scoping review.일반논문Thampy H, Callanan N, Ahmed A, Taromsari S (2026) · DOI: 10.1111/medu.70253

## 임상 시나리오

칫솔질 수행평가 신뢰도 확보평가자 간 점수 차이를 줄이는 임상 평가 설계
평가자 간 점수 차이가 크다면 문항 수 부족보다 평가자 간 신뢰도 문제를 먼저 의심해야 합니다. 칫솔질은 개인 내에서 비교적 안정적인 습관성 운동 패턴을 보이므로, 수행이 일정한데 점수가 흔들리면 평가자 요인에 의한 측정 오차일 가능성이 높습니다.

우선 각 체크리스트 항목의 행동기준을 조작적으로 정의해야 합니다. 예를 들어 ‘잇몸 경계부를 닦는다’가 아니라 ‘치아와 잇몸 경계에 칫솔모를 45도 각도로 대고 5회 이상 진동시킨다’처럼 관찰 가능한 동작으로 구체화합니다.

이후 평가자 훈련과 보정을 시행합니다. 예시 동영상을 함께 보며 기준 점수를 합의하고, 평가자 간 토의를 거쳐 주기적으로 재보정하는 과정이 채점 일관성과 방어 가능성을 높입니다.

주의문항 수를 늘리거나 평가자를 자주 교체하면 신뢰도가 낮은 상태에서 오히려 측정 오차만 반복 확대될 수 있습니다. 점수를 임의로 평균내는 것도 신뢰도 개선 없이 오차를 은폐하므로 피해야 합니다.

## 핵심 개념

- **평가자 간 신뢰도** — 서로 다른 평가자가 동일한 수행을 관찰했을 때 점수가 일치하는 정도
- **행동기준** — 평가 항목에서 어떤 구체적 동작이나 상태를 관찰해야 하는지 조작적으로 정의한 기준
- **보정** — 평가자들이 동일한 기준으로 점수를 부여하도록 훈련하고 합의하는 과정
- **측정 오차** — 실제 수행 능력과 평가 점수 사이에 발생하는 비일관적 차이
- **내용 타당도** — 평가 문항이 측정하고자 하는 수행 영역을 얼마나 잘 대표하는지

## 같은 주제 문제

- [두개골을 구성하는 뼈 중에서 뇌두개골이 아닌 안면두개골에 속하는 것은?](https://mymerci.kr/pages/nclex_q.php?qn_id=283569)
- [턱관절을 형성하는 뼈의 해부학적 구조물이 바르게 짝지어진 것은?](https://mymerci.kr/pages/nclex_q.php?qn_id=283570)
- [저작근 중에서 아래턱을 위로 당겨 입을 다물게 하며 뺨 부위에서 가장 강한 힘을 내는 근육은?](https://mymerci.kr/pages/nclex_q.php?qn_id=283571)
- [안면신경의 지배를 받으며 저작 시 뺨을 압박하여 음식물이 구강 전정으로 떨어지지 않게 돕는 근육은?](https://mymerci.kr/pages/nclex_q.php?qn_id=283572)
- [삼차신경의 세 번째 가지인 하악신경이 두개골을 빠져나오는 통로가 되는 구멍은?](https://mymerci.kr/pages/nclex_q.php?qn_id=283573)
- [타액선 중 가장 크기가 크며 맑고 묽은 장액성 타액만을 분비하는 곳은?](https://mymerci.kr/pages/nclex_q.php?qn_id=283574)
- [혀의 앞쪽 3분의 2 부위에서 미각을 감지하여 뇌로 전달하는 신경은?](https://mymerci.kr/pages/nclex_q.php?qn_id=283575)
- [아래턱뼈 내부로 신경과 혈관이 들어가는 통로인 하악관의 입구에 해당하는 뼈의 구조물은?](https://mymerci.kr/pages/nclex_q.php?qn_id=283576)

---

More free questions: [기출문제](https://mymerci.kr/)

_학습 참고용입니다. 실제 임상은 최신 지침과 소속 기관 프로토콜을 따르세요._

