익명화한 조사자료도 다른 자료와 결합하면 재식별 가능성이 있다. 필요한 조치는? | 마이메르시 MyMerci
이 문제가 수록된 문제집2026 치과위생사 파이널 모의고사 문제집 보기
의료관계법규
문제

익명화한 조사자료도 다른 자료와 결합하면 재식별 가능성이 있다. 필요한 조치는?

해설
간접식별자 조합으로 재식별될 수 있으므로 위험평가와 최소접근 원칙이 필요하다.
같은 주제 다음 문제의료법상 진단서와 검안서 및 증명서를 교부할 수 있는 의료인으로만 바르게 묶인 것은?이 문제가 수록된 문제집2026 치과위생사 파이널 모의고사19,900원 · 무료 체험 가능

심화 해설

익명화(anonymization)는 개인식별정보를 제거하는 조치이지만, 그 자체로 재식별(re-identification) 위험이 완전히 사라지는 것은 아니다. 특히 여러 자료를 결합하면 각 자료에 남아 있는 준식별자(quasi-identifier)가 서로 연결되어 특정 개인을 다시 특정할 수 있는 가능성이 커진다. 따라서 익명화 자료를 공유하거나 공개할 때는 단순히 ‘익명’이라는 명칭에 의존할 것이 아니라, 결합위험 평가와 접근 제한을 포함한 체계적인 재식별 위험 관리가 필요하다.

재식별 위험의 본질
건강 데이터를 공유하면 질병 이해와 예방·진단·치료법 개발에 도움이 되지만, 공유하는 데이터의 양과 공유 방식은 프라이버시 보호 수준과 균형을 이루어야 한다. 이를 위해서는 데이터를 재식별하려는 잠재적 공격자(adversary)가 누구인지, 어떤 동기와 능력을 가지는지, 재식별이 성공했을 때 데이터 주체에게 어떤 위해(harm)가 발생하는지를 구체적으로 이해해야 한다[1]. 익명화 조치를 했다는 사실만으로는 이러한 위험을 통제할 수 없다.

결합을 통한 재식별 가능성
익명화한 조사자료라도 다른 자료와 결합하면 재식별 가능성이 생긴다. 예를 들어 연령, 성별, 거주 지역, 진단명, 입원 기간 같은 준식별자들이 여러 자료에 흩어져 있다면, 각각은 개인을 특정하지 못하더라도 결합하면 특정 환자로 좁혀질 수 있다. 재식별 위험 평가는 최악의 경우만 가정해서는 안 되며, 공격자가 실제로 확보할 수 있는 자원과 능력을 고려해야 한다. 최악의 경우를 가정한 평가는 위험을 과대추정하여 데이터를 과도하게 변형하거나 공유를 지나치게 제한할 수 있기 때문이다[2]. 반대로 공격자의 현실적 능력을 무시한 채 익명화만 믿으면 위험을 과소평가하게 된다.

임상시험 데이터와 익명화의 한계
임상시험 데이터셋의 익명화와 공유에 대한 표준화된 권고안이 아직 부족한 상황에서, 연구자들은 탈식별(de-identification), 익명화, 공개 방식, 재식별 위험 추정에 대해 다양한 견해와 경험을 가지고 있다[3]. 이는 익명화 자료를 다룰 때 기관마다 접근 방식이 다를 수 있으며, 단일한 ‘익명’ 판정에 의존하기보다는 데이터의 성격과 결합 가능성을 반영한 위험 평가가 필요함을 시사한다.

텍스트 데이터의 재식별 위험
비정형 의료 텍스트에서 자동 탈식별 도구를 사용하는 경우에도, 일반적으로 사용되는 성능 지표가 실제 환자 재식별 위험을 정확히 반영하지 못할 수 있다. 텍스트 데이터 공개와 관련된 재식별 위험을 측정하기 위한 별도의 평가 프레임워크가 필요하다는 점은[4], 익명화 자료의 위험을 단순히 ‘식별정보 제거 여부’로만 판단해서는 안 된다는 것을 보여준다. 결합 가능성과 공격자 모델을 포함한 위험 평가가 필수적이다.

정답 해설
정답은 2번 ‘결합위험을 평가하고 접근을 제한한다’이다. 익명화 자료라도 다른 자료와 결합하면 재식별될 수 있으므로, 자료를 공유하거나 공개하기 전에 결합 가능성을 포함한 재식별 위험을 평가하고, 그 결과에 따라 접근 권한을 제한하는 조치가 필요하다. 이는 재식별 공격자의 자원과 능력을 고려한 현실적 위험 평가[2], 재식별로 인한 위해 분석[1], 표준화된 익명화 및 위험 추정 절차의 필요성[3], 텍스트 데이터의 재식별 위험 측정[4]과 모두 연결된다.

혼동 주의! 1번처럼 이름만 붙이는 것은 실질적 보호 조치가 아니다. 3번처럼 인터넷에 무제한 공개하면 결합 공격에 노출될 위험이 커진다. 4번처럼 원자료와 연결키(linkage key)를 함께 배포하면 익명화의 의미 자체가 사라진다. 5번처럼 보관기한을 없애는 것은 재식별 위험을 낮추는 조치가 아니라 오히려 장기간 노출 위험을 키울 수 있다.

핵심! 익명화는 재식별 위험을 낮추는 하나의 수단일 뿐 완전한 제거를 보장하지 않는다. 데이터 공유 전에 결합 가능성을 포함한 재식별 위험 평가를 수행하고, 위험 수준에 따라 접근을 통제하는 것이 필수적인 관리 조치이다.
참고 문헌 (논문 출처)
  • [1]
    Health Data Re-Identification: Assessing Adversaries and Potential Harms.일반논문Meurers T, Baum L, Haber AC, Halilovic M, Heinz B, Milicevic V (2024) · DOI: 10.3233/SHTI240626
  • [2]
    Enabling realistic health data re-identification risk assessment through adversarial modeling.일반논문Xia W, Liu Y, Wan Z, Vorobeychik Y, Kantacioglu M, Nyemba S (2021) · DOI: 10.1093/jamia/ocaa327
  • [3]
    A survey on UK researchers' views regarding their experiences with the de-identification, anonymisation, release methods and re-identification risk estimation for clinical trial datasets.RCT/임상시험Rodriguez A, Lewis SC, Eldridge S, Jackson T, Weir CJ (2025) · DOI: 10.1177/17407745241259086
  • [4]
    A unified framework for evaluating the risk of re-identification of text de-identification tools.일반논문Scaiano M, Middleton G, Arbuckle L, Kolhatkar V, Peyton L, Dowling M (2016) · DOI: 10.1016/j.jbi.2016.07.015
2026 치과위생사 파이널 모의고사 1,000 문제 · 로그인 없이 바로 볼 수 있어요

마이메르시로 국가고시 완벽 대비

기출문제와 상세 해설을 무료로. 내 약점을 분석하고 진도를 관리하며 더 똑똑하게 공부하세요.

무료로 시작하기

학습 참고용입니다. 실제 임상은 최신 지침과 소속 기관 프로토콜을 따르세요.