보건행정 핵심 해설
이 문제는 보건통계 및 연구 방법론에서 데이터 관리의 실무적 측면을 다루고 있어요. 연구 데이터를
SPSS(Statistical Package for the Social Sciences)로 가져올 때, 변수의 측정 수준(수준척도, 서열척도, 등간척도, 비율척도)과 데이터 유형(문자형, 수치형)을 정확하게 설정하는 것은 분석의 정확성을 위한 첫걸음이에요.
핵심 개념 분석 (Key Concept): 문제의 핵심은 데이터 파일 형식에 따른
변수 유형 자동 인식의 차이입니다. Excel 파일(.xlsx)은 셀에 저장된 원본 데이터 형식 정보(서식)를 포함하고 있어, SPSS가 이 정보를 참조하여 "1", "2"와 같은 텍스트 형식의 숫자를 수치형 변수로 더 쉽게 인식할 수 있는 가능성이 높아요. 반면, .csv나 .txt 같은 순수 텍스트 파일은 모든 데이터를 문자로만 해석하기 때문에, 후속 변수 유형 설정 작업이 추가로 필요할 수 있어요.
정답 근거 (Answer Rationale): 정답은
⑤ .xlsx (Excel 파일)입니다. SPSS는 Excel 파일을 직접 열거나 가져올 때, Excel 파일 내에 정의된 각 셀의
핵심! '서식'(일반, 숫자, 텍스트 등) 정보를 읽어 변수 유형을 추정하는 알고리즘을 가지고 있어요. 따라서 Excel에서 '텍스트' 서식으로 저장된 "1", "2"는 SPSS에서도 문자형(String)으로 인식될 가능성이 있지만, '일반' 또는 '숫자' 서식이었다면 SPSS가 수치형(Numeric)으로 자동 인식할 가능성이 훨씬 높아집니다. 이는 .csv 파일이 모든 데이터를 텍스트로만 처리하는 것과 대비되는 장점이에요.
오답 분석 (Distractor Analysis):
혼동 주의! ①번
.sav는 SPSS의 전용 파일 형식으로, 변수 유형, 값 라벨, 결측값 정의 등 모든 메타데이터가 완벽하게 저장되어 있어요. 하지만 문제는 "Excel에서 불러올 때"의 상황이므로, .sav는 원본 불러오기 형식이 아니라 저장 결과물에 해당해요.
②번
.docx는 워드 프로세서 문서 형식으로, 표 형태의 데이터를 포함할 수는 있지만 통계 소프트웨어에서 직접 분석용 데이터로 불러오는 표준 형식이 아니에요.
③번
.txt는 가장 기본적인 텍스트 파일이에요. 구분자(탭, 쉼표 등)를 지정하여 불러올 수 있지만, 모든 값은 처음에 텍스트로 인식되므로, "1", "2"를 수치형으로 변환하려면 사용자가 추가 작업을 해야 해요.
④번
.csv는 쉼표로 구분된 값 파일로, 데이터 교환에 매우 흔히 사용됩니다. 그러나 .csv의 본질은 텍스트 파일이기 때문에, Excel 내에서의 서식 정보가 완전히 소실되어 SPSS에 텍스트 형태로 들어오게 돼요. 이 경우 숫자처럼 보이는 값도 문자형 변수로 생성되어, 분석 전에 수치형으로 재정의(변수 유형 변경)하는 절차가 필요할 수 있어요.
연관 개념 정리 (Related Concepts): SPSS에서 변수 유형을 설정하는 것은
측정 수준(Measurement Level) 설정과 연결됩니다. 수치형 변수는 주로 '등간척도'나 '비율척도'로, 문자형 변수는 '명목척도'나 '서열척도'로 설정됩니다. 데이터 불러오기 후 '변수 보기'에서 각 변수의 유형과 측정 수준을 꼭 확인하고 필요시 조정해야 정확한 분석이 가능해요.
개념 정리
| 파일 형식 | 특징 | SPSS 변수 유형 인식 |
| .xlsx (Excel) | 셀 서식(숫자, 텍스트, 날짜 등) 정보 보유 | 서식 정보를 참조하여 자동 인식 가능성 높음 |
| .csv (Comma-Separated Values) | 순수 텍스트, 쉼표로 값 구분 | 모든 값을 초기에는 문자형(String)으로 인식 |
| .sav (SPSS 전용) | 변수 정의, 값 라벨, 메타데이터 완전 저장 | 저장된 그대로의 유형 유지 (불러오기 형식 아님) |
| .txt (텍스트) | 순수 텍스트, 구분자 다양(탭, 공백 등) | 모든 값을 초기에는 문자형으로 인식 |
한눈에 비교!
| 비교 항목 | .xlsx 파일 불러오기 | .csv 파일 불러오기 |
| 데이터 형식 정보 | 유지됨 (Excel 서식 참조 가능) | 소실됨 (모든 것이 텍스트로 평탄화) |
| 변수 유형 자동 지정 | 상대적으로 정확한 편 | 부정확할 가능성 높음 (전체 텍스트화) |
| 데이터 무결성 | 높음 (특수문자, 줄바꿈 문제 적음) | 주의 필요 (쉼표나 큰따옴표 처리 문제 발생 가능) |
| 호환성 | SPSS, Excel 사용 환경 필요 | 범용성 최고 (모든 프로그램에서 열기 쉬움) |
실무 포인트
연구 데이터 관리 시, SPSS 작업 흐름은 다음과 같아요:
1.
원본 데이터 준비: Excel에서 데이터 입력 시, 숫자 데이터는 반드시 '일반' 또는 '숫자' 서식으로 입력하세요. "001"처럼 앞자리 0을 유지해야 한다면 텍스트 서식을 미리 적용.
2.
불러오기: SPSS에서 [파일] > [열기] > [데이터] 선택 후, 파일 형식을 "Excel(*.xls, *.xlsx)"로 지정하여 불러옵니다.
3.
변수 보기 점검: 불러온 후 즉시 '변수 보기' 탭에서 각 변수의 '유형'과 '측정 수준'을 확인하세요. 문항지의 리커트 척도(1=매우 그렇지 않다, 5=매우 그렇다)는
수치형 & 등간척도로 설정되어야 해요.
4.
사후 수정: 변수 유형이 잘못 지정되었다면, 변수 보기에서 해당 변수의 '유형' 셀을 더블클릭하여 수치형으로 변경할 수 있어요.
암기 팁
"
엑셀은 옷(서식)을 입고 와서, SPSS가 더 잘 알아본다."
"
CSV는 알몸(텍스트) 상태라, SPSS가 처음엔 모두 글자로만 본다."
국시 빈출 포인트
보건의료정보관리사 시험에서는 연구방법론 파트에서
SPSS 데이터 관리와 관련된 기본 개념이 종종 출제됩니다. 특히 '변수의 측정 수준'과 '적절한 통계 분석법 선택'과 연결지어 질문할 수 있어요. 데이터 파일 형식의 차이는 그 기초 지식으로 꼭 알아두세요.
기출 변형 주의!
*
역방향 질문: "SPSS에서 .csv 파일을 불러왔을 때, 숫자 데이터가 문자형으로 인식되는 주된 원인은?" → 답: "파일 형식이 모든 데이터를 텍스트로 저장하기 때문"
*
실무 적용형: "리커트 5점 척도로 수집된 설문 데이터를 SPSS에서 분석하려고 한다. Excel에서 데이터를 저장할 때 가장 유리한 파일 형식은?" → 답: ".xlsx"