2026-09-28 · 명서율 (책임연구원)

마이크로데이터 어떻게 이용하나요? MDIS 403종 원자료와 가중값·표본설계 변수를 갈라 쓰는 데이터 이용 4단계 절차

#생활통계#마이크로데이터#mdis#가중값#표본설계#표준오차#원자료분석#통계해석

마이크로데이터는 어떻게 이용하나요?

출발점은 집계표로 답이 안 나오는 질문을 구분하는 일입니다. 국가통계포털에 올라온 표는 이미 정해진 축으로 합산된 결과여서 "30대 1인 가구 중 월세로 사는 사람의 소비지출"처럼 세 조건이 겹치는 질문에는 답하지 못합니다. 이럴 때 쓰는 것이 마이크로데이터입니다. 개인·가구·사업체 단위의 응답 기록을 그대로 받아 직접 집계하는 자료입니다. 마이크로데이터 통합서비스(MDIS)는 2025년 기준 403종을 제공하는데요. 국가데이터처 자체 통계 50종과 타 작성기관 353종으로 구성됩니다. 다만 원자료를 내려받아 단순 합계를 내면 거의 틀립니다. 가중값을 곱해 모집단으로 복원하는 과정이 빠지면 숫자가 실제의 절반도 되지 않습니다.

목차

원자료가 필요한 질문의 모양

통계는 대부분 표로 공개됩니다. 표는 이미 누군가가 정한 기준으로 합산된 결과입니다. 연령별 표, 지역별 표, 소득분위별 표가 따로 있지만 그 세 축을 동시에 교차한 표는 없는 경우가 많습니다. 공개 표의 칸 수가 기하급수적으로 늘어나기 때문에 모든 조합을 미리 만들어 둘 수 없습니다.

그래서 조금만 구체적인 질문을 던지면 곧 벽에 부딪힙니다. 지방 소도시에 사는 60대 단독 가구의 주거비 비중, 통근 시간이 90분을 넘는 임금근로자의 가구 구성, 반려동물 지출이 있는 가구의 소득 분포 같은 질문입니다. 이런 질문의 답은 표가 아니라 원자료에 있습니다.

집계표 앞에서 막혔던 질문 하나

지난 봄 지방자치단체 한 곳에서 청년 주거 지원 사업의 대상 기준을 다시 잡아 달라는 의뢰를 받았습니다. 담당 공무원의 질문은 단순했습니다. "우리 시 20대 후반 1인 가구 중 월세를 내면서 소득이 중위 이하인 가구가 몇이나 됩니까?"

국가통계포털에서 찾을 수 있는 표는 세 갈래였습니다. 연령별 1인 가구 수, 거처 종류별 가구 수, 소득분위별 가구 수. 어느 표에도 세 조건이 함께 걸린 칸이 없었습니다. 담당자는 세 표의 비율을 곱해서 추정한 숫자를 이미 만들어 두고 있었는데요. 이 방법은 세 조건이 서로 독립일 때만 성립합니다. 실제로는 연령과 거처 형태, 소득이 강하게 얽혀 있어서 곱셈 추정은 과소 또는 과대 추정으로 흐릅니다.

그래서 MDIS에서 가계동향조사와 주거실태조사 공개용 자료를 받아 직접 집계했습니다. 결과는 곱셈 추정치보다 1.6배 많았습니다. 20대 후반 1인 가구에서 월세 비중이 전체 평균보다 훨씬 높았기 때문입니다. 조건이 겹칠 때 서로를 끌어올리는 구조였습니다. 사업 예산 규모가 바뀌는 차이였습니다.

그 과정에서 저희가 저질렀던 실수도 하나 기록해 둡니다. 첫 집계에서 가중값을 빼고 계산해 표본 가구 수를 그대로 보고했습니다. 숫자가 이상하게 작아서 다시 확인했더니 원자료 한 줄이 수백 가구를 대표하고 있었습니다. 마이크로데이터의 첫 관문이 바로 여기입니다.

집계표와 마이크로데이터는 무엇이 다른가요

구분집계표(KOSIS 등)마이크로데이터(MDIS)
자료 단위이미 합산된 값개인·가구·사업체 한 건씩
교차 집계공개된 축만 가능변수만 있으면 자유롭게 가능
필요 역량표 읽기통계 패키지 사용, 가중값 처리
공개 범위전면 공개공개용·원격접근·센터 방문으로 구분
걸리는 시간즉시신청과 심의에 수일~수주

즉 마이크로데이터는 더 좋은 자료가 아니라 다른 자료입니다. 답이 이미 표에 있으면 표를 쓰는 것이 정확하고 빠릅니다. 표에 없는 조합이 필요할때, 그리고 분석 대상을 스스로 정의해야 할 때 원자료로 내려갑니다.

MDIS가 제공하는 세 가지 이용 경로

MDIS는 국가데이터처가 만드는 통계뿐 아니라 각 부처와 지자체, 연구기관이 작성한 통계의 마이크로데이터를 한 곳에 모아 제공합니다. 자료의 민감도에 따라 이용 경로가 갈립니다.

첫째는 공개용 자료입니다. 식별 위험을 줄이기 위해 일부 변수를 범주화하거나 상한을 씌운 파일입니다. 로그인 후 바로 내려받을 수 있고 비용이 없습니다. 대부분의 생활통계 분석은 여기서 끝납니다.

둘째는 원격접근서비스(RAS)입니다. 공개용보다 상세한 자료를 이용자의 컴퓨터로 내려주지 않습니다. 원격 환경에 접속해 분석만 수행하는 방식입니다. 결과물만 반출 심사를 거쳐 받습니다. 세분화된 지역 변수나 상세 직업 분류가 필요할 때 선택합니다.

셋째는 연구데이터센터(RDC) 방문입니다. 가장 상세한 자료를 지정된 물리 공간에서만 다루는 경로입니다. 접근성은 낮지만 변수 제약이 가장 적습니다. 일정과 자료 이용 승인을 미리 확인해야 합니다.

경로 선택의 기준은 단순합니다. 필요한 변수 목록을 먼저 적습니다. 그다음 그 변수가 공개용에 있는지 확인합니다. 없으면 한 단계 위로 올라갑니다. 처음부터 RDC를 신청해 두고 공개용으로 충분했다는 사실을 나중에 아는 경우가 생각보다 많습니다.

가중값을 곱하지 않으면 숫자가 틀립니다

표본조사의 원자료 한 줄은 자기 자신만 대표하지 않습니다. 표본설계 과정에서 추출 확률이 정해집니다. 여기에 무응답과 사후 보정을 거쳐 각 표본에 가중값이 붙습니다. 가중값은 "이 응답자가 모집단에서 몇 명을 대표하는가"를 뜻합니다.

계산 규칙은 두 가지만 기억하면 됩니다. 규모를 구할 때는 가중값을 더합니다. 표본 300가구가 아니라 그 300가구의 가중값 합계가 추정 가구 수입니다. 평균이나 비율을 구할 때는 가중평균을 씁니다. 각 값에 가중값을 곱해 더한 뒤 가중값 합계로 나눕니다.

가중값을 무시한 단순 집계가 위험한 이유는 방향이 일정하지 않기 때문입니다. 표본이 특정 계층에서 더 많이 추출된 조사라면 단순 평균이 그 계층 쪽으로 끌려갑니다. 저희 사례에서 가중값을 뺀 결과는 규모를 과소 추정했습니다. 다른 조사에서는 반대로 특정 집단의 비율을 부풀리는 방향으로 틀어졌습니다.

표본설계 변수와 표준오차 계산

가중값까지 처리했더라도 한 가지가 더 남습니다. 표준오차입니다. 단순무작위추출을 가정한 공식으로 계산하면 실제보다 오차가 작게 나옵니다. 대부분의 국가통계는 층화와 집락추출을 함께 쓰기 때문입니다.

MDIS가 제공하는 자료에는 층(stratum)과 집락(cluster) 식별 변수가 함께 들어 있는 경우가 많습니다. 통계 패키지에서 표본설계를 선언한 뒤 분석하면 설계를 반영한 표준오차가 나옵니다. R의 survey 패키지, Stata의 svyset, SPSS의 복합표본 분석 모듈이 같은 역할을 합니다.

이 절차가 필요한 이유는 해석 단계에서 드러납니다. 세분화된 집단을 볼수록 표본 수가 줄어들어 오차가 커집니다. 설계를 무시한 오차를 쓰면 통계적으로 의미 없는 차이를 의미 있다고 보고하게 됩니다. 관측치가 30건도 되지 않는 칸을 근거로 정책을 설계하는 사고가 여기서 생깁니다.

실제로 얼마나 차이가 나는지

같은 자료로 표준오차를 두 번 계산해 봤습니다. 20대 후반 1인 가구의 월세 비중을 구하면서 단순무작위추출을 가정한 값과 층·집락을 반영한 값을 비교했습니다. 추정치는 같았지만 표준오차는 후자가 약 1.4배 컸습니다. 그 결과 신뢰구간의 폭이 넓어져, 인접 연령대와의 차이가 통계적으로 유의하지 않은 범위로 들어왔습니다. 보고서의 문장이 "뚜렷하게 높다"에서 "높은 경향이 있으나 차이는 확정적이지 않다"로 바뀌었습니다. 설계 반영은 결론의 강도를 조정하는 절차입니다.

마이크로데이터 이용 4단계

1단계는 질문을 변수 목록으로 바꾸는 것입니다. "청년 주거 부담"이 아니라 "연령, 가구원수, 점유형태, 월세액, 가구소득" 다섯 개 변수로 적습니다. 목록이 나오면 어떤 조사가 그 변수를 모두 가지고 있는지 검색할 수 있습니다.

2단계는 조사와 연도를 고르는 것입니다. 같은 주제를 다루는 조사가 여러 개 있으면 표본 규모와 공표 주기, 지역 세분화 수준을 비교합니다. 조사 간 수치가 다른 경우가 흔한데 이는 모집단 정의와 조사 방식이 다르기 때문입니다.

3단계는 자료를 받아 코드북 부터 읽는 것입니다. 변수명, 결측 코드, 범주 정의, 가중값 변수명이 여기 있습니다. 결측을 0으로 처리하면 평균이 무너지므로 결측 코드 확인이 먼저입니다.

4단계는 집계 후 검증하는 것입니다. 만든 결과를 공표된 집계표와 맞춰 봅니다. 전체 합계나 널리 알려진 비율 하나를 재현해 보면 가중값 처리와 변수 해석이 맞았는지 바로 드러납니다. 이 대조를 생략한 분석은 신뢰하기 어렵습니다.

추가로 하나를 덧붙이면, 결과 파일을 남기는 방식도 중요합니다. 원자료 집계는 코드 한 줄만 바뀌어도 숫자가 달라집니다. 저희는 집계 스크립트와 결과값, 공표치 대조 표를 한 폴더에 묶어 보관합니다. 몇 달 뒤 담당자가 바뀌어도 같은 숫자를 다시 만들 수 있어야 그 숫자를 근거로 쓸 수 있습니다.

자주 나오는 실수 다섯 가지

실수결과확인 방법
가중값 미적용규모 과소·비율 왜곡전체 합계를 공표치와 대조
결측 코드를 값으로 처리평균·합계 왜곡코드북의 결측 규칙 확인
연도별 변수명 변경 무시시계열 단절연도별 코드북 비교
설계 무시한 표준오차없는 차이를 유의하다고 판단층·집락 변수 선언
소표본 칸 해석과도한 일반화관측치 수와 상대표준오차 병기
  • 공표치와 재현 대조는 한 번에 끝나지 않습니다. 총계가 맞는데 하위 항목이 어긋나면 분류 기준이 다른 경우입니다.
  • 두 조사를 합칠 때는 가중값을 그대로 섞으면 안 됩니다. 모집단 정의가 같은지부터 확인해야 합니다.

마지막으로 공개 범위에 대한 오해를 하나 풀고 갑니다. 마이크로데이터는 개인정보 원본이 아닙니다. 이름과 주민등록번호 같은 식별 정보는 제거된 상태로 제공되고, 공개용 자료는 추가로 범주화와 상한 처리를 거칩니다. 그래서 특정 개인을 찾는 목적으로는 쓸 수 없고 집단의 분포를 보는 용도에 맞습니다. 이용 신청 시 서명하는 보안 서약도 재식별 시도를 금지하는 내용을 담고 있습니다.

FAQ

마이크로데이터 이용은 유료인가요? 공개용 자료는 무료로 제공됩니다. 원격접근서비스와 연구데이터센터 이용은 자료 범위와 이용 형태에 따라 신청 절차와 비용 기준이 따로 정해져 있습니다. 개인 이용자라면 대부분 공개용에서 시작하면 됩니다. 문의는 MDIS 콜센터(02-2012-9114)로 하시면 됩니다.
어떤 프로그램이 있어야 분석할 수 있나요? 파일 형식에 따라 다릅니다. CSV로 제공되는 자료는 스프레드시트로도 열 수 있지만 가중값 처리와 설계 반영을 하려면 통계 패키지가 필요합니다. 무료로 쓸 수 있는 R과 survey 패키지 조합이 가장 진입 장벽이 낮습니다. 파이썬을 쓰신다면 pandas로 가중집계까지는 어렵지 않게 처리됩니다.
공개용 자료는 왜 변수가 뭉개져 있나요? 개인 식별 위험을 줄이기 위한 조치입니다. 세부 지역 코드나 정밀한 소득 금액이 그대로 공개되면 몇 개 변수를 겹쳐 특정 가구를 지목할 수 있습니다. 그래서 범주를 묶고 상한을 씌웁니다. 더 상세한 변수가 필요하면 원격접근서비스나 센터 이용으로 올라가야 합니다.
KOSIS 수치와 제가 집계한 값이 다르면 무엇이 틀린 건가요? 먼저 세 가지를 확인하세요. 가중값을 적용했는지, 분석 대상의 정의가 공표 기준과 같은지, 연도와 조사 차수가 같은지입니다. 이 세 가지가 맞는데도 차이가 남으면 공표 시 적용된 보정이나 분류 기준 차이일 가능성이 큽니다. 자료 설명서의 공표 기준 항목을 보시면 대체로 원인이 나옵니다.
지역 단위 분석은 어디까지 가능한가요? 조사에 따라 다릅니다. 표본조사는 시도 단위까지 안정적이고 시군구로 내려가면 표본 수가 부족해지는 경우가 많습니다. 전수조사인 인구주택총조사 계열은 더 작은 단위까지 볼 수 있습니다. 시군구 분석이 꼭 필요하면 조사 선택 단계에서 표본 배분표를 확인하는 편이 안전합니다.

같이 읽으면 좋은 것들