레이블이 공간통계인 게시물을 표시합니다. 모든 게시물 표시
레이블이 공간통계인 게시물을 표시합니다. 모든 게시물 표시

2026-10-04

공간 자기상관과 핫스팟 분석 | 가까운 것은 닮는다 | GeoAI 기초 18편

공간 자기상관과 핫스팟 분석 | 가까운 것은 닮는다 | GeoAI 기초 18편

🎬 1분 브리핑 영상

공간 자기상관과 핫스팟 분석은 사고나 재난이 특정 지역에 몰려 발생하는지, 그저 우연인지를 숫자로 구분하는 방법을 알려준다.

📌 3줄 요약

  • 토블러의 법칙, 가까운 곳은 멀리보다 서로 닮는다는 원리
  • Moran's I로 공간 패턴이 우연인지 군집인지 확인한다
  • Getis-Ord 핫스팟으로 사고·재난 집중 지역을 찾아낸다

어느 지역의 교통사고 지도를 펼쳐 놓고 보면, 사고가 유독 몰려 있는 구간이 눈에 띕니다. 이걸 보고 누군가는 "여기가 위험한 곳이네"라고 말하지만, 또 누군가는 "우연히 점이 몰려 보이는 것뿐"이라고 반박할 수 있습니다. 둘 다 그럴듯해 보이는 게 문제입니다. 사람 눈은 무작위로 흩어진 점에서도 괜히 패턴을 찾아내는 버릇이 있거든요. 이럴 때 필요한 게 공간 통계입니다. 어떤 지역이 진짜로 주변과 다르게 사고나 재난이 몰리는지, 아니면 그냥 점이 듬성듬성 찍히다 보니 그렇게 보이는 건지를 통계적으로 검증하는 도구가 바로 공간 자기상관과 핫스팟 분석입니다.

color-coded density map
자료사진 · 사진: lucasgeorgewendt / Pixabay

🗺️ 토블러의 제1법칙이 뭔가요?

지리학자 월도 토블러는 "모든 것은 다른 모든 것과 관련 있지만, 가까운 것이 먼 것보다 더 관련 있다"고 했습니다. 이걸 토블러의 제1법칙이라고 부릅니다. 쉽게 말하면 옆집과 우리 집은 날씨도 비슷하고 집값도 비슷할 가능성이 높지만, 다른 나라에 있는 집과는 그렇지 않다는 뜻입니다. 이 법칙은 너무 당연해 보이지만, 공간 데이터를 다루는 모든 통계의 전제가 됩니다. 일반 통계는 데이터가 서로 독립적이라고 가정하는데, 공간 데이터는 이웃끼리 닮아 있어서 그 가정이 깨지기 때문입니다. 재난 데이터도 마찬가지입니다. 산사태가 난 지점 옆 사면은 지질이나 경사가 비슷해서 산사태 위험도 비슷하게 나타나는 경우가 많습니다. 이런 이웃 효과를 무시하고 지점 하나하나를 독립된 사건으로만 보면, 왜 피해가 특정 골짜기에 몰렸는지 설명하기 어려워집니다.

📊 Moran's I는 뭘 알려주나요?

Moran's I는 공간 자기상관을 숫자 하나로 요약한 지표입니다. 값은 보통 -1에서 1 사이로 나오는데, 1에 가까우면 비슷한 값끼리 뭉쳐 있다는 뜻이고(군집), -1에 가까우면 비슷한 값끼리 멀리 떨어져 체스판처럼 번갈아 나타난다는 뜻이고(분산), 0에 가까우면 무작위에 가깝다는 뜻입니다. 중요한 건 이 값 자체보다 "이 패턴이 우연히 나올 확률은 얼마나 되는가"를 같이 봐야 한다는 점입니다. 보통 p-value(우연히 이런 결과가 나올 확률)라는 수치를 같이 확인해서, 이 값이 충분히 작아야 "진짜 패턴이 있다"고 말할 수 있습니다. 예를 들어 홍수 피해 신고가 들어온 지역의 Moran's I를 구했는데 값이 높고 p-value도 작다면, 피해가 특정 저지대에 몰려 있다는 걸 통계적으로 뒷받침할 수 있습니다. 반대로 값이 낮으면 피해가 지역 전체에 고르게 흩어져 있다는 뜻이니, 배수 시설 같은 국지적 원인보다 전반적인 강우량을 먼저 의심해봐야 합니다.

🔥 핫스팟(Getis-Ord)은 뭐가 다른가요?

Moran's I가 "전체적으로 패턴이 있는가"를 하나의 숫자로 말해준다면, Getis-Ord Gi*(지스타)는 "그럼 구체적으로 어디가 뜨거운 곳(핫스팟)이고 어디가 차가운 곳(콜드스팟)인가"를 지점마다 짚어줍니다. 각 지점과 그 주변 이웃들의 값을 비교해서, 주변 전체보다 유의미하게 높은 값이 몰린 곳을 핫스팟으로, 유의미하게 낮은 값이 몰린 곳을 콜드스팟으로 표시합니다. 결과는 보통 신뢰도에 따라 90%, 95%, 99% 구간으로 나눠 지도에 색을 입혀 보여줍니다. 산불 발생 이력 데이터에 이 분석을 돌리면, 단순히 점이 많은 곳이 아니라 통계적으로 유의미하게 발화가 집중된 구역을 짚어낼 수 있습니다. 이렇게 뽑힌 핫스팟은 예방 순찰 경로나 감시 카메라 배치 우선순위를 정하는 근거 자료로 쓰이곤 합니다.

🚗 사고 데이터에 어떻게 적용하나요?

교통사고나 응급 신고처럼 점 형태로 쌓인 데이터는 핫스팟 분석과 궁합이 좋습니다. 다만 주의할 점이 있는데, 점 데이터를 그대로 쓰기보다 격자(일정 크기의 네모 칸)나 행정구역 단위로 집계한 다음 분석하는 경우가 많습니다. 점 하나하나의 위치 오차나 우연한 쏠림을 줄이기 위해서입니다. 또 하나 중요한 건 이웃을 어떻게 정의하느냐에 따라 결과가 달라진다는 점입니다. 거리 기준으로 500미터 안을 이웃으로 볼지, 인접한 행정구역만 이웃으로 볼지에 따라 핫스팟의 모양과 범위가 바뀝니다. 그래서 이 기준값은 정답이 정해져 있다기보다 해봐야 아는 것에 가깝습니다. 여러 거리값으로 반복해서 돌려보고, 결과가 크게 흔들리지 않는 안정적인 구간을 찾는 과정이 필요합니다. 이런 식으로 찾아낸 사고 핫스팟은 교통안전시설 개선이나 대피소 접근로 점검 같은 실제 조치의 우선순위를 정하는 데 쓰입니다.

⚠️ 핫스팟 분석, 이것만은 주의하세요

핫스팟 분석은 "어디가 위험한가"를 보여주지, "왜 위험한가"는 말해주지 않습니다. 원인 분석은 별개의 작업입니다. 또 데이터가 적은 지역은 우연히 몇 건만 몰려도 핫스팟처럼 보일 수 있어서, 표본 수가 충분한지 꼭 확인해야 합니다. 행정구역 경계를 바꾸면 결과도 달라지는 현상(가변 공간단위 문제라고 부릅니다)도 알아두면 좋습니다. 분석 단위를 읍면동으로 하느냐 1km 격자로 하느냐에 따라 핫스팟 모양이 달라질 수 있다는 뜻입니다. 재난 대응 현장에서는 이 분석 결과를 유일한 근거로 쓰기보다, 현장 조사나 다른 통계와 함께 교차 확인하는 보조 도구로 쓰는 게 안전합니다.

🖥️ 화면에서 따라하기

따라하기 단계

  1. 데이터 준비
    사고·재난 지점의 위도경도가 담긴 표(csv)나 포인트 레이어를 준비한다
  2. QGIS 설치 확인
    QGIS 실행 후 플러그인 메뉴에서 공간 통계 관련 도구 설치 여부를 본다(버전마다 위치가 다를 수 있다)
  3. 레이어 불러오기
    레이어 > 레이어 추가 > 벡터 레이어에서 csv나 shp 파일을 불러온다
  4. 공간 가중치 설정
    처리 도구상자에서 '거리 기반 가중치' 혹은 '인접 기반 가중치' 도구를 검색해 실행한다
  5. Moran's I 실행
    처리 도구상자에서 'Moran's I' 또는 '공간 자기상관' 검색 후 대상 필드를 지정해 실행한다
  6. 결과 확인
    출력된 Moran's I 값과 p-value를 로그 패널에서 확인하고 지도에 색상으로 표시해본다

※ 프로그램 버전에 따라 메뉴 이름이 조금씩 다를 수 있습니다. 위 그림은 순서를 정리한 도식입니다.

✍️ 그대로 복사해 쓰는 프롬프트

공간 자기상관 분석 결과를 보고서 문장으로 풀어쓰기

역할은 공간통계를 쉽게 설명하는 GIS 분석가다
아래 분석 결과를 바탕으로 비전문가도 이해할 수 있는 2~3문단 요약을 작성해줘
분석 대상은 [분석 대상, 예: 2024년 교통사고 발생 지점]이고
Moran's I 값은 [수치], p-value는 [수치]이다
핫스팟으로 분류된 지역은 [지역명 목록]이다
통계 용어는 괄호 안에 쉬운 설명을 덧붙이고
확인되지 않은 원인은 추측하지 말고 "추가 조사가 필요하다"고만 표현해줘
결과는 보고서 서론에 들어갈 문단 형식으로 작성해줘

※ 대괄호 부분을 상황에 맞게 바꿔서 쓰세요. 받은 답은 그대로 쓰지 말고 사실 확인을 거치세요.

🧪 직접 해보기

  • QGIS나 공개 GIS 도구에서 자기 지역 사고 데이터를 불러와 지도에 점으로 찍어본다
  • 같은 데이터로 격자 크기를 다르게(500m, 1km) 해서 핫스팟 결과가 어떻게 달라지는지 비교해본다
  • 뉴스나 공공데이터포털에서 받은 재난 신고 통계로 Moran's I를 직접 계산해보고 p-value를 확인한다

❓ 자주 묻는 질문

Q. Moran's I 값이 높으면 무조건 위험 지역인가요?
A. 아닙니다. 값이 높다는 건 비슷한 값끼리 뭉쳐 있다는 뜻일 뿐이고, 그 값 자체가 낮은 수준에서 뭉쳐 있을 수도 있습니다. 반드시 원래 데이터의 크기와 함께 해석해야 합니다.

Q. 핫스팟 분석과 그냥 지도에 점 많은 곳 찾는 것의 차이는 뭔가요?
A. 점이 많아 보여도 전체 데이터 양이 많으면 우연히 그럴 수 있습니다. 핫스팟 분석은 주변과 비교해 통계적으로 유의미하게 쏠렸는지를 검증한다는 점이 다릅니다.

Q. 이 분석에 필요한 최소 데이터 양이 있나요?
A. 정해진 기준은 없지만 표본이 너무 적으면 결과가 불안정해집니다. 여러 기간이나 단위를 바꿔가며 결과가 일관되게 나오는지 직접 확인해보는 게 안전합니다.

가까운 곳은 서로 닮는다는 단순한 생각이 공간 통계의 출발점이 되고, 그 생각을 숫자로 검증하는 순간 지도 위의 느낌은 근거 있는 판단으로 바뀝니다. 다음 편에서는 이렇게 찾아낸 핫스팟을 시간 축까지 더해 "언제, 어디서" 위험이 반복되는지 살펴보는 시공간 분석을 다뤄보겠습니다.

GeoAI 기초 시리즈 18편 · 전체 43편


재난안전과 GeoAI 이야기를 더 보고 싶다면 아래 채널도 함께 보세요.

📌 바로가기

GeoAI 위성·드론 영상 분석, 재난대응 산업이 뜬다 | 재난안전과 GeoAI

GeoAI 위성·드론 영상 분석 기술이 재난대응 산업의 중심으로 떠오르고 있다. 누리호 5차 발사, 위성·드론 영상 분석 스타트업, ArcGIS 경사지 위험 분석 서비스까지 오늘의 관련 소식을 정리했다. 📌 3줄 요약 아크넥사는 위성·드론 영상을...