레이블이 라벨링인 게시물을 표시합니다. 모든 게시물 표시
레이블이 라벨링인 게시물을 표시합니다. 모든 게시물 표시

2026-09-24

공간 AI의 학습 데이터는 어떻게 만드나 | 라벨링과 품질 | GeoAI 기초 9편

📌 3줄 요약

  • 위성·드론 영상 라벨링에는 점·폴리곤·마스크 세 방식이 있고 목적에 따라 선택한다.
  • 클래스 불균형과 특정 지역 편향은 모델 성능을 조용히 무너뜨리는 주요 원인이다.
  • 좋은 학습 데이터는 양보다 일관성과 다양성, 그리고 명확한 라벨 기준에서 나온다.

홍수 피해 건물을 자동으로 탐지하는 AI 모델을 만들었는데, 실제 재난 현장에서 돌려보니 엉뚱한 곳을 피해 건물로 잡아내거나 명백한 침수 지역을 그냥 지나치는 일이 생깁니다. 알고리즘 문제일까요? 꼭 그렇지는 않습니다. 모델을 훈련할 때 쓴 데이터 자체에 문제가 있었을 가능성이 높습니다.

공간 AI 모델은 사람이 직접 정답을 표시해 준 영상, 즉 라벨링된 데이터를 보고 패턴을 익힙니다. 라벨이 부정확하거나, 특정 상황만 잔뜩 포함되어 있거나, 한 지역 데이터만 쓰였다면 모델은 그 편향을 그대로 배웁니다. 이번 글에서는 위성·드론 영상에 라벨을 붙이는 방법, 데이터가 가질 수 있는 구조적 문제, 그리고 실무에서 쓸 만한 데이터셋이 갖춰야 할 조건을 하나씩 짚어 보겠습니다.

🗺️ 라벨링 방식은 왜 세 가지나 되나요?

라벨링이란 AI 모델이 '무엇이 무엇인지' 배울 수 있도록 영상 위에 정답 표시를 남기는 작업입니다. 위성·드론 영상에서는 크게 점(Point), 폴리곤(Polygon), 픽셀 마스크(Pixel Mask) 세 가지 방식을 씁니다.

점 라벨링은 건물 중심이나 나무 위치처럼 '이 근처에 무언가 있다'는 위치 정보만 기록합니다. 빠르게 작업할 수 있지만 크기나 경계는 알 수 없습니다. 폴리곤 라벨링은 건물 외곽선을 직접 따라 그려 면적과 형태 정보를 남깁니다. 픽셀 마스크(시맨틱 세그멘테이션용 라벨로, 영상의 픽셀 하나하나에 클래스 번호를 부여하는 방식)는 가장 정밀하지만 작업 시간도 가장 많이 걸립니다. 산사태 피해 범위나 홍수 침수 면적처럼 경계가 불규칙한 대상은 픽셀 마스크로 라벨링해야 모델이 실제 형태를 제대로 학습합니다.

🏗️ 폴리곤을 그릴 때 어디까지 따라야 올바른 라벨인가요?

라벨링 도구(QGIS, CVAT, Label Studio 등)를 열면 영상 위에 직접 폴리곤을 그릴 수 있습니다. 문제는 '얼마나 꼼꼼하게 따야 하는가'입니다. 건물 라벨이라면 처마 끝까지 포함할지, 그림자를 제외할지처럼 세부 기준이 없으면 작업자마다 결과가 달라집니다. 이것이 바로 '해봐야 아는 것'입니다. 같은 영상을 두 사람에게 라벨링시킨 뒤 두 결과물을 겹쳐 보면 일치율(IoU, Intersection over Union — 두 영역이 겹치는 넓이를 합친 넓이로 나눈 값)을 수치로 확인할 수 있습니다. IoU가 0.7에 못 미친다면 라벨 기준 문서가 더 구체적이어야 한다는 신호입니다. 재난 대응에서는 같은 건물을 '피해'로 볼지 '심각 피해'로 볼지 기준이 흔들리면 모델이 두 클래스를 구분하지 못하게 됩니다.

⚖️ 클래스 불균형이 모델을 어떻게 망가뜨리나요?

재난 영상에는 피해를 입은 건물보다 정상 건물이 압도적으로 많습니다. 예를 들어 피해 건물이 전체의 5%뿐이라면, 모델이 모든 건물을 '정상'으로 분류해도 정확도는 95%가 나옵니다. 숫자만 보면 훌륭해 보이지만 실제로는 피해 건물을 하나도 탐지하지 못한 것입니다.

이를 클래스 불균형 문제라고 합니다. 해결 방법은 여러 가지입니다. 소수 클래스 샘플을 인위적으로 늘리는 오버샘플링, 손실 함수에 가중치를 달리 주는 방식(Focal Loss 등), 또는 피해 사례를 더 많이 수집하는 원천적 접근이 있습니다. 홍수·산불 피해 탐지 모델을 만들 때 재현율(Recall — 실제 피해 중 모델이 맞춘 비율)을 정밀도(Precision)만큼 반드시 점검해야 하는 이유가 여기에 있습니다.

🌏 지역 편향이란 무엇이고 왜 생기나요?

학습 데이터가 특정 나라나 기후대의 영상에만 쏠려 있으면 모델은 그 지역의 시각적 특성에 최적화됩니다. 예를 들어 유럽 도시의 건물 영상으로만 학습한 모델은 한국의 붉은 지붕 단독주택이나 동남아시아의 판자촌을 제대로 분류하지 못할 수 있습니다. 이것이 지역 편향입니다.

계절과 식생도 같은 문제를 만듭니다. 여름 녹음이 우거진 영상으로만 학습했다면, 겨울 낙엽 상태의 같은 지역에서 모델 성능이 크게 떨어집니다. 국내 재난 대응 모델을 만들 때 해외 공개 데이터셋을 그대로 쓰면 안 되는 핵심 이유가 여기 있습니다. 국내 다양한 지형과 계절을 반영한 데이터를 별도로 수집하거나 파인튜닝(기존 모델을 새 데이터로 추가 학습하는 과정)을 거쳐야 합니다.

✅ 좋은 학습 데이터셋은 어떤 조건을 갖춰야 하나요?

좋은 데이터셋은 세 가지 조건을 충족합니다. 첫째, 라벨 기준이 문서화되어 있어야 합니다. '침수 건물'의 정의, 라벨 경계 처리 방법, 애매한 케이스 판단 예시가 기록으로 남아 있어야 다른 사람도 일관되게 작업할 수 있습니다. 둘째, 클래스와 지역·계절이 고루 분포해야 합니다. 숫자만 많은 것은 의미가 없고, 모델이 마주칠 실제 환경을 다양하게 포함해야 합니다. 셋째, 검수 이력이 있어야 합니다. 라벨링 담당자 외에 검수자가 따로 있고, 수정 내역이 버전으로 관리되면 신뢰도가 높아집니다. 재난 분야에서는 현장 전문가(소방, 토목, 기상 등)와 라벨러가 협력해 기준을 잡는 것이 데이터 품질을 높이는 가장 현실적인 방법입니다.

🖥️ 화면에서 따라하기

  1. QGIS 설치 확인
    QGIS 공식 사이트(qgis.org)에서 버전에 맞는 설치 파일을 받아 설치한다. 메뉴 이름은 버전마다 다를 수 있으므로 공식 문서를 함께 열어 둔다.
  2. 영상 불러오기
    레이어 > 레이어 추가 > 래스터 레이어 를 클릭해 드론·위성 영상 파일(GeoTIFF 등)을 선택하고 추가 를 누른다.
  3. 라벨 레이어 생성
    레이어 > 레이어 생성 > 새 GeoPackage 레이어 에서 도형 유형을 폴리곤 으로 선택, 클래스명 필드(텍스트)를 추가하고 확인 을 누른다.
  4. 폴리곤 그리기
    편집 > 편집 모드 켜기 후 디지타이징 도구모음에서 폴리곤 피처 추가 를 클릭, 건물 외곽을 클릭해 따라 그린 뒤 오른쪽 클릭 > 완료 로 저장한다.
  5. 라벨 일치율 확인
    두 사람이 동일 영역을 각각 라벨링한 뒤, 벡터 > 지오프로세싱 도구 > 교차(Intersection) 로 겹치는 면적을 계산해 IoU를 수동으로 확인한다.
  6. 저장 및 내보내기
    레이어 오른쪽 클릭 > 내보내기 > 피처를 다른 이름으로 저장 에서 형식을 GeoJSON 또는 Shapefile 로 선택하고 내보내기 를 완료한다.

※ 프로그램 버전에 따라 메뉴 이름이 조금씩 다를 수 있습니다.

✍️ 그대로 복사해 쓰는 프롬프트

위성·드론 영상 라벨링 기준 문서 초안을 빠르게 만들 때

당신은 공간정보 데이터 품질 전문가입니다.
아래 조건에 맞는 위성·드론 영상 라벨링 기준 문서 초안을 작성해 주세요.

[대상 재난 유형]: (예: 홍수 침수 건물 탐지)
[영상 해상도 및 종류]: (예: 해상도 0.5m 광학 위성영상)
[라벨링 방식]: (예: 폴리곤 라벨링)
[클래스 목록]: (예: 정상 건물, 부분 침수, 완전 침수, 불명확)

문서에는 다음 항목을 반드시 포함하세요.
1. 각 클래스의 정의와 판별 기준(시각적 특징 포함)
2. 경계가 애매할 때의 처리 원칙(예: 건물 처마, 그림자, 식생 겹침)
3. 작업자 간 일치율(IoU) 목표 수치와 검수 절차
4. 자주 발생하는 오류 유형 3가지와 예방 지침

확인되지 않은 수치나 특정 도구의 현재 기능을 단정하지 마세요.
결과는 실무자가 바로 편집할 수 있도록 표 형식과 번호 목록을 섞어 작성하세요.
생성된 문서는 현장 전문가와 함께 반드시 검토하고 수정해야 합니다.

데이터셋의 클래스 불균형 현황을 파악하고 대응 방안을 정리할 때

당신은 머신러닝 데이터 품질을 검토하는 전문가입니다.
아래 데이터셋 정보를 바탕으로 클래스 불균형 문제와 대응 방안을 분석해 주세요.

[클래스별 샘플 수]: (예: 정상 건물 8,000개 / 피해 건물 400개)
[학습 목적]: (예: 산사태 피해 건물 탐지)
[사용 예정 모델 유형]: (예: 이미지 세그멘테이션 모델)

분석에는 다음을 포함하세요.
1. 불균형 비율 계산과 위험 수준 판단
2. 권장 대응 방법 2~3가지와 각각의 장단점
3. 모델 평가 시 정밀도(Precision), 재현율(Recall), F1 중 우선해야 할 지표와 이유
4. 이 데이터셋으로 학습할 때 주의해야 할 점

특정 라이브러리 버전이나 현재 성능을 단정하는 표현은 쓰지 마세요.
결과는 비전공자 실무자도 이해할 수 있도록 쉬운 말로 설명하고, 생성 결과는 반드시 담당자가 검토 후 적용하세요.

※ 대괄호 부분을 상황에 맞게 바꿔서 쓰세요. 받은 답은 그대로 쓰지 말고 사실 확인을 거치세요.

🧪 직접 해보기

  • QGIS에 공개 드론 영상(국토지리정보원 등에서 제공하는 공개 정사영상)을 불러온 뒤, 건물 하나를 직접 폴리곤으로 따라 그려 라벨링이 얼마나 주관적인지 체감해 본다.
  • 같은 영상 구역을 동료나 지인과 각각 독립적으로 라벨링한 뒤 두 결과물을 QGIS에서 겹쳐 보고, 어느 부분에서 경계가 다르게 나왔는지 확인해 본다.
  • 공개된 위성영상 라벨링 데이터셋(예: 재난 대응 관련 국제 공모전에서 공개된 데이터셋)을 내려받아 클래스별 샘플 수를 세어 보고, 불균형 여부를 직접 판단해 본다.

❓ 자주 묻는 질문

Q. 라벨링 작업을 AI가 자동으로 해줄 수는 없나요?
A. 반자동 라벨링 도구를 활용하면 초안을 빠르게 만들 수 있습니다. 하지만 재난 영상처럼 정확도가 중요한 경우, 자동 생성된 라벨을 사람이 반드시 검수하고 수정해야 합니다. 자동화는 작업 속도를 높이는 보조 수단이지, 품질을 보장하지는 않습니다.

Q. 라벨링 작업자는 GIS 전문가여야 하나요?
A. 반드시 그렇지는 않습니다. 도구 사용법은 비교적 짧은 교육으로 익힐 수 있지만, 어떤 대상을 어떤 기준으로 분류할지 판단하는 데는 재난 분야 현장 지식이 필요합니다. 라벨링 기준 문서를 만들 때 현장 전문가가 참여하는 것이 중요한 이유입니다.

Q. 오픈소스 라벨링 도구로는 무엇이 있나요?
A. CVAT, Label Studio, QGIS의 디지타이징 기능 등이 널리 쓰입니다. 각 도구의 기능과 지원 형식은 버전마다 다르고 지속적으로 변하므로, 사용 전에 공식 문서에서 최신 정보를 확인하는 것이 좋습니다.

공간 AI의 성능은 결국 학습 데이터의 품질에서 시작됩니다. 아무리 정교한 모델 구조를 갖춰도, 라벨이 제각각이거나 특정 지역·상황에 편향된 데이터로 학습했다면 실제 재난 현장에서 믿고 쓰기 어렵습니다. 라벨링 기준 문서를 만들고, 두 작업자의 결과를 비교하고, 클래스별 샘플 수를 세어 보는 일이 번거로워 보여도 이 과정이 모델의 신뢰도를 결정합니다. 데이터가 마련되었다면 이제 실제로 모델을 어떻게 학습시키는지, 그 구체적인 흐름이 궁금해지지 않으시나요?

GeoAI 기초 시리즈 9편 · 전체 43편


재난안전과 GeoAI 이야기를 더 보고 싶다면 아래 채널도 함께 보세요.

📌 바로가기

GeoAI 위성·드론 영상 분석, 재난대응 산업이 뜬다 | 재난안전과 GeoAI

GeoAI 위성·드론 영상 분석 기술이 재난대응 산업의 중심으로 떠오르고 있다. 누리호 5차 발사, 위성·드론 영상 분석 스타트업, ArcGIS 경사지 위험 분석 서비스까지 오늘의 관련 소식을 정리했다. 📌 3줄 요약 아크넥사는 위성·드론 영상을...