본문 바로가기
회사소개 기술·연구 문의 무료 현장 진단
기술 이야기 목록
Computer Vision Object Detection

건설현장에서 ‘작은 것’을 본다는 것

Tiny Object Detection과 PTZ 자율관제

ONTOH Team 2026.06.26 약 9분 읽기
요약
01
광역 CCTV에서 멀리 있는 안전모·작업자는 수십 픽셀에 불과해, 일반 검출기로는 그냥 놓친다.
02
근본 원인은 모델이다. 다운샘플링을 거치며 작은 객체의 특징이 특징 맵에서 통째로 사라진다.
03
그래서 픽셀을 되찾는다. PTZ 줌으로 물리 해상도를 확보하는 2단계 파이프라인.

건설현장 안전관리에서 가장 흔한 오해는 “CCTV가 있으니 사고를 본다”는 것입니다. 현실은 다릅니다. 카메라는 현장을 넓게 봐야 하고, 넓게 볼수록 정작 봐야 할 대상 — 안전모를 쓰지 않은 작업자, 안전대를 걸지 않은 고소작업자 — 은 화면 속에서 아주 작아집니다. 이 글은 그 ‘작음’이라는 문제를 컴퓨터 비전 관점에서 풀어봅니다.

1. 50m 밖 안전모는 몇 픽셀인가

문제를 숫자로 만들어 봅시다. 1080p(1920×1080) 카메라가 수평 화각 약 60°로 폭 50m 구역을 비춘다고 하면, 가로 1px은 현장에서 약 2.6cm에 해당합니다. 작업자의 안전모 지름을 약 25cm로 잡으면 화면상 너비는 25 / 2.6 ≈ 9.6px. 높이까지 합쳐도 10×7px 남짓입니다.

COCO 데이터셋은 면적이 32×32px(=1024px²) 미만인 객체를 ‘small’로 정의합니다. 위의 안전모는 약 70px²로, 이 기준의 1/14에 불과한 tiny object입니다.

사람 눈에는 “저기 사람 있네” 싶어도, 검출 모델 입장에서 10픽셀짜리 헬멧은 텍스처도, 형태도 거의 남지 않은 흐릿한 색 덩어리입니다. 게다가 입력 이미지를 모델이 쓰는 크기(예: 640×640)로 리사이즈하면 이 객체는 다시 1/3로 줄어 3~4px이 됩니다.

사람 눈엔, 점.
광역 한 장에 흩어진 작업자들 — AI는 안전모를 하나씩 찾아낸다.돋보기를 끌어 몇 픽셀짜리 헬멧을 직접 확인해 보세요.
안전모 5건 검출
돋보기 드래그
그림 1. 광역 한 장에서 동시에 잡힌 안전모 5건 — 돋보기로 끌어 확대하면 몇 픽셀짜리 헬멧이 또렷해진다.

2. 왜 일반 검출기는 작은 객체에 약한가

YOLO·Faster R-CNN 같은 표준 검출기는 입력을 여러 단계의 다운샘플링(stride)으로 압축하며 특징을 뽑습니다. stride가 32라면, 입력에서 32×32px 영역이 특징 맵에서는 단 1px로 수축합니다. 즉 10px짜리 객체는 특징 맵에서 채 1픽셀도 차지하지 못하고 사라집니다.

이를 완화하려고 나온 것이 FPN(Feature Pyramid Network)입니다. 깊은 층의 의미 정보와 얕은 층의 고해상도 위치 정보를 결합해 여러 스케일을 동시에 보는 구조죠. 그래도 한계는 분명합니다.

  • 정보 자체가 없다: 애초에 픽셀이 몇 개 안 되면, 어떤 네트워크도 없는 디테일을 복원할 수 없습니다.
  • 앵커/라벨 정합 문제: 작은 박스는 IoU가 조금만 어긋나도 매칭에서 탈락해 학습 신호가 약합니다.
  • 배경 노이즈: 작은 객체일수록 주변 배경에 묻혀 오탐(false positive)이 늘어납니다.

3. PTZ 카메라 — 광역과 디테일의 맞교환

PTZ는 Pan(좌우 회전)·Tilt(상하 회전)·Zoom(확대)의 약자입니다. 한 대의 카메라가 시야를 물리적으로 옮기고 당겨, 광각 감시와 망원 확대를 모두 수행합니다.

PTZ는 2장의 근본 해법입니다. 픽셀이 부족하면, 렌즈로 직접 픽셀을 더 확보하면 됩니다. ×8로 줌인하면 9px이던 안전모가 70px이 넘는 또렷한 객체가 되고(그림 1), 검출은 평범한 문제로 돌아옵니다.

대신 대가가 있습니다. PTZ는 한 번에 한 곳만 봅니다. 줌인한 순간 나머지 현장은 사각지대가 됩니다. 그래서 진짜 어려운 문제는 검출이 아니라 “언제, 어디를 볼 것인가”라는 스케줄링이 됩니다.

  • 광역 상시 감시로 “수상한 영역”의 후보를 싸게 찾고,
  • 그 좌표로 PTZ를 자동 구동(프리셋·좌표 매핑)해 줌인 검증하고,
  • 여러 후보가 동시에 뜨면 위험도·우선순위로 순회 순서를 정합니다.

이 “자동으로 보던 곳을 옮겨 가며 검증하는” 흐름이 바로 ONTOH가 말하는 자율관제(autonomous monitoring)의 핵심입니다.

4. 픽셀이 부족할 때 쓰는 기법들

렌즈로 다 해결되지 않는 상황(고정 카메라 구간, 동시다발 이벤트)에서는 소프트웨어로 작은 객체를 살려야 합니다. 실무에서 효과가 큰 순서대로 정리하면:

4.1 멀티스케일 학습과 작은 앵커

학습 시 입력 해상도를 다양화하고, 작은 객체에 맞춘 앵커/라벨 할당 전략(예: 중심 기반 매칭)을 쓰면 tiny 영역의 재현율이 개선됩니다.

4.2 시간 정보 활용

한 프레임에서 3px인 객체도, 연속 프레임에서 움직임으로 드러납니다. 트래킹과 결합하면 단일 프레임에선 애매하던 검출을 시간축으로 확정할 수 있습니다.

광역 탐지 상시·저비용 후보 검출 PTZ 줌 검증 픽셀 확보 후 정밀 판정 위험 판정·알림 PPE 미착용·위험구역 진입
그림 2. LOOKAT의 2단계 파이프라인 — 싸게 찾고, 줌으로 확인하고, 위험만 알린다.

5. PPE 검출의 현실

작은 객체를 찾았다고 끝이 아닙니다. 안전관리의 본질은 “보호구를 제대로 착용했는가”를 판정하는 것이고, 여기서 또 다른 난관이 시작됩니다.

5.1 PPE는 종류가 많고 불균형하다

현장 PPE는 안전모, 안전대(추락방지 하네스), 안전화, 안전조끼, 보안경, 보호장갑 등으로 다양합니다. 그런데 “안전모 미착용” 같은 위반 장면은 정상 장면보다 훨씬 드물어, 데이터가 심한 클래스 불균형을 보입니다. 정작 잡아야 할 위반이 소수 클래스라는 점이 학습을 어렵게 만듭니다.

5.2 ‘쓴 것’과 ‘든 것’의 구분

안전모를 손에 들고 있는 작업자를 ‘착용’으로 오판하면 안전관리는 무력화됩니다. 단순히 “헬멧이 프레임에 있다”가 아니라, 사람의 머리 위치와 헬멧의 상대 위치를 함께 봐야 합니다. 그래서 PPE 검출은 사람 검출·자세 추정과 결합될 때 비로소 신뢰할 만해집니다.

5.3 가려짐과 시점

다른 작업자·자재에 가려지거나(occlusion), 카메라가 등 뒤에서 보는 각도에서는 보호구가 보이지 않습니다. 한 프레임의 ‘미검출’을 곧바로 ‘미착용’으로 단정하지 않고, 여러 프레임·여러 카메라의 근거를 모아 판단해야 오탐을 줄일 수 있습니다.

6. 정리 — ‘작음’을 다루는 시스템 설계

Tiny object detection은 더 좋은 모델 하나로 끝나는 문제가 아니라 시스템 설계의 문제입니다. 정리하면:

  • 픽셀을 확보하라: PTZ 줌으로 물리적 해상도를 확보한다.
  • 2단계로 나눠라: 광역에서 싸게 후보를 찾고, 줌으로 비싸게 검증한다.
  • 맥락을 결합하라: 사람·자세·시간 정보를 함께 봐야 PPE 착용 여부가 신뢰성을 얻는다.
  • 스케줄링이 본질이다: 한 대의 PTZ로 ‘언제 어디를 볼지’ 정하는 것이 검출 정확도만큼 중요하다.

LOOKAT은 이 원칙들을 하나의 자율관제 루프로 묶어, 사람이 모니터를 24시간 응시하지 않아도 현장의 ‘작은 위험’을 놓치지 않도록 설계되었습니다. 다음 글에서는 이 중 PPE 착용 판정을 더 깊이 다루겠습니다.

공유하기 링크 복사됨
블로그 목록으로

현장에 LOOKAT을 적용해 보고 싶다면

자율관제 도입 상담을 도와드립니다.

도입 문의