---
title: "[논문 AI 리뷰] SAM 3: SEGMENT ANYTHING WITH CONCEPTS"
description: "SAM 3은 짧은 명사구나 이미지 예시만으로 이미지와 비디오 전반에 걸쳐 특정 개념에 해당하는 모든 객체를 검출·분할·추적하는 새로운 Promptable Concept Segmentation 작업을 정의하고, 4 백만 개념·5 천2백만 마스크를 포함한 대규모 SA‑Co 데이터셋과 presence 토큰을 도입한 혁신적 아키텍처를 제안해 기존 대비 2배 이상 성능 향상을 달성했으며, LVIS와 SA‑Co 등 주요 벤치마크에서 새로운 SOTA를 기록했다. 다만 복잡한 언어 표현 처리와 비디오 객체 수 증가에 따른 실시간 처리 한계가 남아 있어 추가 연구가 필요하다."
date: "2025-11-15T16:00:00.000+09:00"
last_modified: "2026-05-15T08:36:00.000Z"
type: "Paper"
tags:
  - "Computer Vision"
  - "deep learning"
  - "transformer"
categories:
  - "AI논문리뷰"
series:
  - "AI 논문 리뷰"
canonical_url: "https://blog.pieroot.xyz/sam3-segment-anything"
markdown_url: "https://blog.pieroot.xyz/sam3-segment-anything.md"
---

# \[논문 AI 리뷰\] SAM 3: SEGMENT ANYTHING WITH CONCEPTS

SAM 3은 짧은 명사구나 이미지 예시만으로 이미지와 비디오 전반에 걸쳐 특정 개념에 해당하는 모든 객체를 검출·분할·추적하는 새로운 Promptable Concept Segmentation 작업을 정의하고, 4 백만 개념·5 천2백만 마스크를 포함한 대규모 SA‑Co 데이터셋과 presence 토큰을 도입한 혁신적 아키텍처를 제안해 기존 대비 2배 이상 성능 향상을 달성했으며, LVIS와 SA‑Co 등 주요 벤치마크에서 새로운 SOTA를 기록했다. 다만 복잡한 언어 표현 처리와 비디오 객체 수 증가에 따른 실시간 처리 한계가 남아 있어 추가 연구가 필요하다.

**한문장 요약**  

이 논문은 개념 기반 프롬프트로 이미지와 비디오에서 모든 객체 인스턴스를 검출·분할·추적하는 새로운 작업(Promptable Concept Segmentation)을 정의하고, 이를 위한 대규모 데이터셋(SA-Co)과 혁신적인 모델 아키텍처(SAM 3)를 제안하여 기존 대비 2배 이상의 성능 향상을 달성했으므로, 컴퓨터비전 및 멀티모달 AI 연구자라면 반드시 읽어야 할 중요한 연구입니다.

#### 1. Main Contributions

- **새로운 작업 정의**: 짧은 명사구(noun phrase), 이미지 예시, 또는 이들의 조합으로 시각적 개념을 지정하면 해당 개념과 일치하는 모든 객체 인스턴스의 분할 마스크와 고유 식별자를 반환하는 \*Promptable Concept Segmentation(PCS)\* 작업을 체계적으로 정식화했습니다.

- **대규모 고품질 데이터셋**: 4M 개의 고유 개념 레이블과 52M 개의 마스크를 포함하는 \*SA-Co\* 데이터셋을 구축했으며, 이는 기존 오픈-보커불러리 분할 데이터셋 대비 50배 이상 많은 개념을 포괄합니다.

- **혁신적 모델 아키텍처**: 인식과 위치 추정을 분리하는 \*presence token\*을 도입한 SAM 3 모델을 설계하여, 복잡한 개념의 존재 여부와 개별 객체 위치를 효율적으로 처리합니다.

- **확장 가능한 데이터 엔진**: AI 검증기(MLLM 기반)를 활용해 마스크 품질과 완전성을 자동 검증하여 인간 주석 대비 2배 이상의 처리량을 달성했습니다.

- **SOTA 성능 달성**: LVIS 벤치마크에서 제로-샷 마스크 AP 47.0을 기록하며 기존 최고 성능(38.5)을 크게 웃돌고, SA-Co 벤치모크에서 최소 2배 이상의 성능 향상을 보입니다.

#### 2. Key Methods and Approach

- **아키텍처 개요**: Perception Encoder(PE)라는 공유 비전 백본을 기반으로, 이미지 수준 검출기(DETR 스타일)와 메모리 기반 비디오 추적기(SAM 2 스타일)로 구성된 듀얼 인코더-디코더 트랜스포머 구조를 사용합니다.

- **Presence Token**: 전역 컨텍스트에서 개념 존재 확률 $p(\text{NP is present})$를 예측하는 학습 가능한 토큰을 도입하여, 각 객체 쿼리가 인식 대신 위치 추정에 집중하도록 합니다. 최종 객체 점수는 $p(\text{query}_i \text{ matches} \mid \text{NP present}) \times p(\text{NP present})$로 계산됩니다.

- **데이터 엔진 파이프라인**: 1) 메타데이터 큐레이션, 2) Llama 기반 명사구 생성 및 하드 네거티브 샘플링, 3) AI 검증기(MV/EV)를 통한 자동 품질 검증, 4) 인간 보정 단계로 구성된 4단계 반복적 주석 프로세스를 설계했습니다.

- **4단계 학습 전략**: 1) PE 프리트레이닝(54억 이미지-텍스트 쌍), 2) 대규모 개념 커버리지를 위한 검출기 프리트레이닝, 3) 인터랙티브 학습 및 presence 최적화, 4) 고정 백본 위 추적기 전용 트레이닝으로 점진적 능력 향상을 구현했습니다.

#### 3. Main Results and Findings

- **이미지 PCS**: LVIS에서 제로-샷 마스크 AP 47.0으로 DINO-X(38.5) 대비 22% 향상. SA-Co/Gold 벤치마크에서 CGF1 52.8로 OWLv2⋆(45.7) 대비 15% 개선. 인간 성능 하한선(74.2) 대비 71% 수준 달성.

- **비디오 PCS**: SA-Co/VEval에서 CGF1 27.8, pHOTA 53.9로 LLMDet+SAM 3 Tracker(3.6, 31.2) 대비 7배 이상 향상. 인간 성능 대비 약 50% 수준.

- **퓨-샷 적응**: ODinW13에서 10-shot 박스 AP 71.6으로 Grounding DINO(67.9) 대비 5% 향상. Roboflow100-VL에서 10-shot AP 35.7으로 Gemini(9.8) 대비 3.6배 개선.

- **객체 카운팅**: CountBench에서 MAE 0.11, 정확도 95.6%로 Gemini 2.5 Pro(0.24, 92.4%) 대비 오차 54% 감소.

- **추론 분할**: ReasonSeg 벤치마크에서 제로-샷 gIoU 76.0으로 RSVP(64.7) 대비 17% 향상.

- **효율성**: H200 GPU에서 100+ 객체가 포함된 단일 이미지 처리에 30ms 소요. 비디오의 경우 객체 수에 선형적으로 확장되며, 약 5개 동시 객체에 대해 실시간(30 FPS) 처리 가능.

#### 4. Limitations and Open Questions

- **명사구 복잡성 제한**: "작은 빨간 사과"와 같은 1-2개 속성을 넘는 복잡한 참조 표현이나 "선물 상자를 들고 있지 않은 앉아 있는 사람"과 같은 다단계 추론을 요구하는 쿼리는 MLLM과 결합하지 않으면 처리가 불가능합니다.

- **비디오 처리 확장성**: 각 객체를 위한 별도 메모리 뱅크를 유지하는 설계로, 객체 수가 증가할 때 추론 지연이 선형적으로 증가하여 혼잡한 장면(수십 개 객체)에서는 실시간 처리가 어렵습니다.

- **개념-인스턴스 상호작용 모호성**: 개념 수준 프롬프트(모든 "고양이" 분할)와 인스턴스 수준 프롬프트(특정 고양이만 수정)를 동시에 처리할 때 "모드 스위치"가 필요하며, 보다 원활한 통합이 요구됩니다.

- **제로-샷 도메인 일반화**: 미세한 의학 이미지나 드론 영상과 같은 틈새 도메인에 대해서는 제로-샷 성능이 제한적이며, 도메인 특화 합성 데이터 생성(§B.3)에 의존해야 합니다.

#### 5. Professional TL;DR (Overall Summary)

SAM 3는 단순 명사구나 이미지 예시만으로 이미지와 비디오 전체에 걸쳐 특정 개념의 모든 객체 인스턴스를 검출·분할·추적할 수 있는 새로운 프롬프트 가능 개념 분할 작업을 정의하고, 이를 위해 4M 개의 고유 개념과 52M 개의 마스크로 구성된 SA-Co 데이터셋을 구축했습니다. 인식과 위치 추정을 분리하는 presence 토큰을 도입한 혁신적 아키텍처와 AI 검증기를 통합한 확장 가능한 데이터 엔진을 통해, 기존 시스템 대비 2배 이상의 성능 향상을 달성하며 LVIS, SA-Co 등 주요 벤치마크에서 새로운 SOTA를 제시합니다. 다만 복잡한 참조 표현 처리와 비디오 객체 수 증가에 따른 실시간 처리 한계 등의 과제가 남아 있으나, 멀티모달 AI, 로보틱스, AR 등 다양한 응용 분야의 중요한 이정표가 될 것입니다.

#### 6. Critical Evaluation

**문제 정의의 명확성**: PCS 작업을 "짧은 명사구나 이미지 예시로 시각적 개념을 지정하면 모든 인스턴스를 분할"이라는 명확한 형식으로 정의하고, 다중 해석 가능성, 주관적 기술어, 경계 모호성 등 내재적 모호성을 체계적으로 다루기 위한 평가 프로토콜(oracle matching, 3인 주석)과 모델 내 모호성 처리(전문가 혼합)를 모두 제공하여 작업의 엄밀성을 높였습니다.  

→ **점수**: 8/10

**독창성/의의**: SAM 1/2의 단일 객체 중심 PVS 작업을 개념 수준으로 일반화한 PCS를 처음으로 정식화했으며, 인식-위치 추정 분리라는 새로운 아키텍처적 통찰과 AI 검증기를 통한 2배 속도 향상 데이터 엔진은 기존 연구와 명확히 구분되는 기여입니다. 특히 4M 개념 규모의 SA-Co 데이터셋은 기존 LVIS(1.2K) 대비 3,000배 이상 확장된 규모로, 오픈-보커불러리 분야의 근본적 한계를 극복했습니다.  

→ **점수**: 9/10

**결과의 타당성**: 제로-샷, 퓨-샷, 인터랙티브 설정을 포함한 다양한 실험 설정에서 철저한 검증을 수행했으며, 인간 성능 범위(74.2-81.4 CGF1)를明確히 제시하여 모델의 상대적 수준을 객관적으로 평가했습니다. 또한 presence 토큰, 하드 네거티브, AI 검증기 등 주요 구성 요소에 대한 개별적 ablation study를 통해 각 기술의 효과를 정량적으로 입증했습니다. 다만 일부 벤치마크(GLEE, LLMDet)가 SA-Co에서 제로-샷으로 평가된 점은 공정성에 약간의 그림자를 드리울 수 있습니다.  

→ **점수**: 9/10

**영향력/적용성**: 로보틱스(객체 조작), AR(실시간 환경 이해), 과학 연구(대규모 이미지 분석), 콘텐츠 제작(자동 분할) 등 광범위한 분야에 즉각적인 응용 가능성이 있습니다. SA-Co 데이터셋과 모델 체크포인트를 오픈소스로 공개하여 연구 커뮤니티의 진입 장벽을 크게 낮췄습니다. 다만 비디오 처리의 선형적 확장성과 고사양 GPU 의존성(H200)은 실제 배포 시 인프라 부담으로 작용할 수 있습니다.  

→ **점수**: 8/10

**강점**:

- **대규모 개념 커버리지**: 4M 개념을 포함한 SA-Co 데이터셋은 기존 데이터셋의 한계를 극복하고 실제 세계의 시각적 개념을 포괄적으로 표현합니다.

- **효율적인 인식-위치 추정 분리**: Presence 토큰을 통한 인식과 위치 추정의 역할 분리는 복잡한 개념의 정확한 분류와 동시에 객체의 정밀한 위치 추정을 동시에 달성합니다.

**약점**:

- **비디오 처리의 확장성 한계**: 객체 수에 선형적으로 증가하는 처리 지연으로, 혼잡한 장면에서는 실시간 처리가 불가능하며 병렬화(최대 64개 객체)에도 한계가 있습니다.

- **복잡한 언어 표현 처리 제한**: 단순 명사구만을 직접 처리하며, 다중 속성이나 추론을 요구하는 쿼리는 MLLM 결합 없이는 처리되지 않아 완전한 엔드투엔드 솔루션으로서의 독립성이 부족합니다.

**총점**: 34/40 → **8.5/10**

#### 7. Further Research and Recommendation

**추가 연구 필요성**: SAM 3는 개념 수준 분할의 기반을 제시했으나, 비디오 객체 수 증가에 따른 효율성 문제와 복잡한 언어 표현 처리 한계는 향후 연구가 필수적입니다. 특히 객체 간 공유 메모리를 통한 컨텍스트 활용, 개념-인스턴스 프롬프트의 원활한 통합, 그리고 틈새 도메인으로의 제로-샷 일반화 개선을 위한 연구가 필요합니다. 이러한 개선은 자율주행, 실시간 로보틱스 등 실제 적용을 위한 필수 과제입니다.  

→ **결론**: 추가 연구가 **강력히 권장됩니다**.

**논문 추천 여부**: 이 논문은 멀티모달 AI의 핵심 과제인 개념 기반 시각적 이해에 대한 체계적이고 확장 가능한 접근법을 제시하며, 대규모 데이터셋과 모델을 오픈소스로 공개하여 연구 커뮤니티에 즉각적인 가치를 제공합니다. 특히 SAM 1/2 사용자들에게는 자연스러운 기능 확장 경로를, 오픈-보커불러리 연구자들에게는 실용적이고 강력한 기준선을 제공합니다. 구현 세부사항과 평가 프로토콜의 투명성은 재현성을 높이며, 제시된 한계점과 향후 방향은 후속 연구를 위한 명확한 로드맵을 제시합니다.  

→ **결론**: **강력히 추천합니다**.

---

**총평**: SAM 3는 개념 기반 프롬프트를 통한 포괄적인 객체 분할과 추적이라는 야심찬 목표를 명확한 작업 정의, 혁신적 아키텍처, 대규모 데이터셋을 통해 성공적으로 달성했습니다. 일부 한계가 존재하지만, 제시된 기술적 기여와 오픈소스 공개는 컴퓨터비전 및 멀티모달 AI 분야의 중대한 진전을 대표합니다.
