AI 이미지 모델, 왜 단순한 윤곽선 인식조차 어려워할까?

문광주 기자 / 기사승인 : 2026-09-21 09:33:01
  • -
  • +
  • 인쇄
3분 읽기
- 인간과 달리 전체 '실루엣' 활용 능력 떨어져… 200여 개 인공신경망 비교 연구 결과
- "AI가 수많은 이미지를 학습해도, 시각 정보 처리할 때 인간처럼 전체적인 형태 구조를 파악하는 능력은 여전히 부족하다"
- AI가 사물을 인식할 때 어떤 시각적 요소에 의존하는지 파악하는 새로운 검증 프레임워크를 제시

 

▲ 인간은 질감이나 내부 세부 사항 없이도 윤곽선만으로 사물을 인식하는 경우가 많다. 이처럼 전체적인 형태에 의존하는 특성은 현재의 AI 이미지 모델에 상당한 어려움을 불러일으킨다. © IraGirichBO / depositphotos.com


인간과 달리 전체 '실루엣' 활용 능력 떨어져… 200여 개 인공신경망 비교 연구 결과
인간은 표면 질감이나 내부 세부 정보가 없어도 사물의 대략적인 형태나 윤곽선(실루엣)만 보고 일상적인 물체를 쉽게 알아채곤 한다. 반면 최신 인공지능(AI) 이미지 인식 모델들은 인간과 달리 전체적인 '형태(글로벌 셰이프)'를 활용하는 능력이 크게 떨어진다는 연구 결과가 나왔다.

미국 뉴욕대학교(NYU) 그로스만 의과대학 비유 J. 허(Biyu J. He) 교수 연구진은 이미지 구성 요소를 체계적으로 변형해 전체적 형태(글로벌 셰이프), 내부 구성 요소, 표면 질감의 3가지 요소로 분리한 후, 인간의 인식 방식과 200개 이상의 다양한 딥러닝 인공신경망 모델을 비교 분석했다.

형태·부품·질감 분리 실험… "인간의 시각 처리 방식과 차이 커"


실험 결과, 연구진이 테스트한 200여 개 모델 중 단 하나도 인간의 시각적 힌트(visual cue) 활용 패턴을 완벽히 재현하지 못했다. 이는 순환 연결(Recurrent connection) 구조를 가졌거나 특정 전용 학습 과정을 거친 AI 모델에서도 동일하게 나타났다.

특히 사물의 전체적인 윤곽만으로 대상을 맞춰야 하는 조건에서 AI 모델들의 성능 저하가 가장 눈에 띄었다. 연구진은 "AI가 수많은 이미지를 학습했음에도 불구하고, 시각 정보를 처리할 때 인간처럼 전체적인 형태 구조를 파악하는 능력은 여전히 부족하다"고 설명했다.

그나마 인간과 가장 유사한 인식을 보여준 시스템은 이미지와 텍스트를 함께 대조 학습(Contrastive learning)시킨 미세조정(Fine-tuned) 모델들이었다. 그러나 이 모델들 역시 전체적인 형태 정보를 일부 훼손하거나 변형했을 때는 인간과의 인식 패턴 일치도가 크게 떨어졌다. 


"높은 정답률이 인간 수준의 시각 능력 뜻하진 않아"


이번 연구는 단순히 이미지 분류 정답률을 높이는 것과 인간처럼 시각 정보를 처리하는 것은 별개의 문제임을 시사한다. 실제로 뇌의 복측 시각 경로(Ventral visual stream) 데이터와 유사도가 높은 것으로 측정된 모델이라 하더라도, 실제 인간과 동일한 물체 인식 행동으로 이어지지는 않았다.

연구진은 "이번 연구는 단순히 정답률에만 치중하던 기존 평가 방식에서 벗어나, AI가 사물을 인식할 때 어떤 시각적 요소에 의존하는지 파악하는 새로운 검증 프레임워크를 제시한다"고 강조했다.

이번 연구는 제어된 이미지 변형을 통한 실험으로, 자율주행이나 로보틱스, 의료 분야 등 현장에 즉시 적용되는 직접적인 안전성 진단은 아니다. 그러나 연구진은 "향후 AI의 오류 패턴을 개선하고 고도화된 보조 시스템이나 뇌-컴퓨터 인터페이스(BCI)를 개발하는 데 기여할 수 있을 것"으로 기대했다.

[더사이언스플러스=문광주 기자]

[저작권자ⓒ the SCIENCE plus. 무단전재-재배포 금지]

  • 글자크기
  • +
  • -
  • 인쇄

주요기사

+

많이 본 기사

Basic Science

+

AI & Tech

+

Photos

+