- ECCV 2026 AI 시티 챌린지, 보행자 의도 분석 1위·교통법규 위반 탐지 2위
- CCTV·어안렌즈·차량 카메라 영상 통합 분석, 위험상황 판단 근거까지 설명
[헤럴드경제=구본혁 기자] 보행자가 도로를 건너려는 순간을 포착하고 신호위반이나 역주행 등 위험상황까지 스스로 판단하는 국산 AI 기술이 국제대회에서 세계 최고로 인정받았다.
한국전자통신연구원(ETRI)은 미국 워싱턴대학교(UW)와 구성한 공동연구팀이 지난 8일 스웨덴 말뫼에서 열린 세계적 컴퓨터비전 학술대회 ‘ECCV 2026’의 제10회 AI 시티 챌린지에서 2개 부문 종합 1위와 2위를 차지했다고 22일 밝혔다.
AI 시티 챌린지는 엔비디아(NVIDIA)를 비롯한 글로벌 대학·연구기관·기업 연구진이 참여하는 국제 AI 경진대회다. 올해는 AI가 학습하지 않은 새로운 환경에서도 안정적으로 작동하는지, 서로 다른 카메라와 촬영 시점의 영상을 얼마나 정확하게 이해하고 추론하는지를 중점 평가했다.
ETRI·워싱턴대 공동연구팀 ‘UWIPL_ETRI’는 보행자 횡단의도를 분석하는 PSI-VQA 부문에서 참가 7개 팀 중 종합 1위, 교차로 교통법규 위반상황을 분석하는 FETV 부문에서 참가 8개 팀 중 종합 2위를 기록했다.
PSI-VQA는 차량 전방 카메라 영상에서 보행자의 움직임을 분석해 도로를 건너려는 의도와 위험상황 발생 시점, 판단 근거까지 추론하는 과제다. 단순히 사람이나 자동차를 찾아내는 객체인식을 넘어 행동 의도까지 파악해야 한다.
FETV는 교차로에 설치된 어안렌즈 카메라 영상에서 신호위반과 역주행, 무단횡단 등을 찾아내고 상황을 설명하는 과제다. 어안렌즈는 넓은 교차로를 한 화면에 담을 수 있지만 화면 가장자리로 갈수록 영상 왜곡이 커 차량과 보행자의 위치 및 움직임을 정확하게 파악하기 어렵다.
핵심은 통합 교통영상 이해 기술 ‘유니트래픽(UniTraffic)’이다.
기존 영상분석 AI가 CCTV와 차량 카메라 등 촬영 장치별로 별도 모델을 구축하는 방식이었다면, 유니트래픽은 천장형 CCTV와 교차로 어안렌즈, 차량 탑재 카메라 영상을 하나의 비전언어모델(VLM) 기반 시스템으로 처리한다.
VLM은 영상과 언어정보를 함께 이해하고 추론하는 AI다. 영상 속 사람과 차량을 인식하는 데 그치지 않고 무슨 일이 벌어졌는지, 왜 위험한지를 언어로 설명할 수 있다.
유니트래픽은 전체 영상을 먼저 빠르게 분석한 뒤 보행자 움직임이나 차량 진로 변경 등 정밀한 판단이 필요한 장면만 집중적으로 재분석한다. 긴 교통영상을 효율적으로 처리하면서 중요한 위험상황을 놓치지 않도록 설계한 것이다.
AI 판단의 신뢰성을 높이기 위한 ‘교통 증거 그래프(Traffic Evidence Graph)’도 적용했다. 보행자의 위치와 이동 방향, 주변 차량의 움직임, 행동 발생 시점 등을 연결해 판단 근거로 활용하는 기술이다. 이를 통해 영상에 존재하지 않는 내용을 사실처럼 생성하는 AI의 오류를 줄이고 판단 결과의 설명 가능성을 높였다.
변우진 ETRI 대경권연구본부장은 “오랜 기간 축적해 온 지능형 교통관제와 영상분석 기술을 국제공동연구를 통해 최신 AI 기술로 발전시킨 결과”라며 “실제 교통현장 실증과 국내 기업 협력을 확대해 국민이 체감할 수 있는 교통·안전 서비스로 발전시키겠다”고 말했다.
nbgkoo@heraldcorp.com

