KOBRA 첨단바이오 연구협력센터

IEEE/CVF Conference on Computer Vision and Pattern Recognition

뉴스 · 2025-06-27 · 조회 59

1. 학회 개요

CVPR(IEEE/CVF Conference on Computer Vision and Pattern Recognition)은 컴퓨터비전 분야에서 가장 권위 있는 국제학술대회 중 하나로, 최신 연구 성과가 집약되고 전 세계 연구자 및 산업계 전문가들이 활발히 교류하는 장이다. 이미지 및 동영상 인식, 3D 비전, 생성 모델, 멀티모달 학습 등 핵심 연구뿐 아니라, 의료영상 분석, 자율주행, 로보틱스 등 다양한 응용 분야를 아우르며, 의료·바이오 분야와의 접점 또한 점차 확대되고 있다.​
​
CVPR 2025는 6월 11일부터 15일까지 미국 테네시주 내슈빌에서 개최되었다. 특히 의료·바이오 관련된 비전 기술이 다수의 워크숍과 발표 세션에서 다루어지며, 바이오 분야 연구자들에게도 중요한 기술적 통찰과 협력의 기회를 제공하는 장으로 자리매김하고 있다.
​
1.jpg
사진 설명] CVPR 2025 키노트 및 구두(Oral)발표 현장 전경. 규모가 매우 큰 학회인 만큼 매우 큰 장소에서 키노트가 진행되고 있는 모습이다.

1-2.jpg
사진 설명] CVPR 2025 엑스포 현장 전경. Amazon, Google, Apple, Meta 등 세계적 테크 기업들이 자사의 최신 기술과 연구를 소개하며, 업계 연구자들과의 활발한 교류가 이루어졌다.

​​CVPR은 논문 발표 외에도 다양한 학술 및 산업 프로그램으로 구성되어 있다. 구두(Oral) 및 포스터(Poster) 발표를 통해 최신 연구 결과를 공유하고, 워크숍(Workshop)과 튜토리얼(Tutorial)에서는 특정 주제에 대한 심화 논의와 기술 교육이 이루어진다. 이외에도 기업의 최신 기술과 제품을 소개하는 산업 전시(EXPO), 실시간 문제 해결 능력을 겨루는 챌린지(Challenge), 네트워킹 이벤트 등이 마련되었다.

2. 인공지능과 의료·바이오에 대한 학회 발표 참관

2.jpg
사진 설명] 코넬 대학교 교수이자 방사선의인 Timothy Deyer, M.D.는 “3D Vision-Language Models for Medical Imaging – A Clinical Perspective” 세션에서 강연 중인 모습. AI가 전문의를 대체하는 것이 아닌, 임상적 책임과 법적 기준을 고려한 ‘AI와 함께 발전된 전문의’를 만드는 방향으로 나아가야 한다는 메시지를 전했다.

2-1.jpg
사진 설명] MIT의 교수이자 컴퓨터비전 분야의 선도적 연구자인 Kaiming He가 강연 중이다. ResNet, Mask R-CNN 등 핵심 모델을 제안한 그는 이번 강연에서 디퓨전 모델을 넘어 비디오, 3D, 이미지 합성 등 다양한 비전 과제에 적용 가능한 end-to-end 생성 모델 구조의 방향성과 가능성을 제시했다.

2-2.jpg
사진 설명] Meta의 Daniel Bolya가 멀티모달 모델 Perception Encoder 구조 소개하며 CLIP과의 성능을 비교하기 위해서 여러 데모를 현장에서 시연하며 설명하고 있는 모습.

2-3.jpg
사진 설명] NVIDIA에서 구두(Oral)발표로 “FoundationStereo: Zero-Shot Stereo Matching with Foundation Models”를 발표 중인 모습. 사전학습된 Foundation Model의 시각 표현을 활용해 별도의 학습 없이도 정확한 스테레오 매칭을 수행하는 zero-shot 프레임워크를 제안하였다.


CVPR 2025에서는 Vision-Language Models(VLM), Foundation Models, 그리고 멀티모달(Multi-modal) 학습 기술을 의료 영상 분석에 적용하려는 연구가 활발히 논의되었다. 다양한 세션을 참관한 결과, 현재 의료 인공지능 분야에서 공통적으로 주목받는 연구 흐름과 기술적 과제는 다음과 같다.
​
첫째, 범용 VLM의 의료 적용에는 여러 한계가 존재한다. 일반 도메인에서 학습된 VLM은 의료 영상에 적용할 경우 환각(hallucination), 부정확한 임상적 추론(reasoning), 임상 맥락에 대한 이해 부족 등 문제를 일으킬 수 있으며, 이를 보완하기 위해 의료 도메인 특화 학습 전략의 필요성이 강조되었다.
​
둘째, 의료 데이터의 구조적 복잡성과 표현 방식이 중요한 이슈로 부각되었다. 의료 영상과 임상 정보를 효과적으로 통합하려면 단순한 이미지-텍스트 쌍을 넘어서 환자 이력, 해부학적 구조, 진단 기준 등 다양한 요소를 반영할 수 있는 구조화된 표현(structured representation) 방식이 요구되며, 데이터 프라이버시를 고려한 처리도 함께 고려되어야 한다.
​
셋째, 비용 효율적인 학습 전략에 대한 관심이 높았다. 의료 데이터는 접근성과 양에서 제약이 있기 때문에, 사전학습된 VLM을 단 몇 개의 샘플로도 빠르게 적응시키는 prompt engineering, retrieval 기반 보강, low-rank adaptation 등의 기법들이 주요한 해결책으로 제시되었다.
​
마지막으로, 신뢰성 있는 모델 설계와 해석 가능성(explainability)에 대한 요구가 매우 컸다. 실제 임상 환경에서는 모델의 정량적 성능뿐만 아니라, 의사결정의 투명성, 오류 발생 시의 책임 소재, 환자 안전 확보가 필수적이다. 이에 따라 해석 가능한 구조 설계, 규제 및 정책에 부합하는 모델 개발을 위한 논의가 활발히 진행되었다. 이러한 흐름은 의료 인공지능 기술이 단순한 성능 향상을 넘어 실제 임상 환경에서의 실용성과 신뢰성을 확보하는 방향으로 발전하고 있음을 보여준다.

3. 포스터 세션 발표 및 피드백
​
3.jpg
사진 설명] CVPR 2025에서 “DART: Disease-aware Image-Text Alignment and Self-correcting Re-alignment for Trustworthy Radiology Report Generation” 포스터를 발표하는 모습. 질병 중심의 이미지-텍스트 정렬과 자기 정렬 기반 생성 모델을 통해, 임상적으로 신뢰할 수 있는 흉부 X-ray 리포트 자동 생성 방법을 제안하였다.

​
CVPR 2025에서 “DART: Disease-aware Image-Text Alignment and Self-correcting Re-alignment for Trustworthy Radiology Report Generation”이라는 제목의 논문을 포스터 세션에서 발표했다. 해당 논문은 흉부 엑스레이 영상으로부터 신뢰성 있는 방사선 판독 보고서를 자동 생성하기 위한 프레임워크인 DART를 제안한다. DART는 질병 관련 소견을 중심으로 이미지와 텍스트 간의 정렬을 학습하고, 이를 기반으로 생성된 리포트를 스스로 수정하는 자기 정렬 모듈(self-correcting realignment module)을 포함한다. 이러한 구조를 통해 임상적으로 중요한 정보를 정확하게 포착하고, 과잉 생성이나 누락을 줄여 더 신뢰도 높은 리포트를 생성할 수 있음을 다수의 실험을 통해 입증하였다.
​
포스터 발표를 통해 다양한 연구자들과 활발한 의견 교환이 이루어졌다. 특히 Vision-Language Model(VLM) 기반으로 본 연구를 확장하는 방안에 대한 논의가 많았으며, 사전학습된 멀티모달 모델을 활용하거나 instruction-tuning과 같은 최신 학습 기법을 적용하여 성능과 범용성을 높이는 방향이 제안되었다. 또한, 생성된 리포트의 해석 가능성과 임상 적용 가능성을 높이기 위한 향상된 XAI 기반의 설명 기법 도입에 대한 피드백도 다수 있었고, 이와 관련해 시각적 근거 제시(visual grounding)나 중요 소견 하이라이팅(highlighting)과 같은 후속 연구 아이디어도 도출할 수 있었다. 전반적으로 본 연구가 의료영상 리포트 생성의 좋은 성능과 해석 가능성을 동시에 고려하고 있다는 점에서 긍정적인 반응을 얻었다.

4. 결론

이번 CVPR 2025 참가를 통해 최신 컴퓨터비전 기술의 발전 방향과 의료 인공지능 분야의 융합 흐름을 직접 체감할 수 있었다. 다양한 연사 및 연구자들과의 교류를 통해 기술적 통찰뿐만 아니라 연구의 확장 가능성에 대한 구체적인 아이디어를 얻었으며, 본인의 연구를 세계적인 연구자들에게 소개하고 피드백을 받을 수 있었던 점은 매우 뜻깊은 경험이었다. 특히 VLM 기반 확장, 해석 가능성 향상을 위한 XAI 기법 등 실제 임상 적용 가능성과 신뢰성을 높이기 위한 후속 연구 주제에 대해 실질적인 방향성을 정립할 수 있었다. 향후에는 이번 학회에서 얻은 경험을 바탕으로 기술적 완성도와 임상적 활용 가능성을 동시에 고려하는 연구를 지속해 나갈 계획이다.
​
학회명 : IEEE/CVF Conference on Computer Vision and Pattern Recognition(CVPR)
개최지 : 미국 내슈빌
개최일 : 2025.06.11.~ 2025.06.15.
발표제목 : DART: Disease-aware Image-Text Alignment and Self-correcting Re-alignment for Trustworthy Radiology Report Generation
작성자 : 고려대학교 허근수

← 목록으로