Uploads from ‍김성범[ 교수 / 산업경영공학부 ]

Watch and track your favorite playlist.

Curated by: ‍김성범[ 교수 / 산업경영공학부 ] (327 videos)


Currently Playing: [Open DMQA Seminar] Vision Language Model-Based Test-Time Adaptation

대규모 사전학습 Vision-Language Model은 추가 학습 없이도 다양한 태스크에 대해 우수한 zero-shot 성능을 보이지만, 실제 환경에서 발생하는 도메인 변화 상황에서는 성능 저하가 발생하는 한계를 가진다. 이러한 문제를 해결하기 위해, 테스트 단계에서 주어지는 unlabeled 데이터를 활용하여 모델을 적응시키는 Test-time Adaptation 기법들이 주목받고 있다. 특히 최근에는 CLIP과 같은 Vision-Language Model을 기반으로, 새로운 환경에 유연하게 대응하기 위한 다양한 방법들이 제안되고 있다. 본 세미나에서는 Vision-Language Model 기반 TTA의 기본 개념과 함께, 다양한 접근 방식들이 어떻게 발전해왔는지에 초점을 맞추어 대표적인 방법론과 그 한계를 소개한다. 참고자료 [1] Liang, J., He, R., & Tan, T. (2024). A comprehensive survey on test-time adaptation under distribution shifts. International Journal of Computer Vision, 1-34. [2] Li, Y., Su, Y., Goodge, A., Jia, K., & Xu, X. (2024). Efficient and context-aware label propagation for zero-/few-shot training-free adaptation of vision-language model. In ICLR. [3] Sheng, L., Liang, J., Wang, Z., & He, R. (2025). R-tpt: Improving adversarial robustness of vision-language models through test-time prompt tuning. In CVPR. [4] Maharana, S., Zhang, B., Karlinsky, L., Feris, R., & Guo, Y. (2025). Batclip: Bimodal online test-time adaptation for clip. In ICCV.


Tracks in this Playlist