Towards Open-Vocabulary Video Semantic Segmentation
Published in IEEE Transactions on Multimedia (TMM), 2025
Recommended citation: Li, X., Liu, Y., Sun, G., Wu, M., Zhang, L., & Zhu, C. (2025). Towards Open-Vocabulary Video Semantic Segmentation. IEEE Transactions on Multimedia, 27, 2924–2934. https://arxiv.org/pdf/2412.09329
An open-vocabulary video semantic segmentation framework using video-text encoding and spatial-temporal fusion.
