Towards Open-Vocabulary Video Semantic Segmentation

Published in IEEE Transactions on Multimedia (TMM), 2025

Recommended citation: Li, X., Liu, Y., Sun, G., Wu, M., Zhang, L., & Zhu, C. (2025). Towards Open-Vocabulary Video Semantic Segmentation. IEEE Transactions on Multimedia, 27, 2924–2934. https://arxiv.org/pdf/2412.09329

An open-vocabulary video semantic segmentation framework using video-text encoding and spatial-temporal fusion.