Task
Text To Video
SpatialVID: A Large-Scale Video Dataset with Spatial Annotations Jiahao Wang1* Yufeng Yuan1* Rujie Zheng1* Youtian Lin1 Jian Gao1 Lin-Zhuo Chen1 Yajie Bao1 Yi Zhang1 Chang Zeng1 Yanxi Zhou1 Xiaoxiao Long1 Hao Zhu1 Zhaoxiang Zhang2 Xun Cao1 Yao Yao1† 1Nanjing University 2Institute of Automation, Chinese Academy of Science *Equal Contribution †Corresponding Author CVPR 2026… See the full description on the dataset page: https://huggingface.co/datasets/FelixYuan/SpatialVID-HQ.