ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Athar, Ali, Deng, Xueqing, Chen, Liang-Chieh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation
por: Deng, Xueqing, et al.
Publicado: (2025)
por: Deng, Xueqing, et al.
Publicado: (2025)
Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding
por: Zhang, Tao, et al.
Publicado: (2025)
por: Zhang, Tao, et al.
Publicado: (2025)
COCONut: Modernizing COCO Segmentation
por: Deng, Xueqing, et al.
Publicado: (2024)
por: Deng, Xueqing, et al.
Publicado: (2024)
A Simple Video Segmenter by Tracking Objects Along Axial Trajectories
por: He, Ju, et al.
Publicado: (2023)
por: He, Ju, et al.
Publicado: (2023)
ViDiC: Video Difference Captioning
por: Wu, Jiangtao, et al.
Publicado: (2025)
por: Wu, Jiangtao, et al.
Publicado: (2025)
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
por: Deng, Andong, et al.
Publicado: (2024)
por: Deng, Andong, et al.
Publicado: (2024)
Grounded Video Caption Generation
por: Kazakos, Evangelos, et al.
Publicado: (2024)
por: Kazakos, Evangelos, et al.
Publicado: (2024)
MSC: A Marine Wildlife Video Dataset with Grounded Segmentation and Clip-Level Captioning
por: Truong, Quang-Trung, et al.
Publicado: (2025)
por: Truong, Quang-Trung, et al.
Publicado: (2025)
Exploiting Auxiliary Caption for Video Grounding
por: Li, Hongxiang, et al.
Publicado: (2023)
por: Li, Hongxiang, et al.
Publicado: (2023)
Pixels to Prose: Understanding the art of Image Captioning
por: Singh, Hrishikesh, et al.
Publicado: (2024)
por: Singh, Hrishikesh, et al.
Publicado: (2024)
Let Me Finish My Sentence: Video Temporal Grounding with Holistic Text Understanding
por: Woo, Jongbhin, et al.
Publicado: (2024)
por: Woo, Jongbhin, et al.
Publicado: (2024)
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
por: Ding, Henghui, et al.
Publicado: (2025)
por: Ding, Henghui, et al.
Publicado: (2025)
From Pixels to Concepts: Do Segmentation Models Understand What They Segment?
por: Liang, Shuang, et al.
Publicado: (2026)
por: Liang, Shuang, et al.
Publicado: (2026)
AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
por: Chen, Xinlong, et al.
Publicado: (2025)
por: Chen, Xinlong, et al.
Publicado: (2025)
Synthesizing Artifact Dataset for Pixel-level Detection
por: Menn, Dennis, et al.
Publicado: (2025)
por: Menn, Dennis, et al.
Publicado: (2025)
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
por: Drago, Mauro Orazio, et al.
Publicado: (2025)
por: Drago, Mauro Orazio, et al.
Publicado: (2025)
Randomized Autoregressive Visual Generation
por: Yu, Qihang, et al.
Publicado: (2024)
por: Yu, Qihang, et al.
Publicado: (2024)
When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding
por: Fang, Pengcheng, et al.
Publicado: (2025)
por: Fang, Pengcheng, et al.
Publicado: (2025)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
por: Xue, Zhucun, et al.
Publicado: (2025)
por: Xue, Zhucun, et al.
Publicado: (2025)
1st Place Winner of the 2024 Pixel-level Video Understanding in the Wild (CVPR'24 PVUW) Challenge in Video Panoptic Segmentation and Best Long Video Consistency of Video Semantic Segmentation
por: Liu, Qingfeng, et al.
Publicado: (2024)
por: Liu, Qingfeng, et al.
Publicado: (2024)
PVUW 2025 Challenge Report: Advances in Pixel-level Understanding of Complex Videos in the Wild
por: Ding, Henghui, et al.
Publicado: (2025)
por: Ding, Henghui, et al.
Publicado: (2025)
ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
por: Chen, Lin, et al.
Publicado: (2024)
por: Chen, Lin, et al.
Publicado: (2024)
ViLLa: Video Reasoning Segmentation with Large Language Model
por: Zheng, Rongkun, et al.
Publicado: (2024)
por: Zheng, Rongkun, et al.
Publicado: (2024)
ViViD: Video Virtual Try-on using Diffusion Models
por: Fang, Zixun, et al.
Publicado: (2024)
por: Fang, Zixun, et al.
Publicado: (2024)
Language and Geometry Grounded Sparse Voxel Representations for Holistic Scene Understanding
por: Wu, Guile, et al.
Publicado: (2026)
por: Wu, Guile, et al.
Publicado: (2026)
Large-scale Pre-training for Grounded Video Caption Generation
por: Kazakos, Evangelos, et al.
Publicado: (2025)
por: Kazakos, Evangelos, et al.
Publicado: (2025)
An Image is Worth 32 Tokens for Reconstruction and Generation
por: Yu, Qihang, et al.
Publicado: (2024)
por: Yu, Qihang, et al.
Publicado: (2024)
ViTamin: Designing Scalable Vision Models in the Vision-Language Era
por: Chen, Jieneng, et al.
Publicado: (2024)
por: Chen, Jieneng, et al.
Publicado: (2024)
Shot2Tactic-Caption: Multi-Scale Captioning of Badminton Videos for Tactical Understanding
por: Ding, Ning, et al.
Publicado: (2025)
por: Ding, Ning, et al.
Publicado: (2025)
Pixel-Wise Recognition for Holistic Surgical Scene Understanding
por: Ayobi, Nicolás, et al.
Publicado: (2024)
por: Ayobi, Nicolás, et al.
Publicado: (2024)
ViLA: Efficient Video-Language Alignment for Video Question Answering
por: Wang, Xijun, et al.
Publicado: (2023)
por: Wang, Xijun, et al.
Publicado: (2023)
ViSIL: Unified Evaluation of Information Loss in Multimodal Video Captioning
por: Li, Po-han, et al.
Publicado: (2026)
por: Li, Po-han, et al.
Publicado: (2026)
ViTOC: Vision Transformer and Object-aware Captioner
por: Huang, Feiyang
Publicado: (2024)
por: Huang, Feiyang
Publicado: (2024)
ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
por: Yang, Timing, et al.
Publicado: (2025)
por: Yang, Timing, et al.
Publicado: (2025)
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
por: Liang, Wenqi, et al.
Publicado: (2025)
por: Liang, Wenqi, et al.
Publicado: (2025)
Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos
por: Lin, Weifeng, et al.
Publicado: (2025)
por: Lin, Weifeng, et al.
Publicado: (2025)
ViMU: Benchmarking Video Metaphorical Understanding
por: Li, Qi, et al.
Publicado: (2026)
por: Li, Qi, et al.
Publicado: (2026)
From Pixels to Prose: A Large Dataset of Dense Image Captions
por: Singla, Vasu, et al.
Publicado: (2024)
por: Singla, Vasu, et al.
Publicado: (2024)
How Important are Videos for Training Video LLMs?
por: Lydakis, George, et al.
Publicado: (2025)
por: Lydakis, George, et al.
Publicado: (2025)
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
por: Zhang, Xu, et al.
Publicado: (2026)
por: Zhang, Xu, et al.
Publicado: (2026)
Ejemplares similares
-
COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation
por: Deng, Xueqing, et al.
Publicado: (2025) -
Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding
por: Zhang, Tao, et al.
Publicado: (2025) -
COCONut: Modernizing COCO Segmentation
por: Deng, Xueqing, et al.
Publicado: (2024) -
A Simple Video Segmenter by Tracking Objects Along Axial Trajectories
por: He, Ju, et al.
Publicado: (2023) -
ViDiC: Video Difference Captioning
por: Wu, Jiangtao, et al.
Publicado: (2025)