SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses
Fuente:
arXiv
Guardado en:
| Autores principales: | Tan, Chaolei, Lin, Zihang, Pu, Junfu, Qi, Zhongang, Pei, Wei-Yi, Qu, Zhi, Wang, Yexin, Shan, Ying, Zheng, Wei-Shi, Hu, Jian-Fang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
por: Pu, Junfu, et al.
Publicado: (2026)
por: Pu, Junfu, et al.
Publicado: (2026)
Siamese Learning with Joint Alignment and Regression for Weakly-Supervised Video Paragraph Grounding
por: Tan, Chaolei, et al.
Publicado: (2024)
por: Tan, Chaolei, et al.
Publicado: (2024)
Music Grounding by Short Video
por: Xin, Zijie, et al.
Publicado: (2024)
por: Xin, Zijie, et al.
Publicado: (2024)
Grounding is All You Need? Dual Temporal Grounding for Video Dialog
por: Qin, You, et al.
Publicado: (2024)
por: Qin, You, et al.
Publicado: (2024)
MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
por: Fang, Pengcheng, et al.
Publicado: (2026)
por: Fang, Pengcheng, et al.
Publicado: (2026)
Will It Go Viral? Grounding Micro-Video Popularity Prediction on the Open Web
por: Heo, Ryang, et al.
Publicado: (2026)
por: Heo, Ryang, et al.
Publicado: (2026)
Muse: A Multimodal Conversational Recommendation Dataset with Scenario-Grounded User Profiles
por: Wang, Zihan, et al.
Publicado: (2024)
por: Wang, Zihan, et al.
Publicado: (2024)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
por: Qu, Mengxue, et al.
Publicado: (2024)
por: Qu, Mengxue, et al.
Publicado: (2024)
SVD: Spatial Video Dataset
por: Izadimehr, M. H., et al.
Publicado: (2025)
por: Izadimehr, M. H., et al.
Publicado: (2025)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
por: Zhang, Jun, et al.
Publicado: (2025)
por: Zhang, Jun, et al.
Publicado: (2025)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
por: Wang, Jieyi, et al.
Publicado: (2026)
por: Wang, Jieyi, et al.
Publicado: (2026)
MSC: A Marine Wildlife Video Dataset with Grounded Segmentation and Clip-Level Captioning
por: Truong, Quang-Trung, et al.
Publicado: (2025)
por: Truong, Quang-Trung, et al.
Publicado: (2025)
Learning High-Quality Navigation and Zooming on Omnidirectional Images in Virtual Reality
por: Cao, Zidong, et al.
Publicado: (2024)
por: Cao, Zidong, et al.
Publicado: (2024)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
por: Pramanick, Shraman, et al.
Publicado: (2025)
por: Pramanick, Shraman, et al.
Publicado: (2025)
FineBadminton: A Multi-Level Dataset for Fine-Grained Badminton Video Understanding
por: He, Xusheng, et al.
Publicado: (2025)
por: He, Xusheng, et al.
Publicado: (2025)
Timed text extraction from Taiwanese Kua-á-hì TV series
por: Huang, Tzu-Hung, et al.
Publicado: (2026)
por: Huang, Tzu-Hung, et al.
Publicado: (2026)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
por: Zhang, Zhenxing, et al.
Publicado: (2024)
por: Zhang, Zhenxing, et al.
Publicado: (2024)
A New Dataset and Benchmark for Grounding Multimodal Misinformation
por: Yang, Bingjian, et al.
Publicado: (2025)
por: Yang, Bingjian, et al.
Publicado: (2025)
Unified ROI-based Image Compression Paradigm with Generalized Gaussian Model
por: Hu, Kai, et al.
Publicado: (2026)
por: Hu, Kai, et al.
Publicado: (2026)
Scene-Text Grounding for Text-Based Video Question Answering
por: Zhou, Sheng, et al.
Publicado: (2024)
por: Zhou, Sheng, et al.
Publicado: (2024)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
por: Meng, Jiahao, et al.
Publicado: (2025)
por: Meng, Jiahao, et al.
Publicado: (2025)
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
por: Zhang, Meishan, et al.
Publicado: (2024)
por: Zhang, Meishan, et al.
Publicado: (2024)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
por: Li, Wenrui, et al.
Publicado: (2024)
por: Li, Wenrui, et al.
Publicado: (2024)
MMED: A Multimodal Micro-Expression Dataset based on Audio-Visual Fusion
por: Wang, Junbo, et al.
Publicado: (2025)
por: Wang, Junbo, et al.
Publicado: (2025)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
por: Ilaslan, Muhammet Furkan, et al.
Publicado: (2024)
por: Ilaslan, Muhammet Furkan, et al.
Publicado: (2024)
VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding
por: Gao, Shibo, et al.
Publicado: (2025)
por: Gao, Shibo, et al.
Publicado: (2025)
Generalizing Video DeepFake Detection by Self-generated Audio-Visual Pseudo-Fakes
por: Wei, Zihe, et al.
Publicado: (2026)
por: Wei, Zihe, et al.
Publicado: (2026)
MotionScape: A Large-Scale Real-World Highly Dynamic UAV Video Dataset for World Models
por: Guo, Zile, et al.
Publicado: (2026)
por: Guo, Zile, et al.
Publicado: (2026)
SGAT4PASS: Spherical Geometry-Aware Transformer for PAnoramic Semantic Segmentation
por: Li, Xuewei, et al.
Publicado: (2023)
por: Li, Xuewei, et al.
Publicado: (2023)
GLANCE: A Global-Local Coordination Multi-Agent Framework for Music-Grounded Non-Linear Video Editing
por: Lin, Zihao, et al.
Publicado: (2026)
por: Lin, Zihao, et al.
Publicado: (2026)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
por: Sun, Luoyi, et al.
Publicado: (2026)
por: Sun, Luoyi, et al.
Publicado: (2026)
Phi-Ground Tech Report: Advancing Perception in GUI Grounding
por: Zhang, Miaosen, et al.
Publicado: (2025)
por: Zhang, Miaosen, et al.
Publicado: (2025)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
por: Zhao, Qihao, et al.
Publicado: (2026)
por: Zhao, Qihao, et al.
Publicado: (2026)
HLFormer: Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning
por: Li, Jun, et al.
Publicado: (2025)
por: Li, Jun, et al.
Publicado: (2025)
RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild
por: Xu, Danni, et al.
Publicado: (2026)
por: Xu, Danni, et al.
Publicado: (2026)
Factorized Learning for Temporally Grounded Video-Language Models
por: Zeng, Wenzheng, et al.
Publicado: (2025)
por: Zeng, Wenzheng, et al.
Publicado: (2025)
Video Quality Assessment for Resolution Cross-Over in Live Sports
por: Zhu, Jingwen, et al.
Publicado: (2025)
por: Zhu, Jingwen, et al.
Publicado: (2025)
Can I Trust Your Answer? Visually Grounded Video Question Answering
por: Xiao, Junbin, et al.
Publicado: (2023)
por: Xiao, Junbin, et al.
Publicado: (2023)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
por: Zeng, Xiangyu, et al.
Publicado: (2024)
por: Zeng, Xiangyu, et al.
Publicado: (2024)
Catalogue Grounded Multimodal Attribution for Museum Video under Resource and Regulatory Constraints
por: Nanang, Minsak, et al.
Publicado: (2026)
por: Nanang, Minsak, et al.
Publicado: (2026)
Ejemplares similares
-
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
por: Pu, Junfu, et al.
Publicado: (2026) -
Siamese Learning with Joint Alignment and Regression for Weakly-Supervised Video Paragraph Grounding
por: Tan, Chaolei, et al.
Publicado: (2024) -
Music Grounding by Short Video
por: Xin, Zijie, et al.
Publicado: (2024) -
Grounding is All You Need? Dual Temporal Grounding for Video Dialog
por: Qin, You, et al.
Publicado: (2024) -
MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
por: Fang, Pengcheng, et al.
Publicado: (2026)