DIBS: Enhancing Dense Video Captioning with Unlabeled Videos via Pseudo Boundary Enrichment and Online Refinement
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Hao, Liu, Huabin, Qiao, Yu, Sun, Xiao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning
di: Ge, Shiping, et al.
Pubblicazione: (2024)
di: Ge, Shiping, et al.
Pubblicazione: (2024)
Question-Answering Dense Video Events
di: Qin, Hangyu, et al.
Pubblicazione: (2024)
di: Qin, Hangyu, et al.
Pubblicazione: (2024)
PolySmart @ TRECVid 2024 Video Captioning (VTT)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
Video Summarization: Towards Entity-Aware Captions
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
MSC: A Marine Wildlife Video Dataset with Grounded Segmentation and Clip-Level Captioning
di: Truong, Quang-Trung, et al.
Pubblicazione: (2025)
di: Truong, Quang-Trung, et al.
Pubblicazione: (2025)
Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation
di: Huang, Feizhen, et al.
Pubblicazione: (2025)
di: Huang, Feizhen, et al.
Pubblicazione: (2025)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
di: Yao, Linli, et al.
Pubblicazione: (2023)
di: Yao, Linli, et al.
Pubblicazione: (2023)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
IG Captioner: Information Gain Captioners are Strong Zero-shot Classifiers
di: Yang, Chenglin, et al.
Pubblicazione: (2023)
di: Yang, Chenglin, et al.
Pubblicazione: (2023)
Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input
di: Liu, Jiajun, et al.
Pubblicazione: (2024)
di: Liu, Jiajun, et al.
Pubblicazione: (2024)
VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection
di: Wang, Qiang, et al.
Pubblicazione: (2025)
di: Wang, Qiang, et al.
Pubblicazione: (2025)
MagicMotion: Controllable Video Generation with Dense-to-Sparse Trajectory Guidance
di: Li, Quanhao, et al.
Pubblicazione: (2025)
di: Li, Quanhao, et al.
Pubblicazione: (2025)
Moiré Video Authentication: A Physical Signature Against AI Video Generation
di: Qing, Yuan, et al.
Pubblicazione: (2026)
di: Qing, Yuan, et al.
Pubblicazione: (2026)
Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion
di: Zhang, Yinghui, et al.
Pubblicazione: (2025)
di: Zhang, Yinghui, et al.
Pubblicazione: (2025)
PlanLLM: Video Procedure Planning with Refinable Large Language Models
di: Yang, Dejie, et al.
Pubblicazione: (2024)
di: Yang, Dejie, et al.
Pubblicazione: (2024)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
di: Wang, Yun, et al.
Pubblicazione: (2025)
di: Wang, Yun, et al.
Pubblicazione: (2025)
Bernini: Latent Semantic Planning for Video Diffusion
di: Bernini Team, et al.
Pubblicazione: (2026)
di: Bernini Team, et al.
Pubblicazione: (2026)
UniVid: Pyramid Diffusion Model for High Quality Video Generation
di: Xiao, Xinyu, et al.
Pubblicazione: (2026)
di: Xiao, Xinyu, et al.
Pubblicazione: (2026)
TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
di: Yu, Jiashuo, et al.
Pubblicazione: (2025)
di: Yu, Jiashuo, et al.
Pubblicazione: (2025)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
di: Xiao, Junbin, et al.
Pubblicazione: (2026)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
Interactive Video Generation via Domain Adaptation
di: Rawal, Ishaan, et al.
Pubblicazione: (2025)
di: Rawal, Ishaan, et al.
Pubblicazione: (2025)
Video Seal: Open and Efficient Video Watermarking
di: Fernandez, Pierre, et al.
Pubblicazione: (2024)
di: Fernandez, Pierre, et al.
Pubblicazione: (2024)
A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming
di: Zhou, Pengyuan, et al.
Pubblicazione: (2024)
di: Zhou, Pengyuan, et al.
Pubblicazione: (2024)
Advance Fake Video Detection via Vision Transformers
di: Battocchio, Joy, et al.
Pubblicazione: (2025)
di: Battocchio, Joy, et al.
Pubblicazione: (2025)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
LAVA: Language Driven Scalable and Versatile Traffic Video Analytics
di: Yu, Yanrui, et al.
Pubblicazione: (2025)
di: Yu, Yanrui, et al.
Pubblicazione: (2025)
Joint Flow And Feature Refinement Using Attention For Video Restoration
di: Merugu, Ranjith, et al.
Pubblicazione: (2025)
di: Merugu, Ranjith, et al.
Pubblicazione: (2025)
FedVideoMAE: Efficient Privacy-Preserving Federated Video Moderation
di: Tao, Ziyuan, et al.
Pubblicazione: (2025)
di: Tao, Ziyuan, et al.
Pubblicazione: (2025)
SAM as the Guide: Mastering Pseudo-Label Refinement in Semi-Supervised Referring Expression Segmentation
di: Yang, Danni, et al.
Pubblicazione: (2024)
di: Yang, Danni, et al.
Pubblicazione: (2024)
VIA: Unified Spatiotemporal Video Adaptation Framework for Global and Local Video Editing
di: Gu, Jing, et al.
Pubblicazione: (2024)
di: Gu, Jing, et al.
Pubblicazione: (2024)
Composing Concepts from Images and Videos via Concept-prompt Binding
di: Kong, Xianghao, et al.
Pubblicazione: (2025)
di: Kong, Xianghao, et al.
Pubblicazione: (2025)
Can I Trust Your Answer? Visually Grounded Video Question Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
LoViF 2026 The First Challenge on Weather Removal in Videos
di: Qian, Chenghao, et al.
Pubblicazione: (2026)
di: Qian, Chenghao, et al.
Pubblicazione: (2026)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
di: Meng, Jiahao, et al.
Pubblicazione: (2025)
di: Meng, Jiahao, et al.
Pubblicazione: (2025)
VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control
di: Bian, Yuxuan, et al.
Pubblicazione: (2025)
di: Bian, Yuxuan, et al.
Pubblicazione: (2025)
Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective
di: Yuan, Hangjie, et al.
Pubblicazione: (2025)
di: Yuan, Hangjie, et al.
Pubblicazione: (2025)
Compressed Deepfake Video Detection Based on 3D Spatiotemporal Trajectories
di: Chen, Zongmei, et al.
Pubblicazione: (2024)
di: Chen, Zongmei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning
di: Ge, Shiping, et al.
Pubblicazione: (2024) -
Question-Answering Dense Video Events
di: Qin, Hangyu, et al.
Pubblicazione: (2024) -
PolySmart @ TRECVid 2024 Video Captioning (VTT)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024) -
Video Summarization: Towards Entity-Aware Captions
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023) -
MSC: A Marine Wildlife Video Dataset with Grounded Segmentation and Clip-Level Captioning
di: Truong, Quang-Trung, et al.
Pubblicazione: (2025)