VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Xinlong, Zhang, Yuanxing, Rao, Chongling, Guan, Yushuo, Liu, Jiaheng, Zhang, Fuzheng, Song, Chengru, Liu, Qiang, Zhang, Di, Tan, Tieniu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
IF-VidCap: Can Video Caption Models Follow Instructions?
di: Li, Shihao, et al.
Pubblicazione: (2025)
di: Li, Shihao, et al.
Pubblicazione: (2025)
Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Models
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models
di: Chen, Xinlong, et al.
Pubblicazione: (2026)
di: Chen, Xinlong, et al.
Pubblicazione: (2026)
TextVidBench: A Benchmark for Long Video Scene Text Understanding
di: Zhong, Yangyang, et al.
Pubblicazione: (2025)
di: Zhong, Yangyang, et al.
Pubblicazione: (2025)
VidText: Towards Comprehensive Evaluation for Video Text Understanding
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
ViDiC: Video Difference Captioning
di: Wu, Jiangtao, et al.
Pubblicazione: (2025)
di: Wu, Jiangtao, et al.
Pubblicazione: (2025)
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
di: Wei, Yuancheng, et al.
Pubblicazione: (2026)
di: Wei, Yuancheng, et al.
Pubblicazione: (2026)
TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
di: Yao, Linli, et al.
Pubblicazione: (2026)
di: Yao, Linli, et al.
Pubblicazione: (2026)
VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking
di: Meng, Desen, et al.
Pubblicazione: (2025)
di: Meng, Desen, et al.
Pubblicazione: (2025)
Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models
di: Yi, Hao, et al.
Pubblicazione: (2024)
di: Yi, Hao, et al.
Pubblicazione: (2024)
GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
di: Li, Bozhou, et al.
Pubblicazione: (2025)
di: Li, Bozhou, et al.
Pubblicazione: (2025)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
di: Pan, Yaning, et al.
Pubblicazione: (2025)
di: Pan, Yaning, et al.
Pubblicazione: (2025)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
SnapCap: Efficient Snapshot Compressive Video Captioning
di: Sun, Jianqiao, et al.
Pubblicazione: (2024)
di: Sun, Jianqiao, et al.
Pubblicazione: (2024)
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
di: Jeon, MinJu, et al.
Pubblicazione: (2025)
di: Jeon, MinJu, et al.
Pubblicazione: (2025)
AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
di: Chai, Wenhao, et al.
Pubblicazione: (2024)
di: Chai, Wenhao, et al.
Pubblicazione: (2024)
BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations
di: Feng, Weixi, et al.
Pubblicazione: (2025)
di: Feng, Weixi, et al.
Pubblicazione: (2025)
The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss
di: Li, Bozhou, et al.
Pubblicazione: (2025)
di: Li, Bozhou, et al.
Pubblicazione: (2025)
Video ReCap: Recursive Captioning of Hour-Long Videos
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
Cap2Sum: Learning to Summarize Videos by Generating Captions
di: Zhao, Cairong, et al.
Pubblicazione: (2024)
di: Zhao, Cairong, et al.
Pubblicazione: (2024)
Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search
di: Yu, Linhao, et al.
Pubblicazione: (2025)
di: Yu, Linhao, et al.
Pubblicazione: (2025)
GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection
di: Ni, Zhenliang, et al.
Pubblicazione: (2025)
di: Ni, Zhenliang, et al.
Pubblicazione: (2025)
SeqBench: Benchmarking Sequential Narrative Generation in Text-to-Video Models
di: Tang, Zhengxu, et al.
Pubblicazione: (2025)
di: Tang, Zhengxu, et al.
Pubblicazione: (2025)
IP-Bench: Benchmark for Image Protection Methods in Image-to-Video Generation Scenarios
di: Li, Xiaofeng, et al.
Pubblicazione: (2026)
di: Li, Xiaofeng, et al.
Pubblicazione: (2026)
CodecCap: High-Fidelity Codec-Inspired Residual Modeling for Dense Video Captioning
di: Lin, Zihan, et al.
Pubblicazione: (2026)
di: Lin, Zihan, et al.
Pubblicazione: (2026)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
di: Xue, Zhucun, et al.
Pubblicazione: (2025)
di: Xue, Zhucun, et al.
Pubblicazione: (2025)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
di: Ma, David, et al.
Pubblicazione: (2025)
di: Ma, David, et al.
Pubblicazione: (2025)
Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding
di: Wang, Xiao, et al.
Pubblicazione: (2024)
di: Wang, Xiao, et al.
Pubblicazione: (2024)
InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption
di: Fan, Tiehan, et al.
Pubblicazione: (2024)
di: Fan, Tiehan, et al.
Pubblicazione: (2024)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs
di: Ma, Junpeng, et al.
Pubblicazione: (2025)
di: Ma, Junpeng, et al.
Pubblicazione: (2025)
AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs
di: Xia, Shuhan, et al.
Pubblicazione: (2025)
di: Xia, Shuhan, et al.
Pubblicazione: (2025)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
di: Li, Jingyao, et al.
Pubblicazione: (2025)
di: Li, Jingyao, et al.
Pubblicazione: (2025)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
di: Wu, Peiran, et al.
Pubblicazione: (2025)
di: Wu, Peiran, et al.
Pubblicazione: (2025)
T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation
di: Chen, Yubin, et al.
Pubblicazione: (2025)
di: Chen, Yubin, et al.
Pubblicazione: (2025)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
di: Li, Shicheng, et al.
Pubblicazione: (2025)
di: Li, Shicheng, et al.
Pubblicazione: (2025)
T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
di: Cao, Zhe, et al.
Pubblicazione: (2025)
di: Cao, Zhe, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks
di: Chen, Xinlong, et al.
Pubblicazione: (2025) -
IF-VidCap: Can Video Caption Models Follow Instructions?
di: Li, Shihao, et al.
Pubblicazione: (2025) -
Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Models
di: Chen, Xinlong, et al.
Pubblicazione: (2025) -
AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
di: Chen, Xinlong, et al.
Pubblicazione: (2025) -
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
di: Shi, Yang, et al.
Pubblicazione: (2025)