Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Tang, Changli, Li, Yixuan, Yang, Yudong, Zhuang, Jimin, Sun, Guangzhi, Li, Wei, Ma, Zujun, Zhang, Chao |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
by: Tang, Changli, et al.
Published: (2025)
by: Tang, Changli, et al.
Published: (2025)
Improving LLM Video Understanding with 16 Frames Per Second
by: Li, Yixuan, et al.
Published: (2025)
by: Li, Yixuan, et al.
Published: (2025)
High-Frequency Enhanced Hybrid Neural Representation for Video Compression
by: Yu, Li, et al.
Published: (2024)
by: Yu, Li, et al.
Published: (2024)
Sketch It Out: Exploring Label-Free Structural Cues for Multimodal Gait Recognition
by: Zhang, Chao, et al.
Published: (2026)
by: Zhang, Chao, et al.
Published: (2026)
CAMP-VQA: Caption-Embedded Multimodal Perception for No-Reference Quality Assessment of Compressed Video
by: Wang, Xinyi, et al.
Published: (2025)
by: Wang, Xinyi, et al.
Published: (2025)
Advancing Video Anomaly Detection: A Bi-Directional Hybrid Framework for Enhanced Single- and Multi-Task Approaches
by: Shen, Guodong, et al.
Published: (2025)
by: Shen, Guodong, et al.
Published: (2025)
Unveiling Hidden Details: A RAW Data-Enhanced Paradigm for Real-World Super-Resolution
by: Peng, Long, et al.
Published: (2024)
by: Peng, Long, et al.
Published: (2024)
CAMixerSR: Only Details Need More "Attention"
by: Wang, Yan, et al.
Published: (2024)
by: Wang, Yan, et al.
Published: (2024)
MedRegion-CT: Region-Focused Multimodal LLM for Comprehensive 3D CT Report Generation
by: Kyung, Sunggu, et al.
Published: (2025)
by: Kyung, Sunggu, et al.
Published: (2025)
Keep It Accurate and Robust: An Enhanced Nuclei Analysis Framework
by: Zhang, Wenhua, et al.
Published: (2022)
by: Zhang, Wenhua, et al.
Published: (2022)
Single-Image HDR Reconstruction Assisted Ghost Suppression and Detail Preservation Network for Multi-Exposure HDR Imaging
by: Li, Huafeng, et al.
Published: (2024)
by: Li, Huafeng, et al.
Published: (2024)
How Accurate are Video Quality Models for Diffusion-Based Video Super-Resolution?
by: Herb, Benjamin, et al.
Published: (2026)
by: Herb, Benjamin, et al.
Published: (2026)
Neural Video Compression with Context Modulation
by: Tang, Chuanbo, et al.
Published: (2025)
by: Tang, Chuanbo, et al.
Published: (2025)
Efficient Dynamic-NeRF Based Volumetric Video Coding with Rate Distortion Optimization
by: Zhang, Zhiyu, et al.
Published: (2024)
by: Zhang, Zhiyu, et al.
Published: (2024)
RetinaLogos: Fine-Grained Synthesis of High-Resolution Retinal Images Through Captions
by: Ning, Junzhi, et al.
Published: (2025)
by: Ning, Junzhi, et al.
Published: (2025)
RealisVSR: Detail-enhanced Diffusion for Real-World 4K Video Super-Resolution
by: Zhao, Weisong, et al.
Published: (2025)
by: Zhao, Weisong, et al.
Published: (2025)
Augmented Deep Contexts for Spatially Embedded Video Coding
by: Bian, Yifan, et al.
Published: (2025)
by: Bian, Yifan, et al.
Published: (2025)
Uncertainty-Aware Deep Video Compression with Ensembles
by: Ma, Wufei, et al.
Published: (2024)
by: Ma, Wufei, et al.
Published: (2024)
A Multi-annotated and Multi-modal Dataset for Wide-angle Video Quality Assessment
by: Hu, Bo, et al.
Published: (2025)
by: Hu, Bo, et al.
Published: (2025)
Object Segmentation-Assisted Inter Prediction for Versatile Video Coding
by: Li, Zhuoyuan, et al.
Published: (2024)
by: Li, Zhuoyuan, et al.
Published: (2024)
Mind the Detail: Uncovering Clinically Relevant Image Details in Accelerated MRI with Semantically Diverse Reconstructions
by: Morshuis, Jan Nikolas, et al.
Published: (2025)
by: Morshuis, Jan Nikolas, et al.
Published: (2025)
AID-DTI: Accelerating High-fidelity Diffusion Tensor Imaging with Detail-Preserving Model-based Deep Learning
by: Fan, Wenxin, et al.
Published: (2024)
by: Fan, Wenxin, et al.
Published: (2024)
Modular Blind Video Quality Assessment
by: Wen, Wen, et al.
Published: (2024)
by: Wen, Wen, et al.
Published: (2024)
EndoGen: Conditional Autoregressive Endoscopic Video Generation
by: Liu, Xinyu, et al.
Published: (2025)
by: Liu, Xinyu, et al.
Published: (2025)
NVC-1B: A Large Neural Video Coding Model
by: Sheng, Xihua, et al.
Published: (2024)
by: Sheng, Xihua, et al.
Published: (2024)
GenDR: Lighten Generative Detail Restoration
by: Wang, Yan, et al.
Published: (2025)
by: Wang, Yan, et al.
Published: (2025)
Enhanced Encoder-Decoder Architecture for Accurate Monocular Depth Estimation
by: Das, Dabbrata, et al.
Published: (2024)
by: Das, Dabbrata, et al.
Published: (2024)
DiffRect: Latent Diffusion Label Rectification for Semi-supervised Medical Image Segmentation
by: Liu, Xinyu, et al.
Published: (2024)
by: Liu, Xinyu, et al.
Published: (2024)
RetinaRegen: A Hybrid Model for Readability and Detail Restoration in Fundus Images
by: Tang, Yuhan, et al.
Published: (2025)
by: Tang, Yuhan, et al.
Published: (2025)
Cross-domain Denoising for Low-dose Multi-frame Spiral Computed Tomography
by: Lu, Yucheng, et al.
Published: (2023)
by: Lu, Yucheng, et al.
Published: (2023)
Enhancing Neural Video Compression of Static Scenes with Positive-Incentive Noise
by: Yuan, Cheng, et al.
Published: (2026)
by: Yuan, Cheng, et al.
Published: (2026)
DGSSA: Domain generalization with structural and stylistic augmentation for retinal vessel segmentation
by: Liu, Bo, et al.
Published: (2025)
by: Liu, Bo, et al.
Published: (2025)
Adaptive Image Quality Assessment via Teaching Large Multimodal Model to Compare
by: Zhu, Hanwei, et al.
Published: (2024)
by: Zhu, Hanwei, et al.
Published: (2024)
KVQ: Kwai Video Quality Assessment for Short-form Videos
by: Lu, Yiting, et al.
Published: (2024)
by: Lu, Yiting, et al.
Published: (2024)
3D Multi-frame Fusion for Video Stabilization
by: Peng, Zhan, et al.
Published: (2024)
by: Peng, Zhan, et al.
Published: (2024)
Spatial-Temporal Multi-level Association for Video Object Segmentation
by: Miao, Deshui, et al.
Published: (2024)
by: Miao, Deshui, et al.
Published: (2024)
UltraDfeGAN: Detail-Enhancing Generative Adversarial Networks for High-Fidelity Functional Ultrasound Synthesis
by: Li, Zhuo, et al.
Published: (2025)
by: Li, Zhuo, et al.
Published: (2025)
TESL-Net: A Transformer-Enhanced CNN for Accurate Skin Lesion Segmentation
by: Iqbal, Shahzaib, et al.
Published: (2024)
by: Iqbal, Shahzaib, et al.
Published: (2024)
Whitened CLIP as a Likelihood Surrogate of Images and Captions
by: Betser, Roy, et al.
Published: (2025)
by: Betser, Roy, et al.
Published: (2025)
The Solution for the CVPR2023 NICE Image Captioning Challenge
by: Wu, Xiangyu, et al.
Published: (2023)
by: Wu, Xiangyu, et al.
Published: (2023)
Similar Items
-
video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
by: Tang, Changli, et al.
Published: (2025) -
Improving LLM Video Understanding with 16 Frames Per Second
by: Li, Yixuan, et al.
Published: (2025) -
High-Frequency Enhanced Hybrid Neural Representation for Video Compression
by: Yu, Li, et al.
Published: (2024) -
Sketch It Out: Exploring Label-Free Structural Cues for Multimodal Gait Recognition
by: Zhang, Chao, et al.
Published: (2026) -
CAMP-VQA: Caption-Embedded Multimodal Perception for No-Reference Quality Assessment of Compressed Video
by: Wang, Xinyi, et al.
Published: (2025)