ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Lin, Wei, Xilin, Li, Jinsong, Dong, Xiaoyi, Zhang, Pan, Zang, Yuhang, Chen, Zehui, Duan, Haodong, Lin, Bin, Tang, Zhenyu, Yuan, Li, Qiao, Yu, Lin, Dahua, Zhao, Feng, Wang, Jiaqi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Are We on the Right Way for Evaluating Large Vision-Language Models?
por: Chen, Lin, et al.
Publicado: (2024)
por: Chen, Lin, et al.
Publicado: (2024)
VideoRoPE: What Makes for Good Video Rotary Position Embedding?
por: Wei, Xilin, et al.
Publicado: (2025)
por: Wei, Xilin, et al.
Publicado: (2025)
Streaming Long Video Understanding with Large Language Models
por: Qian, Rui, et al.
Publicado: (2024)
por: Qian, Rui, et al.
Publicado: (2024)
Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing
por: Li, Jinsong, et al.
Publicado: (2026)
por: Li, Jinsong, et al.
Publicado: (2026)
Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models
por: Li, Jinsong, et al.
Publicado: (2025)
por: Li, Jinsong, et al.
Publicado: (2025)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
por: Zhang, Beichen, et al.
Publicado: (2025)
por: Zhang, Beichen, et al.
Publicado: (2025)
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
por: Liu, Yuhong, et al.
Publicado: (2025)
por: Liu, Yuhong, et al.
Publicado: (2025)
Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction
por: Qian, Rui, et al.
Publicado: (2025)
por: Qian, Rui, et al.
Publicado: (2025)
SPARK: Synergistic Policy And Reward Co-Evolving Framework
por: Liu, Ziyu, et al.
Publicado: (2025)
por: Liu, Ziyu, et al.
Publicado: (2025)
Visual-RFT: Visual Reinforcement Fine-Tuning
por: Liu, Ziyu, et al.
Publicado: (2025)
por: Liu, Ziyu, et al.
Publicado: (2025)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
por: Fang, Xinyu, et al.
Publicado: (2024)
por: Fang, Xinyu, et al.
Publicado: (2024)
BoostStep: Boosting mathematical capability of Large Language Models via improved single-step reasoning
por: Zhang, Beichen, et al.
Publicado: (2025)
por: Zhang, Beichen, et al.
Publicado: (2025)
SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree
por: Ding, Shuangrui, et al.
Publicado: (2024)
por: Ding, Shuangrui, et al.
Publicado: (2024)
ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way
por: Bu, Jiazi, et al.
Publicado: (2024)
por: Bu, Jiazi, et al.
Publicado: (2024)
ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
por: Xing, Long, et al.
Publicado: (2025)
por: Xing, Long, et al.
Publicado: (2025)
Advancing Complex Video Object Segmentation via Progressive Concept Construction
por: Zhang, Zhixiong, et al.
Publicado: (2025)
por: Zhang, Zhixiong, et al.
Publicado: (2025)
SIM-CoT: Supervised Implicit Chain-of-Thought
por: Wei, Xilin, et al.
Publicado: (2025)
por: Wei, Xilin, et al.
Publicado: (2025)
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
por: Xing, Long, et al.
Publicado: (2025)
por: Xing, Long, et al.
Publicado: (2025)
MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs
por: Liu, Ziyu, et al.
Publicado: (2024)
por: Liu, Ziyu, et al.
Publicado: (2024)
Visual Agentic Reinforcement Fine-Tuning
por: Liu, Ziyu, et al.
Publicado: (2025)
por: Liu, Ziyu, et al.
Publicado: (2025)
ETCHR: Editing To Clarify and Harness Reasoning
por: Zhang, Beichen, et al.
Publicado: (2026)
por: Zhang, Beichen, et al.
Publicado: (2026)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
por: Liu, Ziyu, et al.
Publicado: (2024)
por: Liu, Ziyu, et al.
Publicado: (2024)
MM-IFEngine: Towards Multimodal Instruction Following
por: Ding, Shengyuan, et al.
Publicado: (2025)
por: Ding, Shengyuan, et al.
Publicado: (2025)
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
por: Li, Yifei, et al.
Publicado: (2025)
por: Li, Yifei, et al.
Publicado: (2025)
Bootstrap3D: Improving Multi-view Diffusion Model with Synthetic Data
por: Sun, Zeyi, et al.
Publicado: (2024)
por: Sun, Zeyi, et al.
Publicado: (2024)
ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation
por: Chen, Junying, et al.
Publicado: (2025)
por: Chen, Junying, et al.
Publicado: (2025)
DualFocus: Integrating Macro and Micro Perspectives in Multi-modal Large Language Models
por: Cao, Yuhang, et al.
Publicado: (2024)
por: Cao, Yuhang, et al.
Publicado: (2024)
InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions
por: Zhang, Pan, et al.
Publicado: (2024)
por: Zhang, Pan, et al.
Publicado: (2024)
Light-A-Video: Training-free Video Relighting via Progressive Light Fusion
por: Zhou, Yujie, et al.
Publicado: (2025)
por: Zhou, Yujie, et al.
Publicado: (2025)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
por: Zang, Yuhang, et al.
Publicado: (2025)
por: Zang, Yuhang, et al.
Publicado: (2025)
Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings
por: Ma, Yubo, et al.
Publicado: (2025)
por: Ma, Yubo, et al.
Publicado: (2025)
SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation
por: Liu, Zihan, et al.
Publicado: (2025)
por: Liu, Zihan, et al.
Publicado: (2025)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
por: Huang, Qidong, et al.
Publicado: (2024)
por: Huang, Qidong, et al.
Publicado: (2024)
SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
por: Sun, Zeyi, et al.
Publicado: (2025)
por: Sun, Zeyi, et al.
Publicado: (2025)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
por: Ding, Shengyuan, et al.
Publicado: (2025)
por: Ding, Shengyuan, et al.
Publicado: (2025)
RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition
por: Liu, Ziyu, et al.
Publicado: (2024)
por: Liu, Ziyu, et al.
Publicado: (2024)
ProSA: Assessing and Understanding the Prompt Sensitivity of LLMs
por: Zhuo, Jingming, et al.
Publicado: (2024)
por: Zhuo, Jingming, et al.
Publicado: (2024)
Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs
por: Qiao, Yuxuan, et al.
Publicado: (2024)
por: Qiao, Yuxuan, et al.
Publicado: (2024)
From Captions to Keyframes: KeyScore for Multimodal Frame Scoring and Video-Language Understanding
por: Lin, Shih-Yao, et al.
Publicado: (2025)
por: Lin, Shih-Yao, et al.
Publicado: (2025)
2nd Place Report of MOSEv2 Challenge 2025: Concept Guided Video Object Segmentation via SeC
por: Zhang, Zhixiong, et al.
Publicado: (2025)
por: Zhang, Zhixiong, et al.
Publicado: (2025)
Ejemplares similares
-
Are We on the Right Way for Evaluating Large Vision-Language Models?
por: Chen, Lin, et al.
Publicado: (2024) -
VideoRoPE: What Makes for Good Video Rotary Position Embedding?
por: Wei, Xilin, et al.
Publicado: (2025) -
Streaming Long Video Understanding with Large Language Models
por: Qian, Rui, et al.
Publicado: (2024) -
Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing
por: Li, Jinsong, et al.
Publicado: (2026) -
Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models
por: Li, Jinsong, et al.
Publicado: (2025)