Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Yang, Liu, Jiaheng, Guan, Yushuo, Wu, Zhenhua, Zhang, Yuanxing, Wang, Zihao, Lin, Weihong, Hua, Jingyun, Wang, Zekun, Chen, Xinlong, Zeng, Bohan, Zhang, Wentao, Zhang, Fuzheng, Yang, Wenjing, Zhang, Di |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models
di: Chen, Xinlong, et al.
Pubblicazione: (2026)
di: Chen, Xinlong, et al.
Pubblicazione: (2026)
The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss
di: Li, Bozhou, et al.
Pubblicazione: (2025)
di: Li, Bozhou, et al.
Pubblicazione: (2025)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
di: Li, Bozhou, et al.
Pubblicazione: (2025)
di: Li, Bozhou, et al.
Pubblicazione: (2025)
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Models
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
Semantic Routing: Exploring Multi-Layer LLM Feature Weighting for Diffusion Transformers
di: Li, Bozhou, et al.
Pubblicazione: (2026)
di: Li, Bozhou, et al.
Pubblicazione: (2026)
AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
di: Ding, Yue, et al.
Pubblicazione: (2026)
di: Ding, Yue, et al.
Pubblicazione: (2026)
VABench: A Comprehensive Benchmark for Audio-Video Generation
di: Hua, Daili, et al.
Pubblicazione: (2025)
di: Hua, Daili, et al.
Pubblicazione: (2025)
MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
di: Peng, Tianhao, et al.
Pubblicazione: (2025)
di: Peng, Tianhao, et al.
Pubblicazione: (2025)
Clapper: Compact Learning and Video Representation in VLMs
di: Kong, Lingyu, et al.
Pubblicazione: (2025)
di: Kong, Lingyu, et al.
Pubblicazione: (2025)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
di: Dai, Yifan, et al.
Pubblicazione: (2026)
di: Dai, Yifan, et al.
Pubblicazione: (2026)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
di: Zhang, Hongzhi, et al.
Pubblicazione: (2025)
di: Zhang, Hongzhi, et al.
Pubblicazione: (2025)
Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling
di: Wang, Yuran, et al.
Pubblicazione: (2025)
di: Wang, Yuran, et al.
Pubblicazione: (2025)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
di: Pan, Yaning, et al.
Pubblicazione: (2025)
di: Pan, Yaning, et al.
Pubblicazione: (2025)
Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding
di: Wang, Xiao, et al.
Pubblicazione: (2024)
di: Wang, Xiao, et al.
Pubblicazione: (2024)
A Multistage Extraction Pipeline for Long Scanned Financial Documents: An Empirical Study in Industrial KYC Workflows
di: Han, Yuxuan, et al.
Pubblicazione: (2026)
di: Han, Yuxuan, et al.
Pubblicazione: (2026)
MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
di: Wang, Pei, et al.
Pubblicazione: (2024)
di: Wang, Pei, et al.
Pubblicazione: (2024)
CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation
di: Tong, Chengzhuo, et al.
Pubblicazione: (2026)
di: Tong, Chengzhuo, et al.
Pubblicazione: (2026)
Multimodal Reasoning for Science: Technical Report and 1st Place Solution to the ICML 2025 SeePhys Challenge
di: Liang, Hao, et al.
Pubblicazione: (2025)
di: Liang, Hao, et al.
Pubblicazione: (2025)
MIO: A Foundation Model on Multimodal Tokens
di: Wang, Zekun, et al.
Pubblicazione: (2024)
di: Wang, Zekun, et al.
Pubblicazione: (2024)
UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations
di: Zhao, Yaqi, et al.
Pubblicazione: (2026)
di: Zhao, Yaqi, et al.
Pubblicazione: (2026)
T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
di: Cao, Zhe, et al.
Pubblicazione: (2025)
di: Cao, Zhe, et al.
Pubblicazione: (2025)
Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code
di: Lin, Haobo, et al.
Pubblicazione: (2026)
di: Lin, Haobo, et al.
Pubblicazione: (2026)
Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)
Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models
di: Yi, Hao, et al.
Pubblicazione: (2024)
di: Yi, Hao, et al.
Pubblicazione: (2024)
Adapting Foundation Models for Few-Shot Medical Image Segmentation: Actively and Sequentially
di: Yang, Jingyun, et al.
Pubblicazione: (2025)
di: Yang, Jingyun, et al.
Pubblicazione: (2025)
Learning What is Worth Learning: Active and Sequential Domain Adaptation for Multi-modal Gross Tumor Volume Segmentation
di: Yang, Jingyun, et al.
Pubblicazione: (2025)
di: Yang, Jingyun, et al.
Pubblicazione: (2025)
ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
di: Li, Yuhang, et al.
Pubblicazione: (2025)
di: Li, Yuhang, et al.
Pubblicazione: (2025)
Hierarchical Feature Learning for Medical Point Clouds via State Space Model
di: Zhang, Guoqing, et al.
Pubblicazione: (2025)
di: Zhang, Guoqing, et al.
Pubblicazione: (2025)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
di: Li, Shicheng, et al.
Pubblicazione: (2025)
di: Li, Shicheng, et al.
Pubblicazione: (2025)
MCRL4OR: Multimodal Contrastive Representation Learning for Off-Road Environmental Perception
di: Yang, Yi, et al.
Pubblicazione: (2025)
di: Yang, Yi, et al.
Pubblicazione: (2025)
Semantic Score Distillation Sampling for Compositional Text-to-3D Generation
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
ViDiC: Video Difference Captioning
di: Wu, Jiangtao, et al.
Pubblicazione: (2025)
di: Wu, Jiangtao, et al.
Pubblicazione: (2025)
Asynchronous Multimodal Video Sequence Fusion via Learning Modality-Exclusive and -Agnostic Representations
di: Yang, Dingkang, et al.
Pubblicazione: (2024)
di: Yang, Dingkang, et al.
Pubblicazione: (2024)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
di: Ma, David, et al.
Pubblicazione: (2025)
di: Ma, David, et al.
Pubblicazione: (2025)
Dynamic Multimodal Expression Generation for LLM-Driven Pedagogical Agents: From User Experience Perspective
di: Wan, Ninghao, et al.
Pubblicazione: (2026)
di: Wan, Ninghao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks
di: Chen, Xinlong, et al.
Pubblicazione: (2025) -
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
di: Wang, Xiao, et al.
Pubblicazione: (2025) -
DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models
di: Chen, Xinlong, et al.
Pubblicazione: (2026) -
The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss
di: Li, Bozhou, et al.
Pubblicazione: (2025) -
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
di: Shi, Yang, et al.
Pubblicazione: (2025)