MDP3: A Training-free Approach for List-wise Frame Selection in Video-LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Hui, Lu, Shiyin, Wang, Huanyu, Chen, Qing-Guo, Xu, Zhao, Luo, Weihua, Zhang, Kaifu, Li, Ming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
por: Lu, Shiyin, et al.
Publicado: (2024)
por: Lu, Shiyin, et al.
Publicado: (2024)
Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
por: Yang, Wenhao, et al.
Publicado: (2025)
por: Yang, Wenhao, et al.
Publicado: (2025)
Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization
por: Wang, Yibo, et al.
Publicado: (2026)
por: Wang, Yibo, et al.
Publicado: (2026)
Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
por: Fu, Minghao, et al.
Publicado: (2025)
por: Fu, Minghao, et al.
Publicado: (2025)
CHATS: Combining Human-Aligned Optimization and Test-Time Sampling for Text-to-Image Generation
por: Fu, Minghao, et al.
Publicado: (2025)
por: Fu, Minghao, et al.
Publicado: (2025)
TeEFusion: Blending Text Embeddings to Distill Classifier-Free Guidance
por: Fu, Minghao, et al.
Publicado: (2025)
por: Fu, Minghao, et al.
Publicado: (2025)
Omni-View: Unlocking How Generation Facilitates Understanding in Unified 3D Model based on Multiview images
por: Hu, JiaKui, et al.
Publicado: (2025)
por: Hu, JiaKui, et al.
Publicado: (2025)
Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs
por: Zhang, Shaojie, et al.
Publicado: (2025)
por: Zhang, Shaojie, et al.
Publicado: (2025)
Multimodal Tabular Reasoning with Privileged Structured Information
por: Jiang, Jun-Peng, et al.
Publicado: (2025)
por: Jiang, Jun-Peng, et al.
Publicado: (2025)
From Frames to Clips: Training-free Adaptive Key Clip Selection for Long-Form Video Understanding
por: Sun, Guangyu, et al.
Publicado: (2025)
por: Sun, Guangyu, et al.
Publicado: (2025)
Evaluating Image Caption via Cycle-consistent Text-to-Image Generation
por: Cui, Tianyu, et al.
Publicado: (2025)
por: Cui, Tianyu, et al.
Publicado: (2025)
Parrot: Multilingual Visual Instruction Tuning
por: Sun, Hai-Long, et al.
Publicado: (2024)
por: Sun, Hai-Long, et al.
Publicado: (2024)
Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
por: Yang, Wenhao, et al.
Publicado: (2026)
por: Yang, Wenhao, et al.
Publicado: (2026)
LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs
por: Kim, Jihwan, et al.
Publicado: (2026)
por: Kim, Jihwan, et al.
Publicado: (2026)
Frame-Voyager: Learning to Query Frames for Video Large Language Models
por: Yu, Sicheng, et al.
Publicado: (2024)
por: Yu, Sicheng, et al.
Publicado: (2024)
Wings: Learning Multimodal LLMs without Text-only Forgetting
por: Zhang, Yi-Kai, et al.
Publicado: (2024)
por: Zhang, Yi-Kai, et al.
Publicado: (2024)
Generative Inbetweening through Frame-wise Conditions-Driven Video Generation
por: Zhu, Tianyi, et al.
Publicado: (2024)
por: Zhu, Tianyi, et al.
Publicado: (2024)
PEMF-VTO: Point-Enhanced Video Virtual Try-on via Mask-free Paradigm
por: Chang, Tianyu, et al.
Publicado: (2024)
por: Chang, Tianyu, et al.
Publicado: (2024)
Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs
por: Wang, Yibo, et al.
Publicado: (2026)
por: Wang, Yibo, et al.
Publicado: (2026)
UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation
por: Duan, Lunhao, et al.
Publicado: (2024)
por: Duan, Lunhao, et al.
Publicado: (2024)
ZeroSmooth: Training-free Diffuser Adaptation for High Frame Rate Video Generation
por: Yang, Shaoshu, et al.
Publicado: (2024)
por: Yang, Shaoshu, et al.
Publicado: (2024)
Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs
por: Han, Kai, et al.
Publicado: (2024)
por: Han, Kai, et al.
Publicado: (2024)
Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities
por: Zhao, Shanshan, et al.
Publicado: (2025)
por: Zhao, Shanshan, et al.
Publicado: (2025)
Step-wise Distribution Alignment Guided Style Prompt Tuning for Source-free Cross-domain Few-shot Learning
por: Xu, Huali, et al.
Publicado: (2024)
por: Xu, Huali, et al.
Publicado: (2024)
KTV: Keyframes and Key Tokens Selection for Efficient Training-Free Video LLMs
por: Song, Baiyang, et al.
Publicado: (2026)
por: Song, Baiyang, et al.
Publicado: (2026)
Frame-wise Conditioning Adaptation for Fine-Tuning Diffusion Models in Text-to-Video Prediction
por: Liu, Zheyuan, et al.
Publicado: (2025)
por: Liu, Zheyuan, et al.
Publicado: (2025)
Event-Anchored Frame Selection for Effective Long-Video Understanding
por: Chen, Wang, et al.
Publicado: (2026)
por: Chen, Wang, et al.
Publicado: (2026)
Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding
por: Gao, Sensen, et al.
Publicado: (2025)
por: Gao, Sensen, et al.
Publicado: (2025)
Weight Group-wise Post-Training Quantization for Medical Foundation Model
por: Chen, Yineng, et al.
Publicado: (2026)
por: Chen, Yineng, et al.
Publicado: (2026)
Think-Clip-Sample: Slow-Fast Frame Selection for Video Understanding
por: Tan, Wenhui, et al.
Publicado: (2026)
por: Tan, Wenhui, et al.
Publicado: (2026)
EditCast3D: Single-Frame-Guided 3D Editing with Video Propagation and View Selection
por: Qu, Huaizhi, et al.
Publicado: (2025)
por: Qu, Huaizhi, et al.
Publicado: (2025)
PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs
por: Sun, Bowen, et al.
Publicado: (2025)
por: Sun, Bowen, et al.
Publicado: (2025)
Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos
por: Feng, X., et al.
Publicado: (2026)
por: Feng, X., et al.
Publicado: (2026)
FreePCA: Integrating Consistency Information across Long-short Frames in Training-free Long Video Generation via Principal Component Analysis
por: Tan, Jiangtong, et al.
Publicado: (2025)
por: Tan, Jiangtong, et al.
Publicado: (2025)
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
por: Ghazanfari, Sara, et al.
Publicado: (2025)
por: Ghazanfari, Sara, et al.
Publicado: (2025)
Training-Free Image Editing with Visual Context Integration and Concept Alignment
por: Song, Rui, et al.
Publicado: (2026)
por: Song, Rui, et al.
Publicado: (2026)
Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding
por: Chen, Wang, et al.
Publicado: (2026)
por: Chen, Wang, et al.
Publicado: (2026)
SPACE: Noise Contrastive Estimation Stabilizes Self-Play Fine-Tuning for Large Language Models
por: Wang, Yibo, et al.
Publicado: (2025)
por: Wang, Yibo, et al.
Publicado: (2025)
Layer-wise Noise Guided Selective Wavelet Reconstruction for Robust Medical Image Segmentation
por: Lu, Yuting, et al.
Publicado: (2025)
por: Lu, Yuting, et al.
Publicado: (2025)
Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs
por: Chung, Hyungjin, et al.
Publicado: (2025)
por: Chung, Hyungjin, et al.
Publicado: (2025)
Ejemplares similares
-
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
por: Lu, Shiyin, et al.
Publicado: (2024) -
Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
por: Yang, Wenhao, et al.
Publicado: (2025) -
Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization
por: Wang, Yibo, et al.
Publicado: (2026) -
Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
por: Fu, Minghao, et al.
Publicado: (2025) -
CHATS: Combining Human-Aligned Optimization and Test-Time Sampling for Text-to-Image Generation
por: Fu, Minghao, et al.
Publicado: (2025)