TiFRe: Text-guided Video Frame Reduction for Efficient Video Multi-modal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zheng, Xiangtian, Wang, Zishuo, Peng, Yuxin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
por: Li, Zeqian, et al.
Publicado: (2025)
por: Li, Zeqian, et al.
Publicado: (2025)
Frame-Voyager: Learning to Query Frames for Video Large Language Models
por: Yu, Sicheng, et al.
Publicado: (2024)
por: Yu, Sicheng, et al.
Publicado: (2024)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
por: Nie, Yuxiang, et al.
Publicado: (2025)
por: Nie, Yuxiang, et al.
Publicado: (2025)
Relaxing Anchor-Frame Dominance for Mitigating Hallucinations in Video Large Language Models
por: Liu, Zijian, et al.
Publicado: (2026)
por: Liu, Zijian, et al.
Publicado: (2026)
VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion
por: Tang, Linfeng, et al.
Publicado: (2025)
por: Tang, Linfeng, et al.
Publicado: (2025)
Multi-Granularity and Multi-modal Feature Interaction Approach for Text Video Retrieval
por: Li, Wenjun, et al.
Publicado: (2024)
por: Li, Wenjun, et al.
Publicado: (2024)
PMQ-VE: Progressive Multi-Frame Quantization for Video Enhancement
por: Feng, ZhanFeng, et al.
Publicado: (2025)
por: Feng, ZhanFeng, et al.
Publicado: (2025)
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
por: Zhang, Deyu, et al.
Publicado: (2025)
por: Zhang, Deyu, et al.
Publicado: (2025)
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
por: Liao, Wenhui, et al.
Publicado: (2024)
por: Liao, Wenhui, et al.
Publicado: (2024)
Training-free Video Temporal Grounding using Large-scale Pre-trained Models
por: Zheng, Minghang, et al.
Publicado: (2024)
por: Zheng, Minghang, et al.
Publicado: (2024)
Text-Video Multi-Grained Integration for Video Moment Montage
por: Yin, Zhihui, et al.
Publicado: (2024)
por: Yin, Zhihui, et al.
Publicado: (2024)
FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering
por: Cheng, Zheng, et al.
Publicado: (2024)
por: Cheng, Zheng, et al.
Publicado: (2024)
Self-supervised Learning of Event-guided Video Frame Interpolation for Rolling Shutter Frames
por: Lu, Yunfan, et al.
Publicado: (2023)
por: Lu, Yunfan, et al.
Publicado: (2023)
VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
Poisoning Prompt-Guided Sampling in Video Large Language Models
por: Cao, Yuxin, et al.
Publicado: (2025)
por: Cao, Yuxin, et al.
Publicado: (2025)
Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models
por: Li, Jinlong, et al.
Publicado: (2026)
por: Li, Jinlong, et al.
Publicado: (2026)
EventDiff: A Unified and Efficient Diffusion Model Framework for Event-based Video Frame Interpolation
por: Zheng, Hanle, et al.
Publicado: (2025)
por: Zheng, Hanle, et al.
Publicado: (2025)
HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
por: Peng, Zelin, et al.
Publicado: (2025)
por: Peng, Zelin, et al.
Publicado: (2025)
VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning on Language-Video Foundation Models
por: Chen, Hong, et al.
Publicado: (2023)
por: Chen, Hong, et al.
Publicado: (2023)
Text-guided Fine-Grained Video Anomaly Understanding
por: Gu, Jihao, et al.
Publicado: (2025)
por: Gu, Jihao, et al.
Publicado: (2025)
Towards Redundancy Reduction in Diffusion Models for Efficient Video Super-Resolution
por: Guo, Jinpei, et al.
Publicado: (2025)
por: Guo, Jinpei, et al.
Publicado: (2025)
Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval
por: Ko, Dohwan, et al.
Publicado: (2025)
por: Ko, Dohwan, et al.
Publicado: (2025)
Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
por: Liu, Zhihang, et al.
Publicado: (2025)
por: Liu, Zhihang, et al.
Publicado: (2025)
Efficient Multi-modal Large Language Models via Visual Token Grouping
por: Huang, Minbin, et al.
Publicado: (2024)
por: Huang, Minbin, et al.
Publicado: (2024)
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval
por: Shen, Leqi, et al.
Publicado: (2025)
por: Shen, Leqi, et al.
Publicado: (2025)
Exploring Efficient Foundational Multi-modal Models for Video Summarization
por: Samel, Karan, et al.
Publicado: (2024)
por: Samel, Karan, et al.
Publicado: (2024)
GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding
por: Ma, Junpeng, et al.
Publicado: (2026)
por: Ma, Junpeng, et al.
Publicado: (2026)
Large Motion Video Autoencoding with Cross-modal Video VAE
por: Xing, Yazhou, et al.
Publicado: (2024)
por: Xing, Yazhou, et al.
Publicado: (2024)
Frame-Level Captions for Long Video Generation with Complex Multi Scenes
por: Zheng, Guangcong, et al.
Publicado: (2025)
por: Zheng, Guangcong, et al.
Publicado: (2025)
Motion-aware Latent Diffusion Models for Video Frame Interpolation
por: Huang, Zhilin, et al.
Publicado: (2024)
por: Huang, Zhilin, et al.
Publicado: (2024)
Real-time Video Target Tracking Algorithm Utilizing Convolutional Neural Networks (CNN)
por: Tan, Chaoyi, et al.
Publicado: (2024)
por: Tan, Chaoyi, et al.
Publicado: (2024)
M-LLM Based Video Frame Selection for Efficient Video Understanding
por: Hu, Kai, et al.
Publicado: (2025)
por: Hu, Kai, et al.
Publicado: (2025)
Failures to Surface Harmful Contents in Video Large Language Models
por: Cao, Yuxin, et al.
Publicado: (2025)
por: Cao, Yuxin, et al.
Publicado: (2025)
SurgFed: Language-guided Multi-Task Federated Learning for Surgical Video Understanding
por: Fang, Zheng, et al.
Publicado: (2026)
por: Fang, Zheng, et al.
Publicado: (2026)
LADDER: An Efficient Framework for Video Frame Interpolation
por: Shen, Tong, et al.
Publicado: (2024)
por: Shen, Tong, et al.
Publicado: (2024)
Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models
por: Shen, Yiqing, et al.
Publicado: (2025)
por: Shen, Yiqing, et al.
Publicado: (2025)
Frame-wise Conditioning Adaptation for Fine-Tuning Diffusion Models in Text-to-Video Prediction
por: Liu, Zheyuan, et al.
Publicado: (2025)
por: Liu, Zheyuan, et al.
Publicado: (2025)
Empowering Segmentation Ability to Multi-modal Large Language Models
por: Yang, Yuqi, et al.
Publicado: (2024)
por: Yang, Yuqi, et al.
Publicado: (2024)
VideoLLM-online: Online Video Large Language Model for Streaming Video
por: Chen, Joya, et al.
Publicado: (2024)
por: Chen, Joya, et al.
Publicado: (2024)
Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
por: Wen, Zichen, et al.
Publicado: (2025)
por: Wen, Zichen, et al.
Publicado: (2025)
Ejemplares similares
-
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
por: Li, Zeqian, et al.
Publicado: (2025) -
Frame-Voyager: Learning to Query Frames for Video Large Language Models
por: Yu, Sicheng, et al.
Publicado: (2024) -
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
por: Nie, Yuxiang, et al.
Publicado: (2025) -
Relaxing Anchor-Frame Dominance for Mitigating Hallucinations in Video Large Language Models
por: Liu, Zijian, et al.
Publicado: (2026) -
VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion
por: Tang, Linfeng, et al.
Publicado: (2025)