Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Shimin, Yuan, Yitian, Chen, Shaoxiang, Jie, Zequn, Ma, Lin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability
von: Chen, Shimin, et al.
Veröffentlicht: (2024)
von: Chen, Shimin, et al.
Veröffentlicht: (2024)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
von: Jiao, Yang, et al.
Veröffentlicht: (2025)
von: Jiao, Yang, et al.
Veröffentlicht: (2025)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
von: Lan, Xiaohan, et al.
Veröffentlicht: (2024)
von: Lan, Xiaohan, et al.
Veröffentlicht: (2024)
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2024)
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2024)
Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
von: Yuan, Liping, et al.
Veröffentlicht: (2025)
von: Yuan, Liping, et al.
Veröffentlicht: (2025)
Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters
von: Li, Kevin Y., et al.
Veröffentlicht: (2024)
von: Li, Kevin Y., et al.
Veröffentlicht: (2024)
From Fewer Samples to Fewer Bits: Reframing Dataset Distillation as Joint Optimization of Precision and Compactness
von: Dinh, My H., et al.
Veröffentlicht: (2026)
von: Dinh, My H., et al.
Veröffentlicht: (2026)
MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis
von: Chen, Lei, et al.
Veröffentlicht: (2024)
von: Chen, Lei, et al.
Veröffentlicht: (2024)
Partial Channel Network: Compute Fewer, Perform Better
von: Huang, Haiduo, et al.
Veröffentlicht: (2025)
von: Huang, Haiduo, et al.
Veröffentlicht: (2025)
XNet v2: Fewer Limitations, Better Results and Greater Universality
von: Zhou, Yanfeng, et al.
Veröffentlicht: (2024)
von: Zhou, Yanfeng, et al.
Veröffentlicht: (2024)
Scaling Artificial Intelligence for Multi-Tumor Early Detection with More Reports, Fewer Masks
von: Bassi, Pedro R. A. S., et al.
Veröffentlicht: (2025)
von: Bassi, Pedro R. A. S., et al.
Veröffentlicht: (2025)
LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs
von: Chen, Shaoxiang, et al.
Veröffentlicht: (2024)
von: Chen, Shaoxiang, et al.
Veröffentlicht: (2024)
VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models
von: Li, Chenglin, et al.
Veröffentlicht: (2024)
von: Li, Chenglin, et al.
Veröffentlicht: (2024)
Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
von: Jiao, Yang, et al.
Veröffentlicht: (2024)
von: Jiao, Yang, et al.
Veröffentlicht: (2024)
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
von: Sun, Fengyuan, et al.
Veröffentlicht: (2025)
von: Sun, Fengyuan, et al.
Veröffentlicht: (2025)
ELIP: Efficient Discriminative Language-Image Pre-training with Fewer Vision Tokens
von: Guo, Yangyang, et al.
Veröffentlicht: (2023)
von: Guo, Yangyang, et al.
Veröffentlicht: (2023)
MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models
von: Yang, Garry, et al.
Veröffentlicht: (2025)
von: Yang, Garry, et al.
Veröffentlicht: (2025)
Few and Fewer: Learning Better from Few Examples Using Fewer Base Classes
von: Lafargue, Raphael, et al.
Veröffentlicht: (2024)
von: Lafargue, Raphael, et al.
Veröffentlicht: (2024)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
von: Chen, Xueyi, et al.
Veröffentlicht: (2025)
von: Chen, Xueyi, et al.
Veröffentlicht: (2025)
VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding
von: He, Zhihao, et al.
Veröffentlicht: (2026)
von: He, Zhihao, et al.
Veröffentlicht: (2026)
Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
von: Ma, Yinchao, et al.
Veröffentlicht: (2026)
von: Ma, Yinchao, et al.
Veröffentlicht: (2026)
VideoMAR: Autoregressive Video Generatio with Continuous Tokens
von: Yu, Hu, et al.
Veröffentlicht: (2025)
von: Yu, Hu, et al.
Veröffentlicht: (2025)
Medical Large Vision Language Models with Multi-Image Visual Ability
von: Yang, Xikai, et al.
Veröffentlicht: (2025)
von: Yang, Xikai, et al.
Veröffentlicht: (2025)
TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
von: Li, Wei, et al.
Veröffentlicht: (2024)
von: Li, Wei, et al.
Veröffentlicht: (2024)
Stronger, Fewer, & Superior: Harnessing Vision Foundation Models for Domain Generalized Semantic Segmentation
von: Wei, Zhixiang, et al.
Veröffentlicht: (2023)
von: Wei, Zhixiang, et al.
Veröffentlicht: (2023)
Rethinking Token Reduction for Large Vision-Language Models
von: Wang, Yi, et al.
Veröffentlicht: (2026)
von: Wang, Yi, et al.
Veröffentlicht: (2026)
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
von: Susladkar, Onkar, et al.
Veröffentlicht: (2026)
von: Susladkar, Onkar, et al.
Veröffentlicht: (2026)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
von: Chen, Tao, et al.
Veröffentlicht: (2026)
von: Chen, Tao, et al.
Veröffentlicht: (2026)
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
von: Zhang, Yongheng, et al.
Veröffentlicht: (2025)
von: Zhang, Yongheng, et al.
Veröffentlicht: (2025)
Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding
von: Clark, Christopher, et al.
Veröffentlicht: (2026)
von: Clark, Christopher, et al.
Veröffentlicht: (2026)
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
von: Luo, Bingjun, et al.
Veröffentlicht: (2026)
von: Luo, Bingjun, et al.
Veröffentlicht: (2026)
MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models
von: Liu, Shengyuan, et al.
Veröffentlicht: (2026)
von: Liu, Shengyuan, et al.
Veröffentlicht: (2026)
PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models
von: Meng, Yu, et al.
Veröffentlicht: (2025)
von: Meng, Yu, et al.
Veröffentlicht: (2025)
M4V: Multi-Modal Mamba for Text-to-Video Generation
von: Huang, Jiancheng, et al.
Veröffentlicht: (2025)
von: Huang, Jiancheng, et al.
Veröffentlicht: (2025)
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
von: Kang, Minseok, et al.
Veröffentlicht: (2026)
von: Kang, Minseok, et al.
Veröffentlicht: (2026)
Personalized Video Summarization by Multimodal Video Understanding
von: Chen, Brian, et al.
Veröffentlicht: (2024)
von: Chen, Brian, et al.
Veröffentlicht: (2024)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
von: Zhao, Baining, et al.
Veröffentlicht: (2025)
von: Zhao, Baining, et al.
Veröffentlicht: (2025)
CoCoVideo: The High-Quality Commercial-Model-Based Contrastive Benchmark for AI-Generated Video Detection
von: Feng, Huidong, et al.
Veröffentlicht: (2026)
von: Feng, Huidong, et al.
Veröffentlicht: (2026)
Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
von: Liu, Zhihang, et al.
Veröffentlicht: (2025)
von: Liu, Zhihang, et al.
Veröffentlicht: (2025)
LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models
von: Qharabagh, Muhammad Fetrat, et al.
Veröffentlicht: (2024)
von: Qharabagh, Muhammad Fetrat, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability
von: Chen, Shimin, et al.
Veröffentlicht: (2024) -
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
von: Jiao, Yang, et al.
Veröffentlicht: (2025) -
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
von: Lan, Xiaohan, et al.
Veröffentlicht: (2024) -
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2024) -
Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
von: Yuan, Liping, et al.
Veröffentlicht: (2025)