TTF: Temporal Token Fusion for Efficient Video-Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huo, Simin, LI, Ning |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MaMe & MaRe: Matrix-Based Token Merging and Restoration for Efficient Visual Perception and Synthesis
par: Huo, Simin, et autres
Publié: (2026)
par: Huo, Simin, et autres
Publié: (2026)
TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models
par: Liu, Chenghao, et autres
Publié: (2025)
par: Liu, Chenghao, et autres
Publié: (2025)
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
par: Kang, Minseok, et autres
Publié: (2026)
par: Kang, Minseok, et autres
Publié: (2026)
Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
par: Zhang, Jianrui, et autres
Publié: (2026)
par: Zhang, Jianrui, et autres
Publié: (2026)
Motion Guided Token Compression for Efficient Masked Video Modeling
par: Feng, Yukun, et autres
Publié: (2024)
par: Feng, Yukun, et autres
Publié: (2024)
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
par: Luo, Bingjun, et autres
Publié: (2026)
par: Luo, Bingjun, et autres
Publié: (2026)
The Devil is in Temporal Token: High Quality Video Reasoning Segmentation
par: Gong, Sitong, et autres
Publié: (2025)
par: Gong, Sitong, et autres
Publié: (2025)
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling
par: Ju, Shaobo, et autres
Publié: (2026)
par: Ju, Shaobo, et autres
Publié: (2026)
Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification
par: Awan, Mahrukh, et autres
Publié: (2024)
par: Awan, Mahrukh, et autres
Publié: (2024)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
par: Chen, Shimin, et autres
Publié: (2024)
par: Chen, Shimin, et autres
Publié: (2024)
SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization
par: Tan, Zhentao, et autres
Publié: (2024)
par: Tan, Zhentao, et autres
Publié: (2024)
B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens
par: Lu, Zhuqiang, et autres
Publié: (2024)
par: Lu, Zhuqiang, et autres
Publié: (2024)
Spatio-Temporal Token Pruning for Efficient High-Resolution GUI Agents
par: Xu, Zhou, et autres
Publié: (2026)
par: Xu, Zhou, et autres
Publié: (2026)
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
par: Sun, Fengyuan, et autres
Publié: (2025)
par: Sun, Fengyuan, et autres
Publié: (2025)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
par: Chen, Xueyi, et autres
Publié: (2025)
par: Chen, Xueyi, et autres
Publié: (2025)
Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs
par: Hyun, Jeongseok, et autres
Publié: (2025)
par: Hyun, Jeongseok, et autres
Publié: (2025)
Human-Centric Video Anomaly Detection Through Spatio-Temporal Pose Tokenization and Transformer
par: Noghre, Ghazal Alinezhad, et autres
Publié: (2024)
par: Noghre, Ghazal Alinezhad, et autres
Publié: (2024)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
par: Wang, Haibo, et autres
Publié: (2024)
par: Wang, Haibo, et autres
Publié: (2024)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
par: He, Jialuo, et autres
Publié: (2026)
par: He, Jialuo, et autres
Publié: (2026)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
par: Li, Ao, et autres
Publié: (2025)
par: Li, Ao, et autres
Publié: (2025)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
par: Sha, Lin, et autres
Publié: (2026)
par: Sha, Lin, et autres
Publié: (2026)
Efficient Neural Video Representation with Temporally Coherent Modulation
par: Shin, Seungjun, et autres
Publié: (2025)
par: Shin, Seungjun, et autres
Publié: (2025)
Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models
par: Zhang, Jingrui, et autres
Publié: (2026)
par: Zhang, Jingrui, et autres
Publié: (2026)
HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models
par: Zhou, Ziqin, et autres
Publié: (2025)
par: Zhou, Ziqin, et autres
Publié: (2025)
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
par: Yu, Shoubin, et autres
Publié: (2024)
par: Yu, Shoubin, et autres
Publié: (2024)
InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression
par: Lu, Dongchen, et autres
Publié: (2025)
par: Lu, Dongchen, et autres
Publié: (2025)
Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning
par: Yue, Feng, et autres
Publié: (2025)
par: Yue, Feng, et autres
Publié: (2025)
Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
par: Ma, Yinchao, et autres
Publié: (2026)
par: Ma, Yinchao, et autres
Publié: (2026)
EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent
par: Li, Jiaao, et autres
Publié: (2025)
par: Li, Jiaao, et autres
Publié: (2025)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
par: Jin, Xinqi, et autres
Publié: (2025)
par: Jin, Xinqi, et autres
Publié: (2025)
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
par: Susladkar, Onkar, et autres
Publié: (2026)
par: Susladkar, Onkar, et autres
Publié: (2026)
Temporal Aware Pruning for Efficient Diffusion-based Video Generation
par: Li, Sheng, et autres
Publié: (2026)
par: Li, Sheng, et autres
Publié: (2026)
Decoupled Seg Tokens Make Stronger Reasoning Video Segmenter and Grounder
par: Jisheng, Dang, et autres
Publié: (2025)
par: Jisheng, Dang, et autres
Publié: (2025)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
par: Zhang, Jusheng, et autres
Publié: (2025)
par: Zhang, Jusheng, et autres
Publié: (2025)
TempGlitch: Evaluating Vision-Language Models for Temporal Glitch Detection in Gameplay Videos
par: Yu, Yakun, et autres
Publié: (2026)
par: Yu, Yakun, et autres
Publié: (2026)
Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models
par: Cao, Tri, et autres
Publié: (2026)
par: Cao, Tri, et autres
Publié: (2026)
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
par: Qian, Chen, et autres
Publié: (2026)
par: Qian, Chen, et autres
Publié: (2026)
Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation
par: Yang, Zhiyuan, et autres
Publié: (2026)
par: Yang, Zhiyuan, et autres
Publié: (2026)
Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models
par: Apedo, Yvon, et autres
Publié: (2026)
par: Apedo, Yvon, et autres
Publié: (2026)
Documents similaires
-
MaMe & MaRe: Matrix-Based Token Merging and Restoration for Efficient Visual Perception and Synthesis
par: Huo, Simin, et autres
Publié: (2026) -
TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models
par: Liu, Chenghao, et autres
Publié: (2025) -
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
par: Kang, Minseok, et autres
Publié: (2026) -
Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
par: Zhang, Jianrui, et autres
Publié: (2026) -
Motion Guided Token Compression for Efficient Masked Video Modeling
par: Feng, Yukun, et autres
Publié: (2024)