Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Jiaqi, Zheng, Shuntian, Shen, Yixian, Huang, Jia-Hong, Lu, Xiaoman, Ni, Minzhe, Guan, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Why Learn What Physics Already Knows? Realizing Agile mmWave-based Human Pose Estimation via Physics-Guided Preprocessing
par: Zheng, Shuntian, et autres
Publié: (2026)
par: Zheng, Shuntian, et autres
Publié: (2026)
Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization
par: Li, Jiaqi, et autres
Publié: (2026)
par: Li, Jiaqi, et autres
Publié: (2026)
Doppler Prompting for Stable mmWave-based Human Pose Estimation
par: Zheng, Shuntian, et autres
Publié: (2026)
par: Zheng, Shuntian, et autres
Publié: (2026)
Person Parametric Physics-informed Representation for mmWave-based Human Pose Estimation
par: Zheng, Shuntian, et autres
Publié: (2025)
par: Zheng, Shuntian, et autres
Publié: (2025)
Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding
par: Huang, Yanxiang, et autres
Publié: (2026)
par: Huang, Yanxiang, et autres
Publié: (2026)
Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding
par: Zheng, Zelin, et autres
Publié: (2026)
par: Zheng, Zelin, et autres
Publié: (2026)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
par: Sha, Lin, et autres
Publié: (2026)
par: Sha, Lin, et autres
Publié: (2026)
A Two-Stage Motion-Aware Framework for mmWave-based Human Mesh Recovery
par: Pham, Hoang Hai, et autres
Publié: (2026)
par: Pham, Hoang Hai, et autres
Publié: (2026)
Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models
par: Gröpl, Marcel, et autres
Publié: (2026)
par: Gröpl, Marcel, et autres
Publié: (2026)
VITED: Video Temporal Evidence Distillation
par: Lu, Yujie, et autres
Publié: (2025)
par: Lu, Yujie, et autres
Publié: (2025)
Token Expand-Merge: Training-Free Token Compression for Vision-Language-Action Models
par: Ye, Yifan, et autres
Publié: (2025)
par: Ye, Yifan, et autres
Publié: (2025)
ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models
par: Kim, Youngeun, et autres
Publié: (2025)
par: Kim, Youngeun, et autres
Publié: (2025)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
par: Meng, Jiahao, et autres
Publié: (2025)
par: Meng, Jiahao, et autres
Publié: (2025)
MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
par: Fang, Pengcheng, et autres
Publié: (2026)
par: Fang, Pengcheng, et autres
Publié: (2026)
Gradient Weight-normalized Low-rank Projection for Efficient LLM Training
par: Huang, Jia-Hong, et autres
Publié: (2024)
par: Huang, Jia-Hong, et autres
Publié: (2024)
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
par: Li, Geng, et autres
Publié: (2026)
par: Li, Geng, et autres
Publié: (2026)
Language-Guided Temporal Token Pruning for Efficient VideoLLM Processing
par: Kumar, Yogesh
Publié: (2025)
par: Kumar, Yogesh
Publié: (2025)
Semantic Granularity Navigation in Image Editing
par: Lu, Liangsi, et autres
Publié: (2026)
par: Lu, Liangsi, et autres
Publié: (2026)
Chain of Evidences and Evidence to Generate: Prompting for Context Grounded and Retrieval Augmented Reasoning
par: Parvez, Md Rizwan
Publié: (2024)
par: Parvez, Md Rizwan
Publié: (2024)
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
par: Liu, Ye, et autres
Publié: (2025)
par: Liu, Ye, et autres
Publié: (2025)
Training Noise Token Pruning
par: Rao, Mingxing, et autres
Publié: (2024)
par: Rao, Mingxing, et autres
Publié: (2024)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
par: Huang, Xiaohu, et autres
Publié: (2024)
par: Huang, Xiaohu, et autres
Publié: (2024)
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models
par: Huang, Jia-Hong, et autres
Publié: (2024)
par: Huang, Jia-Hong, et autres
Publié: (2024)
The Environmental Impacts of Machine Learning Training Keep Rising Evidencing Rebound Effect
par: Morand, Clément, et autres
Publié: (2025)
par: Morand, Clément, et autres
Publié: (2025)
Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs
par: Hyun, Jeongseok, et autres
Publié: (2025)
par: Hyun, Jeongseok, et autres
Publié: (2025)
BEAR: Budgeted Evidence Allocation for Multi-Document Reasoning
par: Sun, Lin, et autres
Publié: (2026)
par: Sun, Lin, et autres
Publié: (2026)
GeoWeaver: Grounding Visual Tokens with Geometric Evidence before Scene Reasoning
par: Miao, Deshui, et autres
Publié: (2026)
par: Miao, Deshui, et autres
Publié: (2026)
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
par: Bagrov, Natan, et autres
Publié: (2025)
par: Bagrov, Natan, et autres
Publié: (2025)
EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding
par: Ahn, Geo, et autres
Publié: (2026)
par: Ahn, Geo, et autres
Publié: (2026)
Training-Free Semantic Video Composition via Pre-trained Diffusion Model
par: Guo, Jiaqi, et autres
Publié: (2024)
par: Guo, Jiaqi, et autres
Publié: (2024)
Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs
par: Jung, Chaeyoung, et autres
Publié: (2026)
par: Jung, Chaeyoung, et autres
Publié: (2026)
SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization
par: Tan, Zhentao, et autres
Publié: (2024)
par: Tan, Zhentao, et autres
Publié: (2024)
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
par: Xu, Jingqi, et autres
Publié: (2025)
par: Xu, Jingqi, et autres
Publié: (2025)
Grounding-Aware Token Pruning: Recovering from Drastic Performance Drops in Visual Grounding Caused by Pruning
par: Chien, Tzu-Chun, et autres
Publié: (2025)
par: Chien, Tzu-Chun, et autres
Publié: (2025)
Boundedness of stable minimal models with klt singularities
par: Zhu, Minzhe
Publié: (2023)
par: Zhu, Minzhe
Publié: (2023)
Training-Free Efficient Video Generation via Dynamic Token Carving
par: Zhang, Yuechen, et autres
Publié: (2025)
par: Zhang, Yuechen, et autres
Publié: (2025)
ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
par: Li, Zechen, et autres
Publié: (2025)
par: Li, Zechen, et autres
Publié: (2025)
Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
par: Li, Daiqiang, et autres
Publié: (2026)
par: Li, Daiqiang, et autres
Publié: (2026)
Training-Trajectory-Aware Token Selection
par: Shen, Zhanming, et autres
Publié: (2026)
par: Shen, Zhanming, et autres
Publié: (2026)
FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention
par: Lu, Yu, et autres
Publié: (2024)
par: Lu, Yu, et autres
Publié: (2024)
Documents similaires
-
Why Learn What Physics Already Knows? Realizing Agile mmWave-based Human Pose Estimation via Physics-Guided Preprocessing
par: Zheng, Shuntian, et autres
Publié: (2026) -
Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization
par: Li, Jiaqi, et autres
Publié: (2026) -
Doppler Prompting for Stable mmWave-based Human Pose Estimation
par: Zheng, Shuntian, et autres
Publié: (2026) -
Person Parametric Physics-informed Representation for mmWave-based Human Pose Estimation
par: Zheng, Shuntian, et autres
Publié: (2025) -
Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding
par: Huang, Yanxiang, et autres
Publié: (2026)