Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Yuchen, Garg, Amanmeet, Chaudhuri, Shalini, Zhao, Rui, Kessler, Garin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
por: Poppi, Tobia, et al.
Publicado: (2026)
por: Poppi, Tobia, et al.
Publicado: (2026)
Learning to Rank Caption Chains for Video-Text Alignment
por: Blume, Ansel, et al.
Publicado: (2026)
por: Blume, Ansel, et al.
Publicado: (2026)
Object-Centric Vision Token Pruning for Vision Language Models
por: Li, Guangyuan, et al.
Publicado: (2025)
por: Li, Guangyuan, et al.
Publicado: (2025)
Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing
por: Wang, Weixing, et al.
Publicado: (2025)
por: Wang, Weixing, et al.
Publicado: (2025)
Dynamic Token Reduction during Generation for Vision Language Models
por: Liang, Xiaoyu, et al.
Publicado: (2025)
por: Liang, Xiaoyu, et al.
Publicado: (2025)
One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition
por: Darur, Balaji, et al.
Publicado: (2026)
por: Darur, Balaji, et al.
Publicado: (2026)
Perception Tokens Enhance Visual Reasoning in Multimodal Language Models
por: Bigverdi, Mahtab, et al.
Publicado: (2024)
por: Bigverdi, Mahtab, et al.
Publicado: (2024)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
por: Li, Hongxing, et al.
Publicado: (2025)
por: Li, Hongxing, et al.
Publicado: (2025)
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
por: Dai, Muzhi, et al.
Publicado: (2025)
por: Dai, Muzhi, et al.
Publicado: (2025)
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
por: Luo, Bingjun, et al.
Publicado: (2026)
por: Luo, Bingjun, et al.
Publicado: (2026)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
por: Qian, Chen, et al.
Publicado: (2026)
por: Qian, Chen, et al.
Publicado: (2026)
CARPE: Context-Aware Image Representation Prioritization via Ensemble for Large Vision-Language Models
por: Lee, Donghee, et al.
Publicado: (2026)
por: Lee, Donghee, et al.
Publicado: (2026)
Rethinking Token Reduction for Large Vision-Language Models
por: Wang, Yi, et al.
Publicado: (2026)
por: Wang, Yi, et al.
Publicado: (2026)
SpaRE: Enhancing Spatial Reasoning in Vision-Language Models with Synthetic Data
por: Ogezi, Michael, et al.
Publicado: (2025)
por: Ogezi, Michael, et al.
Publicado: (2025)
Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
por: Li, Kaiyuan, et al.
Publicado: (2025)
por: Li, Kaiyuan, et al.
Publicado: (2025)
Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
por: Lian, Shijie, et al.
Publicado: (2025)
por: Lian, Shijie, et al.
Publicado: (2025)
PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models
por: Meng, Yu, et al.
Publicado: (2025)
por: Meng, Yu, et al.
Publicado: (2025)
Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency
por: Liu, Junming, et al.
Publicado: (2026)
por: Liu, Junming, et al.
Publicado: (2026)
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
por: Li, Dingming, et al.
Publicado: (2025)
por: Li, Dingming, et al.
Publicado: (2025)
ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models
por: Zhang, Pu, et al.
Publicado: (2025)
por: Zhang, Pu, et al.
Publicado: (2025)
Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation
por: Yang, Zhiyuan, et al.
Publicado: (2026)
por: Yang, Zhiyuan, et al.
Publicado: (2026)
Token-Level Inference-Time Alignment for Vision-Language Models
por: Chen, Kejia, et al.
Publicado: (2025)
por: Chen, Kejia, et al.
Publicado: (2025)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
por: Wang, Xinhao, et al.
Publicado: (2026)
por: Wang, Xinhao, et al.
Publicado: (2026)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
por: Chen, Jiuhai, et al.
Publicado: (2024)
por: Chen, Jiuhai, et al.
Publicado: (2024)
Beyond BEV: Optimizing Point-Level Tokens for Collaborative Perception
por: Li, Yang, et al.
Publicado: (2025)
por: Li, Yang, et al.
Publicado: (2025)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
por: Li, Ao, et al.
Publicado: (2025)
por: Li, Ao, et al.
Publicado: (2025)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
por: Song, Python, et al.
Publicado: (2025)
por: Song, Python, et al.
Publicado: (2025)
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
por: Zhao, Ruosen, et al.
Publicado: (2025)
por: Zhao, Ruosen, et al.
Publicado: (2025)
GST-VLA: Structured Gaussian Spatial Tokens for 3D Depth-Aware Vision-Language-Action Models
por: Sarowar, Md Selim, et al.
Publicado: (2026)
por: Sarowar, Md Selim, et al.
Publicado: (2026)
Enhancing Vision-Language Models for Autonomous Driving through Task-Specific Prompting and Spatial Reasoning
por: Wu, Aodi, et al.
Publicado: (2025)
por: Wu, Aodi, et al.
Publicado: (2025)
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
por: Tong, Haoyu, et al.
Publicado: (2026)
por: Tong, Haoyu, et al.
Publicado: (2026)
SPHERE: Unveiling Spatial Blind Spots in Vision-Language Models Through Hierarchical Evaluation
por: Zhang, Wenyu, et al.
Publicado: (2024)
por: Zhang, Wenyu, et al.
Publicado: (2024)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
por: Kim, Sohee, et al.
Publicado: (2025)
por: Kim, Sohee, et al.
Publicado: (2025)
Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models
por: Apedo, Yvon, et al.
Publicado: (2026)
por: Apedo, Yvon, et al.
Publicado: (2026)
Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models
por: Wang, Xiaoyan, et al.
Publicado: (2025)
por: Wang, Xiaoyan, et al.
Publicado: (2025)
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
por: Zhao, Jianfei, et al.
Publicado: (2025)
por: Zhao, Jianfei, et al.
Publicado: (2025)
Break the Visual Perception: Adversarial Attacks Targeting Encoded Visual Tokens of Large Vision-Language Models
por: Wang, Yubo, et al.
Publicado: (2024)
por: Wang, Yubo, et al.
Publicado: (2024)
Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Image Generation
por: Zheng, Anlin, et al.
Publicado: (2025)
por: Zheng, Anlin, et al.
Publicado: (2025)
Multi-Cache Enhanced Prototype Learning for Test-Time Generalization of Vision-Language Models
por: Chen, Xinyu, et al.
Publicado: (2025)
por: Chen, Xinyu, et al.
Publicado: (2025)
Ejemplares similares
-
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
por: Poppi, Tobia, et al.
Publicado: (2026) -
Learning to Rank Caption Chains for Video-Text Alignment
por: Blume, Ansel, et al.
Publicado: (2026) -
Object-Centric Vision Token Pruning for Vision Language Models
por: Li, Guangyuan, et al.
Publicado: (2025) -
Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing
por: Wang, Weixing, et al.
Publicado: (2025) -
Dynamic Token Reduction during Generation for Vision Language Models
por: Liang, Xiaoyu, et al.
Publicado: (2025)