Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Yuhuan, Wei, Cong, Lin, Fangzhen, Chen, Wenhu, Wang, Haozhe |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CogDoc: Towards Unified thinking in Documents
par: Xu, Qixin, et autres
Publié: (2025)
par: Xu, Qixin, et autres
Publié: (2025)
Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning
par: Wang, Haozhe, et autres
Publié: (2026)
par: Wang, Haozhe, et autres
Publié: (2026)
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
par: Wang, Haozhe, et autres
Publié: (2025)
par: Wang, Haozhe, et autres
Publié: (2025)
Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions
par: Sun, Xiaoxiao, et autres
Publié: (2026)
par: Sun, Xiaoxiao, et autres
Publié: (2026)
Language-Driven Object-Oriented Two-Stage Method for Scene Graph Anticipation
par: Zhu, Xiaomeng, et autres
Publié: (2025)
par: Zhu, Xiaomeng, et autres
Publié: (2025)
TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
par: Liu, Zhiheng, et autres
Publié: (2025)
par: Liu, Zhiheng, et autres
Publié: (2025)
ABC: Achieving Better Control of Multimodal Embeddings using VLMs
par: Schneider, Benjamin, et autres
Publié: (2025)
par: Schneider, Benjamin, et autres
Publié: (2025)
PixelWorld: How Far Are We from Perceiving Everything as Pixels?
par: Lyu, Zhiheng, et autres
Publié: (2025)
par: Lyu, Zhiheng, et autres
Publié: (2025)
From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning
par: Wang, Changpeng, et autres
Publié: (2025)
par: Wang, Changpeng, et autres
Publié: (2025)
ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation
par: Ren, Weiming, et autres
Publié: (2024)
par: Ren, Weiming, et autres
Publié: (2024)
ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
par: Wang, Xiyao, et autres
Publié: (2025)
par: Wang, Xiyao, et autres
Publié: (2025)
Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable
par: Liu, Haozhe, et autres
Publié: (2024)
par: Liu, Haozhe, et autres
Publié: (2024)
On the Perception Bottleneck of VLMs for Chart Understanding
par: Liu, Junteng, et autres
Publié: (2025)
par: Liu, Junteng, et autres
Publié: (2025)
In Defense of Lazy Visual Grounding for Open-Vocabulary Semantic Segmentation
par: Kang, Dahyun, et autres
Publié: (2024)
par: Kang, Dahyun, et autres
Publié: (2024)
Toward Inherently Robust VLMs Against Visual Perception Attacks
par: MohajerAnsari, Pedram, et autres
Publié: (2025)
par: MohajerAnsari, Pedram, et autres
Publié: (2025)
VISTA: Enhancing Long-Duration and High-Resolution Video Understanding by Video Spatiotemporal Augmentation
par: Ren, Weiming, et autres
Publié: (2024)
par: Ren, Weiming, et autres
Publié: (2024)
ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs
par: Gao, Yiling, et autres
Publié: (2026)
par: Gao, Yiling, et autres
Publié: (2026)
VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
par: Zhou, Guanyu, et autres
Publié: (2026)
par: Zhou, Guanyu, et autres
Publié: (2026)
T2Vs Meet VLMs: A Scalable Multimodal Dataset for Visual Harmfulness Recognition
par: Yeh, Chen, et autres
Publié: (2024)
par: Yeh, Chen, et autres
Publié: (2024)
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
par: Chen, Liyang, et autres
Publié: (2025)
par: Chen, Liyang, et autres
Publié: (2025)
ChatRex: Taming Multimodal LLM for Joint Perception and Understanding
par: Jiang, Qing, et autres
Publié: (2024)
par: Jiang, Qing, et autres
Publié: (2024)
Understanding and Rectifying Safety Perception Distortion in VLMs
par: Zou, Xiaohan, et autres
Publié: (2025)
par: Zou, Xiaohan, et autres
Publié: (2025)
Tango: Taming Visual Signals for Efficient Video Large Language Models
par: Yin, Shukang, et autres
Publié: (2026)
par: Yin, Shukang, et autres
Publié: (2026)
ISCS: Parameter-Guided Feature Pruning for Resource-Constrained Embodied Perception
par: Wang, Jinhao, et autres
Publié: (2025)
par: Wang, Jinhao, et autres
Publié: (2025)
Slow Perception: Let's Perceive Geometric Figures Step-by-step
par: Wei, Haoran, et autres
Publié: (2024)
par: Wei, Haoran, et autres
Publié: (2024)
TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-Transformers
par: Yu, Bin, et autres
Publié: (2026)
par: Yu, Bin, et autres
Publié: (2026)
Vamba: Understanding Hour-Long Videos with Hybrid Mamba-Transformers
par: Ren, Weiming, et autres
Publié: (2025)
par: Ren, Weiming, et autres
Publié: (2025)
Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better
par: Wang, Dianyi, et autres
Publié: (2025)
par: Wang, Dianyi, et autres
Publié: (2025)
Align then Adapt: Rethinking Parameter-Efficient Transfer Learning in 4D Perception
par: Sun, Yiding, et autres
Publié: (2026)
par: Sun, Yiding, et autres
Publié: (2026)
Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
par: Guo, Hao, et autres
Publié: (2026)
par: Guo, Hao, et autres
Publié: (2026)
LazyMAR: Accelerating Masked Autoregressive Models via Feature Caching
par: Yan, Feihong, et autres
Publié: (2025)
par: Yan, Feihong, et autres
Publié: (2025)
SlimComm: Doppler-Guided Sparse Queries for Bandwidth-Efficient Cooperative 3-D Perception
par: Yazgan, Melih, et autres
Publié: (2025)
par: Yazgan, Melih, et autres
Publié: (2025)
CodePercept: Code-Grounded Visual STEM Perception for MLLMs
par: Guan, Tongkun, et autres
Publié: (2026)
par: Guan, Tongkun, et autres
Publié: (2026)
HEAD: A Bandwidth-Efficient Cooperative Perception Approach for Heterogeneous Connected and Autonomous Vehicles
par: Qu, Deyuan, et autres
Publié: (2024)
par: Qu, Deyuan, et autres
Publié: (2024)
HOISDF: Constraining 3D Hand-Object Pose Estimation with Global Signed Distance Fields
par: Qi, Haozhe, et autres
Publié: (2024)
par: Qi, Haozhe, et autres
Publié: (2024)
UniVideo: Unified Understanding, Generation, and Editing for Videos
par: Wei, Cong, et autres
Publié: (2025)
par: Wei, Cong, et autres
Publié: (2025)
Are VLMs Ready for Lane Topology Awareness in Autonomous Driving?
par: Chen, Xin, et autres
Publié: (2025)
par: Chen, Xin, et autres
Publié: (2025)
Taming Real-World Space-Time Video Super-Resolution with One-Step Diffusion
par: Wei, Shuoyan, et autres
Publié: (2026)
par: Wei, Shuoyan, et autres
Publié: (2026)
VSDiffusion: Taming Ill-Posed Shadow Generation via Visibility-Constrained Diffusion
par: Li, Jing, et autres
Publié: (2026)
par: Li, Jing, et autres
Publié: (2026)
CogRail: Benchmarking VLMs in Cognitive Intrusion Perception for Intelligent Railway Transportation Systems
par: Tian, Yonglin, et autres
Publié: (2026)
par: Tian, Yonglin, et autres
Publié: (2026)
Documents similaires
-
CogDoc: Towards Unified thinking in Documents
par: Xu, Qixin, et autres
Publié: (2025) -
Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning
par: Wang, Haozhe, et autres
Publié: (2026) -
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
par: Wang, Haozhe, et autres
Publié: (2025) -
Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions
par: Sun, Xiaoxiao, et autres
Publié: (2026) -
Language-Driven Object-Oriented Two-Stage Method for Scene Graph Anticipation
par: Zhu, Xiaomeng, et autres
Publié: (2025)