VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Hengbo, Jin, Shengjie, Ma, Yanbiao, Lu, Zhiwu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sparsity- and Hybridity-Inspired Visual Parameter-Efficient Fine-Tuning for Medical Diagnosis
di: Liu, Mingyuan, et al.
Pubblicazione: (2024)
di: Liu, Mingyuan, et al.
Pubblicazione: (2024)
SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference
di: Khaki, Samir, et al.
Pubblicazione: (2025)
di: Khaki, Samir, et al.
Pubblicazione: (2025)
Geometric Origins of Bias in Deep Neural Networks: A Human Visual System Perspective
di: Ma, Yanbiao, et al.
Pubblicazione: (2025)
di: Ma, Yanbiao, et al.
Pubblicazione: (2025)
Learnable Sparsity for Vision Generative Models
di: Zhang, Yang, et al.
Pubblicazione: (2024)
di: Zhang, Yang, et al.
Pubblicazione: (2024)
Calibrating Biased Distribution in VFM-derived Latent Space via Cross-Domain Geometric Consistency
di: Ma, Yanbiao, et al.
Pubblicazione: (2025)
di: Ma, Yanbiao, et al.
Pubblicazione: (2025)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
di: Zhu, Jiaying, et al.
Pubblicazione: (2025)
di: Zhu, Jiaying, et al.
Pubblicazione: (2025)
CoTMR: Chain-of-Thought Multi-Scale Reasoning for Training-Free Zero-Shot Composed Image Retrieval
di: Sun, Zelong, et al.
Pubblicazione: (2025)
di: Sun, Zelong, et al.
Pubblicazione: (2025)
OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence
di: Tang, Feilong, et al.
Pubblicazione: (2026)
di: Tang, Feilong, et al.
Pubblicazione: (2026)
Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts
di: Rang, Miao, et al.
Pubblicazione: (2025)
di: Rang, Miao, et al.
Pubblicazione: (2025)
DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
Sparsity Meets Similarity: Leveraging Long-Tail Distribution for Dynamic Optimized Token Representation in Multimodal Large Language Models
di: Yu, Gaotong, et al.
Pubblicazione: (2024)
di: Yu, Gaotong, et al.
Pubblicazione: (2024)
Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2026)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2026)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
di: Jiang, Houcheng, et al.
Pubblicazione: (2026)
di: Jiang, Houcheng, et al.
Pubblicazione: (2026)
Triage: Hierarchical Visual Budgeting for Efficient Video Reasoning in Vision-Language Models
di: Wang, Anmin, et al.
Pubblicazione: (2026)
di: Wang, Anmin, et al.
Pubblicazione: (2026)
AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
di: Li, Xiping, et al.
Pubblicazione: (2025)
di: Li, Xiping, et al.
Pubblicazione: (2025)
SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs
di: Wang, Jiahui, et al.
Pubblicazione: (2025)
di: Wang, Jiahui, et al.
Pubblicazione: (2025)
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
di: Jin, Jing, et al.
Pubblicazione: (2026)
di: Jin, Jing, et al.
Pubblicazione: (2026)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
di: Zuo, Jing, et al.
Pubblicazione: (2026)
di: Zuo, Jing, et al.
Pubblicazione: (2026)
Efficient Modulation for Vision Networks
di: Ma, Xu, et al.
Pubblicazione: (2024)
di: Ma, Xu, et al.
Pubblicazione: (2024)
Compositional Attribute Imbalance in Vision Datasets
di: Chen, Jiayi, et al.
Pubblicazione: (2025)
di: Chen, Jiayi, et al.
Pubblicazione: (2025)
VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity
di: Bi, Jing, et al.
Pubblicazione: (2025)
di: Bi, Jing, et al.
Pubblicazione: (2025)
Weakly Supervised Video Anomaly Detection with Anomaly-Connected Components and Intention Reasoning
di: Wang, Yu, et al.
Pubblicazione: (2026)
di: Wang, Yu, et al.
Pubblicazione: (2026)
CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
di: Chen, Zeyuan, et al.
Pubblicazione: (2025)
di: Chen, Zeyuan, et al.
Pubblicazione: (2025)
Question Aware Vision Transformer for Multimodal Reasoning
di: Ganz, Roy, et al.
Pubblicazione: (2024)
di: Ganz, Roy, et al.
Pubblicazione: (2024)
Once for Both: Single Stage of Importance and Sparsity Search for Vision Transformer Compression
di: Ye, Hancheng, et al.
Pubblicazione: (2024)
di: Ye, Hancheng, et al.
Pubblicazione: (2024)
Dynamic Pyramid Network for Efficient Multimodal Large Language Model
di: Ai, Hao, et al.
Pubblicazione: (2025)
di: Ai, Hao, et al.
Pubblicazione: (2025)
DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
BabyVision: Visual Reasoning Beyond Language
di: Chen, Liang, et al.
Pubblicazione: (2026)
di: Chen, Liang, et al.
Pubblicazione: (2026)
DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning
di: Majeedi, Abrar, et al.
Pubblicazione: (2026)
di: Majeedi, Abrar, et al.
Pubblicazione: (2026)
Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language Model
di: Zhang, Wenqi, et al.
Pubblicazione: (2024)
di: Zhang, Wenqi, et al.
Pubblicazione: (2024)
Exploring Beyond Logits: Hierarchical Dynamic Labeling Based on Embeddings for Semi-Supervised Classification
di: Ma, Yanbiao, et al.
Pubblicazione: (2024)
di: Ma, Yanbiao, et al.
Pubblicazione: (2024)
Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
di: Liu, Yuhan, et al.
Pubblicazione: (2025)
di: Liu, Yuhan, et al.
Pubblicazione: (2025)
Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
di: Jin, Yang, et al.
Pubblicazione: (2023)
di: Jin, Yang, et al.
Pubblicazione: (2023)
Towards General Multimodal Visual Tracking
di: Lu, Andong, et al.
Pubblicazione: (2025)
di: Lu, Andong, et al.
Pubblicazione: (2025)
ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better
di: Zhang, Yuan, et al.
Pubblicazione: (2025)
di: Zhang, Yuan, et al.
Pubblicazione: (2025)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
di: Duan, Yuchen, et al.
Pubblicazione: (2024)
di: Duan, Yuchen, et al.
Pubblicazione: (2024)
PathMR: Multimodal Visual Reasoning for Interpretable Pathology Diagnosis
di: Zhang, Ye, et al.
Pubblicazione: (2025)
di: Zhang, Ye, et al.
Pubblicazione: (2025)
Pursuing Better Decision Boundaries for Long-Tailed Object Detection via Category Information Amount
di: Ma, Yanbiao, et al.
Pubblicazione: (2025)
di: Ma, Yanbiao, et al.
Pubblicazione: (2025)
Deep Feature Gaussian Processes for Single-Scene Aerosol Optical Depth Reconstruction
di: Liu, Shengjie, et al.
Pubblicazione: (2024)
di: Liu, Shengjie, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Sparsity- and Hybridity-Inspired Visual Parameter-Efficient Fine-Tuning for Medical Diagnosis
di: Liu, Mingyuan, et al.
Pubblicazione: (2024) -
SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference
di: Khaki, Samir, et al.
Pubblicazione: (2025) -
Geometric Origins of Bias in Deep Neural Networks: A Human Visual System Perspective
di: Ma, Yanbiao, et al.
Pubblicazione: (2025) -
Learnable Sparsity for Vision Generative Models
di: Zhang, Yang, et al.
Pubblicazione: (2024) -
Calibrating Biased Distribution in VFM-derived Latent Space via Cross-Domain Geometric Consistency
di: Ma, Yanbiao, et al.
Pubblicazione: (2025)