Modality-Aware Zero-Shot Pruning and Sparse Attention for Efficient Multimodal Edge Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sui, Yueyuan, Mohapatra, Payal, Eldenk, Doğaç, Yang, Haodong, Zhang, Yiting, Zhang, Haoyan, Zhu, Qi, Xia, Stephen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MAESTRO : Adaptive Sparse Attention and Robust Learning for Multimodal Dynamic Time Series
par: Mohapatra, Payal, et autres
Publié: (2025)
par: Mohapatra, Payal, et autres
Publié: (2025)
Attention Drift: What Autoregressive Speculative Decoding Models Learn
par: Eldenk, Doğaç, et autres
Publié: (2026)
par: Eldenk, Doğaç, et autres
Publié: (2026)
UNIFERENCE: A Discrete Event Simulation Framework for Developing Distributed AI Models
par: Eldenk, Doğaç, et autres
Publié: (2026)
par: Eldenk, Doğaç, et autres
Publié: (2026)
Incidents During Microservice Decomposition: A Case Study
par: Eldenk, Doğaç, et autres
Publié: (2025)
par: Eldenk, Doğaç, et autres
Publié: (2025)
EmboAlign: Aligning Video Generation with Compositional Constraints for Zero-Shot Manipulation
par: Zhang, Gehao, et autres
Publié: (2026)
par: Zhang, Gehao, et autres
Publié: (2026)
MambaLite-Micro: Memory-Optimized Mamba Inference on MCUs
par: Xu, Hongjun, et autres
Publié: (2025)
par: Xu, Hongjun, et autres
Publié: (2025)
SparseDVFS: Sparse-Aware DVFS for Energy-Efficient Edge Inference
par: Zhang, Ziyang, et autres
Publié: (2026)
par: Zhang, Ziyang, et autres
Publié: (2026)
Phase-driven Domain Generalizable Learning for Nonstationary Time Series
par: Mohapatra, Payal, et autres
Publié: (2024)
par: Mohapatra, Payal, et autres
Publié: (2024)
ElastiFormer: Learned Redundancy Reduction in Transformer via Self-Distillation
par: Liu, Junzhang, et autres
Publié: (2024)
par: Liu, Junzhang, et autres
Publié: (2024)
Can LLMs Understand Unvoiced Speech? Exploring EMG-to-Text Conversion with LLMs
par: Mohapatra, Payal, et autres
Publié: (2025)
par: Mohapatra, Payal, et autres
Publié: (2025)
Missingness-resilient Video-enhanced Multimodal Disfluency Detection
par: Mohapatra, Payal, et autres
Publié: (2024)
par: Mohapatra, Payal, et autres
Publié: (2024)
MoA-Off: Adaptive Heterogeneous Modality-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
par: Yang, Zheming, et autres
Publié: (2025)
par: Yang, Zheming, et autres
Publié: (2025)
TRAMBA: A Hybrid Transformer and Mamba Architecture for Practical Audio and Bone Conduction Speech Super Resolution and Enhancement on Mobile and Wearable Platforms
par: Sui, Yueyuan, et autres
Publié: (2024)
par: Sui, Yueyuan, et autres
Publié: (2024)
MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference
par: Yang, Zheming, et autres
Publié: (2026)
par: Yang, Zheming, et autres
Publié: (2026)
Environment-Aware Dynamic Pruning for Pipelined Edge Inference
par: O'Quinn, Austin, et autres
Publié: (2025)
par: O'Quinn, Austin, et autres
Publié: (2025)
Timestep-Aware Block Masking for Efficient Diffusion Model Inference
par: He, Haodong, et autres
Publié: (2026)
par: He, Haodong, et autres
Publié: (2026)
ASAP: Attention-Shift-Aware Pruning for Efficient LVLM Inference
par: Pathak, Surendra, et autres
Publié: (2026)
par: Pathak, Surendra, et autres
Publié: (2026)
OATS: Outlier-Aware Pruning Through Sparse and Low Rank Decomposition
par: Zhang, Stephen, et autres
Publié: (2024)
par: Zhang, Stephen, et autres
Publié: (2024)
ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models
par: Zhang, Pu, et autres
Publié: (2025)
par: Zhang, Pu, et autres
Publié: (2025)
MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference
par: Li, Bo, et autres
Publié: (2026)
par: Li, Bo, et autres
Publié: (2026)
Guest Editors´ Introduction. Electronic Document Interoperability in eBusiness and eGovernment Applications
par: Asuman Dogac
Publié: (2008)
par: Asuman Dogac
Publié: (2008)
Multimodal Graph-Based Variational Mixture of Experts Network for Zero-Shot Multimodal Information Extraction
par: Zhou, Baohang, et autres
Publié: (2025)
par: Zhou, Baohang, et autres
Publié: (2025)
Modality-Aware Neuron Pruning for Unlearning in Multimodal Large Language Models
par: Liu, Zheyuan, et autres
Publié: (2025)
par: Liu, Zheyuan, et autres
Publié: (2025)
SpAtten: Efficient Sparse Attention Architecture with Cascade Token and Head Pruning
par: Wang, Hanrui, et autres
Publié: (2020)
par: Wang, Hanrui, et autres
Publié: (2020)
Graph Neural Network-based Multi-agent Reinforcement Learning for Resilient Distributed Coordination of Multi-Robot Systems
par: Goeckner, Anthony, et autres
Publié: (2024)
par: Goeckner, Anthony, et autres
Publié: (2024)
CATP: Contextually Adaptive Token Pruning for Efficient and Enhanced Multimodal In-Context Learning
par: Li, Yanshu, et autres
Publié: (2025)
par: Li, Yanshu, et autres
Publié: (2025)
Adamas: Hadamard Sparse Attention for Efficient Long-Context Inference
par: Yan, Siyuan, et autres
Publié: (2025)
par: Yan, Siyuan, et autres
Publié: (2025)
DAT: Dual-Aware Adaptive Transmission for Efficient Multimodal LLM Inference in Edge-Cloud Systems
par: Guo, Qi, et autres
Publié: (2026)
par: Guo, Qi, et autres
Publié: (2026)
Hyperbolic Multimodal Generative Representation Learning for Generalized Zero-Shot Multimodal Information Extraction
par: Zhou, Baohang, et autres
Publié: (2026)
par: Zhou, Baohang, et autres
Publié: (2026)
TimeSliver : Symbolic-Linear Decomposition for Explainable Time Series Classification
par: Pandey, Akash, et autres
Publié: (2026)
par: Pandey, Akash, et autres
Publié: (2026)
AnchorAttention: Difference-Aware Sparse Attention with Stripe Granularity
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
Zero-TPrune: Zero-Shot Token Pruning through Leveraging of the Attention Graph in Pre-Trained Transformers
par: Wang, Hongjie, et autres
Publié: (2023)
par: Wang, Hongjie, et autres
Publié: (2023)
Efficient Many-Shot In-Context Learning with Dynamic Block-Sparse Attention
par: Xiao, Emily, et autres
Publié: (2025)
par: Xiao, Emily, et autres
Publié: (2025)
Communication-Efficient Multi-Modal Edge Inference via Uncertainty-Aware Distributed Learning
par: Zhao, Hang, et autres
Publié: (2026)
par: Zhao, Hang, et autres
Publié: (2026)
EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models
par: Xing, Xingrun, et autres
Publié: (2025)
par: Xing, Xingrun, et autres
Publié: (2025)
EVA: Mixture-of-Experts Semantic Variant Alignment for Compositional Zero-Shot Learning
par: Zhang, Xiao, et autres
Publié: (2025)
par: Zhang, Xiao, et autres
Publié: (2025)
CachePrune: Privacy-Aware and Fine-Grained KV Cache Sharing for Efficient LLM Inference
par: Wu, Guanlong, et autres
Publié: (2026)
par: Wu, Guanlong, et autres
Publié: (2026)
XTransfer: Modality-Agnostic Few-Shot Model Transfer for Human Sensing at the Edge
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
Where Relevance Emerges: A Layer-Wise Study of Internal Attention for Zero-Shot Re-Ranking
par: Chen, Haodong, et autres
Publié: (2026)
par: Chen, Haodong, et autres
Publié: (2026)
MonarchAttention: Zero-Shot Conversion to Fast, Hardware-Aware Structured Attention
par: Yaras, Can, et autres
Publié: (2025)
par: Yaras, Can, et autres
Publié: (2025)
Documents similaires
-
MAESTRO : Adaptive Sparse Attention and Robust Learning for Multimodal Dynamic Time Series
par: Mohapatra, Payal, et autres
Publié: (2025) -
Attention Drift: What Autoregressive Speculative Decoding Models Learn
par: Eldenk, Doğaç, et autres
Publié: (2026) -
UNIFERENCE: A Discrete Event Simulation Framework for Developing Distributed AI Models
par: Eldenk, Doğaç, et autres
Publié: (2026) -
Incidents During Microservice Decomposition: A Case Study
par: Eldenk, Doğaç, et autres
Publié: (2025) -
EmboAlign: Aligning Video Generation with Compositional Constraints for Zero-Shot Manipulation
par: Zhang, Gehao, et autres
Publié: (2026)