EchoingPixels: Cross-Modal Adaptive Token Reduction for Efficient Audio-Visual LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Gong, Chao, Wang, Depeng, Wei, Zhipeng, Guo, Ya, Zhu, Huijia, Chen, Jingjing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Rethinking Visual Token Reduction in LVLMs Under Cross-Modal Misalignment
por: Xu, Rui, et al.
Publicado: (2025)
por: Xu, Rui, et al.
Publicado: (2025)
PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding
por: Wang, Nan, et al.
Publicado: (2026)
por: Wang, Nan, et al.
Publicado: (2026)
VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation
por: Han, Feng, et al.
Publicado: (2025)
por: Han, Feng, et al.
Publicado: (2025)
LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing
por: Wang, Langyu, et al.
Publicado: (2024)
por: Wang, Langyu, et al.
Publicado: (2024)
Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models
por: Gong, Chao, et al.
Publicado: (2024)
por: Gong, Chao, et al.
Publicado: (2024)
Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration
por: Zhou, Ziheng, et al.
Publicado: (2024)
por: Zhou, Ziheng, et al.
Publicado: (2024)
Mettle: Meta-Token Learning for Memory-Efficient Audio-Visual Adaptation
por: Zhou, Jinxing, et al.
Publicado: (2025)
por: Zhou, Jinxing, et al.
Publicado: (2025)
ImageAttributionBench: How Far Are We from Generalizable Attribution?
por: Mou, Tingshu, et al.
Publicado: (2026)
por: Mou, Tingshu, et al.
Publicado: (2026)
EchoingECG: An Electrocardiogram Cross-Modal Model for Echocardiogram Tasks
por: Gao, Yuan, et al.
Publicado: (2025)
por: Gao, Yuan, et al.
Publicado: (2025)
From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities
por: Zhang, Wanpeng, et al.
Publicado: (2024)
por: Zhang, Wanpeng, et al.
Publicado: (2024)
SimToken: A Simple Baseline for Referring Audio-Visual Segmentation
por: Jin, Dian, et al.
Publicado: (2025)
por: Jin, Dian, et al.
Publicado: (2025)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
por: Chen, Yaru, et al.
Publicado: (2025)
por: Chen, Yaru, et al.
Publicado: (2025)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
por: Zhu, Jiaying, et al.
Publicado: (2025)
por: Zhu, Jiaying, et al.
Publicado: (2025)
From Waveforms to Pixels: A Survey on Audio-Visual Segmentation
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
Learning Visual Affordance from Audio
por: Lu, Lidong, et al.
Publicado: (2025)
por: Lu, Lidong, et al.
Publicado: (2025)
PRIMED: Adaptive Modality Suppression for Referring Audio-Visual Segmentation via Biased Competition
por: He, Yuchen, et al.
Publicado: (2026)
por: He, Yuchen, et al.
Publicado: (2026)
AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models
por: Sung-Bin, Kim, et al.
Publicado: (2024)
por: Sung-Bin, Kim, et al.
Publicado: (2024)
Adaptive Identification of Blurred Regions for Accurate Image Deblurring
por: Gao, Hu, et al.
Publicado: (2025)
por: Gao, Hu, et al.
Publicado: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
por: Liu, Zehua, et al.
Publicado: (2024)
por: Liu, Zehua, et al.
Publicado: (2024)
A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning
por: Chen, Tianle, et al.
Publicado: (2026)
por: Chen, Tianle, et al.
Publicado: (2026)
Unsupervised Audio-Visual Segmentation with Modality Alignment
por: Bhosale, Swapnil, et al.
Publicado: (2024)
por: Bhosale, Swapnil, et al.
Publicado: (2024)
EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning
por: Xing, Zhenghao, et al.
Publicado: (2025)
por: Xing, Zhenghao, et al.
Publicado: (2025)
Spatial and Frequency Domain Adaptive Fusion Network for Image Deblurring
por: Gao, Hu, et al.
Publicado: (2025)
por: Gao, Hu, et al.
Publicado: (2025)
EEPNet-V2: Patch-to-Pixel Solution for Efficient Cross-Modal Registration between LiDAR Point Cloud and Camera Image
por: Yue, Yuanchao, et al.
Publicado: (2025)
por: Yue, Yuanchao, et al.
Publicado: (2025)
Residual Cross-Modal Fusion Networks for Audio-Visual Navigation
por: Wang, Yi, et al.
Publicado: (2026)
por: Wang, Yi, et al.
Publicado: (2026)
Cross-Modal Binary Attention: An Energy-Efficient Fusion Framework for Audio-Visual Learning
por: Saleh, Mohamed, et al.
Publicado: (2026)
por: Saleh, Mohamed, et al.
Publicado: (2026)
AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees
por: Li, Yuankai, et al.
Publicado: (2026)
por: Li, Yuankai, et al.
Publicado: (2026)
DuMo: Dual Encoder Modulation Network for Precise Concept Erasure
por: Han, Feng, et al.
Publicado: (2025)
por: Han, Feng, et al.
Publicado: (2025)
EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation
por: Xiong, Tianwei, et al.
Publicado: (2026)
por: Xiong, Tianwei, et al.
Publicado: (2026)
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
por: Guo, Yiwei, et al.
Publicado: (2026)
por: Guo, Yiwei, et al.
Publicado: (2026)
UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
por: Yue, Zhengrong, et al.
Publicado: (2025)
por: Yue, Zhengrong, et al.
Publicado: (2025)
Towards Flexible, Scalable, and Adaptive Multi-Modal Conditioned Face Synthesis
por: Ren, Jingjing, et al.
Publicado: (2023)
por: Ren, Jingjing, et al.
Publicado: (2023)
EchoPrune: Interpreting Redundancy as Temporal Echoes for Efficient VideoLLMs
por: Li, Jiameng, et al.
Publicado: (2026)
por: Li, Jiameng, et al.
Publicado: (2026)
Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference
por: Cho, Hyeonwoo, et al.
Publicado: (2026)
por: Cho, Hyeonwoo, et al.
Publicado: (2026)
Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning
por: He, Xiang, et al.
Publicado: (2025)
por: He, Xiang, et al.
Publicado: (2025)
HAVT-IVD: Heterogeneity-Aware Cross-Modal Network for Audio-Visual Surveillance: Idling Vehicles Detection With Multichannel Audio and Multiscale Visual Cues
por: Li, Xiwen, et al.
Publicado: (2025)
por: Li, Xiwen, et al.
Publicado: (2025)
Towards Open-Vocabulary Audio-Visual Event Localization
por: Zhou, Jinxing, et al.
Publicado: (2024)
por: Zhou, Jinxing, et al.
Publicado: (2024)
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
por: Rho, Kyeongha, et al.
Publicado: (2025)
por: Rho, Kyeongha, et al.
Publicado: (2025)
Memory Efficient Matting with Adaptive Token Routing
por: Lin, Yiheng, et al.
Publicado: (2024)
por: Lin, Yiheng, et al.
Publicado: (2024)
FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression
por: Zhu, Yuke, et al.
Publicado: (2024)
por: Zhu, Yuke, et al.
Publicado: (2024)
Ejemplares similares
-
Rethinking Visual Token Reduction in LVLMs Under Cross-Modal Misalignment
por: Xu, Rui, et al.
Publicado: (2025) -
PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding
por: Wang, Nan, et al.
Publicado: (2026) -
VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation
por: Han, Feng, et al.
Publicado: (2025) -
LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing
por: Wang, Langyu, et al.
Publicado: (2024) -
Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models
por: Gong, Chao, et al.
Publicado: (2024)