BitStack: Any-Size Compression of Large Language Models in Variable Memory Environments
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Xinghao, Wang, Pengyu, Wang, Bo, Zhang, Dong, Zhou, Yunhua, Qiu, Xipeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Prism: Spectral-Aware Block-Sparse Attention
por: Wang, Xinghao, et al.
Publicado: (2026)
por: Wang, Xinghao, et al.
Publicado: (2026)
Sparser Block-Sparse Attention via Token Permutation
por: Wang, Xinghao, et al.
Publicado: (2025)
por: Wang, Xinghao, et al.
Publicado: (2025)
DenoSent: A Denoising Objective for Self-Supervised Sentence Representation Learning
por: Wang, Xinghao, et al.
Publicado: (2024)
por: Wang, Xinghao, et al.
Publicado: (2024)
AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
por: Zhan, Jun, et al.
Publicado: (2024)
por: Zhan, Jun, et al.
Publicado: (2024)
The Open-World Lottery Ticket Hypothesis for OOD Intent Classification
por: Zhou, Yunhua, et al.
Publicado: (2022)
por: Zhou, Yunhua, et al.
Publicado: (2022)
Vision-centric Token Compression in Large Language Model
por: Xing, Ling, et al.
Publicado: (2025)
por: Xing, Ling, et al.
Publicado: (2025)
Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models
por: Liu, Peiju, et al.
Publicado: (2026)
por: Liu, Peiju, et al.
Publicado: (2026)
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
por: Zong, Yi, et al.
Publicado: (2024)
por: Zong, Yi, et al.
Publicado: (2024)
Data-free Weight Compress and Denoise for Large Language Models
por: Peng, Runyu, et al.
Publicado: (2024)
por: Peng, Runyu, et al.
Publicado: (2024)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
por: An, Dong, et al.
Publicado: (2023)
por: An, Dong, et al.
Publicado: (2023)
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
por: Wang, Peng, et al.
Publicado: (2024)
por: Wang, Peng, et al.
Publicado: (2024)
Visual In-Context Learning for Large Vision-Language Models
por: Zhou, Yucheng, et al.
Publicado: (2024)
por: Zhou, Yucheng, et al.
Publicado: (2024)
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
por: Zhang, Haowei, et al.
Publicado: (2026)
por: Zhang, Haowei, et al.
Publicado: (2026)
Mitigating Hallucinations in Large Vision-Language Models with Internal Fact-based Contrastive Decoding
por: Wang, Chao, et al.
Publicado: (2025)
por: Wang, Chao, et al.
Publicado: (2025)
SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models
por: Fei, Senyu, et al.
Publicado: (2025)
por: Fei, Senyu, et al.
Publicado: (2025)
In-Memory Learning: A Declarative Learning Framework for Large Language Models
por: Wang, Bo, et al.
Publicado: (2024)
por: Wang, Bo, et al.
Publicado: (2024)
High Efficiency Image Compression for Large Visual-Language Models
por: Li, Binzhe, et al.
Publicado: (2024)
por: Li, Binzhe, et al.
Publicado: (2024)
Multi-Vector Index Compression in Any Modality
por: Qin, Hanxiang, et al.
Publicado: (2026)
por: Qin, Hanxiang, et al.
Publicado: (2026)
World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning
por: Wang, Siyin, et al.
Publicado: (2025)
por: Wang, Siyin, et al.
Publicado: (2025)
LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models
por: Wang, Chenglin, et al.
Publicado: (2026)
por: Wang, Chenglin, et al.
Publicado: (2026)
Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM
por: Tan, Chenkun, et al.
Publicado: (2025)
por: Tan, Chenkun, et al.
Publicado: (2025)
SLAB: Efficient Transformers with Simplified Linear Attention and Progressive Re-parameterized Batch Normalization
por: Guo, Jialong, et al.
Publicado: (2024)
por: Guo, Jialong, et al.
Publicado: (2024)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
por: Kang, Jialiang, et al.
Publicado: (2025)
por: Kang, Jialiang, et al.
Publicado: (2025)
Judge Anything: MLLM as a Judge Across Any Modality
por: Pu, Shu, et al.
Publicado: (2025)
por: Pu, Shu, et al.
Publicado: (2025)
To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models
por: Lin, Junyan, et al.
Publicado: (2024)
por: Lin, Junyan, et al.
Publicado: (2024)
MetaAlign: Align Large Language Models with Diverse Preferences during Inference Time
por: Zhang, Mozhi, et al.
Publicado: (2024)
por: Zhang, Mozhi, et al.
Publicado: (2024)
Context Cascade Compression: Exploring the Upper Limits of Text Compression
por: Liu, Fanfan, et al.
Publicado: (2025)
por: Liu, Fanfan, et al.
Publicado: (2025)
Integrating Chain-of-Thought for Multimodal Alignment: A Study on 3D Vision-Language Learning
por: Chen, Yanjun, et al.
Publicado: (2025)
por: Chen, Yanjun, et al.
Publicado: (2025)
MMRQA: Signal-Enhanced Multimodal Large Language Models for MRI Quality Assessment
por: Jia, Fankai, et al.
Publicado: (2025)
por: Jia, Fankai, et al.
Publicado: (2025)
UniChange: Unifying Change Detection with Multimodal Large Language Model
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models
por: Liu, Xinxin, et al.
Publicado: (2026)
por: Liu, Xinxin, et al.
Publicado: (2026)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
por: Wang, Xinyu, et al.
Publicado: (2025)
por: Wang, Xinyu, et al.
Publicado: (2025)
LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
por: Fei, Senyu, et al.
Publicado: (2025)
por: Fei, Senyu, et al.
Publicado: (2025)
InferAligner: Inference-Time Alignment for Harmlessness through Cross-Model Guidance
por: Wang, Pengyu, et al.
Publicado: (2024)
por: Wang, Pengyu, et al.
Publicado: (2024)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
por: HyperAI Team, et al.
Publicado: (2025)
por: HyperAI Team, et al.
Publicado: (2025)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
por: Wu, Yuhang, et al.
Publicado: (2024)
por: Wu, Yuhang, et al.
Publicado: (2024)
MM-SAP: A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in Perception
por: Wang, Yuhao, et al.
Publicado: (2024)
por: Wang, Yuhao, et al.
Publicado: (2024)
Any2Point: Empowering Any-modality Large Models for Efficient 3D Understanding
por: Tang, Yiwen, et al.
Publicado: (2024)
por: Tang, Yiwen, et al.
Publicado: (2024)
SignLLM: Sign Language Production Large Language Models
por: Fang, Sen, et al.
Publicado: (2024)
por: Fang, Sen, et al.
Publicado: (2024)
Built Environment Reasoning from Remote Sensing Imagery Using Large Vision--Language Models
por: Wang, Dongdong, et al.
Publicado: (2026)
por: Wang, Dongdong, et al.
Publicado: (2026)
Ejemplares similares
-
Prism: Spectral-Aware Block-Sparse Attention
por: Wang, Xinghao, et al.
Publicado: (2026) -
Sparser Block-Sparse Attention via Token Permutation
por: Wang, Xinghao, et al.
Publicado: (2025) -
DenoSent: A Denoising Objective for Self-Supervised Sentence Representation Learning
por: Wang, Xinghao, et al.
Publicado: (2024) -
AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
por: Zhan, Jun, et al.
Publicado: (2024) -
The Open-World Lottery Ticket Hypothesis for OOD Intent Classification
por: Zhou, Yunhua, et al.
Publicado: (2022)