Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhao, Han, Zhang, Min, Zhao, Wei, Ding, Pengxiang, Huang, Siteng, Wang, Donglin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
von: Liu, Yang, et al.
Veröffentlicht: (2024)
von: Liu, Yang, et al.
Veröffentlicht: (2024)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
von: Ding, Pengxiang, et al.
Veröffentlicht: (2023)
von: Ding, Pengxiang, et al.
Veröffentlicht: (2023)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
von: Liu, Yang, et al.
Veröffentlicht: (2025)
von: Liu, Yang, et al.
Veröffentlicht: (2025)
ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification
von: Cui, Can, et al.
Veröffentlicht: (2024)
von: Cui, Can, et al.
Veröffentlicht: (2024)
QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning
von: Tong, Xinyang, et al.
Veröffentlicht: (2024)
von: Tong, Xinyang, et al.
Veröffentlicht: (2024)
ML-Mamba: Efficient Multi-Modal Large Language Model Utilizing Mamba-2
von: Huang, Wenjun, et al.
Veröffentlicht: (2024)
von: Huang, Wenjun, et al.
Veröffentlicht: (2024)
CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction
von: Gong, Zhefei, et al.
Veröffentlicht: (2024)
von: Gong, Zhefei, et al.
Veröffentlicht: (2024)
Focus-Consistent Multi-Level Aggregation for Compositional Zero-Shot Learning
von: Dai, Fengyuan, et al.
Veröffentlicht: (2024)
von: Dai, Fengyuan, et al.
Veröffentlicht: (2024)
Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot Learning
von: Huang, Siteng, et al.
Veröffentlicht: (2023)
von: Huang, Siteng, et al.
Veröffentlicht: (2023)
Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration
von: Han, Yuhang, et al.
Veröffentlicht: (2024)
von: Han, Yuhang, et al.
Veröffentlicht: (2024)
M2IST: Multi-Modal Interactive Side-Tuning for Efficient Referring Expression Comprehension
von: Liu, Xuyang, et al.
Veröffentlicht: (2024)
von: Liu, Xuyang, et al.
Veröffentlicht: (2024)
Sparse-Tuning: Adapting Vision Transformers with Efficient Fine-tuning and Inference
von: Liu, Ting, et al.
Veröffentlicht: (2024)
von: Liu, Ting, et al.
Veröffentlicht: (2024)
VGDiffZero: Text-to-image Diffusion Models Can Be Zero-shot Visual Grounders
von: Liu, Xuyang, et al.
Veröffentlicht: (2023)
von: Liu, Xuyang, et al.
Veröffentlicht: (2023)
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
von: Chen, Jiayi, et al.
Veröffentlicht: (2025)
von: Chen, Jiayi, et al.
Veröffentlicht: (2025)
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
Expressive Forecasting of 3D Whole-body Human Motions
von: Ding, Pengxiang, et al.
Veröffentlicht: (2023)
von: Ding, Pengxiang, et al.
Veröffentlicht: (2023)
Hypergraph Multi-modal Large Language Model: Exploiting EEG and Eye-tracking Modalities to Evaluate Heterogeneous Responses for Video Understanding
von: Wu, Minghui, et al.
Veröffentlicht: (2024)
von: Wu, Minghui, et al.
Veröffentlicht: (2024)
Rethinking Target Label Conditioning in Adversarial Attacks: A 2D Tensor-Guided Generative Approach
von: Liu, Hangyu, et al.
Veröffentlicht: (2025)
von: Liu, Hangyu, et al.
Veröffentlicht: (2025)
OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation
von: Cui, Can, et al.
Veröffentlicht: (2025)
von: Cui, Can, et al.
Veröffentlicht: (2025)
ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver
von: Song, Wenxuan, et al.
Veröffentlicht: (2025)
von: Song, Wenxuan, et al.
Veröffentlicht: (2025)
Exploring the Evolution of Physics Cognition in Video Generation: A Survey
von: Lin, Minghui, et al.
Veröffentlicht: (2025)
von: Lin, Minghui, et al.
Veröffentlicht: (2025)
Prompt-based Distribution Alignment for Unsupervised Domain Adaptation
von: Bai, Shuanghao, et al.
Veröffentlicht: (2023)
von: Bai, Shuanghao, et al.
Veröffentlicht: (2023)
VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL
von: Dai, Fengyuan, et al.
Veröffentlicht: (2025)
von: Dai, Fengyuan, et al.
Veröffentlicht: (2025)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
von: Song, Wenxuan, et al.
Veröffentlicht: (2025)
von: Song, Wenxuan, et al.
Veröffentlicht: (2025)
Cobra: Efficient Line Art COlorization with BRoAder References
von: Zhuang, Junhao, et al.
Veröffentlicht: (2025)
von: Zhuang, Junhao, et al.
Veröffentlicht: (2025)
CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models
von: Song, Wenxuan, et al.
Veröffentlicht: (2026)
von: Song, Wenxuan, et al.
Veröffentlicht: (2026)
SmartHome-Bench: A Comprehensive Benchmark for Video Anomaly Detection in Smart Homes Using Multi-Modal Large Language Models
von: Zhao, Xinyi, et al.
Veröffentlicht: (2025)
von: Zhao, Xinyi, et al.
Veröffentlicht: (2025)
GeRM: A Generalist Robotic Model with Mixture-of-experts for Quadruped Robot
von: Song, Wenxuan, et al.
Veröffentlicht: (2024)
von: Song, Wenxuan, et al.
Veröffentlicht: (2024)
Enhancing Adversarial Transferability via Component-Wise Transformation
von: Liu, Hangyu, et al.
Veröffentlicht: (2025)
von: Liu, Hangyu, et al.
Veröffentlicht: (2025)
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
von: Chen, Junjie, et al.
Veröffentlicht: (2025)
von: Chen, Junjie, et al.
Veröffentlicht: (2025)
Holistic Autonomous Driving Understanding by Bird's-Eye-View Injected Multi-Modal Large Models
von: Ding, Xinpeng, et al.
Veröffentlicht: (2024)
von: Ding, Xinpeng, et al.
Veröffentlicht: (2024)
Slow-Fast Architecture for Video Multi-Modal Large Language Models
von: Shi, Min, et al.
Veröffentlicht: (2025)
von: Shi, Min, et al.
Veröffentlicht: (2025)
LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models
von: Qiu, Han, et al.
Veröffentlicht: (2024)
von: Qiu, Han, et al.
Veröffentlicht: (2024)
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
von: Wang, Yu, et al.
Veröffentlicht: (2024)
von: Wang, Yu, et al.
Veröffentlicht: (2024)
M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models
von: Bai, Fan, et al.
Veröffentlicht: (2024)
von: Bai, Fan, et al.
Veröffentlicht: (2024)
Learning Disentangled Identifiers for Action-Customized Text-to-Image Generation
von: Huang, Siteng, et al.
Veröffentlicht: (2023)
von: Huang, Siteng, et al.
Veröffentlicht: (2023)
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
von: Lv, Weiyi, et al.
Veröffentlicht: (2025)
von: Lv, Weiyi, et al.
Veröffentlicht: (2025)
Trajectory Mamba: Efficient Attention-Mamba Forecasting Model Based on Selective SSM
von: Huang, Yizhou, et al.
Veröffentlicht: (2025)
von: Huang, Yizhou, et al.
Veröffentlicht: (2025)
Sigma: Siamese Mamba Network for Multi-Modal Semantic Segmentation
von: Wan, Zifu, et al.
Veröffentlicht: (2024)
von: Wan, Zifu, et al.
Veröffentlicht: (2024)
MM-DETR: An Efficient Multimodal Detection Transformer with Mamba-Driven Dual-Granularity Fusion and Frequency-Aware Modality Adapters
von: Han, Jianhong, et al.
Veröffentlicht: (2025)
von: Han, Jianhong, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
von: Liu, Yang, et al.
Veröffentlicht: (2024) -
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
von: Ding, Pengxiang, et al.
Veröffentlicht: (2023) -
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
von: Liu, Yang, et al.
Veröffentlicht: (2025) -
ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification
von: Cui, Can, et al.
Veröffentlicht: (2024) -
QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning
von: Tong, Xinyang, et al.
Veröffentlicht: (2024)