M2IST: Multi-Modal Interactive Side-Tuning for Efficient Referring Expression Comprehension
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Xuyang, Liu, Ting, Huang, Siteng, Xin, Yi, Hu, Yue, Yin, Quanjun, Wang, Donglin, Wu, Yuanyuan, Chen, Honggang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DARA: Domain- and Relation-aware Adapters Make Parameter-efficient Tuning for Visual Grounding
von: Liu, Ting, et al.
Veröffentlicht: (2024)
von: Liu, Ting, et al.
Veröffentlicht: (2024)
MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression Comprehension
von: Liu, Ting, et al.
Veröffentlicht: (2024)
von: Liu, Ting, et al.
Veröffentlicht: (2024)
Sparse-Tuning: Adapting Vision Transformers with Efficient Fine-tuning and Inference
von: Liu, Ting, et al.
Veröffentlicht: (2024)
von: Liu, Ting, et al.
Veröffentlicht: (2024)
VGDiffZero: Text-to-image Diffusion Models Can Be Zero-shot Visual Grounders
von: Liu, Xuyang, et al.
Veröffentlicht: (2023)
von: Liu, Xuyang, et al.
Veröffentlicht: (2023)
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
von: Zhao, Han, et al.
Veröffentlicht: (2024)
von: Zhao, Han, et al.
Veröffentlicht: (2024)
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
von: Chen, Junjie, et al.
Veröffentlicht: (2025)
von: Chen, Junjie, et al.
Veröffentlicht: (2025)
Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration
von: Han, Yuhang, et al.
Veröffentlicht: (2024)
von: Han, Yuhang, et al.
Veröffentlicht: (2024)
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
von: Liu, Ting, et al.
Veröffentlicht: (2024)
von: Liu, Ting, et al.
Veröffentlicht: (2024)
Accelerating Diffusion Transformers with Token-wise Feature Caching
von: Zou, Chang, et al.
Veröffentlicht: (2024)
von: Zou, Chang, et al.
Veröffentlicht: (2024)
Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot Learning
von: Huang, Siteng, et al.
Veröffentlicht: (2023)
von: Huang, Siteng, et al.
Veröffentlicht: (2023)
VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL
von: Dai, Fengyuan, et al.
Veröffentlicht: (2025)
von: Dai, Fengyuan, et al.
Veröffentlicht: (2025)
Perception- and Fidelity-aware Reduced-Reference Super-Resolution Image Quality Assessment
von: Lin, Xinying, et al.
Veröffentlicht: (2024)
von: Lin, Xinying, et al.
Veröffentlicht: (2024)
Focus-Consistent Multi-Level Aggregation for Compositional Zero-Shot Learning
von: Dai, Fengyuan, et al.
Veröffentlicht: (2024)
von: Dai, Fengyuan, et al.
Veröffentlicht: (2024)
SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding
von: Shi, Liangtao, et al.
Veröffentlicht: (2025)
von: Shi, Liangtao, et al.
Veröffentlicht: (2025)
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
ReMeREC: Relation-aware and Multi-entity Referring Expression Comprehension
von: Hu, Yizhi, et al.
Veröffentlicht: (2025)
von: Hu, Yizhi, et al.
Veröffentlicht: (2025)
DAP: Domain-aware Prompt Learning for Vision-and-Language Navigation
von: Liu, Ting, et al.
Veröffentlicht: (2023)
von: Liu, Ting, et al.
Veröffentlicht: (2023)
Densely Connected Parameter-Efficient Tuning for Referring Image Segmentation
von: Huang, Jiaqi, et al.
Veröffentlicht: (2025)
von: Huang, Jiaqi, et al.
Veröffentlicht: (2025)
Zero-Shot Referring Expression Comprehension via Vison-Language True/False Verification
von: Liu, Jeffrey, et al.
Veröffentlicht: (2025)
von: Liu, Jeffrey, et al.
Veröffentlicht: (2025)
Embodied Referring Expression Comprehension in Human-Robot Interaction
von: Islam, Md Mofijul, et al.
Veröffentlicht: (2025)
von: Islam, Md Mofijul, et al.
Veröffentlicht: (2025)
Self-paced Multi-grained Cross-modal Interaction Modeling for Referring Expression Comprehension
von: Miao, Peihan, et al.
Veröffentlicht: (2022)
von: Miao, Peihan, et al.
Veröffentlicht: (2022)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
von: Liu, Yang, et al.
Veröffentlicht: (2024)
von: Liu, Yang, et al.
Veröffentlicht: (2024)
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
von: Ding, Henghui, et al.
Veröffentlicht: (2025)
von: Ding, Henghui, et al.
Veröffentlicht: (2025)
GREx: Generalized Referring Expression Segmentation, Comprehension, and Generation
von: Ding, Henghui, et al.
Veröffentlicht: (2026)
von: Ding, Henghui, et al.
Veröffentlicht: (2026)
MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation
von: Liu, Yang, et al.
Veröffentlicht: (2026)
von: Liu, Yang, et al.
Veröffentlicht: (2026)
SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation
von: Chen, Yi-Chia, et al.
Veröffentlicht: (2024)
von: Chen, Yi-Chia, et al.
Veröffentlicht: (2024)
WeakMCN: Multi-task Collaborative Network for Weakly Supervised Referring Expression Comprehension and Segmentation
von: Liu, Yang, et al.
Veröffentlicht: (2025)
von: Liu, Yang, et al.
Veröffentlicht: (2025)
Learning Disentangled Identifiers for Action-Customized Text-to-Image Generation
von: Huang, Siteng, et al.
Veröffentlicht: (2023)
von: Huang, Siteng, et al.
Veröffentlicht: (2023)
Efficient Multi-task Prompt Tuning for Recommendation
von: Bai, Ting, et al.
Veröffentlicht: (2024)
von: Bai, Ting, et al.
Veröffentlicht: (2024)
Referring Expression Comprehension for Small Objects
von: Goto, Kanoko, et al.
Veröffentlicht: (2025)
von: Goto, Kanoko, et al.
Veröffentlicht: (2025)
Internal Spectral Theory (IST)
von: Rivière, christophe
Veröffentlicht: (2026)
von: Rivière, christophe
Veröffentlicht: (2026)
HER2 Expression Prediction with Flexible Multi-Modal Inputs via Dynamic Bidirectional Reconstruction
von: Qin, Jie, et al.
Veröffentlicht: (2025)
von: Qin, Jie, et al.
Veröffentlicht: (2025)
A Survey on Feedback-based Multi-step Reasoning for Large Language Models on Mathematics
von: Wei, Ting-Ruen, et al.
Veröffentlicht: (2025)
von: Wei, Ting-Ruen, et al.
Veröffentlicht: (2025)
M2Rec: Multi-scale Mamba for Efficient Sequential Recommendation
von: Zhang, Qianru, et al.
Veröffentlicht: (2025)
von: Zhang, Qianru, et al.
Veröffentlicht: (2025)
VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension
von: Park, Hyejin, et al.
Veröffentlicht: (2026)
von: Park, Hyejin, et al.
Veröffentlicht: (2026)
ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification
von: Cui, Can, et al.
Veröffentlicht: (2024)
von: Cui, Can, et al.
Veröffentlicht: (2024)
Adaptive Data Harvesting for Efficient Neural Network Learning with Universal Constraints
von: Kang, Siteng, et al.
Veröffentlicht: (2026)
von: Kang, Siteng, et al.
Veröffentlicht: (2026)
RefDrone: A Challenging Benchmark for Referring Expression Comprehension in Drone Scenes
von: Sun, Zhichao, et al.
Veröffentlicht: (2025)
von: Sun, Zhichao, et al.
Veröffentlicht: (2025)
RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
von: Gao, Tianyi, et al.
Veröffentlicht: (2025)
von: Gao, Tianyi, et al.
Veröffentlicht: (2025)
Re-M3Dr: Rebalanced MultiModal Mean Deviation Regression
von: Yin, Haojie, et al.
Veröffentlicht: (2026)
von: Yin, Haojie, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
DARA: Domain- and Relation-aware Adapters Make Parameter-efficient Tuning for Visual Grounding
von: Liu, Ting, et al.
Veröffentlicht: (2024) -
MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression Comprehension
von: Liu, Ting, et al.
Veröffentlicht: (2024) -
Sparse-Tuning: Adapting Vision Transformers with Efficient Fine-tuning and Inference
von: Liu, Ting, et al.
Veröffentlicht: (2024) -
VGDiffZero: Text-to-image Diffusion Models Can Be Zero-shot Visual Grounders
von: Liu, Xuyang, et al.
Veröffentlicht: (2023) -
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
von: Zhao, Han, et al.
Veröffentlicht: (2024)