SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Liangtao, Liu, Ting, Hu, Xiantao, Hu, Yue, Yin, Quanjun, Hong, Richang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
di: Liu, Ting, et al.
Pubblicazione: (2024)
di: Liu, Ting, et al.
Pubblicazione: (2024)
MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression Comprehension
di: Liu, Ting, et al.
Pubblicazione: (2024)
di: Liu, Ting, et al.
Pubblicazione: (2024)
Explicit Context Reasoning with Supervision for Visual Tracking
di: Zeng, Fansheng, et al.
Pubblicazione: (2025)
di: Zeng, Fansheng, et al.
Pubblicazione: (2025)
Adaptive Perception for Unified Visual Multi-modal Object Tracking
di: Hu, Xiantao, et al.
Pubblicazione: (2025)
di: Hu, Xiantao, et al.
Pubblicazione: (2025)
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
DARA: Domain- and Relation-aware Adapters Make Parameter-efficient Tuning for Visual Grounding
di: Liu, Ting, et al.
Pubblicazione: (2024)
di: Liu, Ting, et al.
Pubblicazione: (2024)
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery
di: Li, Ke, et al.
Pubblicazione: (2026)
di: Li, Ke, et al.
Pubblicazione: (2026)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
SimVG: A Simple Framework for Visual Grounding with Decoupled Multi-modal Fusion
di: Dai, Ming, et al.
Pubblicazione: (2024)
di: Dai, Ming, et al.
Pubblicazione: (2024)
PathVG: A New Benchmark and Dataset for Pathology Visual Grounding
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
di: Xiao, Linhui, et al.
Pubblicazione: (2023)
di: Xiao, Linhui, et al.
Pubblicazione: (2023)
WaterVG: Waterway Visual Grounding based on Text-Guided Vision and mmWave Radar
di: Guan, Runwei, et al.
Pubblicazione: (2024)
di: Guan, Runwei, et al.
Pubblicazione: (2024)
Multi-source Multimodal Progressive Domain Adaption for Audio-Visual Deception Detection
di: Lin, Ronghao, et al.
Pubblicazione: (2025)
di: Lin, Ronghao, et al.
Pubblicazione: (2025)
DAP: Domain-aware Prompt Learning for Vision-and-Language Navigation
di: Liu, Ting, et al.
Pubblicazione: (2023)
di: Liu, Ting, et al.
Pubblicazione: (2023)
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
di: Bai, Sule, et al.
Pubblicazione: (2025)
di: Bai, Sule, et al.
Pubblicazione: (2025)
$\text{VG}^2$GT: Voxel-Gaussian Splatting Visual Geometry Grounded Transformer
di: Zhao, Yibin, et al.
Pubblicazione: (2026)
di: Zhao, Yibin, et al.
Pubblicazione: (2026)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
di: Zheng, Shurong, et al.
Pubblicazione: (2026)
di: Zheng, Shurong, et al.
Pubblicazione: (2026)
ResVG: Enhancing Relation and Semantic Understanding in Multiple Instances for Visual Grounding
di: Zheng, Minghang, et al.
Pubblicazione: (2024)
di: Zheng, Minghang, et al.
Pubblicazione: (2024)
VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction
di: Yan, Xiaoyang, et al.
Pubblicazione: (2026)
di: Yan, Xiaoyang, et al.
Pubblicazione: (2026)
LLM4VG: Large Language Models Evaluation for Video Grounding
di: Feng, Wei, et al.
Pubblicazione: (2023)
di: Feng, Wei, et al.
Pubblicazione: (2023)
VG3T: Visual Geometry Grounded Gaussian Transformer
di: Kim, Junho, et al.
Pubblicazione: (2025)
di: Kim, Junho, et al.
Pubblicazione: (2025)
Grid Jigsaw Representation with CLIP: A New Perspective on Image Clustering
di: Song, Zijie, et al.
Pubblicazione: (2023)
di: Song, Zijie, et al.
Pubblicazione: (2023)
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
di: Kang, Weitai, et al.
Pubblicazione: (2025)
di: Kang, Weitai, et al.
Pubblicazione: (2025)
Seeing is Believing? Enhancing Vision-Language Navigation using Visual Perturbations
di: Zhang, Xuesong, et al.
Pubblicazione: (2024)
di: Zhang, Xuesong, et al.
Pubblicazione: (2024)
PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination
di: Dai, Ming, et al.
Pubblicazione: (2025)
di: Dai, Ming, et al.
Pubblicazione: (2025)
AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional Relations
di: Liu, Junli, et al.
Pubblicazione: (2025)
di: Liu, Junli, et al.
Pubblicazione: (2025)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
di: Lim, Byeonggeuk, et al.
Pubblicazione: (2026)
di: Lim, Byeonggeuk, et al.
Pubblicazione: (2026)
An Effective End-to-End Solution for Multimodal Action Recognition
di: Wang, Songping, et al.
Pubblicazione: (2025)
di: Wang, Songping, et al.
Pubblicazione: (2025)
Towards Low-latency Event-based Visual Recognition with Hybrid Step-wise Distillation Spiking Neural Networks
di: Zhong, Xian, et al.
Pubblicazione: (2024)
di: Zhong, Xian, et al.
Pubblicazione: (2024)
Sparse-Tuning: Adapting Vision Transformers with Efficient Fine-tuning and Inference
di: Liu, Ting, et al.
Pubblicazione: (2024)
di: Liu, Ting, et al.
Pubblicazione: (2024)
Infrared and Visible Image Fusion: From Data Compatibility to Task Adaption
di: Liu, Jinyuan, et al.
Pubblicazione: (2025)
di: Liu, Jinyuan, et al.
Pubblicazione: (2025)
AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding
di: Li, Haocheng, et al.
Pubblicazione: (2026)
di: Li, Haocheng, et al.
Pubblicazione: (2026)
GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer
di: Jia, Ding, et al.
Pubblicazione: (2024)
di: Jia, Ding, et al.
Pubblicazione: (2024)
Iterative Adversarial Attack on Image-guided Story Ending Generation
di: Wang, Youze, et al.
Pubblicazione: (2023)
di: Wang, Youze, et al.
Pubblicazione: (2023)
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
di: Wang, Yuji, et al.
Pubblicazione: (2025)
di: Wang, Yuji, et al.
Pubblicazione: (2025)
M2IST: Multi-Modal Interactive Side-Tuning for Efficient Referring Expression Comprehension
di: Liu, Xuyang, et al.
Pubblicazione: (2024)
di: Liu, Xuyang, et al.
Pubblicazione: (2024)
Explicit Visual Prompts for Visual Object Tracking
di: Shi, Liangtao, et al.
Pubblicazione: (2024)
di: Shi, Liangtao, et al.
Pubblicazione: (2024)
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
di: Li, Pengxiang, et al.
Pubblicazione: (2025)
di: Li, Pengxiang, et al.
Pubblicazione: (2025)
TrajVG: 3D Trajectory-Coupled Visual Geometry Learning
di: Miao, Xingyu, et al.
Pubblicazione: (2026)
di: Miao, Xingyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
di: Liu, Ting, et al.
Pubblicazione: (2024) -
MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression Comprehension
di: Liu, Ting, et al.
Pubblicazione: (2024) -
Explicit Context Reasoning with Supervision for Visual Tracking
di: Zeng, Fansheng, et al.
Pubblicazione: (2025) -
Adaptive Perception for Unified Visual Multi-modal Object Tracking
di: Hu, Xiantao, et al.
Pubblicazione: (2025) -
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
di: Xiao, Linhui, et al.
Pubblicazione: (2024)