PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination
Fuente:
arXiv
Salvato in:
| Autori principali: | Dai, Ming, Cheng, Wenxuan, Zhuang, Jiedong, Liu, Jiang-jiang, Zhao, Hongshen, Feng, Zhenhua, Yang, Wankou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SimVG: A Simple Framework for Visual Grounding with Decoupled Multi-modal Fusion
di: Dai, Ming, et al.
Pubblicazione: (2024)
di: Dai, Ming, et al.
Pubblicazione: (2024)
Multi-task Visual Grounding with Coarse-to-Fine Consistency Constraints
di: Dai, Ming, et al.
Pubblicazione: (2025)
di: Dai, Ming, et al.
Pubblicazione: (2025)
Improving Generalized Visual Grounding with Instance-aware Joint Learning
di: Dai, Ming, et al.
Pubblicazione: (2025)
di: Dai, Ming, et al.
Pubblicazione: (2025)
DeRIS: Decoupling Perception and Cognition for Enhanced Referring Image Segmentation through Loopback Synergy
di: Dai, Ming, et al.
Pubblicazione: (2025)
di: Dai, Ming, et al.
Pubblicazione: (2025)
Vision Remember: Recovering Visual Information in Efficient LVLM with Vision Feature Resampling
di: Feng, Ze, et al.
Pubblicazione: (2025)
di: Feng, Ze, et al.
Pubblicazione: (2025)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
di: Zheng, Shurong, et al.
Pubblicazione: (2026)
di: Zheng, Shurong, et al.
Pubblicazione: (2026)
MGMapNet: Multi-Granularity Representation Learning for End-to-End Vectorized HD Map Construction
di: Yang, Jing, et al.
Pubblicazione: (2024)
di: Yang, Jing, et al.
Pubblicazione: (2024)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
di: Xiao, Linhui, et al.
Pubblicazione: (2023)
di: Xiao, Linhui, et al.
Pubblicazione: (2023)
Drone Referring Localization: An Efficient Heterogeneous Spatial Feature Interaction Method For UAV Self-Localization
di: Dai, Ming, et al.
Pubblicazione: (2022)
di: Dai, Ming, et al.
Pubblicazione: (2022)
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
di: Kang, Weitai, et al.
Pubblicazione: (2025)
di: Kang, Weitai, et al.
Pubblicazione: (2025)
AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding
di: Li, Haocheng, et al.
Pubblicazione: (2026)
di: Li, Haocheng, et al.
Pubblicazione: (2026)
VG3T: Visual Geometry Grounded Gaussian Transformer
di: Kim, Junho, et al.
Pubblicazione: (2025)
di: Kim, Junho, et al.
Pubblicazione: (2025)
PathVG: A New Benchmark and Dataset for Pathology Visual Grounding
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
$\text{VG}^2$GT: Voxel-Gaussian Splatting Visual Geometry Grounded Transformer
di: Zhao, Yibin, et al.
Pubblicazione: (2026)
di: Zhao, Yibin, et al.
Pubblicazione: (2026)
Spatially Visual Perception for End-to-End Robotic Learning
di: Davies, Travis, et al.
Pubblicazione: (2024)
di: Davies, Travis, et al.
Pubblicazione: (2024)
ResVG: Enhancing Relation and Semantic Understanding in Multiple Instances for Visual Grounding
di: Zheng, Minghang, et al.
Pubblicazione: (2024)
di: Zheng, Minghang, et al.
Pubblicazione: (2024)
A Proposed End-To-End Principle for Data Commons
di: Grossman, Robert L.
Pubblicazione: (2025)
di: Grossman, Robert L.
Pubblicazione: (2025)
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding
di: Shi, Liangtao, et al.
Pubblicazione: (2025)
di: Shi, Liangtao, et al.
Pubblicazione: (2025)
AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional Relations
di: Liu, Junli, et al.
Pubblicazione: (2025)
di: Liu, Junli, et al.
Pubblicazione: (2025)
Multi-label Cluster Discrimination for Visual Representation Learning
di: An, Xiang, et al.
Pubblicazione: (2024)
di: An, Xiang, et al.
Pubblicazione: (2024)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
di: Lim, Byeonggeuk, et al.
Pubblicazione: (2026)
di: Lim, Byeonggeuk, et al.
Pubblicazione: (2026)
VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction
di: Yan, Xiaoyang, et al.
Pubblicazione: (2026)
di: Yan, Xiaoyang, et al.
Pubblicazione: (2026)
Precise GPS-Denied UAV Self-Positioning via Context-Enhanced Cross-View Geo-Localization
di: Xu, Yuanze, et al.
Pubblicazione: (2025)
di: Xu, Yuanze, et al.
Pubblicazione: (2025)
iPad: Iterative Proposal-centric End-to-End Autonomous Driving
di: Guo, Ke, et al.
Pubblicazione: (2025)
di: Guo, Ke, et al.
Pubblicazione: (2025)
End-to-End Vision Tokenizer Tuning
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
LLM4VG: Large Language Models Evaluation for Video Grounding
di: Feng, Wei, et al.
Pubblicazione: (2023)
di: Feng, Wei, et al.
Pubblicazione: (2023)
End-to-End Visual Autonomous Parking via Control-Aided Attention
di: Chen, Chao, et al.
Pubblicazione: (2025)
di: Chen, Chao, et al.
Pubblicazione: (2025)
PRAG: End-to-End Privacy-Preserving Retrieval-Augmented Generation
di: Li, Zhijun, et al.
Pubblicazione: (2026)
di: Li, Zhijun, et al.
Pubblicazione: (2026)
ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming
di: Zhuang, Jiedong, et al.
Pubblicazione: (2024)
di: Zhuang, Jiedong, et al.
Pubblicazione: (2024)
Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan
di: Wang, Jialing, et al.
Pubblicazione: (2026)
di: Wang, Jialing, et al.
Pubblicazione: (2026)
WaterVG: Waterway Visual Grounding based on Text-Guided Vision and mmWave Radar
di: Guan, Runwei, et al.
Pubblicazione: (2024)
di: Guan, Runwei, et al.
Pubblicazione: (2024)
Q Cache: Visual Attention is Valuable in Less than Half of Decode Layers for Multimodal Large Language Model
di: Zhuang, Jiedong, et al.
Pubblicazione: (2026)
di: Zhuang, Jiedong, et al.
Pubblicazione: (2026)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery
di: Li, Ke, et al.
Pubblicazione: (2026)
di: Li, Ke, et al.
Pubblicazione: (2026)
GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning
di: Kang, Weitai, et al.
Pubblicazione: (2025)
di: Kang, Weitai, et al.
Pubblicazione: (2025)
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
di: Bai, Sule, et al.
Pubblicazione: (2025)
di: Bai, Sule, et al.
Pubblicazione: (2025)
TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding
di: Huo, Mingyue, et al.
Pubblicazione: (2026)
di: Huo, Mingyue, et al.
Pubblicazione: (2026)
Reference Channel Selection by Multi-Channel Masking for End-to-End Multi-Channel Speech Enhancement
di: Dai, Wang, et al.
Pubblicazione: (2024)
di: Dai, Wang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SimVG: A Simple Framework for Visual Grounding with Decoupled Multi-modal Fusion
di: Dai, Ming, et al.
Pubblicazione: (2024) -
Multi-task Visual Grounding with Coarse-to-Fine Consistency Constraints
di: Dai, Ming, et al.
Pubblicazione: (2025) -
Improving Generalized Visual Grounding with Instance-aware Joint Learning
di: Dai, Ming, et al.
Pubblicazione: (2025) -
DeRIS: Decoupling Perception and Cognition for Enhanced Referring Image Segmentation through Loopback Synergy
di: Dai, Ming, et al.
Pubblicazione: (2025) -
Vision Remember: Recovering Visual Information in Efficient LVLM with Vision Feature Resampling
di: Feng, Ze, et al.
Pubblicazione: (2025)