SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kang, Weitai, Liu, Gaowen, Shah, Mubarak, Yan, Yan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
par: Kang, Weitai, et autres
Publié: (2025)
par: Kang, Weitai, et autres
Publié: (2025)
Intent3D: 3D Object Detection in RGB-D Scans Based on Human Intention
par: Kang, Weitai, et autres
Publié: (2024)
par: Kang, Weitai, et autres
Publié: (2024)
ACTRESS: Active Retraining for Semi-supervised Visual Grounding
par: Kang, Weitai, et autres
Publié: (2024)
par: Kang, Weitai, et autres
Publié: (2024)
Visual Grounding with Attention-Driven Constraint Balancing
par: Kang, Weitai, et autres
Publié: (2024)
par: Kang, Weitai, et autres
Publié: (2024)
Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning
par: Kang, Weitai, et autres
Publié: (2024)
par: Kang, Weitai, et autres
Publié: (2024)
VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
par: Kang, Weitai, et autres
Publié: (2025)
par: Kang, Weitai, et autres
Publié: (2025)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
par: Xiao, Linhui, et autres
Publié: (2023)
par: Xiao, Linhui, et autres
Publié: (2023)
VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction
par: Yan, Xiaoyang, et autres
Publié: (2026)
par: Yan, Xiaoyang, et autres
Publié: (2026)
SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding
par: Shi, Liangtao, et autres
Publié: (2025)
par: Shi, Liangtao, et autres
Publié: (2025)
3DResT: A Strong Baseline for Semi-Supervised 3D Referring Expression Segmentation
par: Chen, Wenxin, et autres
Publié: (2025)
par: Chen, Wenxin, et autres
Publié: (2025)
AerialVG: A Challenging Benchmark for Aerial Visual Grounding by Exploring Positional Relations
par: Liu, Junli, et autres
Publié: (2025)
par: Liu, Junli, et autres
Publié: (2025)
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
par: Xiao, Linhui, et autres
Publié: (2024)
par: Xiao, Linhui, et autres
Publié: (2024)
PathVG: A New Benchmark and Dataset for Pathology Visual Grounding
par: Zhong, Chunlin, et autres
Publié: (2025)
par: Zhong, Chunlin, et autres
Publié: (2025)
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
par: Bai, Sule, et autres
Publié: (2025)
par: Bai, Sule, et autres
Publié: (2025)
BoxSeg: Quality-Aware and Peer-Assisted Learning for Box-supervised Instance Segmentation
par: Lai, Jinxiang, et autres
Publié: (2025)
par: Lai, Jinxiang, et autres
Publié: (2025)
Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs
par: Narnaware, Vishal, et autres
Publié: (2026)
par: Narnaware, Vishal, et autres
Publié: (2026)
Temporally Consistent Referring Video Object Segmentation with Hybrid Memory
par: Miao, Bo, et autres
Publié: (2024)
par: Miao, Bo, et autres
Publié: (2024)
On the Faithfulness of Vision Transformer Explanations
par: Wu, Junyi, et autres
Publié: (2024)
par: Wu, Junyi, et autres
Publié: (2024)
Token Transformation Matters: Towards Faithful Post-hoc Explanation for Vision Transformer
par: Wu, Junyi, et autres
Publié: (2024)
par: Wu, Junyi, et autres
Publié: (2024)
ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery
par: Li, Ke, et autres
Publié: (2026)
par: Li, Ke, et autres
Publié: (2026)
$\text{VG}^2$GT: Voxel-Gaussian Splatting Visual Geometry Grounded Transformer
par: Zhao, Yibin, et autres
Publié: (2026)
par: Zhao, Yibin, et autres
Publié: (2026)
ResVG: Enhancing Relation and Semantic Understanding in Multiple Instances for Visual Grounding
par: Zheng, Minghang, et autres
Publié: (2024)
par: Zheng, Minghang, et autres
Publié: (2024)
GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning
par: Kang, Weitai, et autres
Publié: (2025)
par: Kang, Weitai, et autres
Publié: (2025)
VG3T: Visual Geometry Grounded Gaussian Transformer
par: Kim, Junho, et autres
Publié: (2025)
par: Kim, Junho, et autres
Publié: (2025)
MGD$^3$: Mode-Guided Dataset Distillation using Diffusion Models
par: Chan-Santiago, Jeffrey A., et autres
Publié: (2025)
par: Chan-Santiago, Jeffrey A., et autres
Publié: (2025)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
par: Ilaslan, Muhammet Furkan, et autres
Publié: (2024)
par: Ilaslan, Muhammet Furkan, et autres
Publié: (2024)
PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination
par: Dai, Ming, et autres
Publié: (2025)
par: Dai, Ming, et autres
Publié: (2025)
Cross-View Open-Vocabulary Object Detection in Aerial Imagery
par: Kini, Jyoti, et autres
Publié: (2025)
par: Kini, Jyoti, et autres
Publié: (2025)
Motion Marionette: Rethinking Rigid Motion Transfer via Prior Guidance
par: Wang, Haoxuan, et autres
Publié: (2025)
par: Wang, Haoxuan, et autres
Publié: (2025)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
par: Lim, Byeonggeuk, et autres
Publié: (2026)
par: Lim, Byeonggeuk, et autres
Publié: (2026)
SegTrans: Transferable Adversarial Examples for Segmentation Models
par: Song, Yufei, et autres
Publié: (2025)
par: Song, Yufei, et autres
Publié: (2025)
SegMASt3R: Geometry Grounded Segment Matching
par: Jayanti, Rohit, et autres
Publié: (2025)
par: Jayanti, Rohit, et autres
Publié: (2025)
AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation
par: Qian, Rui, et autres
Publié: (2026)
par: Qian, Rui, et autres
Publié: (2026)
Adversarial Bounding Boxes Generation (ABBG) Attack against Visual Object Trackers
par: Nokabadi, Fatemeh Nourilenjan, et autres
Publié: (2024)
par: Nokabadi, Fatemeh Nourilenjan, et autres
Publié: (2024)
LLM4VG: Large Language Models Evaluation for Video Grounding
par: Feng, Wei, et autres
Publié: (2023)
par: Feng, Wei, et autres
Publié: (2023)
RayMap3R: Inference-Time RayMap for Dynamic 3D Reconstruction
par: Wang, Feiran, et autres
Publié: (2026)
par: Wang, Feiran, et autres
Publié: (2026)
Seg2Box: 3D Object Detection by Point-Wise Semantics Supervision
par: Zheng, Maoji, et autres
Publié: (2025)
par: Zheng, Maoji, et autres
Publié: (2025)
SimVG: A Simple Framework for Visual Grounding with Decoupled Multi-modal Fusion
par: Dai, Ming, et autres
Publié: (2024)
par: Dai, Ming, et autres
Publié: (2024)
AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding
par: Li, Haocheng, et autres
Publié: (2026)
par: Li, Haocheng, et autres
Publié: (2026)
Seg-VAR: Image Segmentation with Visual Autoregressive Modeling
par: Zheng, Rongkun, et autres
Publié: (2025)
par: Zheng, Rongkun, et autres
Publié: (2025)
Documents similaires
-
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
par: Kang, Weitai, et autres
Publié: (2025) -
Intent3D: 3D Object Detection in RGB-D Scans Based on Human Intention
par: Kang, Weitai, et autres
Publié: (2024) -
ACTRESS: Active Retraining for Semi-supervised Visual Grounding
par: Kang, Weitai, et autres
Publié: (2024) -
Visual Grounding with Attention-Driven Constraint Balancing
par: Kang, Weitai, et autres
Publié: (2024) -
Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning
par: Kang, Weitai, et autres
Publié: (2024)