A Simple and Better Baseline for Visual Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Jingchao, Zhang, Wenlong, Huang, Dingjiang, Wang, Hong, Zheng, Yefeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
Unlocking the Potential of MLLMs in Referring Expression Segmentation via a Light-weight Mask Decoder
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
VPTracker: Global Vision-Language Tracking via Visual Prompt
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
SimROD: A Simple Baseline for Raw Object Detection with Global and Local Enhancements
di: Xie, Haiyang, et al.
Pubblicazione: (2025)
di: Xie, Haiyang, et al.
Pubblicazione: (2025)
SimBase: A Simple Baseline for Temporal Video Grounding
di: Bao, Peijun, et al.
Pubblicazione: (2024)
di: Bao, Peijun, et al.
Pubblicazione: (2024)
RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
di: Sun, Wenfang, et al.
Pubblicazione: (2026)
di: Sun, Wenfang, et al.
Pubblicazione: (2026)
CubeFormer: A Simple yet Effective Baseline for Lightweight Image Super-Resolution
di: Wang, Jikai, et al.
Pubblicazione: (2024)
di: Wang, Jikai, et al.
Pubblicazione: (2024)
SimToken: A Simple Baseline for Referring Audio-Visual Segmentation
di: Jin, Dian, et al.
Pubblicazione: (2025)
di: Jin, Dian, et al.
Pubblicazione: (2025)
DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework
di: Zhang, Yani, et al.
Pubblicazione: (2025)
di: Zhang, Yani, et al.
Pubblicazione: (2025)
Learning Spectral Diffusion Prior for Hyperspectral Image Reconstruction
di: Yu, Mingyang, et al.
Pubblicazione: (2025)
di: Yu, Mingyang, et al.
Pubblicazione: (2025)
SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution
di: Xie, Liangbin, et al.
Pubblicazione: (2025)
di: Xie, Liangbin, et al.
Pubblicazione: (2025)
Reference Twice: A Simple and Unified Baseline for Few-Shot Instance Segmentation
di: Han, Yue, et al.
Pubblicazione: (2023)
di: Han, Yue, et al.
Pubblicazione: (2023)
InViC: Intent-aware Visual Cues for Medical Visual Question Answering
di: Wang, Zhisong, et al.
Pubblicazione: (2026)
di: Wang, Zhisong, et al.
Pubblicazione: (2026)
MedVLThinker: Simple Baselines for Multimodal Medical Reasoning
di: Huang, Xiaoke, et al.
Pubblicazione: (2025)
di: Huang, Xiaoke, et al.
Pubblicazione: (2025)
ChangingGrounding: 3D Visual Grounding in Changing Scenes
di: Hu, Miao, et al.
Pubblicazione: (2025)
di: Hu, Miao, et al.
Pubblicazione: (2025)
Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models
di: Zhang, Haotian, et al.
Pubblicazione: (2024)
di: Zhang, Haotian, et al.
Pubblicazione: (2024)
Mamba YOLO: A Simple Baseline for Object Detection with State Space Model
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
A Refreshed Similarity-based Upsampler for Direct High-Ratio Feature Upsampling
di: Zhou, Minghao, et al.
Pubblicazione: (2024)
di: Zhou, Minghao, et al.
Pubblicazione: (2024)
A Simple and Efficient Baseline for Zero-Shot Generative Classification
di: Qi, Zipeng, et al.
Pubblicazione: (2024)
di: Qi, Zipeng, et al.
Pubblicazione: (2024)
This Looks Distinctly Like That: Grounding Interpretable Recognition in Stiefel Geometry against Neural Collapse
di: Jia, Junhao, et al.
Pubblicazione: (2026)
di: Jia, Junhao, et al.
Pubblicazione: (2026)
RELOCATE: A Simple Training-Free Baseline for Visual Query Localization Using Region-Based Representations
di: Khosla, Savya, et al.
Pubblicazione: (2024)
di: Khosla, Savya, et al.
Pubblicazione: (2024)
SCT: A Simple Baseline for Parameter-Efficient Fine-Tuning via Salient Channels
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2023)
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2023)
A Simple Baseline for Efficient Hand Mesh Reconstruction
di: Zhou, Zhishan, et al.
Pubblicazione: (2024)
di: Zhou, Zhishan, et al.
Pubblicazione: (2024)
MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline
di: Yao, Huanjin, et al.
Pubblicazione: (2026)
di: Yao, Huanjin, et al.
Pubblicazione: (2026)
Revisiting Simple Baselines for In-The-Wild Deepfake Detection
di: Castaneda, Orlando, et al.
Pubblicazione: (2025)
di: Castaneda, Orlando, et al.
Pubblicazione: (2025)
A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction
di: Zhu, Jie, et al.
Pubblicazione: (2026)
di: Zhu, Jie, et al.
Pubblicazione: (2026)
DINOv3 Beats Specialized Detectors: A Simple Foundation Model Baseline for Image Forensics
di: Yu, Jieming, et al.
Pubblicazione: (2026)
di: Yu, Jieming, et al.
Pubblicazione: (2026)
Unleashing the Power of Generic Segmentation Models: A Simple Baseline for Infrared Small Target Detection
di: Zhang, Mingjin, et al.
Pubblicazione: (2024)
di: Zhang, Mingjin, et al.
Pubblicazione: (2024)
SimpleMatch: A Simple and Strong Baseline for Semantic Correspondence
di: Jin, Hailing, et al.
Pubblicazione: (2026)
di: Jin, Hailing, et al.
Pubblicazione: (2026)
Structure Observation Driven Image-Text Contrastive Learning for Computed Tomography Report Generation
di: Liu, Hong, et al.
Pubblicazione: (2026)
di: Liu, Hong, et al.
Pubblicazione: (2026)
OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation
di: Wu, Size, et al.
Pubblicazione: (2025)
di: Wu, Size, et al.
Pubblicazione: (2025)
Upsample Anything: A Simple and Hard to Beat Baseline for Feature Upsampling
di: Seo, Minseok, et al.
Pubblicazione: (2025)
di: Seo, Minseok, et al.
Pubblicazione: (2025)
A Simple-but-effective Baseline for Training-free Class-Agnostic Counting
di: Lin, Yuhao, et al.
Pubblicazione: (2024)
di: Lin, Yuhao, et al.
Pubblicazione: (2024)
Federated Modality-specific Encoders and Partially Personalized Fusion Decoder for Multimodal Brain Tumor Segmentation
di: Liu, Hong, et al.
Pubblicazione: (2026)
di: Liu, Hong, et al.
Pubblicazione: (2026)
Federated Modality-specific Encoders and Multimodal Anchors for Personalized Brain Tumor Segmentation
di: Dai, Qian, et al.
Pubblicazione: (2024)
di: Dai, Qian, et al.
Pubblicazione: (2024)
Reusing Fusion-Time Spectral Reliability for Adaptive Fusion and Expert Routing in RGB-Infrared Object Detection
di: Wu, Yefeng
Pubblicazione: (2026)
di: Wu, Yefeng
Pubblicazione: (2026)
Adaptive Convolutional Dictionary Network for CT Metal Artifact Reduction
di: Wang, Hong, et al.
Pubblicazione: (2022)
di: Wang, Hong, et al.
Pubblicazione: (2022)
VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
di: Wang, Yuji, et al.
Pubblicazione: (2025)
di: Wang, Yuji, et al.
Pubblicazione: (2025)
SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL
di: Wang, Junke, et al.
Pubblicazione: (2025)
di: Wang, Junke, et al.
Pubblicazione: (2025)
Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model
di: Xu, Wanting, et al.
Pubblicazione: (2024)
di: Xu, Wanting, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
di: Wang, Jingchao, et al.
Pubblicazione: (2025) -
Unlocking the Potential of MLLMs in Referring Expression Segmentation via a Light-weight Mask Decoder
di: Wang, Jingchao, et al.
Pubblicazione: (2025) -
VPTracker: Global Vision-Language Tracking via Visual Prompt
di: Wang, Jingchao, et al.
Pubblicazione: (2025) -
SimROD: A Simple Baseline for Raw Object Detection with Global and Local Enhancements
di: Xie, Haiyang, et al.
Pubblicazione: (2025) -
SimBase: A Simple Baseline for Temporal Video Grounding
di: Bao, Peijun, et al.
Pubblicazione: (2024)