Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yaxian, Ding, Henghui, He, Shuting, Jiang, Xudong, Wei, Bifan, Liu, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GREx: Generalized Referring Expression Segmentation, Comprehension, and Generation
di: Ding, Henghui, et al.
Pubblicazione: (2026)
di: Ding, Henghui, et al.
Pubblicazione: (2026)
Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation
di: He, Shuting, et al.
Pubblicazione: (2024)
di: He, Shuting, et al.
Pubblicazione: (2024)
RefMask3D: Language-Guided Transformer for 3D Referring Segmentation
di: He, Shuting, et al.
Pubblicazione: (2024)
di: He, Shuting, et al.
Pubblicazione: (2024)
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
di: Ding, Henghui, et al.
Pubblicazione: (2025)
di: Ding, Henghui, et al.
Pubblicazione: (2025)
SegPoint: Segment Any Point Cloud via Large Language Model
di: He, Shuting, et al.
Pubblicazione: (2024)
di: He, Shuting, et al.
Pubblicazione: (2024)
Multimodal Referring Segmentation: A Survey
di: Ding, Henghui, et al.
Pubblicazione: (2025)
di: Ding, Henghui, et al.
Pubblicazione: (2025)
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
di: Ying, Kaining, et al.
Pubblicazione: (2025)
di: Ying, Kaining, et al.
Pubblicazione: (2025)
ReferSplat: Referring Segmentation in 3D Gaussian Splatting
di: He, Shuting, et al.
Pubblicazione: (2025)
di: He, Shuting, et al.
Pubblicazione: (2025)
Beyond Referring Expressions: Scenario Comprehension Visual Grounding
di: He, Ruozhen, et al.
Pubblicazione: (2026)
di: He, Ruozhen, et al.
Pubblicazione: (2026)
3D-GRES: Generalized 3D Referring Expression Segmentation
di: Wu, Changli, et al.
Pubblicazione: (2024)
di: Wu, Changli, et al.
Pubblicazione: (2024)
MOSEv2: A More Challenging Dataset for Video Object Segmentation in Complex Scenes
di: Ding, Henghui, et al.
Pubblicazione: (2025)
di: Ding, Henghui, et al.
Pubblicazione: (2025)
A Survey on 3D Gaussian Splatting Applications: Segmentation, Editing, and Generation
di: He, Shuting, et al.
Pubblicazione: (2025)
di: He, Shuting, et al.
Pubblicazione: (2025)
Mitigating the Curse of Dimensionality for Certified Robustness via Dual Randomized Smoothing
di: Xia, Song, et al.
Pubblicazione: (2024)
di: Xia, Song, et al.
Pubblicazione: (2024)
WeakMCN: Multi-task Collaborative Network for Weakly Supervised Referring Expression Comprehension and Segmentation
di: Liu, Yang, et al.
Pubblicazione: (2025)
di: Liu, Yang, et al.
Pubblicazione: (2025)
Ref-SAM3D: Bridging SAM3D with Text for Reference 3D Reconstruction
di: Zhou, Yun, et al.
Pubblicazione: (2025)
di: Zhou, Yun, et al.
Pubblicazione: (2025)
ScanFormer: Referring Expression Comprehension by Iteratively Scanning
di: Su, Wei, et al.
Pubblicazione: (2024)
di: Su, Wei, et al.
Pubblicazione: (2024)
Referring Expression Generation in Visually Grounded Dialogue with Discourse-aware Comprehension Guiding
di: Willemsen, Bram, et al.
Pubblicazione: (2024)
di: Willemsen, Bram, et al.
Pubblicazione: (2024)
LIHE: Linguistic Instance-Split Hyperbolic-Euclidean Framework for Generalized Weakly-Supervised Referring Expression Comprehension
di: Shi, Xianglong, et al.
Pubblicazione: (2025)
di: Shi, Xianglong, et al.
Pubblicazione: (2025)
HCMA: Hierarchical Cross-model Alignment for Grounded Text-to-Image Generation
di: Wang, Hang, et al.
Pubblicazione: (2025)
di: Wang, Hang, et al.
Pubblicazione: (2025)
Latent Expression Generation for Referring Image Segmentation and Grounding
di: Yu, Seonghoon, et al.
Pubblicazione: (2025)
di: Yu, Seonghoon, et al.
Pubblicazione: (2025)
Bring Adaptive Binding Prototypes to Generalized Referring Expression Segmentation
di: Li, Weize, et al.
Pubblicazione: (2024)
di: Li, Weize, et al.
Pubblicazione: (2024)
Self-paced Multi-grained Cross-modal Interaction Modeling for Referring Expression Comprehension
di: Miao, Peihan, et al.
Pubblicazione: (2022)
di: Miao, Peihan, et al.
Pubblicazione: (2022)
SAMA: Towards Multi-Turn Referential Grounded Video Chat with Large Language Models
di: Sun, Ye, et al.
Pubblicazione: (2025)
di: Sun, Ye, et al.
Pubblicazione: (2025)
SceneDesigner: Controllable Multi-Object Image Generation with 9-DoF Pose Manipulation
di: Qin, Zhenyuan, et al.
Pubblicazione: (2025)
di: Qin, Zhenyuan, et al.
Pubblicazione: (2025)
Open-set Anomaly Segmentation in Complex Scenarios
di: Xia, Song, et al.
Pubblicazione: (2025)
di: Xia, Song, et al.
Pubblicazione: (2025)
Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision
di: Li, Ling, et al.
Pubblicazione: (2026)
di: Li, Ling, et al.
Pubblicazione: (2026)
Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models
di: Chen, Jierun, et al.
Pubblicazione: (2024)
di: Chen, Jierun, et al.
Pubblicazione: (2024)
Zero-shot Referring Expression Comprehension via Structural Similarity Between Images and Captions
di: Han, Zeyu, et al.
Pubblicazione: (2023)
di: Han, Zeyu, et al.
Pubblicazione: (2023)
ColLab: A Collaborative Spatial Progressive Data Engine for Referring Expression Comprehension and Generation
di: Zhang, Shilan, et al.
Pubblicazione: (2025)
di: Zhang, Shilan, et al.
Pubblicazione: (2025)
Make Graph-based Referring Expression Comprehension Great Again through Expression-guided Dynamic Gating and Regression
di: Ke, Jingcheng, et al.
Pubblicazione: (2024)
di: Ke, Jingcheng, et al.
Pubblicazione: (2024)
AHMSA-Net: Adaptive Hierarchical Multi-Scale Attention Network for Micro-Expression Recognition
di: Zhang, Lijun, et al.
Pubblicazione: (2025)
di: Zhang, Lijun, et al.
Pubblicazione: (2025)
SAM3-DMS: Decoupled Memory Selection for Multi-target Video Segmentation of SAM3
di: Shen, Ruiqi, et al.
Pubblicazione: (2026)
di: Shen, Ruiqi, et al.
Pubblicazione: (2026)
GroundFlow: A Plug-in Module for Temporal Reasoning on 3D Point Cloud Sequential Grounding
di: Lin, Zijun, et al.
Pubblicazione: (2025)
di: Lin, Zijun, et al.
Pubblicazione: (2025)
Referring Expression Comprehension for Small Objects
di: Goto, Kanoko, et al.
Pubblicazione: (2025)
di: Goto, Kanoko, et al.
Pubblicazione: (2025)
Hierarchical Collaborative Fusion for 3D Instance-aware Referring Expression Segmentation
di: Zhou, Keshen, et al.
Pubblicazione: (2026)
di: Zhou, Keshen, et al.
Pubblicazione: (2026)
RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning
di: Huang, Shiqi, et al.
Pubblicazione: (2026)
di: Huang, Shiqi, et al.
Pubblicazione: (2026)
Hierarchical Disentanglement-Alignment Network for Robust SAR Vehicle Recognition
di: Li, Weijie, et al.
Pubblicazione: (2023)
di: Li, Weijie, et al.
Pubblicazione: (2023)
Evaluating SAM2 for Video Semantic Segmentation
di: Ariff, Syed Hesham Syed, et al.
Pubblicazione: (2025)
di: Ariff, Syed Hesham Syed, et al.
Pubblicazione: (2025)
RefDrone: A Challenging Benchmark for Referring Expression Comprehension in Drone Scenes
di: Sun, Zhichao, et al.
Pubblicazione: (2025)
di: Sun, Zhichao, et al.
Pubblicazione: (2025)
CharaConsist: Fine-Grained Consistent Character Generation
di: Wang, Mengyu, et al.
Pubblicazione: (2025)
di: Wang, Mengyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GREx: Generalized Referring Expression Segmentation, Comprehension, and Generation
di: Ding, Henghui, et al.
Pubblicazione: (2026) -
Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation
di: He, Shuting, et al.
Pubblicazione: (2024) -
RefMask3D: Language-Guided Transformer for 3D Referring Segmentation
di: He, Shuting, et al.
Pubblicazione: (2024) -
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
di: Ding, Henghui, et al.
Pubblicazione: (2025) -
SegPoint: Segment Any Point Cloud via Large Language Model
di: He, Shuting, et al.
Pubblicazione: (2024)