GREx: Generalized Referring Expression Segmentation, Comprehension, and Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ding, Henghui, Liu, Chang, He, Shuting, Jiang, Xudong, Jiang, Yu-Gang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension
par: Wang, Yaxian, et autres
Publié: (2025)
par: Wang, Yaxian, et autres
Publié: (2025)
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
par: Ding, Henghui, et autres
Publié: (2025)
par: Ding, Henghui, et autres
Publié: (2025)
Multimodal Referring Segmentation: A Survey
par: Ding, Henghui, et autres
Publié: (2025)
par: Ding, Henghui, et autres
Publié: (2025)
Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation
par: He, Shuting, et autres
Publié: (2024)
par: He, Shuting, et autres
Publié: (2024)
RefMask3D: Language-Guided Transformer for 3D Referring Segmentation
par: He, Shuting, et autres
Publié: (2024)
par: He, Shuting, et autres
Publié: (2024)
SegPoint: Segment Any Point Cloud via Large Language Model
par: He, Shuting, et autres
Publié: (2024)
par: He, Shuting, et autres
Publié: (2024)
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
par: Ying, Kaining, et autres
Publié: (2025)
par: Ying, Kaining, et autres
Publié: (2025)
MOSEv2: A More Challenging Dataset for Video Object Segmentation in Complex Scenes
par: Ding, Henghui, et autres
Publié: (2025)
par: Ding, Henghui, et autres
Publié: (2025)
ReferSplat: Referring Segmentation in 3D Gaussian Splatting
par: He, Shuting, et autres
Publié: (2025)
par: He, Shuting, et autres
Publié: (2025)
3D-GRES: Generalized 3D Referring Expression Segmentation
par: Wu, Changli, et autres
Publié: (2024)
par: Wu, Changli, et autres
Publié: (2024)
ROSE: Retrieval-Oriented Segmentation Enhancement
par: Tang, Song, et autres
Publié: (2026)
par: Tang, Song, et autres
Publié: (2026)
A Survey on 3D Gaussian Splatting Applications: Segmentation, Editing, and Generation
par: He, Shuting, et autres
Publié: (2025)
par: He, Shuting, et autres
Publié: (2025)
Open-set Anomaly Segmentation in Complex Scenarios
par: Xia, Song, et autres
Publié: (2025)
par: Xia, Song, et autres
Publié: (2025)
Mitigating the Curse of Dimensionality for Certified Robustness via Dual Randomized Smoothing
par: Xia, Song, et autres
Publié: (2024)
par: Xia, Song, et autres
Publié: (2024)
SAM3-DMS: Decoupled Memory Selection for Multi-target Video Segmentation of SAM3
par: Shen, Ruiqi, et autres
Publié: (2026)
par: Shen, Ruiqi, et autres
Publié: (2026)
Evaluating SAM2 for Video Semantic Segmentation
par: Ariff, Syed Hesham Syed, et autres
Publié: (2025)
par: Ariff, Syed Hesham Syed, et autres
Publié: (2025)
Generalized Referring Expression Segmentation on Aerial Photos
par: Marnoto, Luís, et autres
Publié: (2025)
par: Marnoto, Luís, et autres
Publié: (2025)
LIHE: Linguistic Instance-Split Hyperbolic-Euclidean Framework for Generalized Weakly-Supervised Referring Expression Comprehension
par: Shi, Xianglong, et autres
Publié: (2025)
par: Shi, Xianglong, et autres
Publié: (2025)
Latent Expression Generation for Referring Image Segmentation and Grounding
par: Yu, Seonghoon, et autres
Publié: (2025)
par: Yu, Seonghoon, et autres
Publié: (2025)
WeakMCN: Multi-task Collaborative Network for Weakly Supervised Referring Expression Comprehension and Segmentation
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
Bring Adaptive Binding Prototypes to Generalized Referring Expression Segmentation
par: Li, Weize, et autres
Publié: (2024)
par: Li, Weize, et autres
Publié: (2024)
Segment Anything Across Shots: A Method and Benchmark
par: Hu, Hengrui, et autres
Publié: (2025)
par: Hu, Hengrui, et autres
Publié: (2025)
MOVE: Motion-Guided Few-Shot Video Object Segmentation
par: Ying, Kaining, et autres
Publié: (2025)
par: Ying, Kaining, et autres
Publié: (2025)
Zero-shot Referring Expression Comprehension via Structural Similarity Between Images and Captions
par: Han, Zeyu, et autres
Publié: (2023)
par: Han, Zeyu, et autres
Publié: (2023)
SceneDesigner: Controllable Multi-Object Image Generation with 9-DoF Pose Manipulation
par: Qin, Zhenyuan, et autres
Publié: (2025)
par: Qin, Zhenyuan, et autres
Publié: (2025)
SAMA: Towards Multi-Turn Referential Grounded Video Chat with Large Language Models
par: Sun, Ye, et autres
Publié: (2025)
par: Sun, Ye, et autres
Publié: (2025)
A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models
par: Shuai, Xincheng, et autres
Publié: (2024)
par: Shuai, Xincheng, et autres
Publié: (2024)
Beyond Referring Expressions: Scenario Comprehension Visual Grounding
par: He, Ruozhen, et autres
Publié: (2026)
par: He, Ruozhen, et autres
Publié: (2026)
EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models
par: Zhang, Jiacheng, et autres
Publié: (2024)
par: Zhang, Jiacheng, et autres
Publié: (2024)
ColLab: A Collaborative Spatial Progressive Data Engine for Referring Expression Comprehension and Generation
par: Zhang, Shilan, et autres
Publié: (2025)
par: Zhang, Shilan, et autres
Publié: (2025)
Ref-SAM3D: Bridging SAM3D with Text for Reference 3D Reconstruction
par: Zhou, Yun, et autres
Publié: (2025)
par: Zhou, Yun, et autres
Publié: (2025)
ActivityForensics: A Comprehensive Benchmark for Localizing Manipulated Activity in Videos
par: Bao, Peijun, et autres
Publié: (2026)
par: Bao, Peijun, et autres
Publié: (2026)
PECTP: Parameter-Efficient Cross-Task Prompts for Incremental Vision Transformer
par: Feng, Qian, et autres
Publié: (2024)
par: Feng, Qian, et autres
Publié: (2024)
Unveiling Parts Beyond Objects:Towards Finer-Granularity Referring Expression Segmentation
par: Wang, Wenxuan, et autres
Publié: (2023)
par: Wang, Wenxuan, et autres
Publié: (2023)
Harlequin: Color-driven Generation of Synthetic Data for Referring Expression Comprehension
par: Parolari, Luca, et autres
Publié: (2024)
par: Parolari, Luca, et autres
Publié: (2024)
ScanFormer: Referring Expression Comprehension by Iteratively Scanning
par: Su, Wei, et autres
Publié: (2024)
par: Su, Wei, et autres
Publié: (2024)
Text4Seg++: Advancing Image Segmentation via Generative Language Modeling
par: Lan, Mengcheng, et autres
Publié: (2025)
par: Lan, Mengcheng, et autres
Publié: (2025)
Towards Unified Referring Expression Segmentation Across Omni-Level Visual Target Granularities
par: Liu, Jing, et autres
Publié: (2025)
par: Liu, Jing, et autres
Publié: (2025)
LGD: Leveraging Generative Descriptions for Zero-Shot Referring Image Segmentation
par: Li, Jiachen, et autres
Publié: (2025)
par: Li, Jiachen, et autres
Publié: (2025)
Referring Expression Generation in Visually Grounded Dialogue with Discourse-aware Comprehension Guiding
par: Willemsen, Bram, et autres
Publié: (2024)
par: Willemsen, Bram, et autres
Publié: (2024)
Documents similaires
-
Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension
par: Wang, Yaxian, et autres
Publié: (2025) -
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
par: Ding, Henghui, et autres
Publié: (2025) -
Multimodal Referring Segmentation: A Survey
par: Ding, Henghui, et autres
Publié: (2025) -
Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation
par: He, Shuting, et autres
Publié: (2024) -
RefMask3D: Language-Guided Transformer for 3D Referring Segmentation
par: He, Shuting, et autres
Publié: (2024)