ReMeREC: Relation-aware and Multi-entity Referring Expression Comprehension
Fuente:
arXiv
Saved in:
| Main Authors: | Hu, Yizhi, Tian, Zezhao, Qi, Xingqun, Su, Chen, Yang, Bingkun, Yin, Junhui, Sun, Muyi, Zhang, Man, Sun, Zhenan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction
by: Li, Shiying, et al.
Published: (2025)
by: Li, Shiying, et al.
Published: (2025)
RA-SSU: Towards Fine-Grained Audio-Visual Learning with Region-Aware Sound Source Understanding
by: Sun, Muyi, et al.
Published: (2026)
by: Sun, Muyi, et al.
Published: (2026)
DanceEditor: Towards Iterative Editable Music-driven Dance Generation with Open-Vocabulary Descriptions
by: Zhang, Hengyuan, et al.
Published: (2025)
by: Zhang, Hengyuan, et al.
Published: (2025)
SemiTooth: a Generalizable Semi-supervised Framework for Multi-Source Tooth Segmentation
by: Sun, Muyi, et al.
Published: (2026)
by: Sun, Muyi, et al.
Published: (2026)
Referring Expression Generation in Visually Grounded Dialogue with Discourse-aware Comprehension Guiding
by: Willemsen, Bram, et al.
Published: (2024)
by: Willemsen, Bram, et al.
Published: (2024)
REC-RL: Referring expression counting via Gaussian and range-based reward optimization
by: Liu, Hui, et al.
Published: (2026)
by: Liu, Hui, et al.
Published: (2026)
MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression Comprehension
by: Liu, Ting, et al.
Published: (2024)
by: Liu, Ting, et al.
Published: (2024)
ScanFormer: Referring Expression Comprehension by Iteratively Scanning
by: Su, Wei, et al.
Published: (2024)
by: Su, Wei, et al.
Published: (2024)
MoPE-CLIP: Structured Pruning for Efficient Vision-Language Models with Module-wise Pruning Error Metric
by: Lin, Haokun, et al.
Published: (2024)
by: Lin, Haokun, et al.
Published: (2024)
RefDrone: A Challenging Benchmark for Referring Expression Comprehension in Drone Scenes
by: Sun, Zhichao, et al.
Published: (2025)
by: Sun, Zhichao, et al.
Published: (2025)
RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
by: Gao, Tianyi, et al.
Published: (2025)
by: Gao, Tianyi, et al.
Published: (2025)
Pest Manager: A Systematic Framework for Precise Pest Counting and Identification in Invisible Grain Pile Storage Environment
by: Ma, Chuanyang, et al.
Published: (2024)
by: Ma, Chuanyang, et al.
Published: (2024)
Referring Expression Comprehension for Small Objects
by: Goto, Kanoko, et al.
Published: (2025)
by: Goto, Kanoko, et al.
Published: (2025)
M2IST: Multi-Modal Interactive Side-Tuning for Efficient Referring Expression Comprehension
by: Liu, Xuyang, et al.
Published: (2024)
by: Liu, Xuyang, et al.
Published: (2024)
Demonstration-based learning for few-shot biomedical named entity recognition under machine reading comprehension
by: Su, Leilei, et al.
Published: (2023)
by: Su, Leilei, et al.
Published: (2023)
Self-paced Multi-grained Cross-modal Interaction Modeling for Referring Expression Comprehension
by: Miao, Peihan, et al.
Published: (2022)
by: Miao, Peihan, et al.
Published: (2022)
KnowDR-REC: A Benchmark for Referring Expression Comprehension with Real-World Knowledge
by: Jin, Guanghao, et al.
Published: (2025)
by: Jin, Guanghao, et al.
Published: (2025)
GREx: Generalized Referring Expression Segmentation, Comprehension, and Generation
by: Ding, Henghui, et al.
Published: (2026)
by: Ding, Henghui, et al.
Published: (2026)
Beyond Referring Expressions: Scenario Comprehension Visual Grounding
by: He, Ruozhen, et al.
Published: (2026)
by: He, Ruozhen, et al.
Published: (2026)
Harlequin: Color-driven Generation of Synthetic Data for Referring Expression Comprehension
by: Parolari, Luca, et al.
Published: (2024)
by: Parolari, Luca, et al.
Published: (2024)
Zero-Shot Referring Expression Comprehension via Vison-Language True/False Verification
by: Liu, Jeffrey, et al.
Published: (2025)
by: Liu, Jeffrey, et al.
Published: (2025)
Graph and Skipped Transformer: Exploiting Spatial and Temporal Modeling Capacities for Efficient 3D Human Pose Estimation
by: Cui, Mengmeng, et al.
Published: (2024)
by: Cui, Mengmeng, et al.
Published: (2024)
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
by: Ding, Henghui, et al.
Published: (2025)
by: Ding, Henghui, et al.
Published: (2025)
CK-Transformer: Commonsense Knowledge Enhanced Transformers for Referring Expression Comprehension
by: Zhang, Zhi, et al.
Published: (2023)
by: Zhang, Zhi, et al.
Published: (2023)
Hybrid attention structure preserving network for reconstruction of under-sampled OCT images
by: Guo, Zezhao, et al.
Published: (2024)
by: Guo, Zezhao, et al.
Published: (2024)
Comprehension of Multilingual Expressions Referring to Target Objects in Visual Inputs
by: Nogueira, Francisco, et al.
Published: (2025)
by: Nogueira, Francisco, et al.
Published: (2025)
The Solution for the 5th GCAIAC Zero-shot Referring Expression Comprehension Challenge
by: Huang, Longfei, et al.
Published: (2024)
by: Huang, Longfei, et al.
Published: (2024)
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
by: Shen, Li-Cheng, et al.
Published: (2025)
by: Shen, Li-Cheng, et al.
Published: (2025)
Hierarchical Collaborative Fusion for 3D Instance-aware Referring Expression Segmentation
by: Zhou, Keshen, et al.
Published: (2026)
by: Zhou, Keshen, et al.
Published: (2026)
Towards High Fidelity Face Swapping: A Comprehensive Survey and New Benchmark
by: Li, Qi, et al.
Published: (2026)
by: Li, Qi, et al.
Published: (2026)
Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models
by: Chen, Jierun, et al.
Published: (2024)
by: Chen, Jierun, et al.
Published: (2024)
IPDN: Image-enhanced Prompt Decoding Network for 3D Referring Expression Segmentation
by: Chen, Qi, et al.
Published: (2025)
by: Chen, Qi, et al.
Published: (2025)
TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation
by: Lin, Haokun, et al.
Published: (2025)
by: Lin, Haokun, et al.
Published: (2025)
SSP-SAM: SAM with Semantic-Spatial Prompt for Referring Expression Segmentation
by: Tang, Wei, et al.
Published: (2026)
by: Tang, Wei, et al.
Published: (2026)
TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models
by: Li, Zhiwei, et al.
Published: (2025)
by: Li, Zhiwei, et al.
Published: (2025)
Learning Disentangled Representation for One-shot Progressive Face Swapping
by: Li, Qi, et al.
Published: (2022)
by: Li, Qi, et al.
Published: (2022)
FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension
by: Liu, Junzhuo, et al.
Published: (2024)
by: Liu, Junzhuo, et al.
Published: (2024)
Hierarchical Alignment-enhanced Adaptive Grounding Network for Generalized Referring Expression Comprehension
by: Wang, Yaxian, et al.
Published: (2025)
by: Wang, Yaxian, et al.
Published: (2025)
Benchmarking Table Comprehension In The Wild
by: Pan, Yikang, et al.
Published: (2024)
by: Pan, Yikang, et al.
Published: (2024)
When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models
by: Yakun, Cui, et al.
Published: (2026)
by: Yakun, Cui, et al.
Published: (2026)
Similar Items
-
VividListener: Expressive and Controllable Listener Dynamics Modeling for Multi-Modal Responsive Interaction
by: Li, Shiying, et al.
Published: (2025) -
RA-SSU: Towards Fine-Grained Audio-Visual Learning with Region-Aware Sound Source Understanding
by: Sun, Muyi, et al.
Published: (2026) -
DanceEditor: Towards Iterative Editable Music-driven Dance Generation with Open-Vocabulary Descriptions
by: Zhang, Hengyuan, et al.
Published: (2025) -
SemiTooth: a Generalizable Semi-supervised Framework for Multi-Source Tooth Segmentation
by: Sun, Muyi, et al.
Published: (2026) -
Referring Expression Generation in Visually Grounded Dialogue with Discourse-aware Comprehension Guiding
by: Willemsen, Bram, et al.
Published: (2024)