New Dataset and Methods for Fine-Grained Compositional Referring Expression Comprehension via Specialist-MLLM Collaboration
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Xuzheng, Liu, Junzhuo, Wang, Peng, Wang, Guoqing, Yang, Yang, Shen, Heng Tao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension
por: Liu, Junzhuo, et al.
Publicado: (2024)
por: Liu, Junzhuo, et al.
Publicado: (2024)
GeoRef: Referring Expressions in Geometry via Task Formulation, Synthetic Supervision, and Reinforced MLLM-based Solutions
por: Liu, Bing, et al.
Publicado: (2025)
por: Liu, Bing, et al.
Publicado: (2025)
Region-aware Distribution Contrast: A Novel Approach to Multi-Task Partially Supervised Learning
por: Li, Meixuan, et al.
Publicado: (2024)
por: Li, Meixuan, et al.
Publicado: (2024)
Fine-Grained Representation for Lane Topology Reasoning
por: Xu, Guoqing, et al.
Publicado: (2025)
por: Xu, Guoqing, et al.
Publicado: (2025)
CTForensics: A Comprehensive Dataset and Method for AI-Generated CT Image Detection
por: Li, Yiheng, et al.
Publicado: (2026)
por: Li, Yiheng, et al.
Publicado: (2026)
Implicit Counterfactual Learning for Audio-Visual Segmentation
por: Zha, Mingfeng, et al.
Publicado: (2025)
por: Zha, Mingfeng, et al.
Publicado: (2025)
WeakMCN: Multi-task Collaborative Network for Weakly Supervised Referring Expression Comprehension and Segmentation
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
ColLab: A Collaborative Spatial Progressive Data Engine for Referring Expression Comprehension and Generation
por: Zhang, Shilan, et al.
Publicado: (2025)
por: Zhang, Shilan, et al.
Publicado: (2025)
LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents
por: Chen, Boyu, et al.
Publicado: (2025)
por: Chen, Boyu, et al.
Publicado: (2025)
Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
por: Dong, Qihua, et al.
Publicado: (2026)
por: Dong, Qihua, et al.
Publicado: (2026)
Hybrid Feature Collaborative Reconstruction Network for Few-Shot Fine-Grained Image Classification
por: Qiu, Shulei, et al.
Publicado: (2024)
por: Qiu, Shulei, et al.
Publicado: (2024)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
por: Yu, Hong-Tao, et al.
Publicado: (2025)
por: Yu, Hong-Tao, et al.
Publicado: (2025)
Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation
por: Lei, Yinjie, et al.
Publicado: (2023)
por: Lei, Yinjie, et al.
Publicado: (2023)
JoReS-Diff: Joint Retinex and Semantic Priors in Diffusion Model for Low-light Image Enhancement
por: Wu, Yuhui, et al.
Publicado: (2023)
por: Wu, Yuhui, et al.
Publicado: (2023)
EyePCR: A Comprehensive Benchmark for Fine-Grained Perception, Knowledge Comprehension and Clinical Reasoning in Ophthalmic Surgery
por: Wang, Gui, et al.
Publicado: (2025)
por: Wang, Gui, et al.
Publicado: (2025)
CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding
por: Zheng, Lihao, et al.
Publicado: (2026)
por: Zheng, Lihao, et al.
Publicado: (2026)
FineXtrol: Controllable Motion Generation via Fine-Grained Text
por: Shen, Keming, et al.
Publicado: (2025)
por: Shen, Keming, et al.
Publicado: (2025)
UAV as Urban Construction Change Monitor: A New Benchmark and Change Captioning Model
por: Gao, Yupeng, et al.
Publicado: (2026)
por: Gao, Yupeng, et al.
Publicado: (2026)
OneRef: Unified One-tower Expression Grounding and Segmentation with Mask Referring Modeling
por: Xiao, Linhui, et al.
Publicado: (2024)
por: Xiao, Linhui, et al.
Publicado: (2024)
FineState-Bench: A Comprehensive Benchmark for Fine-Grained State Control in GUI Agents
por: Ji, Fengxian, et al.
Publicado: (2025)
por: Ji, Fengxian, et al.
Publicado: (2025)
NAVERO: Unlocking Fine-Grained Semantics for Video-Language Compositionality
por: Tao, Chaofan, et al.
Publicado: (2024)
por: Tao, Chaofan, et al.
Publicado: (2024)
MCFNet: A Multimodal Collaborative Fusion Network for Fine-Grained Semantic Classification
por: Qiao, Yang, et al.
Publicado: (2025)
por: Qiao, Yang, et al.
Publicado: (2025)
Revisiting MLLM Based Image Quality Assessment: Errors and Remedy
por: Tang, Zhenchen, et al.
Publicado: (2025)
por: Tang, Zhenchen, et al.
Publicado: (2025)
Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception
por: Zha, Mingfeng, et al.
Publicado: (2026)
por: Zha, Mingfeng, et al.
Publicado: (2026)
GeoPurify: A Data-Efficient Geometric Distillation Framework for Open-Vocabulary 3D Segmentation
por: Dou, Weijia, et al.
Publicado: (2025)
por: Dou, Weijia, et al.
Publicado: (2025)
Efficient Adaptation of Pre-trained Vision Transformer underpinned by Approximately Orthogonal Fine-Tuning Strategy
por: Yang, Yiting, et al.
Publicado: (2025)
por: Yang, Yiting, et al.
Publicado: (2025)
Micro-Expression Recognition via Fine-Grained Dynamic Perception
por: Shao, Zhiwen, et al.
Publicado: (2025)
por: Shao, Zhiwen, et al.
Publicado: (2025)
FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering
por: Zhong, Liangyu, et al.
Publicado: (2025)
por: Zhong, Liangyu, et al.
Publicado: (2025)
Learning Attribute-Aware Hash Codes for Fine-Grained Image Retrieval via Query Optimization
por: Wang, Peng, et al.
Publicado: (2025)
por: Wang, Peng, et al.
Publicado: (2025)
The Solution for the 5th GCAIAC Zero-shot Referring Expression Comprehension Challenge
por: Huang, Longfei, et al.
Publicado: (2024)
por: Huang, Longfei, et al.
Publicado: (2024)
Re-purposing SAM into Efficient Visual Projectors for MLLM-Based Referring Image Segmentation
por: Yang, Xiaobo, et al.
Publicado: (2025)
por: Yang, Xiaobo, et al.
Publicado: (2025)
Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos
por: Han, Mingfei, et al.
Publicado: (2023)
por: Han, Mingfei, et al.
Publicado: (2023)
Balancing Multi-Target Semi-Supervised Medical Image Segmentation with Collaborative Generalist and Specialists
por: Wang, You, et al.
Publicado: (2025)
por: Wang, You, et al.
Publicado: (2025)
Fast SAM2 with Text-Driven Token Pruning
por: Mandal, Avilasha, et al.
Publicado: (2025)
por: Mandal, Avilasha, et al.
Publicado: (2025)
Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models
por: Chen, Jierun, et al.
Publicado: (2024)
por: Chen, Jierun, et al.
Publicado: (2024)
Hierarchical Feature Learning for Medical Point Clouds via State Space Model
por: Zhang, Guoqing, et al.
Publicado: (2025)
por: Zhang, Guoqing, et al.
Publicado: (2025)
FruitEnsemble: MLLM-Guided Arbitration for Heterogeneous ensemble in Fine-Grained Fruit Recognition
por: Yu, Enhui, et al.
Publicado: (2026)
por: Yu, Enhui, et al.
Publicado: (2026)
Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception
por: Shi, Yuheng, et al.
Publicado: (2025)
por: Shi, Yuheng, et al.
Publicado: (2025)
Leveraging MLLM Embeddings and Attribute Smoothing for Compositional Zero-Shot Learning
por: Yan, Xudong, et al.
Publicado: (2024)
por: Yan, Xudong, et al.
Publicado: (2024)
Exploring Fine-Grained Image-Text Alignment for Referring Remote Sensing Image Segmentation
por: Lei, Sen, et al.
Publicado: (2024)
por: Lei, Sen, et al.
Publicado: (2024)
Ejemplares similares
-
FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension
por: Liu, Junzhuo, et al.
Publicado: (2024) -
GeoRef: Referring Expressions in Geometry via Task Formulation, Synthetic Supervision, and Reinforced MLLM-based Solutions
por: Liu, Bing, et al.
Publicado: (2025) -
Region-aware Distribution Contrast: A Novel Approach to Multi-Task Partially Supervised Learning
por: Li, Meixuan, et al.
Publicado: (2024) -
Fine-Grained Representation for Lane Topology Reasoning
por: Xu, Guoqing, et al.
Publicado: (2025) -
CTForensics: A Comprehensive Dataset and Method for AI-Generated CT Image Detection
por: Li, Yiheng, et al.
Publicado: (2026)