FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Junzhuo, Yang, Xuzheng, Li, Weiwei, Wang, Peng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
New Dataset and Methods for Fine-Grained Compositional Referring Expression Comprehension via Specialist-MLLM Collaboration
por: Yang, Xuzheng, et al.
Publicado: (2025)
por: Yang, Xuzheng, et al.
Publicado: (2025)
Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
por: Dong, Qihua, et al.
Publicado: (2026)
por: Dong, Qihua, et al.
Publicado: (2026)
RefDrone: A Challenging Benchmark for Referring Expression Comprehension in Drone Scenes
por: Sun, Zhichao, et al.
Publicado: (2025)
por: Sun, Zhichao, et al.
Publicado: (2025)
OneRef: Unified One-tower Expression Grounding and Segmentation with Mask Referring Modeling
por: Xiao, Linhui, et al.
Publicado: (2024)
por: Xiao, Linhui, et al.
Publicado: (2024)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
por: Li, Yue, et al.
Publicado: (2025)
por: Li, Yue, et al.
Publicado: (2025)
Improving Brain-to-Image Reconstruction via Fine-Grained Text Bridging
por: Xia, Runze, et al.
Publicado: (2025)
por: Xia, Runze, et al.
Publicado: (2025)
DreamRunner: Fine-Grained Compositional Story-to-Video Generation with Retrieval-Augmented Motion Adaptation
por: Wang, Zun, et al.
Publicado: (2024)
por: Wang, Zun, et al.
Publicado: (2024)
ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning
por: Wang, Yeyuan, et al.
Publicado: (2025)
por: Wang, Yeyuan, et al.
Publicado: (2025)
Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
por: Shen, Yifan, et al.
Publicado: (2025)
por: Shen, Yifan, et al.
Publicado: (2025)
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
por: Liu, Peng, et al.
Publicado: (2025)
por: Liu, Peng, et al.
Publicado: (2025)
RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
por: Gao, Tianyi, et al.
Publicado: (2025)
por: Gao, Tianyi, et al.
Publicado: (2025)
STEMTOX: From Social Tags to Fine-Grained Toxic Meme Detection via Entropy-Guided Multi-Task Learning
por: Swain, Subhankar, et al.
Publicado: (2025)
por: Swain, Subhankar, et al.
Publicado: (2025)
HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities
por: Dönmez, Esra, et al.
Publicado: (2026)
por: Dönmez, Esra, et al.
Publicado: (2026)
MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging
por: Bao, Zhijie, et al.
Publicado: (2026)
por: Bao, Zhijie, et al.
Publicado: (2026)
Fine-Grained Open-Vocabulary Object Detection with Fined-Grained Prompts: Task, Dataset and Benchmark
por: Liu, Ying, et al.
Publicado: (2025)
por: Liu, Ying, et al.
Publicado: (2025)
Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
por: Bai, Tianyi, et al.
Publicado: (2025)
por: Bai, Tianyi, et al.
Publicado: (2025)
The Solution for the 5th GCAIAC Zero-shot Referring Expression Comprehension Challenge
por: Huang, Longfei, et al.
Publicado: (2024)
por: Huang, Longfei, et al.
Publicado: (2024)
Low-Rank Adaptation with Task-Relevant Feature Enhancement for Fine-tuning Language Models
por: Li, Changqun, et al.
Publicado: (2024)
por: Li, Changqun, et al.
Publicado: (2024)
MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression Comprehension
por: Liu, Ting, et al.
Publicado: (2024)
por: Liu, Ting, et al.
Publicado: (2024)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
por: Yu, Hong-Tao, et al.
Publicado: (2025)
por: Yu, Hong-Tao, et al.
Publicado: (2025)
TROPE: TRaining-Free Object-Part Enhancement for Seamlessly Improving Fine-Grained Zero-Shot Image Captioning
por: Feinglass, Joshua, et al.
Publicado: (2024)
por: Feinglass, Joshua, et al.
Publicado: (2024)
Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis
por: Liu, Runzhou, et al.
Publicado: (2026)
por: Liu, Runzhou, et al.
Publicado: (2026)
LLM-based Hierarchical Concept Decomposition for Interpretable Fine-Grained Image Classification
por: Qu, Renyi, et al.
Publicado: (2024)
por: Qu, Renyi, et al.
Publicado: (2024)
Enhancing Fine-Grained Image Classifications via Cascaded Vision Language Models
por: Wei, Canshi
Publicado: (2024)
por: Wei, Canshi
Publicado: (2024)
Unblocking Fine-Grained Evaluation of Detailed Captions: An Explaining AutoRater and Critic-and-Revise Pipeline
por: Gordon, Brian, et al.
Publicado: (2025)
por: Gordon, Brian, et al.
Publicado: (2025)
FineState-Bench: A Comprehensive Benchmark for Fine-Grained State Control in GUI Agents
por: Ji, Fengxian, et al.
Publicado: (2025)
por: Ji, Fengxian, et al.
Publicado: (2025)
ReMeREC: Relation-aware and Multi-entity Referring Expression Comprehension
por: Hu, Yizhi, et al.
Publicado: (2025)
por: Hu, Yizhi, et al.
Publicado: (2025)
BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models
por: Arnould, Ludovic, et al.
Publicado: (2025)
por: Arnould, Ludovic, et al.
Publicado: (2025)
VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning
por: Wu, Xueqing, et al.
Publicado: (2024)
por: Wu, Xueqing, et al.
Publicado: (2024)
FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text Inputs
por: Asokan, Mothilal, et al.
Publicado: (2025)
por: Asokan, Mothilal, et al.
Publicado: (2025)
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
por: Cui, Chenhang, et al.
Publicado: (2024)
por: Cui, Chenhang, et al.
Publicado: (2024)
TaxonRL: Reinforcement Learning with Intermediate Rewards for Interpretable Fine-Grained Visual Reasoning
por: von Klinski, Maximilian, et al.
Publicado: (2026)
por: von Klinski, Maximilian, et al.
Publicado: (2026)
CompAlign: Improving Compositional Text-to-Image Generation with a Complex Benchmark and Fine-Grained Feedback
por: Wan, Yixin, et al.
Publicado: (2025)
por: Wan, Yixin, et al.
Publicado: (2025)
Harlequin: Color-driven Generation of Synthetic Data for Referring Expression Comprehension
por: Parolari, Luca, et al.
Publicado: (2024)
por: Parolari, Luca, et al.
Publicado: (2024)
SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
por: Jin, Weiyang, et al.
Publicado: (2025)
por: Jin, Weiyang, et al.
Publicado: (2025)
Expert Pyramid Tuning: Efficient Parameter Fine-Tuning for Expertise-Driven Task Allocation
por: Zhang, Jia-Chen, et al.
Publicado: (2026)
por: Zhang, Jia-Chen, et al.
Publicado: (2026)
KH-FUNSD: A Hierarchical and Fine-Grained Layout Analysis Dataset for Low-Resource Khmer Business Document
por: Thuon, Nimol, et al.
Publicado: (2025)
por: Thuon, Nimol, et al.
Publicado: (2025)
MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency
por: Zhang, Junzhe, et al.
Publicado: (2024)
por: Zhang, Junzhe, et al.
Publicado: (2024)
VisionPangu: A Compact and Fine-Grained Multimodal Assistant with 1.7B Parameters
por: Fan, Jiaxin, et al.
Publicado: (2026)
por: Fan, Jiaxin, et al.
Publicado: (2026)
African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification
por: Geigle, Gregor, et al.
Publicado: (2024)
por: Geigle, Gregor, et al.
Publicado: (2024)
Ejemplares similares
-
New Dataset and Methods for Fine-Grained Compositional Referring Expression Comprehension via Specialist-MLLM Collaboration
por: Yang, Xuzheng, et al.
Publicado: (2025) -
Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
por: Dong, Qihua, et al.
Publicado: (2026) -
RefDrone: A Challenging Benchmark for Referring Expression Comprehension in Drone Scenes
por: Sun, Zhichao, et al.
Publicado: (2025) -
OneRef: Unified One-tower Expression Grounding and Segmentation with Mask Referring Modeling
por: Xiao, Linhui, et al.
Publicado: (2024) -
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
por: Li, Yue, et al.
Publicado: (2025)