Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Dong, Qihua, Yang, Kuo, Ju, Lin, Zhao, Handong, Zhang, Yitian, Wang, Yizhou, Zeng, Huimin, Lu, Jianglin, Fu, Yun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning
von: Dong, Qihua, et al.
Veröffentlicht: (2025)
von: Dong, Qihua, et al.
Veröffentlicht: (2025)
Seeing Through Words: Controlling Visual Retrieval Quality with Language Models
von: Lu, Jianglin, et al.
Veröffentlicht: (2026)
von: Lu, Jianglin, et al.
Veröffentlicht: (2026)
Scale-Free Graph-Language Models
von: Lu, Jianglin, et al.
Veröffentlicht: (2025)
von: Lu, Jianglin, et al.
Veröffentlicht: (2025)
Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning
von: Dong, Qihua, et al.
Veröffentlicht: (2026)
von: Dong, Qihua, et al.
Veröffentlicht: (2026)
The Indra Representation Hypothesis for Multimodal Alignment
von: Lu, Jianglin, et al.
Veröffentlicht: (2026)
von: Lu, Jianglin, et al.
Veröffentlicht: (2026)
Fine-T2I: An Open, Large-Scale, and Diverse Dataset for High-Quality T2I Fine-Tuning
von: Ma, Xu, et al.
Veröffentlicht: (2026)
von: Ma, Xu, et al.
Veröffentlicht: (2026)
Trajectory Prediction Meets Large Language Models: A Survey
von: Xu, Yi, et al.
Veröffentlicht: (2025)
von: Xu, Yi, et al.
Veröffentlicht: (2025)
RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
von: Gao, Tianyi, et al.
Veröffentlicht: (2025)
von: Gao, Tianyi, et al.
Veröffentlicht: (2025)
Beyond Referring Expressions: Scenario Comprehension Visual Grounding
von: He, Ruozhen, et al.
Veröffentlicht: (2026)
von: He, Ruozhen, et al.
Veröffentlicht: (2026)
Boosting Large Language Models with Mask Fine-Tuning
von: Zhang, Mingyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Mingyuan, et al.
Veröffentlicht: (2025)
FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension
von: Liu, Junzhuo, et al.
Veröffentlicht: (2024)
von: Liu, Junzhuo, et al.
Veröffentlicht: (2024)
Distorted or Fabricated? A Survey on Hallucination in Video LLMs
von: Huang, Yiyang, et al.
Veröffentlicht: (2026)
von: Huang, Yiyang, et al.
Veröffentlicht: (2026)
RefDrone: A Challenging Benchmark for Referring Expression Comprehension in Drone Scenes
von: Sun, Zhichao, et al.
Veröffentlicht: (2025)
von: Sun, Zhichao, et al.
Veröffentlicht: (2025)
Smoothing Grounding and Reasoning for MLLM-Powered GUI Agents with Query-Oriented Pivot Tasks
von: Wu, Zongru, et al.
Veröffentlicht: (2025)
von: Wu, Zongru, et al.
Veröffentlicht: (2025)
MultiRef: Controllable Image Generation with Multiple Visual References
von: Chen, Ruoxi, et al.
Veröffentlicht: (2025)
von: Chen, Ruoxi, et al.
Veröffentlicht: (2025)
OneRef: Unified One-tower Expression Grounding and Segmentation with Mask Referring Modeling
von: Xiao, Linhui, et al.
Veröffentlicht: (2024)
von: Xiao, Linhui, et al.
Veröffentlicht: (2024)
RefCut: Interactive Segmentation with Reference Guidance
von: Lin, Zheng, et al.
Veröffentlicht: (2025)
von: Lin, Zheng, et al.
Veröffentlicht: (2025)
RefTool: Reference-Guided Tool Creation for Knowledge-Intensive Reasoning
von: Liu, Xiao, et al.
Veröffentlicht: (2025)
von: Liu, Xiao, et al.
Veröffentlicht: (2025)
Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes
von: Wang, Yaoting, et al.
Veröffentlicht: (2024)
von: Wang, Yaoting, et al.
Veröffentlicht: (2024)
RefSR-Adv: Adversarial Attack on Reference-based Image Super-Resolution Models
von: Dai, Jiazhu, et al.
Veröffentlicht: (2026)
von: Dai, Jiazhu, et al.
Veröffentlicht: (2026)
DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning
von: Majeedi, Abrar, et al.
Veröffentlicht: (2026)
von: Majeedi, Abrar, et al.
Veröffentlicht: (2026)
RefEdit: A Benchmark and Method for Improving Instruction-based Image Editing Model on Referring Expressions
von: Pathiraja, Bimsara, et al.
Veröffentlicht: (2025)
von: Pathiraja, Bimsara, et al.
Veröffentlicht: (2025)
RefChecker: Reference-based Fine-grained Hallucination Checker and Benchmark for Large Language Models
von: Hu, Xiangkun, et al.
Veröffentlicht: (2024)
von: Hu, Xiangkun, et al.
Veröffentlicht: (2024)
GeoRef: Referring Expressions in Geometry via Task Formulation, Synthetic Supervision, and Reinforced MLLM-based Solutions
von: Liu, Bing, et al.
Veröffentlicht: (2025)
von: Liu, Bing, et al.
Veröffentlicht: (2025)
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
von: Ying, Kaining, et al.
Veröffentlicht: (2025)
von: Ying, Kaining, et al.
Veröffentlicht: (2025)
SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation
von: Chen, Yi-Chia, et al.
Veröffentlicht: (2024)
von: Chen, Yi-Chia, et al.
Veröffentlicht: (2024)
CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning
von: Li, Ming, et al.
Veröffentlicht: (2025)
von: Li, Ming, et al.
Veröffentlicht: (2025)
TransRef: Multi-Scale Reference Embedding Transformer for Reference-Guided Image Inpainting
von: Liu, Taorong, et al.
Veröffentlicht: (2023)
von: Liu, Taorong, et al.
Veröffentlicht: (2023)
RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward
von: Wu, Qiucheng, et al.
Veröffentlicht: (2026)
von: Wu, Qiucheng, et al.
Veröffentlicht: (2026)
Arbitrary-Scale 3D Gaussian Super-Resolution
von: Zeng, Huimin, et al.
Veröffentlicht: (2025)
von: Zeng, Huimin, et al.
Veröffentlicht: (2025)
CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning
von: Song, Qi, et al.
Veröffentlicht: (2025)
von: Song, Qi, et al.
Veröffentlicht: (2025)
Don't Judge by the Look: Towards Motion Coherent Video Representation
von: Zhang, Yitian, et al.
Veröffentlicht: (2024)
von: Zhang, Yitian, et al.
Veröffentlicht: (2024)
Look-Back: Implicit Visual Re-focusing in MLLM Reasoning
von: Yang, Shuo, et al.
Veröffentlicht: (2025)
von: Yang, Shuo, et al.
Veröffentlicht: (2025)
ViRefSAM: Visual Reference-Guided Segment Anything Model for Remote Sensing Segmentation
von: Bi, Hanbo, et al.
Veröffentlicht: (2025)
von: Bi, Hanbo, et al.
Veröffentlicht: (2025)
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
von: Duan, Chengqi, et al.
Veröffentlicht: (2025)
von: Duan, Chengqi, et al.
Veröffentlicht: (2025)
RefTok: Reference-Based Tokenization for Video Generation
von: Fan, Xiang, et al.
Veröffentlicht: (2025)
von: Fan, Xiang, et al.
Veröffentlicht: (2025)
RefAlign: Representation Alignment for Reference-to-Video Generation
von: Wang, Lei, et al.
Veröffentlicht: (2026)
von: Wang, Lei, et al.
Veröffentlicht: (2026)
RefHCM: A Unified Model for Referring Perceptions in Human-Centric Scenarios
von: Huang, Jie, et al.
Veröffentlicht: (2024)
von: Huang, Jie, et al.
Veröffentlicht: (2024)
RefVSR++: Exploiting Reference Inputs for Reference-based Video Super-resolution
von: Zou, Han, et al.
Veröffentlicht: (2023)
von: Zou, Han, et al.
Veröffentlicht: (2023)
Ref-SAM3D: Bridging SAM3D with Text for Reference 3D Reconstruction
von: Zhou, Yun, et al.
Veröffentlicht: (2025)
von: Zhou, Yun, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning
von: Dong, Qihua, et al.
Veröffentlicht: (2025) -
Seeing Through Words: Controlling Visual Retrieval Quality with Language Models
von: Lu, Jianglin, et al.
Veröffentlicht: (2026) -
Scale-Free Graph-Language Models
von: Lu, Jianglin, et al.
Veröffentlicht: (2025) -
Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning
von: Dong, Qihua, et al.
Veröffentlicht: (2026) -
The Indra Representation Hypothesis for Multimodal Alignment
von: Lu, Jianglin, et al.
Veröffentlicht: (2026)