Referring Expression Generation in Visually Grounded Dialogue with Discourse-aware Comprehension Guiding
Fuente:
arXiv
Salvato in:
| Autori principali: | Willemsen, Bram, Skantze, Gabriel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Detecting Referring Expressions in Visually Grounded Dialogue with Autoregressive Language Models
di: Willemsen, Bram, et al.
Pubblicazione: (2025)
di: Willemsen, Bram, et al.
Pubblicazione: (2025)
ReMeREC: Relation-aware and Multi-entity Referring Expression Comprehension
di: Hu, Yizhi, et al.
Pubblicazione: (2025)
di: Hu, Yizhi, et al.
Pubblicazione: (2025)
Exploring Spatial Language Grounding Through Referring Expressions
di: Tumu, Akshar, et al.
Pubblicazione: (2025)
di: Tumu, Akshar, et al.
Pubblicazione: (2025)
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
di: Tumu, Akshar, et al.
Pubblicazione: (2025)
di: Tumu, Akshar, et al.
Pubblicazione: (2025)
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
di: Shen, Li-Cheng, et al.
Pubblicazione: (2025)
di: Shen, Li-Cheng, et al.
Pubblicazione: (2025)
Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
di: Dong, Qihua, et al.
Pubblicazione: (2026)
di: Dong, Qihua, et al.
Pubblicazione: (2026)
MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression Comprehension
di: Liu, Ting, et al.
Pubblicazione: (2024)
di: Liu, Ting, et al.
Pubblicazione: (2024)
CK-Transformer: Commonsense Knowledge Enhanced Transformers for Referring Expression Comprehension
di: Zhang, Zhi, et al.
Pubblicazione: (2023)
di: Zhang, Zhi, et al.
Pubblicazione: (2023)
Latent Expression Generation for Referring Image Segmentation and Grounding
di: Yu, Seonghoon, et al.
Pubblicazione: (2025)
di: Yu, Seonghoon, et al.
Pubblicazione: (2025)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
di: Li, Aiden Yiliu, et al.
Pubblicazione: (2025)
di: Li, Aiden Yiliu, et al.
Pubblicazione: (2025)
The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue
di: Hakimov, Sherzod, et al.
Pubblicazione: (2026)
di: Hakimov, Sherzod, et al.
Pubblicazione: (2026)
VGR: Visual Grounded Reasoning
di: Wang, Jiacong, et al.
Pubblicazione: (2025)
di: Wang, Jiacong, et al.
Pubblicazione: (2025)
TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation
di: Lin, Haokun, et al.
Pubblicazione: (2025)
di: Lin, Haokun, et al.
Pubblicazione: (2025)
Referring Expression Comprehension for Small Objects
di: Goto, Kanoko, et al.
Pubblicazione: (2025)
di: Goto, Kanoko, et al.
Pubblicazione: (2025)
Efficient Adaptation For Remote Sensing Visual Grounding
di: Moughnieh, Hasan, et al.
Pubblicazione: (2025)
di: Moughnieh, Hasan, et al.
Pubblicazione: (2025)
The Role of Entropy in Visual Grounding: Analysis and Optimization
di: Li, Shuo, et al.
Pubblicazione: (2025)
di: Li, Shuo, et al.
Pubblicazione: (2025)
SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation
di: Chen, Yi-Chia, et al.
Pubblicazione: (2024)
di: Chen, Yi-Chia, et al.
Pubblicazione: (2024)
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
di: Kim, Youngmin, et al.
Pubblicazione: (2025)
di: Kim, Youngmin, et al.
Pubblicazione: (2025)
Visual Grounding Methods for VQA are Working for the Wrong Reasons!
di: Shrestha, Robik, et al.
Pubblicazione: (2020)
di: Shrestha, Robik, et al.
Pubblicazione: (2020)
Can VLMs Recall Factual Associations From Visual References?
di: Ashok, Dhananjay, et al.
Pubblicazione: (2025)
di: Ashok, Dhananjay, et al.
Pubblicazione: (2025)
Vero: An Open RL Recipe for General Visual Reasoning
di: Sarch, Gabriel, et al.
Pubblicazione: (2026)
di: Sarch, Gabriel, et al.
Pubblicazione: (2026)
Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning
di: Vaishnav, Mohit, et al.
Pubblicazione: (2026)
di: Vaishnav, Mohit, et al.
Pubblicazione: (2026)
Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams
di: Iyengar, Anirudh Iyengar Kaniyar Narayana, et al.
Pubblicazione: (2026)
di: Iyengar, Anirudh Iyengar Kaniyar Narayana, et al.
Pubblicazione: (2026)
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
di: Qiu, Yifu, et al.
Pubblicazione: (2025)
di: Qiu, Yifu, et al.
Pubblicazione: (2025)
Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale
di: Acuna, David, et al.
Pubblicazione: (2025)
di: Acuna, David, et al.
Pubblicazione: (2025)
Towards Visual-Prompt Temporal Answering Grounding in Medical Instructional Video
di: Li, Bin, et al.
Pubblicazione: (2022)
di: Li, Bin, et al.
Pubblicazione: (2022)
LLM-Optic: Unveiling the Capabilities of Large Language Models for Universal Visual Grounding
di: Zhao, Haoyu, et al.
Pubblicazione: (2024)
di: Zhao, Haoyu, et al.
Pubblicazione: (2024)
Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents
di: Gou, Boyu, et al.
Pubblicazione: (2024)
di: Gou, Boyu, et al.
Pubblicazione: (2024)
Watch Before You Answer: Learning from Visually Grounded Post-Training
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
Router-Suggest: Dynamic Routing for Multimodal Auto-Completion in Visually-Grounded Dialogs
di: Mishra, Sandeep, et al.
Pubblicazione: (2026)
di: Mishra, Sandeep, et al.
Pubblicazione: (2026)
KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding
di: Ma, Xinyu, et al.
Pubblicazione: (2025)
di: Ma, Xinyu, et al.
Pubblicazione: (2025)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
di: Satar, Burak, et al.
Pubblicazione: (2025)
di: Satar, Burak, et al.
Pubblicazione: (2025)
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
di: Li, Zejun, et al.
Pubblicazione: (2024)
di: Li, Zejun, et al.
Pubblicazione: (2024)
AV-Dialog: Spoken Dialogue Models with Audio-Visual Input
di: Chen, Tuochao, et al.
Pubblicazione: (2025)
di: Chen, Tuochao, et al.
Pubblicazione: (2025)
VIMI: Grounding Video Generation through Multi-modal Instruction
di: Fang, Yuwei, et al.
Pubblicazione: (2024)
di: Fang, Yuwei, et al.
Pubblicazione: (2024)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
di: Yu, Shoubin, et al.
Pubblicazione: (2025)
di: Yu, Shoubin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Detecting Referring Expressions in Visually Grounded Dialogue with Autoregressive Language Models
di: Willemsen, Bram, et al.
Pubblicazione: (2025) -
ReMeREC: Relation-aware and Multi-entity Referring Expression Comprehension
di: Hu, Yizhi, et al.
Pubblicazione: (2025) -
Exploring Spatial Language Grounding Through Referring Expressions
di: Tumu, Akshar, et al.
Pubblicazione: (2025) -
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
di: Tumu, Akshar, et al.
Pubblicazione: (2025) -
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
di: Shen, Li-Cheng, et al.
Pubblicazione: (2025)