The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hakimov, Sherzod, D'Agostini, Mattia, Samodelkin, Ivan, Schlangen, David |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sharing the Cost of Success: A Game for Evaluating and Learning Collaborative Multi-Agent Instruction Giving and Following Policies
par: Sadler, Philipp, et autres
Publié: (2024)
par: Sadler, Philipp, et autres
Publié: (2024)
Multi-Turn Multi-Agent Dialogue for Collaborative Reconstruction Improves VLM Performance on Spatial Reasoning, But Only Barely
par: Kranti, Chalamalasetti, et autres
Publié: (2026)
par: Kranti, Chalamalasetti, et autres
Publié: (2026)
clem:todd: A Framework for the Systematic Benchmarking of LLM-Based Task-Oriented Dialogue System Realisations
par: Kranti, Chalamalasetti, et autres
Publié: (2025)
par: Kranti, Chalamalasetti, et autres
Publié: (2025)
Learning Communication Policies for Different Follower Behaviors in a Collaborative Reference Game
par: Sadler, Philipp, et autres
Publié: (2024)
par: Sadler, Philipp, et autres
Publié: (2024)
Ad-hoc Concept Forming in the Game Codenames as a Means for Evaluating Large Language Models
par: Hakimov, Sherzod, et autres
Publié: (2025)
par: Hakimov, Sherzod, et autres
Publié: (2025)
A Third Paradigm for LLM Evaluation: Dialogue Game-Based Evaluation using clembench
par: Schlangen, David, et autres
Publié: (2025)
par: Schlangen, David, et autres
Publié: (2025)
Retrieval-Augmented Code Generation for Situated Action Generation: A Case Study on Minecraft
par: Kranti, Chalamalasetti, et autres
Publié: (2024)
par: Kranti, Chalamalasetti, et autres
Publié: (2024)
Plant in Cupboard, Orange on Rably, Inat Aphone. Benchmarking Incremental Learning of Situation and Language Model using a Text-Simulated Situated Environment
par: Jordan, Jonathan, et autres
Publié: (2025)
par: Jordan, Jonathan, et autres
Publié: (2025)
From Templates to Natural Language: Generalization Challenges in Instruction-Tuned LLMs for Spatial Reasoning
par: Kranti, Chalamalasetti, et autres
Publié: (2025)
par: Kranti, Chalamalasetti, et autres
Publié: (2025)
Using Game Play to Investigate Multimodal and Conversational Grounding in Large Multimodal Models
par: Hakimov, Sherzod, et autres
Publié: (2024)
par: Hakimov, Sherzod, et autres
Publié: (2024)
Towards No-Code Programming of Cobots: Experiments with Code Synthesis by Large Code Models for Conversational Programming
par: Kranti, Chalamalasetti, et autres
Publié: (2024)
par: Kranti, Chalamalasetti, et autres
Publié: (2024)
How Many Parameters Does it Take to Change a Light Bulb? Evaluating Performance in Self-Play of Conversational Games as a Function of Model Characteristics
par: Bhavsar, Nidhir, et autres
Publié: (2024)
par: Bhavsar, Nidhir, et autres
Publié: (2024)
Drawing the Line: Enhancing Trustworthiness of MLLMs Through the Power of Refusal
par: Wang, Yuhao, et autres
Publié: (2024)
par: Wang, Yuhao, et autres
Publié: (2024)
Through the Looking Glass: Common Sense Consistency Evaluation of Weird Images
par: Rykov, Elisei, et autres
Publié: (2025)
par: Rykov, Elisei, et autres
Publié: (2025)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
par: Ma, David, et autres
Publié: (2025)
par: Ma, David, et autres
Publié: (2025)
Grounding Partially-Defined Events in Multimodal Data
par: Sanders, Kate, et autres
Publié: (2024)
par: Sanders, Kate, et autres
Publié: (2024)
Iteratively Prompting Multimodal LLMs to Reproduce Natural and AI-Generated Images
par: Naseh, Ali, et autres
Publié: (2024)
par: Naseh, Ali, et autres
Publié: (2024)
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
par: Kim, Youngmin, et autres
Publié: (2025)
par: Kim, Youngmin, et autres
Publié: (2025)
TurkicNLP: An NLP Toolkit for Turkic Languages
par: Hakimov, Sherzod
Publié: (2026)
par: Hakimov, Sherzod
Publié: (2026)
Improved GUI Grounding via Iterative Narrowing
par: Nguyen, Anthony
Publié: (2024)
par: Nguyen, Anthony
Publié: (2024)
Play to Generalize: Learning to Reason Through Game Play
par: Xie, Yunfei, et autres
Publié: (2025)
par: Xie, Yunfei, et autres
Publié: (2025)
DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students' Hand-Drawn Math Images
par: Baral, Sami, et autres
Publié: (2025)
par: Baral, Sami, et autres
Publié: (2025)
Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation
par: Zhou, Yucheng, et autres
Publié: (2025)
par: Zhou, Yucheng, et autres
Publié: (2025)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
par: Li, Aiden Yiliu, et autres
Publié: (2025)
par: Li, Aiden Yiliu, et autres
Publié: (2025)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
par: Chen, Jiaxing, et autres
Publié: (2024)
par: Chen, Jiaxing, et autres
Publié: (2024)
LLMs as Bridges: Reformulating Grounded Multimodal Named Entity Recognition
par: Li, Jinyuan, et autres
Publié: (2024)
par: Li, Jinyuan, et autres
Publié: (2024)
Pre-Training Multimodal Hallucination Detectors with Corrupted Grounding Data
par: Whitehead, Spencer, et autres
Publié: (2024)
par: Whitehead, Spencer, et autres
Publié: (2024)
Kestrel: 3D Multimodal LLM for Part-Aware Grounded Description
par: Ahmed, Mahmoud, et autres
Publié: (2024)
par: Ahmed, Mahmoud, et autres
Publié: (2024)
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
par: Chung, Jiwan, et autres
Publié: (2025)
par: Chung, Jiwan, et autres
Publié: (2025)
Common Objects Out of Context (COOCo): Investigating Multimodal Context and Semantic Scene Violations in Referential Communication
par: Merlo, Filippo, et autres
Publié: (2025)
par: Merlo, Filippo, et autres
Publié: (2025)
MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models
par: Biswas, Shristi Das, et autres
Publié: (2026)
par: Biswas, Shristi Das, et autres
Publié: (2026)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
Referring Expression Generation in Visually Grounded Dialogue with Discourse-aware Comprehension Guiding
par: Willemsen, Bram, et autres
Publié: (2024)
par: Willemsen, Bram, et autres
Publié: (2024)
VIGiA: Instructional Video Guidance via Dialogue Reasoning and Retrieval
par: Glória-Silva, Diogo, et autres
Publié: (2026)
par: Glória-Silva, Diogo, et autres
Publié: (2026)
Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction
par: Hu, Juncheng, et autres
Publié: (2026)
par: Hu, Juncheng, et autres
Publié: (2026)
Iterative Self-Improvement of Vision Language Models for Image Scoring and Self-Explanation
par: Tanji, Naoto, et autres
Publié: (2025)
par: Tanji, Naoto, et autres
Publié: (2025)
ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue
par: Li, Zhangpu, et autres
Publié: (2024)
par: Li, Zhangpu, et autres
Publié: (2024)
MOTOR: Multimodal Optimal Transport via Grounded Retrieval in Medical Visual Question Answering
par: Shaaban, Mai A., et autres
Publié: (2025)
par: Shaaban, Mai A., et autres
Publié: (2025)
I see what you mean: Co-Speech Gestures for Reference Resolution in Multimodal Dialogue
par: Ghaleb, Esam, et autres
Publié: (2025)
par: Ghaleb, Esam, et autres
Publié: (2025)
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
par: Guo, Zichun, et autres
Publié: (2026)
par: Guo, Zichun, et autres
Publié: (2026)
Documents similaires
-
Sharing the Cost of Success: A Game for Evaluating and Learning Collaborative Multi-Agent Instruction Giving and Following Policies
par: Sadler, Philipp, et autres
Publié: (2024) -
Multi-Turn Multi-Agent Dialogue for Collaborative Reconstruction Improves VLM Performance on Spatial Reasoning, But Only Barely
par: Kranti, Chalamalasetti, et autres
Publié: (2026) -
clem:todd: A Framework for the Systematic Benchmarking of LLM-Based Task-Oriented Dialogue System Realisations
par: Kranti, Chalamalasetti, et autres
Publié: (2025) -
Learning Communication Policies for Different Follower Behaviors in a Collaborative Reference Game
par: Sadler, Philipp, et autres
Publié: (2024) -
Ad-hoc Concept Forming in the Game Codenames as a Means for Evaluating Large Language Models
par: Hakimov, Sherzod, et autres
Publié: (2025)