Vision-Language Models Are Not Pragmatically Competent in Referring Expression Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Ziqiao, Ding, Jing, Zhang, Xuejun, Luo, Dezhi, Ding, Jiahe, Xu, Sihan, Huang, Yuchen, Peng, Run, Chai, Joyce |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards A Holistic Landscape of Situated Theory of Mind in Large Language Models
par: Ma, Ziqiao, et autres
Publié: (2023)
par: Ma, Ziqiao, et autres
Publié: (2023)
Multi-Object Hallucination in Vision-Language Models
par: Chen, Xuweiyi, et autres
Publié: (2024)
par: Chen, Xuweiyi, et autres
Publié: (2024)
World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models
par: Ma, Ziqiao, et autres
Publié: (2023)
par: Ma, Ziqiao, et autres
Publié: (2023)
Babysit A Language Model From Scratch: Interactive Language Learning by Trials and Demonstrations
par: Ma, Ziqiao, et autres
Publié: (2024)
par: Ma, Ziqiao, et autres
Publié: (2024)
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
par: Zhang, Zheyuan, et autres
Publié: (2024)
par: Zhang, Zheyuan, et autres
Publié: (2024)
The Mechanistic Emergence of Symbol Grounding in Language Models
par: Wu, Shuyu, et autres
Publié: (2025)
par: Wu, Shuyu, et autres
Publié: (2025)
Are Multimodal Large Language Models Pragmatically Competent Listeners in Simple Reference Resolution Tasks?
par: Junker, Simeon, et autres
Publié: (2025)
par: Junker, Simeon, et autres
Publié: (2025)
The Pragmatic Mind of Machines: Tracing the Emergence of Pragmatic Competence in Large Language Models
par: Yu, Kefan, et autres
Publié: (2025)
par: Yu, Kefan, et autres
Publié: (2025)
GROUNDHOG: Grounding Large Language Models to Holistic Segmentation
par: Zhang, Yichi, et autres
Publié: (2024)
par: Zhang, Yichi, et autres
Publié: (2024)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
Pragmatic Competence Evaluation of Large Language Models for the Korean Language
par: Park, Dojun, et autres
Publié: (2024)
par: Park, Dojun, et autres
Publié: (2024)
On SkipGram Word Embedding Models with Negative Sampling: Unified Framework and Impact of Noise Distributions
par: Liu, Dezhi, et autres
Publié: (2020)
par: Liu, Dezhi, et autres
Publié: (2020)
CycleNet: Rethinking Cycle Consistency in Text-Guided Diffusion for Image Manipulation
par: Xu, Sihan, et autres
Publié: (2023)
par: Xu, Sihan, et autres
Publié: (2023)
DriVLMe: Enhancing LLM-based Autonomous Driving Agents with Embodied and Social Experiences
par: Huang, Yidong, et autres
Publié: (2024)
par: Huang, Yidong, et autres
Publié: (2024)
Communication and Verification in LLM Agents towards Collaboration under Information Asymmetry
par: Peng, Run, et autres
Publié: (2025)
par: Peng, Run, et autres
Publié: (2025)
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
par: Zhang, Zory, et autres
Publié: (2025)
par: Zhang, Zory, et autres
Publié: (2025)
Think, Act, and Ask: Open-World Interactive Personalized Robot Navigation
par: Dai, Yinpei, et autres
Publié: (2023)
par: Dai, Yinpei, et autres
Publié: (2023)
From Behavioral Performance to Internal Competence: Interpreting Vision-Language Models with VLM-Lens
par: Sheta, Hala, et autres
Publié: (2025)
par: Sheta, Hala, et autres
Publié: (2025)
O-Edit: Orthogonal Subspace Editing for Language Model Sequential Editing
par: Cai, Yuchen, et autres
Publié: (2024)
par: Cai, Yuchen, et autres
Publié: (2024)
Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutors
par: Wang, Jian, et autres
Publié: (2025)
par: Wang, Jian, et autres
Publié: (2025)
Next-Embedding Prediction Makes Strong Vision Learners
par: Xu, Sihan, et autres
Publié: (2025)
par: Xu, Sihan, et autres
Publié: (2025)
TongGu: Mastering Classical Chinese Understanding with Knowledge-Grounded Large Language Models
par: Cao, Jiahuan, et autres
Publié: (2024)
par: Cao, Jiahuan, et autres
Publié: (2024)
ChartAdapter: Large Vision-Language Model for Chart Summarization
par: Xu, Peixin, et autres
Publié: (2024)
par: Xu, Peixin, et autres
Publié: (2024)
How Hypocritical Is Your LLM judge? Listener-Speaker Asymmetries in the Pragmatic Competence of Large Language Models
par: Sieker, Judith, et autres
Publié: (2026)
par: Sieker, Judith, et autres
Publié: (2026)
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
par: Tumu, Akshar, et autres
Publié: (2025)
par: Tumu, Akshar, et autres
Publié: (2025)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
par: Yu, Shoubin, et autres
Publié: (2025)
par: Yu, Shoubin, et autres
Publié: (2025)
CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning
par: Dong, Qihua, et autres
Publié: (2025)
par: Dong, Qihua, et autres
Publié: (2025)
MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems
par: Li, Kaixin, et autres
Publié: (2024)
par: Li, Kaixin, et autres
Publié: (2024)
Diagnosing Moral Reasoning Acquisition in Language Models: Pragmatics and Generalization
par: Liu, Guangliang, et autres
Publié: (2025)
par: Liu, Guangliang, et autres
Publié: (2025)
Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
par: Ding, Yi, et autres
Publié: (2025)
par: Ding, Yi, et autres
Publié: (2025)
Prosody in Pragmatic Competence: Proficiency Impact on Pitch and Fluency Features in Request‐Making in Second Language Chinese
par: Mo Chen, et autres
Publié: (2025)
par: Mo Chen, et autres
Publié: (2025)
A Wolf in Sheep's Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily
par: Ding, Peng, et autres
Publié: (2023)
par: Ding, Peng, et autres
Publié: (2023)
P-ICL: Point In-Context Learning for Named Entity Recognition with Large Language Models
par: Jiang, Guochao, et autres
Publié: (2024)
par: Jiang, Guochao, et autres
Publié: (2024)
Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties
par: Yu, Keunwoo Peter, et autres
Publié: (2023)
par: Yu, Keunwoo Peter, et autres
Publié: (2023)
Evaluation of Cultural Competence of Vision-Language Models
par: Yadav, Srishti, et autres
Publié: (2025)
par: Yadav, Srishti, et autres
Publié: (2025)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
par: Ding, Yi, et autres
Publié: (2025)
par: Ding, Yi, et autres
Publié: (2025)
HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization
par: Peng, Qiwei, et autres
Publié: (2024)
par: Peng, Qiwei, et autres
Publié: (2024)
Intercultural Competence and Pragmatics
par: Schauer, Gila A.
Publié: (2024)
par: Schauer, Gila A.
Publié: (2024)
Detecting Referring Expressions in Visually Grounded Dialogue with Autoregressive Language Models
par: Willemsen, Bram, et autres
Publié: (2025)
par: Willemsen, Bram, et autres
Publié: (2025)
Intrinsic Task-based Evaluation for Referring Expression Generation
par: Chen, Guanyi, et autres
Publié: (2024)
par: Chen, Guanyi, et autres
Publié: (2024)
Documents similaires
-
Towards A Holistic Landscape of Situated Theory of Mind in Large Language Models
par: Ma, Ziqiao, et autres
Publié: (2023) -
Multi-Object Hallucination in Vision-Language Models
par: Chen, Xuweiyi, et autres
Publié: (2024) -
World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models
par: Ma, Ziqiao, et autres
Publié: (2023) -
Babysit A Language Model From Scratch: Interactive Language Learning by Trials and Demonstrations
par: Ma, Ziqiao, et autres
Publié: (2024) -
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
par: Zhang, Zheyuan, et autres
Publié: (2024)