Vision-Language Models Are Not Pragmatically Competent in Referring Expression Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Ziqiao, Ding, Jing, Zhang, Xuejun, Luo, Dezhi, Ding, Jiahe, Xu, Sihan, Huang, Yuchen, Peng, Run, Chai, Joyce |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards A Holistic Landscape of Situated Theory of Mind in Large Language Models
di: Ma, Ziqiao, et al.
Pubblicazione: (2023)
di: Ma, Ziqiao, et al.
Pubblicazione: (2023)
Multi-Object Hallucination in Vision-Language Models
di: Chen, Xuweiyi, et al.
Pubblicazione: (2024)
di: Chen, Xuweiyi, et al.
Pubblicazione: (2024)
World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models
di: Ma, Ziqiao, et al.
Pubblicazione: (2023)
di: Ma, Ziqiao, et al.
Pubblicazione: (2023)
Babysit A Language Model From Scratch: Interactive Language Learning by Trials and Demonstrations
di: Ma, Ziqiao, et al.
Pubblicazione: (2024)
di: Ma, Ziqiao, et al.
Pubblicazione: (2024)
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
di: Zhang, Zheyuan, et al.
Pubblicazione: (2024)
di: Zhang, Zheyuan, et al.
Pubblicazione: (2024)
The Mechanistic Emergence of Symbol Grounding in Language Models
di: Wu, Shuyu, et al.
Pubblicazione: (2025)
di: Wu, Shuyu, et al.
Pubblicazione: (2025)
Are Multimodal Large Language Models Pragmatically Competent Listeners in Simple Reference Resolution Tasks?
di: Junker, Simeon, et al.
Pubblicazione: (2025)
di: Junker, Simeon, et al.
Pubblicazione: (2025)
The Pragmatic Mind of Machines: Tracing the Emergence of Pragmatic Competence in Large Language Models
di: Yu, Kefan, et al.
Pubblicazione: (2025)
di: Yu, Kefan, et al.
Pubblicazione: (2025)
GROUNDHOG: Grounding Large Language Models to Holistic Segmentation
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
Pragmatic Competence Evaluation of Large Language Models for the Korean Language
di: Park, Dojun, et al.
Pubblicazione: (2024)
di: Park, Dojun, et al.
Pubblicazione: (2024)
On SkipGram Word Embedding Models with Negative Sampling: Unified Framework and Impact of Noise Distributions
di: Liu, Dezhi, et al.
Pubblicazione: (2020)
di: Liu, Dezhi, et al.
Pubblicazione: (2020)
CycleNet: Rethinking Cycle Consistency in Text-Guided Diffusion for Image Manipulation
di: Xu, Sihan, et al.
Pubblicazione: (2023)
di: Xu, Sihan, et al.
Pubblicazione: (2023)
DriVLMe: Enhancing LLM-based Autonomous Driving Agents with Embodied and Social Experiences
di: Huang, Yidong, et al.
Pubblicazione: (2024)
di: Huang, Yidong, et al.
Pubblicazione: (2024)
Communication and Verification in LLM Agents towards Collaboration under Information Asymmetry
di: Peng, Run, et al.
Pubblicazione: (2025)
di: Peng, Run, et al.
Pubblicazione: (2025)
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
di: Zhang, Zory, et al.
Pubblicazione: (2025)
di: Zhang, Zory, et al.
Pubblicazione: (2025)
Think, Act, and Ask: Open-World Interactive Personalized Robot Navigation
di: Dai, Yinpei, et al.
Pubblicazione: (2023)
di: Dai, Yinpei, et al.
Pubblicazione: (2023)
From Behavioral Performance to Internal Competence: Interpreting Vision-Language Models with VLM-Lens
di: Sheta, Hala, et al.
Pubblicazione: (2025)
di: Sheta, Hala, et al.
Pubblicazione: (2025)
O-Edit: Orthogonal Subspace Editing for Language Model Sequential Editing
di: Cai, Yuchen, et al.
Pubblicazione: (2024)
di: Cai, Yuchen, et al.
Pubblicazione: (2024)
Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutors
di: Wang, Jian, et al.
Pubblicazione: (2025)
di: Wang, Jian, et al.
Pubblicazione: (2025)
Next-Embedding Prediction Makes Strong Vision Learners
di: Xu, Sihan, et al.
Pubblicazione: (2025)
di: Xu, Sihan, et al.
Pubblicazione: (2025)
TongGu: Mastering Classical Chinese Understanding with Knowledge-Grounded Large Language Models
di: Cao, Jiahuan, et al.
Pubblicazione: (2024)
di: Cao, Jiahuan, et al.
Pubblicazione: (2024)
ChartAdapter: Large Vision-Language Model for Chart Summarization
di: Xu, Peixin, et al.
Pubblicazione: (2024)
di: Xu, Peixin, et al.
Pubblicazione: (2024)
How Hypocritical Is Your LLM judge? Listener-Speaker Asymmetries in the Pragmatic Competence of Large Language Models
di: Sieker, Judith, et al.
Pubblicazione: (2026)
di: Sieker, Judith, et al.
Pubblicazione: (2026)
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
di: Tumu, Akshar, et al.
Pubblicazione: (2025)
di: Tumu, Akshar, et al.
Pubblicazione: (2025)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
di: Yu, Shoubin, et al.
Pubblicazione: (2025)
di: Yu, Shoubin, et al.
Pubblicazione: (2025)
CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning
di: Dong, Qihua, et al.
Pubblicazione: (2025)
di: Dong, Qihua, et al.
Pubblicazione: (2025)
MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems
di: Li, Kaixin, et al.
Pubblicazione: (2024)
di: Li, Kaixin, et al.
Pubblicazione: (2024)
Diagnosing Moral Reasoning Acquisition in Language Models: Pragmatics and Generalization
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
di: Ding, Yi, et al.
Pubblicazione: (2025)
di: Ding, Yi, et al.
Pubblicazione: (2025)
Prosody in Pragmatic Competence: Proficiency Impact on Pitch and Fluency Features in Request‐Making in Second Language Chinese
di: Mo Chen, et al.
Pubblicazione: (2025)
di: Mo Chen, et al.
Pubblicazione: (2025)
A Wolf in Sheep's Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily
di: Ding, Peng, et al.
Pubblicazione: (2023)
di: Ding, Peng, et al.
Pubblicazione: (2023)
P-ICL: Point In-Context Learning for Named Entity Recognition with Large Language Models
di: Jiang, Guochao, et al.
Pubblicazione: (2024)
di: Jiang, Guochao, et al.
Pubblicazione: (2024)
Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2023)
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2023)
Evaluation of Cultural Competence of Vision-Language Models
di: Yadav, Srishti, et al.
Pubblicazione: (2025)
di: Yadav, Srishti, et al.
Pubblicazione: (2025)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
di: Ding, Yi, et al.
Pubblicazione: (2025)
di: Ding, Yi, et al.
Pubblicazione: (2025)
HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization
di: Peng, Qiwei, et al.
Pubblicazione: (2024)
di: Peng, Qiwei, et al.
Pubblicazione: (2024)
Intercultural Competence and Pragmatics
di: Schauer, Gila A.
Pubblicazione: (2024)
di: Schauer, Gila A.
Pubblicazione: (2024)
Detecting Referring Expressions in Visually Grounded Dialogue with Autoregressive Language Models
di: Willemsen, Bram, et al.
Pubblicazione: (2025)
di: Willemsen, Bram, et al.
Pubblicazione: (2025)
Intrinsic Task-based Evaluation for Referring Expression Generation
di: Chen, Guanyi, et al.
Pubblicazione: (2024)
di: Chen, Guanyi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Towards A Holistic Landscape of Situated Theory of Mind in Large Language Models
di: Ma, Ziqiao, et al.
Pubblicazione: (2023) -
Multi-Object Hallucination in Vision-Language Models
di: Chen, Xuweiyi, et al.
Pubblicazione: (2024) -
World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models
di: Ma, Ziqiao, et al.
Pubblicazione: (2023) -
Babysit A Language Model From Scratch: Interactive Language Learning by Trials and Demonstrations
di: Ma, Ziqiao, et al.
Pubblicazione: (2024) -
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
di: Zhang, Zheyuan, et al.
Pubblicazione: (2024)