Rolling the DICE on Idiomaticity: How LLMs Fail to Grasp Context
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mi, Maggie, Villavicencio, Aline, Moosavi, Nafise Sadat |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Input Perception to Predictive Insight: Modeling Model Blind Spots Before They Become Errors
par: Mi, Maggie, et autres
Publié: (2025)
par: Mi, Maggie, et autres
Publié: (2025)
How to Leverage Digit Embeddings to Represent Numbers?
par: Sivakumar, Jasivan Alex, et autres
Publié: (2024)
par: Sivakumar, Jasivan Alex, et autres
Publié: (2024)
Stands to Reason: Investigating the Effect of Reasoning on Idiomaticity Detection
par: Phelps, Dylan, et autres
Publié: (2025)
par: Phelps, Dylan, et autres
Publié: (2025)
Sign of the Times: Evaluating the use of Large Language Models for Idiomaticity Detection
par: Phelps, Dylan, et autres
Publié: (2024)
par: Phelps, Dylan, et autres
Publié: (2024)
LLMs as Narcissistic Evaluators: When Ego Inflates Evaluation Scores
par: Liu, Yiqi, et autres
Publié: (2023)
par: Liu, Yiqi, et autres
Publié: (2023)
Initialisation Determines the Basin: Efficient Codebook Optimisation for Extreme LLM Quantization
par: Kennedy, Ian W., et autres
Publié: (2026)
par: Kennedy, Ian W., et autres
Publié: (2026)
SemEval-2025 Task 1: AdMIRe -- Advancing Multimodal Idiomaticity Representation
par: Pickard, Thomas, et autres
Publié: (2025)
par: Pickard, Thomas, et autres
Publié: (2025)
Exploring the Influence of Label Aggregation on Minority Voices: Implications for Dataset Bias and Model Training
par: Pandya, Mugdha, et autres
Publié: (2024)
par: Pandya, Mugdha, et autres
Publié: (2024)
MultiHoax: A Dataset of Multi-hop False-Premise Questions
par: Shafiei, Mohammadamin, et autres
Publié: (2025)
par: Shafiei, Mohammadamin, et autres
Publié: (2025)
More or Less Wrong: A Benchmark for Directional Bias in LLM Comparative Reasoning
par: Shafiei, Mohammadamin, et autres
Publié: (2025)
par: Shafiei, Mohammadamin, et autres
Publié: (2025)
LLMs Do Not See Age: Assessing Demographic Bias in Automated Systematic Review Synthesis
par: Aghaebe, Favour Yahdii, et autres
Publié: (2025)
par: Aghaebe, Favour Yahdii, et autres
Publié: (2025)
Deconstructing Attention: Investigating Design Principles for Effective Language Modeling
par: Xue, Huiyin, et autres
Publié: (2025)
par: Xue, Huiyin, et autres
Publié: (2025)
Decoding News Narratives: A Critical Analysis of Large Language Models in Framing Detection
par: Pastorino, Valeria, et autres
Publié: (2024)
par: Pastorino, Valeria, et autres
Publié: (2024)
Investigating Idiomaticity in Word Representations
par: He, Wei, et autres
Publié: (2024)
par: He, Wei, et autres
Publié: (2024)
No Shortcuts to Culture: Indonesian Multi-hop Question Answering for Complex Cultural Understanding
par: Permadi, Vynska Amalia, et autres
Publié: (2026)
par: Permadi, Vynska Amalia, et autres
Publié: (2026)
Faithful Summarisation under Disagreement via Belief-Level Aggregation
par: Aghaebe, Favour Yahdii, et autres
Publié: (2026)
par: Aghaebe, Favour Yahdii, et autres
Publié: (2026)
Enhancing Idiomatic Representation in Multiple Languages via an Adaptive Contrastive Triplet Loss
par: He, Wei, et autres
Publié: (2024)
par: He, Wei, et autres
Publié: (2024)
Beyond Hate Speech: NLP's Challenges and Opportunities in Uncovering Dehumanizing Language
par: Saffari, Hamidreza, et autres
Publié: (2024)
par: Saffari, Hamidreza, et autres
Publié: (2024)
RIGOURATE: Quantifying Scientific Exaggeration with Evidence-Aligned Claim Evaluation
par: James, Joseph, et autres
Publié: (2026)
par: James, Joseph, et autres
Publié: (2026)
Exploring Gender Disparities in Automatic Speech Recognition Technology
par: ElGhazaly, Hend, et autres
Publié: (2025)
par: ElGhazaly, Hend, et autres
Publié: (2025)
Hidden Failures in Robustness: Why Supervised Uncertainty Quantification Needs Better Evaluation
par: Stacey, Joe, et autres
Publié: (2026)
par: Stacey, Joe, et autres
Publié: (2026)
ContrastScore: Towards Higher Quality, Less Biased, More Efficient Evaluation Metrics with Contrastive Evaluation
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
How Can We Effectively Expand the Vocabulary of LLMs with 0.01GB of Target Language Text?
par: Yamaguchi, Atsuki, et autres
Publié: (2024)
par: Yamaguchi, Atsuki, et autres
Publié: (2024)
How LLMs Fail to Support Fact-Checking
par: Proma, Adiba Mahbub, et autres
Publié: (2025)
par: Proma, Adiba Mahbub, et autres
Publié: (2025)
CLIX: Cross-Lingual Explanations of Idiomatic Expressions
par: Gluck, Aaron, et autres
Publié: (2025)
par: Gluck, Aaron, et autres
Publié: (2025)
A Parallel Cross-Lingual Benchmark for Multimodal Idiomaticity Understanding
par: Torunoğlu-Selamet, Dilara, et autres
Publié: (2026)
par: Torunoğlu-Selamet, Dilara, et autres
Publié: (2026)
Improving LLM Abilities in Idiomatic Translation
par: Donthi, Sundesh, et autres
Publié: (2024)
par: Donthi, Sundesh, et autres
Publié: (2024)
Graph-Assisted Culturally Adaptable Idiomatic Translation for Indic Languages
par: Singh, Pratik Rakesh, et autres
Publié: (2025)
par: Singh, Pratik Rakesh, et autres
Publié: (2025)
Mitigating Catastrophic Forgetting in Target Language Adaptation of LLMs via Source-Shielded Updates
par: Yamaguchi, Atsuki, et autres
Publié: (2025)
par: Yamaguchi, Atsuki, et autres
Publié: (2025)
DICE: Structured Reasoning in LLMs through SLM-Guided Chain-of-Thought Correction
par: Li, Yiqi, et autres
Publié: (2025)
par: Li, Yiqi, et autres
Publié: (2025)
Roll Out and Roll Back: Diffusion LLMs are Their Own Efficiency Teachers
par: Zeng, Fanqin, et autres
Publié: (2026)
par: Zeng, Fanqin, et autres
Publié: (2026)
Why LLMs Fail at Causal Discovery and How Interventional Agents Escape
par: Roy, Amartya, et autres
Publié: (2026)
par: Roy, Amartya, et autres
Publié: (2026)
Span Modeling for Idiomaticity and Figurative Language Detection with Span Contrastive Loss
par: Matheny, Blake, et autres
Publié: (2026)
par: Matheny, Blake, et autres
Publié: (2026)
Claim Check-Worthiness Detection: How Well do LLMs Grasp Annotation Guidelines?
par: Majer, Laura, et autres
Publié: (2024)
par: Majer, Laura, et autres
Publié: (2024)
Enhancing Linguistic Competence of Language Models through Pre-training with Language Learning Tasks
par: Yamaguchi, Atsuki, et autres
Publié: (2026)
par: Yamaguchi, Atsuki, et autres
Publié: (2026)
Biasless Language Models Learn Unnaturally: How LLMs Fail to Distinguish the Possible from the Impossible
par: Ziv, Imry, et autres
Publié: (2025)
par: Ziv, Imry, et autres
Publié: (2025)
When Meaning Isn't Literal: Exploring Idiomatic Meaning Across Languages and Modalities
par: Das, Sarmistha, et autres
Publié: (2026)
par: Das, Sarmistha, et autres
Publié: (2026)
A Data-Driven Approach to Idiomaticity Based on Experts' Criteria in Theoretical Linguistics
par: Mikhalkova, Elena, et autres
Publié: (2026)
par: Mikhalkova, Elena, et autres
Publié: (2026)
IdioLink: Retrieving Meaning Beyond Words Across Idiomatic and Literal Expressions
par: Hashiloni, Kai Golan, et autres
Publié: (2026)
par: Hashiloni, Kai Golan, et autres
Publié: (2026)
Preferences for Idiomatic Language are Acquired Slowly -- and Forgotten Quickly: A Case Study on Swedish
par: Kunz, Jenny
Publié: (2026)
par: Kunz, Jenny
Publié: (2026)
Documents similaires
-
From Input Perception to Predictive Insight: Modeling Model Blind Spots Before They Become Errors
par: Mi, Maggie, et autres
Publié: (2025) -
How to Leverage Digit Embeddings to Represent Numbers?
par: Sivakumar, Jasivan Alex, et autres
Publié: (2024) -
Stands to Reason: Investigating the Effect of Reasoning on Idiomaticity Detection
par: Phelps, Dylan, et autres
Publié: (2025) -
Sign of the Times: Evaluating the use of Large Language Models for Idiomaticity Detection
par: Phelps, Dylan, et autres
Publié: (2024) -
LLMs as Narcissistic Evaluators: When Ego Inflates Evaluation Scores
par: Liu, Yiqi, et autres
Publié: (2023)