Out of Style: RAG's Fragility to Linguistic Variation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cao, Tianyu, Bhandari, Neel, Yerukola, Akhila, Asai, Akari, Sap, Maarten |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Is the Pope Catholic? Yes, the Pope is Catholic. Generative Evaluation of Non-Literal Intent Resolution in LLMs
par: Yerukola, Akhila, et autres
Publié: (2024)
par: Yerukola, Akhila, et autres
Publié: (2024)
Mind the Gesture: Evaluating AI Sensitivity to Culturally Offensive Non-Verbal Gestures
par: Yerukola, Akhila, et autres
Publié: (2025)
par: Yerukola, Akhila, et autres
Publié: (2025)
NormAd: A Framework for Measuring the Cultural Adaptability of Large Language Models
par: Rao, Abhinav, et autres
Publié: (2024)
par: Rao, Abhinav, et autres
Publié: (2024)
Words Like Knives: Backstory-Personalized Modeling and Detection of Violent Communication
par: Shen, Jocelyn, et autres
Publié: (2025)
par: Shen, Jocelyn, et autres
Publié: (2025)
PolyGuard: A Multilingual Safety Moderation Tool for 17 Languages
par: Kumar, Priyanshu, et autres
Publié: (2025)
par: Kumar, Priyanshu, et autres
Publié: (2025)
Mitigating Bias in RAG: Controlling the Embedder
par: Kim, Taeyoun, et autres
Publié: (2025)
par: Kim, Taeyoun, et autres
Publié: (2025)
Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering
par: Vijayvargiya, Sanidhya, et autres
Publié: (2025)
par: Vijayvargiya, Sanidhya, et autres
Publié: (2025)
Social World Models
par: Zhou, Xuhui, et autres
Publié: (2025)
par: Zhou, Xuhui, et autres
Publié: (2025)
HEART-felt Narratives: Tracing Empathy and Narrative Style in Personal Stories with LLMs
par: Shen, Jocelyn, et autres
Publié: (2024)
par: Shen, Jocelyn, et autres
Publié: (2024)
CodeRAG-Bench: Can Retrieval Augment Code Generation?
par: Wang, Zora Zhiruo, et autres
Publié: (2024)
par: Wang, Zora Zhiruo, et autres
Publié: (2024)
Imperfectly Cooperative Human-AI Interactions: Comparing the Impacts of Human and AI Attributes in Simulated and User Studies
par: Cohen, Myke C., et autres
Publié: (2026)
par: Cohen, Myke C., et autres
Publié: (2026)
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
par: Chen, Tong, et autres
Publié: (2025)
par: Chen, Tong, et autres
Publié: (2025)
AgentIR: Reasoning-Aware Retrieval for Deep Research Agents
par: Chen, Zijian, et autres
Publié: (2026)
par: Chen, Zijian, et autres
Publié: (2026)
From Dogwhistles to Bullhorns: Unveiling Coded Rhetoric with Language Models
par: Mendelsohn, Julia, et autres
Publié: (2023)
par: Mendelsohn, Julia, et autres
Publié: (2023)
Stereotype or Personalization? User Identity Biases Chatbot Recommendations
par: Kantharuban, Anjali, et autres
Publié: (2024)
par: Kantharuban, Anjali, et autres
Publié: (2024)
Where Do People Tell Stories Online? Story Detection Across Online Communities
par: Antoniak, Maria, et autres
Publié: (2023)
par: Antoniak, Maria, et autres
Publié: (2023)
Fine-grained Hallucination Detection and Editing for Language Models
par: Mishra, Abhika, et autres
Publié: (2024)
par: Mishra, Abhika, et autres
Publié: (2024)
Differentially-Private Text Rewriting reshapes Linguistic Style
par: Arnold, Stefan
Publié: (2026)
par: Arnold, Stefan
Publié: (2026)
Martingale Score: An Unsupervised Metric for Bayesian Rationality in LLM Reasoning
par: He, Zhonghao, et autres
Publié: (2025)
par: He, Zhonghao, et autres
Publié: (2025)
Relying on the Unreliable: The Impact of Language Models' Reluctance to Express Uncertainty
par: Zhou, Kaitlyn, et autres
Publié: (2024)
par: Zhou, Kaitlyn, et autres
Publié: (2024)
Say It Differently: Linguistic Styles as Jailbreak Vectors
par: Panda, Srikant, et autres
Publié: (2025)
par: Panda, Srikant, et autres
Publié: (2025)
BabyLM Challenge: Exploring the Effect of Variation Sets on Language Model Training Efficiency
par: Haga, Akari, et autres
Publié: (2024)
par: Haga, Akari, et autres
Publié: (2024)
Breaking mBad! Supervised Fine-tuning for Cross-Lingual Detoxification
par: Beniwal, Himanshu, et autres
Publié: (2025)
par: Beniwal, Himanshu, et autres
Publié: (2025)
Is this the real life? Is this just fantasy? The Misleading Success of Simulating Social Interactions With LLMs
par: Zhou, Xuhui, et autres
Publié: (2024)
par: Zhou, Xuhui, et autres
Publié: (2024)
GoodPoint: Learning Constructive Scientific Paper Feedback from Author Responses
par: Mun, Jimin, et autres
Publié: (2026)
par: Mun, Jimin, et autres
Publié: (2026)
Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations
par: Zheng, Mingqian, et autres
Publié: (2026)
par: Zheng, Mingqian, et autres
Publié: (2026)
Curiosity-Driven LLM-as-a-judge for Personalized Creative Judgment
par: Kumar, Vanya Bannihatti, et autres
Publié: (2025)
par: Kumar, Vanya Bannihatti, et autres
Publié: (2025)
PolygloToxicityPrompts: Multilingual Evaluation of Neural Toxic Degeneration in Large Language Models
par: Jain, Devansh, et autres
Publié: (2024)
par: Jain, Devansh, et autres
Publié: (2024)
BIG5-CHAT: Shaping LLM Personalities Through Training on Human-Grounded Data
par: Li, Wenkai, et autres
Publié: (2024)
par: Li, Wenkai, et autres
Publié: (2024)
Linguistic Nepotism: Trading-off Quality for Language Preference in Multilingual RAG
par: Ki, Dayeon, et autres
Publié: (2025)
par: Ki, Dayeon, et autres
Publié: (2025)
Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations
par: Park, Eunkyu, et autres
Publié: (2025)
par: Park, Eunkyu, et autres
Publié: (2025)
Data Defenses Against Large Language Models
par: Agnew, William, et autres
Publié: (2024)
par: Agnew, William, et autres
Publié: (2024)
Leftover Lunch: Advantage-based Offline Reinforcement Learning for Language Models
par: Baheti, Ashutosh, et autres
Publié: (2023)
par: Baheti, Ashutosh, et autres
Publié: (2023)
StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis
par: Zhang, Yu, et autres
Publié: (2023)
par: Zhang, Yu, et autres
Publié: (2023)
Simple Mechanistic Explanations for Out-Of-Context Reasoning
par: Wang, Atticus, et autres
Publié: (2025)
par: Wang, Atticus, et autres
Publié: (2025)
Bilevel MCTS for Amortized O(1) Node Selection in Classical Planning
par: Asai, Masataro
Publié: (2025)
par: Asai, Masataro
Publié: (2025)
Style-agnostic evaluation of ASR using multiple reference transcripts
par: McNamara, Quinten, et autres
Publié: (2024)
par: McNamara, Quinten, et autres
Publié: (2024)
Digital Linguistic Bias in Spanish: Evidence from Lexical Variation in LLMs
par: Kawasaki, Yoshifumi
Publié: (2026)
par: Kawasaki, Yoshifumi
Publié: (2026)
Rel-A.I.: An Interaction-Centered Approach To Measuring Human-LM Reliance
par: Zhou, Kaitlyn, et autres
Publié: (2024)
par: Zhou, Kaitlyn, et autres
Publié: (2024)
EVALUESTEER: Measuring Reward Model Steerability Towards Values and Preferences
par: Ghate, Kshitish, et autres
Publié: (2025)
par: Ghate, Kshitish, et autres
Publié: (2025)
Documents similaires
-
Is the Pope Catholic? Yes, the Pope is Catholic. Generative Evaluation of Non-Literal Intent Resolution in LLMs
par: Yerukola, Akhila, et autres
Publié: (2024) -
Mind the Gesture: Evaluating AI Sensitivity to Culturally Offensive Non-Verbal Gestures
par: Yerukola, Akhila, et autres
Publié: (2025) -
NormAd: A Framework for Measuring the Cultural Adaptability of Large Language Models
par: Rao, Abhinav, et autres
Publié: (2024) -
Words Like Knives: Backstory-Personalized Modeling and Detection of Violent Communication
par: Shen, Jocelyn, et autres
Publié: (2025) -
PolyGuard: A Multilingual Safety Moderation Tool for 17 Languages
par: Kumar, Priyanshu, et autres
Publié: (2025)