Arbiters of Ambivalence: Challenges of Using LLMs in No-Consensus Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Radharapu, Bhaktipriya, Revel, Manon, Ung, Megan, Ruder, Sebastian, Williams, Adina |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Chained Tuning Leads to Biased Forgetting
par: Ung, Megan, et autres
Publié: (2024)
par: Ung, Megan, et autres
Publié: (2024)
Debiasing Text Safety Classifiers through a Fairness-Aware Ensemble
par: Sturman, Olivia, et autres
Publié: (2024)
par: Sturman, Olivia, et autres
Publié: (2024)
Changing Answer Order Can Decrease MMLU Accuracy
par: Gupta, Vipul, et autres
Publié: (2024)
par: Gupta, Vipul, et autres
Publié: (2024)
RealSeal: Revolutionizing Media Authentication with Real-Time Realism Scoring
par: Radharapu, Bhaktipriya, et autres
Publié: (2024)
par: Radharapu, Bhaktipriya, et autres
Publié: (2024)
Beg to Differ: Understanding Reasoning-Answer Misalignment Across Languages
par: Ovalle, Anaelia, et autres
Publié: (2025)
par: Ovalle, Anaelia, et autres
Publié: (2025)
Improving Model Evaluation using SMART Filtering of Benchmark Datasets
par: Gupta, Vipul, et autres
Publié: (2024)
par: Gupta, Vipul, et autres
Publié: (2024)
Calibrating LLM Judges: Linear Probes for Fast and Reliable Uncertainty Estimation
par: Radharapu, Bhaktipriya, et autres
Publié: (2025)
par: Radharapu, Bhaktipriya, et autres
Publié: (2025)
Understanding and Mitigating Language Confusion in LLMs
par: Marchisio, Kelly, et autres
Publié: (2024)
par: Marchisio, Kelly, et autres
Publié: (2024)
Domain Regeneration: How well do LLMs match syntactic properties of text domains?
par: Ju, Da, et autres
Publié: (2025)
par: Ju, Da, et autres
Publié: (2025)
Language and Task Arithmetic with Parameter-Efficient Layers for Zero-Shot Summarization
par: Chronopoulou, Alexandra, et autres
Publié: (2023)
par: Chronopoulou, Alexandra, et autres
Publié: (2023)
SEAL: Systematic Error Analysis for Value ALignment
par: Revel, Manon, et autres
Publié: (2024)
par: Revel, Manon, et autres
Publié: (2024)
ShieldGemma: Generative AI Content Moderation Based on Gemma
par: Zeng, Wenjun, et autres
Publié: (2024)
par: Zeng, Wenjun, et autres
Publié: (2024)
The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs
par: Nawrot, Piotr, et autres
Publié: (2025)
par: Nawrot, Piotr, et autres
Publié: (2025)
How Does Quantization Affect Multilingual LLMs?
par: Marchisio, Kelly, et autres
Publié: (2024)
par: Marchisio, Kelly, et autres
Publié: (2024)
AL-QASIDA: Analyzing LLM Quality and Accuracy Systematically in Dialectal Arabic
par: Robinson, Nathaniel R., et autres
Publié: (2024)
par: Robinson, Nathaniel R., et autres
Publié: (2024)
A Post-trainer's Guide to Multilingual Training Data: Uncovering Cross-lingual Transfer Dynamics
par: Shimabucoro, Luisa, et autres
Publié: (2025)
par: Shimabucoro, Luisa, et autres
Publié: (2025)
A Discriminative Latent-Variable Model for Bilingual Lexicon Induction
par: Ruder, Sebastian, et autres
Publié: (2018)
par: Ruder, Sebastian, et autres
Publié: (2018)
Are Female Carpenters like Blue Bananas? A Corpus Investigation of Occupation Gender Typicality
par: Ju, Da, et autres
Publié: (2024)
par: Ju, Da, et autres
Publié: (2024)
Assessing the Reliability and Validity of GPT-4 in Annotating Emotion Appraisal Ratings
par: Ruder, Deniss, et autres
Publié: (2025)
par: Ruder, Deniss, et autres
Publié: (2025)
FACTORY: A Challenging Human-Verified Prompt Set for Long-Form Factuality
par: Chen, Mingda, et autres
Publié: (2025)
par: Chen, Mingda, et autres
Publié: (2025)
AI-Enhanced Deliberative Democracy and the Future of the Collective Will
par: Revel, Manon, et autres
Publié: (2025)
par: Revel, Manon, et autres
Publié: (2025)
Actor Identification in Discourse: A Challenge for LLMs?
par: Barić, Ana, et autres
Publié: (2024)
par: Barić, Ana, et autres
Publié: (2024)
Are Economists Always More Introverted? Analyzing Consistency in Persona-Assigned LLMs
par: Reusens, Manon, et autres
Publié: (2025)
par: Reusens, Manon, et autres
Publié: (2025)
What makes a good metric? Evaluating automatic metrics for text-to-image consistency
par: Ross, Candace, et autres
Publié: (2024)
par: Ross, Candace, et autres
Publié: (2024)
LLM See, LLM Do: Guiding Data Generation to Target Non-Differentiable Objectives
par: Shimabucoro, Luísa, et autres
Publié: (2024)
par: Shimabucoro, Luísa, et autres
Publié: (2024)
The Causal Influence of Grammatical Gender on Distributional Semantics
par: Stańczak, Karolina, et autres
Publié: (2023)
par: Stańczak, Karolina, et autres
Publié: (2023)
Findings of the BabyLM Challenge: Sample-Efficient Pretraining on Developmentally Plausible Corpora
par: Warstadt, Alex, et autres
Publié: (2025)
par: Warstadt, Alex, et autres
Publié: (2025)
Beyond Marginal Distributions: A Framework to Evaluate the Representativeness of Demographic-Aligned LLMs
par: Williams, Tristan, et autres
Publié: (2026)
par: Williams, Tristan, et autres
Publié: (2026)
Findings of the Second BabyLM Challenge: Sample-Efficient Pretraining on Developmentally Plausible Corpora
par: Hu, Michael Y., et autres
Publié: (2024)
par: Hu, Michael Y., et autres
Publié: (2024)
User Modeling Challenges in Interactive AI Assistant Systems
par: Su, Megan, et autres
Publié: (2024)
par: Su, Megan, et autres
Publié: (2024)
Arbiter: Detecting Interference in LLM Agent System Prompts
par: Mason, Tony
Publié: (2026)
par: Mason, Tony
Publié: (2026)
A Latent-Variable Model for Intrinsic Probing
par: Stańczak, Karolina, et autres
Publié: (2022)
par: Stańczak, Karolina, et autres
Publié: (2022)
[Call for Papers] The 2nd BabyLM Challenge: Sample-efficient pretraining on a developmentally plausible corpus
par: Choshen, Leshem, et autres
Publié: (2024)
par: Choshen, Leshem, et autres
Publié: (2024)
Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL
par: Wu, Zhaofeng, et autres
Publié: (2026)
par: Wu, Zhaofeng, et autres
Publié: (2026)
WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild
par: Lin, Bill Yuchen, et autres
Publié: (2024)
par: Lin, Bill Yuchen, et autres
Publié: (2024)
Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging Tasks
par: Li, Xingxuan, et autres
Publié: (2024)
par: Li, Xingxuan, et autres
Publié: (2024)
Do different prompting methods yield a common task representation in language models?
par: Davidson, Guy, et autres
Publié: (2025)
par: Davidson, Guy, et autres
Publié: (2025)
You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations
par: LeVi, Amit, et autres
Publié: (2025)
par: LeVi, Amit, et autres
Publié: (2025)
Cost-Performance Optimization for Processing Low-Resource Language Tasks Using Commercial LLMs
par: Nag, Arijit, et autres
Publié: (2024)
par: Nag, Arijit, et autres
Publié: (2024)
Finetuning LLMs for Comparative Assessment Tasks
par: Raina, Vatsal, et autres
Publié: (2024)
par: Raina, Vatsal, et autres
Publié: (2024)
Documents similaires
-
Chained Tuning Leads to Biased Forgetting
par: Ung, Megan, et autres
Publié: (2024) -
Debiasing Text Safety Classifiers through a Fairness-Aware Ensemble
par: Sturman, Olivia, et autres
Publié: (2024) -
Changing Answer Order Can Decrease MMLU Accuracy
par: Gupta, Vipul, et autres
Publié: (2024) -
RealSeal: Revolutionizing Media Authentication with Real-Time Realism Scoring
par: Radharapu, Bhaktipriya, et autres
Publié: (2024) -
Beg to Differ: Understanding Reasoning-Answer Misalignment Across Languages
par: Ovalle, Anaelia, et autres
Publié: (2025)