Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Xin, Wu, Di, Qin, Sijing, Echizen, Isao, Ali, Abdallah El, Sugawara, Saku |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Seeing the Reasoning: How LLM Rationales Influence User Trust and Decision-Making in Factual Verification Tasks
di: Sun, Xin, et al.
Pubblicazione: (2026)
di: Sun, Xin, et al.
Pubblicazione: (2026)
Measuring Human Involvement in AI-Generated Text: A Case Study on Academic Writing
di: Guo, Yuchen, et al.
Pubblicazione: (2025)
di: Guo, Yuchen, et al.
Pubblicazione: (2025)
Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models
di: Waseda, Futa, et al.
Pubblicazione: (2025)
di: Waseda, Futa, et al.
Pubblicazione: (2025)
Eyes Can't Always Tell: Fusing Eye Tracking and User Priors for User Modeling under AI Advice Conditions
di: Sun, Xin, et al.
Pubblicazione: (2026)
di: Sun, Xin, et al.
Pubblicazione: (2026)
TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them
di: Wang, Yidong, et al.
Pubblicazione: (2025)
di: Wang, Yidong, et al.
Pubblicazione: (2025)
TactfulToM: Do LLMs Have the Theory of Mind Ability to Understand White Lies?
di: Liu, Yiwei, et al.
Pubblicazione: (2025)
di: Liu, Yiwei, et al.
Pubblicazione: (2025)
SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification
di: Wang, Hongbo, et al.
Pubblicazione: (2025)
di: Wang, Hongbo, et al.
Pubblicazione: (2025)
Enhancing Robustness of LLM-Synthetic Text Detectors for Academic Writing: A Comprehensive Analysis
di: Dou, Zhicheng, et al.
Pubblicazione: (2024)
di: Dou, Zhicheng, et al.
Pubblicazione: (2024)
Rationale-Aware Answer Verification by Pairwise Self-Evaluation
di: Kawabata, Akira, et al.
Pubblicazione: (2024)
di: Kawabata, Akira, et al.
Pubblicazione: (2024)
A Dual-Task Paradigm to Investigate Sentence Comprehension Strategies in Language Models
di: Emura, Rei, et al.
Pubblicazione: (2026)
di: Emura, Rei, et al.
Pubblicazione: (2026)
CxMP: A Linguistic Minimal-Pair Benchmark for Evaluating Constructional Understanding in Language Models
di: Oba, Miyu, et al.
Pubblicazione: (2026)
di: Oba, Miyu, et al.
Pubblicazione: (2026)
Specification-Aware Machine Translation and Evaluation for Purpose Alignment
di: Kayano, Yoko, et al.
Pubblicazione: (2025)
di: Kayano, Yoko, et al.
Pubblicazione: (2025)
What Makes Language Models Good-enough?
di: Asami, Daiki, et al.
Pubblicazione: (2024)
di: Asami, Daiki, et al.
Pubblicazione: (2024)
On the Role of Artificial Intelligence in Human-Machine Symbiosis
di: Chang, Ching-Chun, et al.
Pubblicazione: (2026)
di: Chang, Ching-Chun, et al.
Pubblicazione: (2026)
C2: Scalable Rubric-Augmented Reward Modeling from Binary Preferences
di: Kawabata, Akira, et al.
Pubblicazione: (2026)
di: Kawabata, Akira, et al.
Pubblicazione: (2026)
Zero-Shot Warning Generation for Misinformative Multimodal Content
di: Delvecchio, Giovanni Pio, et al.
Pubblicazione: (2025)
di: Delvecchio, Giovanni Pio, et al.
Pubblicazione: (2025)
Adjust for Trust: Mitigating Trust-Induced Inappropriate Reliance on AI Assistance
di: Srinivasan, Tejas, et al.
Pubblicazione: (2025)
di: Srinivasan, Tejas, et al.
Pubblicazione: (2025)
Cross-Attention Watermarking of Large Language Models
di: Baldassini, Folco Bertini, et al.
Pubblicazione: (2024)
di: Baldassini, Folco Bertini, et al.
Pubblicazione: (2024)
HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment
di: Yang, Langqi, et al.
Pubblicazione: (2025)
di: Yang, Langqi, et al.
Pubblicazione: (2025)
Plugging Schema Graph into Multi-Table QA: A Human-Guided Framework for Reducing LLM Reliance
di: Wang, Xixi, et al.
Pubblicazione: (2025)
di: Wang, Xixi, et al.
Pubblicazione: (2025)
Should I Share this Translation? Evaluating Quality Feedback for User Reliance on Machine Translation
di: Ki, Dayeon, et al.
Pubblicazione: (2025)
di: Ki, Dayeon, et al.
Pubblicazione: (2025)
An LLM-as-Judge Metric for Bridging the Gap with Human Evaluation in SE Tasks
di: Zhou, Xin, et al.
Pubblicazione: (2025)
di: Zhou, Xin, et al.
Pubblicazione: (2025)
Which Feedback Works for Whom? Differential Effects of LLM-Generated Feedback Elements Across Learner Profiles
di: Furuhashi, Momoka, et al.
Pubblicazione: (2026)
di: Furuhashi, Momoka, et al.
Pubblicazione: (2026)
Judge's Verdict: A Comprehensive Analysis of LLM Judge Capability Through Human Agreement
di: Han, Steve, et al.
Pubblicazione: (2025)
di: Han, Steve, et al.
Pubblicazione: (2025)
Aligning Human-AI-Interaction Trust for Mental Health Support: Survey and Position for Multi-Stakeholders
di: Sun, Xin, et al.
Pubblicazione: (2026)
di: Sun, Xin, et al.
Pubblicazione: (2026)
Image-Text Out-Of-Context Detection Using Synthetic Multimodal Misinformation
di: Shalabi, Fatma, et al.
Pubblicazione: (2024)
di: Shalabi, Fatma, et al.
Pubblicazione: (2024)
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
di: Shi, Lin, et al.
Pubblicazione: (2024)
di: Shi, Lin, et al.
Pubblicazione: (2024)
Are Checklists Really Useful for Automatic Evaluation of Generative Tasks?
di: Furuhashi, Momoka, et al.
Pubblicazione: (2025)
di: Furuhashi, Momoka, et al.
Pubblicazione: (2025)
Steganography in Game Actions
di: Chang, Ching-Chun, et al.
Pubblicazione: (2024)
di: Chang, Ching-Chun, et al.
Pubblicazione: (2024)
Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement
di: Jung, Jaehun, et al.
Pubblicazione: (2024)
di: Jung, Jaehun, et al.
Pubblicazione: (2024)
Do LLMs Judge Distantly Supervised Named Entity Labels Well? Constructing the JudgeWEL Dataset
di: Plum, Alistair, et al.
Pubblicazione: (2026)
di: Plum, Alistair, et al.
Pubblicazione: (2026)
Summarization Metrics for Spanish and Basque: Do Automatic Scores and LLM-Judges Correlate with Humans?
di: Barnes, Jeremy, et al.
Pubblicazione: (2025)
di: Barnes, Jeremy, et al.
Pubblicazione: (2025)
Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges
di: Ding, Ruomeng, et al.
Pubblicazione: (2026)
di: Ding, Ruomeng, et al.
Pubblicazione: (2026)
Chronology of Multi-Agent Interactions for Provenance of Evolving Information
di: Chang, Ching-Chun, et al.
Pubblicazione: (2025)
di: Chang, Ching-Chun, et al.
Pubblicazione: (2025)
Rel-A.I.: An Interaction-Centered Approach To Measuring Human-LM Reliance
di: Zhou, Kaitlyn, et al.
Pubblicazione: (2024)
di: Zhou, Kaitlyn, et al.
Pubblicazione: (2024)
VizTrust: A Visual Analytics Tool for Capturing User Trust Dynamics in Human-AI Communication
di: Wang, Xin, et al.
Pubblicazione: (2025)
di: Wang, Xin, et al.
Pubblicazione: (2025)
On the Origin of Synthetic Information by Means of Steganographic Inheritance
di: Chang, Ching-Chun, et al.
Pubblicazione: (2026)
di: Chang, Ching-Chun, et al.
Pubblicazione: (2026)
Steganography Beyond Space-Time with Chain of Multimodal AI
di: Chang, Ching-Chun, et al.
Pubblicazione: (2025)
di: Chang, Ching-Chun, et al.
Pubblicazione: (2025)
A Survey on LLM-as-a-Judge
di: Gu, Jiawei, et al.
Pubblicazione: (2024)
di: Gu, Jiawei, et al.
Pubblicazione: (2024)
Evaluating Metrics for Safety with LLM-as-Judges
di: Clegg, Kester, et al.
Pubblicazione: (2025)
di: Clegg, Kester, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Seeing the Reasoning: How LLM Rationales Influence User Trust and Decision-Making in Factual Verification Tasks
di: Sun, Xin, et al.
Pubblicazione: (2026) -
Measuring Human Involvement in AI-Generated Text: A Case Study on Academic Writing
di: Guo, Yuchen, et al.
Pubblicazione: (2025) -
Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models
di: Waseda, Futa, et al.
Pubblicazione: (2025) -
Eyes Can't Always Tell: Fusing Eye Tracking and User Priors for User Modeling under AI Advice Conditions
di: Sun, Xin, et al.
Pubblicazione: (2026) -
TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them
di: Wang, Yidong, et al.
Pubblicazione: (2025)