Identifying High-Confidence Social Biases in LLMs for Trustworthy Conversational Tutoring Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Alvarez, Aitor Arronte, Fincham, Naiyi Xie |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutors
par: Wang, Jian, et autres
Publié: (2025)
par: Wang, Jian, et autres
Publié: (2025)
Towards Trustworthy Report Generation: A Deep Research Agent with Progressive Confidence Estimation and Calibration
par: Yuan, Yi, et autres
Publié: (2026)
par: Yuan, Yi, et autres
Publié: (2026)
One Size doesn't Fit All: A Personalized Conversational Tutoring Agent for Mathematics Instruction
par: Liu, Ben, et autres
Publié: (2025)
par: Liu, Ben, et autres
Publié: (2025)
Problem-Oriented Segmentation and Retrieval: Case Study on Tutoring Conversations
par: Wang, Rose E., et autres
Publié: (2024)
par: Wang, Rose E., et autres
Publié: (2024)
Position: LLMs Can be Good Tutors in English Education
par: Ye, Jingheng, et autres
Publié: (2025)
par: Ye, Jingheng, et autres
Publié: (2025)
Identifying Implicit Social Biases in Vision-Language Models
par: Hamidieh, Kimia, et autres
Publié: (2024)
par: Hamidieh, Kimia, et autres
Publié: (2024)
Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness
par: Banayeeanzade, Amin, et autres
Publié: (2025)
par: Banayeeanzade, Amin, et autres
Publié: (2025)
From Biased Chatbots to Biased Agents: Examining Role Assignment Effects on LLM Agent Robustness
par: Cao, Linbo, et autres
Publié: (2026)
par: Cao, Linbo, et autres
Publié: (2026)
Decoding Compressed Trust: Scrutinizing the Trustworthiness of Efficient LLMs Under Compression
par: Hong, Junyuan, et autres
Publié: (2024)
par: Hong, Junyuan, et autres
Publié: (2024)
"Not in My Backyard": LLMs Uncover Online and Offline Social Biases Against Homelessness
par: Karr Jr., Jonathan A., et autres
Publié: (2025)
par: Karr Jr., Jonathan A., et autres
Publié: (2025)
Confidence Improves Self-Consistency in LLMs
par: Taubenfeld, Amir, et autres
Publié: (2025)
par: Taubenfeld, Amir, et autres
Publié: (2025)
Developing a Tutoring Dialog Dataset to Optimize LLMs for Educational Use
par: Fateen, Menna, et autres
Publié: (2024)
par: Fateen, Menna, et autres
Publié: (2024)
JT-Safe: Intrinsically Enhancing the Safety and Trustworthiness of LLMs
par: Feng, Junlan, et autres
Publié: (2025)
par: Feng, Junlan, et autres
Publié: (2025)
A Comprehensive Evaluation of Cognitive Biases in LLMs
par: Malberg, Simon, et autres
Publié: (2024)
par: Malberg, Simon, et autres
Publié: (2024)
Conditioning LLMs to Generate Code-Switched Text
par: Heredia, Maite, et autres
Publié: (2025)
par: Heredia, Maite, et autres
Publié: (2025)
Uncovering the Fragility of Trustworthy LLMs through Chinese Textual Ambiguity
par: Wu, Xinwei, et autres
Publié: (2025)
par: Wu, Xinwei, et autres
Publié: (2025)
Unveiling Divergent Inductive Biases of LLMs on Temporal Data
par: Kishore, Sindhu, et autres
Publié: (2024)
par: Kishore, Sindhu, et autres
Publié: (2024)
Can LLMs Generate High-Quality Task-Specific Conversations?
par: Li, Shengqi, et autres
Publié: (2025)
par: Li, Shengqi, et autres
Publié: (2025)
DeepTutor: Towards Agentic Personalized Tutoring
par: Zhao, Bingxi, et autres
Publié: (2026)
par: Zhao, Bingxi, et autres
Publié: (2026)
BrowseConf: Confidence-Guided Test-Time Scaling for Web Agents
par: Ou, Litu, et autres
Publié: (2025)
par: Ou, Litu, et autres
Publié: (2025)
Harmonic LLMs are Trustworthy
par: Kersting, Nicholas S., et autres
Publié: (2024)
par: Kersting, Nicholas S., et autres
Publié: (2024)
MEDEQUALQA: Evaluating Biases in LLMs with Counterfactual Reasoning
par: Ghosh, Rajarshi, et autres
Publié: (2025)
par: Ghosh, Rajarshi, et autres
Publié: (2025)
Confident RAG: Enhancing the Performance of LLMs for Mathematics Question Answering through Multi-Embedding and Confidence Scoring
par: Chen, Shiting, et autres
Publié: (2025)
par: Chen, Shiting, et autres
Publié: (2025)
Enhancing Multiple Dimensions of Trustworthiness in LLMs via Sparse Activation Control
par: Xiao, Yuxin, et autres
Publié: (2024)
par: Xiao, Yuxin, et autres
Publié: (2024)
CausalAbstain: Enhancing Multilingual LLMs with Causal Reasoning for Trustworthy Abstention
par: Sun, Yuxi, et autres
Publié: (2025)
par: Sun, Yuxi, et autres
Publié: (2025)
White Men Lead, Black Women Help? Benchmarking and Mitigating Language Agency Social Biases in LLMs
par: Wan, Yixin, et autres
Publié: (2024)
par: Wan, Yixin, et autres
Publié: (2024)
Mitigating Social Biases in Language Models through Unlearning
par: Dige, Omkar, et autres
Publié: (2024)
par: Dige, Omkar, et autres
Publié: (2024)
Location Not Found: Exposing Implicit Local and Global Biases in Multilingual LLMs
par: Mor-Lan, Guy, et autres
Publié: (2026)
par: Mor-Lan, Guy, et autres
Publié: (2026)
SAFEFLOW: A Principled Protocol for Trustworthy and Transactional Autonomous Agent Systems
par: Li, Peiran, et autres
Publié: (2025)
par: Li, Peiran, et autres
Publié: (2025)
ATA: A Neuro-Symbolic Approach to Implement Autonomous and Trustworthy Agents
par: Peer, David, et autres
Publié: (2025)
par: Peer, David, et autres
Publié: (2025)
Identifying Gender Stereotypes and Biases in Automated Translation from English to Italian using Similarity Networks
par: Mohammadi, Fatemeh, et autres
Publié: (2025)
par: Mohammadi, Fatemeh, et autres
Publié: (2025)
Confirming Correct, Missing the Rest: LLM Tutoring Agents Struggle Where Feedback Matters Most
par: Yasir, Tahreem, et autres
Publié: (2026)
par: Yasir, Tahreem, et autres
Publié: (2026)
How Trustworthy are Open-Source LLMs? An Assessment under Malicious Demonstrations Shows their Vulnerabilities
par: Mo, Lingbo, et autres
Publié: (2023)
par: Mo, Lingbo, et autres
Publié: (2023)
When Weak LLMs Speak with Confidence, Preference Alignment Gets Stronger
par: Afzali, Amirabbas, et autres
Publié: (2026)
par: Afzali, Amirabbas, et autres
Publié: (2026)
Teaching LLMs to Abstain via Fine-Grained Semantic Confidence Reward
par: An, Hao, et autres
Publié: (2025)
par: An, Hao, et autres
Publié: (2025)
Why are all LLMs Obsessed with Japanese Culture? On the Hidden Cultural and Regional Biases of LLMs
par: de Landa, Joseba Fernandez, et autres
Publié: (2026)
par: de Landa, Joseba Fernandez, et autres
Publié: (2026)
Learning to Route LLMs with Confidence Tokens
par: Chuang, Yu-Neng, et autres
Publié: (2024)
par: Chuang, Yu-Neng, et autres
Publié: (2024)
Embracing Trustworthy Brain-Agent Collaboration as Paradigm Extension for Intelligent Assistive Technologies
par: Chen, Yankai, et autres
Publié: (2025)
par: Chen, Yankai, et autres
Publié: (2025)
Pitfalls of Conversational LLMs on News Debiasing
par: Schlicht, Ipek Baris, et autres
Publié: (2024)
par: Schlicht, Ipek Baris, et autres
Publié: (2024)
Double-Calibration: Towards Reliable LLMs via Calibrating Knowledge and Reasoning Confidence
par: Lu, Yuyin, et autres
Publié: (2026)
par: Lu, Yuyin, et autres
Publié: (2026)
Documents similaires
-
Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutors
par: Wang, Jian, et autres
Publié: (2025) -
Towards Trustworthy Report Generation: A Deep Research Agent with Progressive Confidence Estimation and Calibration
par: Yuan, Yi, et autres
Publié: (2026) -
One Size doesn't Fit All: A Personalized Conversational Tutoring Agent for Mathematics Instruction
par: Liu, Ben, et autres
Publié: (2025) -
Problem-Oriented Segmentation and Retrieval: Case Study on Tutoring Conversations
par: Wang, Rose E., et autres
Publié: (2024) -
Position: LLMs Can be Good Tutors in English Education
par: Ye, Jingheng, et autres
Publié: (2025)