BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Blankenstein, Thierry, Yu, Jialin, Li, Zixuan, Plachouras, Vassilis, Sengupta, Sunando, Torr, Philip, Gal, Yarin, Paren, Alasdair, Bibi, Adel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ToolTweak: An Attack on Tool Selection in LLM-based Agents
di: Sneh, Jonathan, et al.
Pubblicazione: (2025)
di: Sneh, Jonathan, et al.
Pubblicazione: (2025)
MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents
di: Aichberger, Lukas, et al.
Pubblicazione: (2025)
di: Aichberger, Lukas, et al.
Pubblicazione: (2025)
OMNI-LEAK: Orchestrator Multi-Agent Network Induced Data Leakage
di: Naik, Akshat, et al.
Pubblicazione: (2026)
di: Naik, Akshat, et al.
Pubblicazione: (2026)
Universal In-Context Approximation By Prompting Fully Recurrent Models
di: Petrov, Aleksandar, et al.
Pubblicazione: (2024)
di: Petrov, Aleksandar, et al.
Pubblicazione: (2024)
BiasBuster: a Neural Approach for Accurate Estimation of Population Statistics using Biased Location Data
di: Zeighami, Sepanta, et al.
Pubblicazione: (2024)
di: Zeighami, Sepanta, et al.
Pubblicazione: (2024)
FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction
di: Lin, Runqi, et al.
Pubblicazione: (2025)
di: Lin, Runqi, et al.
Pubblicazione: (2025)
Detecting LLM Hallucination Through Layer-wise Information Deficiency: Analysis of Ambiguous Prompts and Unanswerable Questions
di: Kim, Hazel, et al.
Pubblicazione: (2024)
di: Kim, Hazel, et al.
Pubblicazione: (2024)
Latent Directions: A Simple Pathway to Bias Mitigation in Generative AI
di: Olmos, Carolina Lopez, et al.
Pubblicazione: (2024)
di: Olmos, Carolina Lopez, et al.
Pubblicazione: (2024)
Shh, don't say that! Domain Certification in LLMs
di: Emde, Cornelius, et al.
Pubblicazione: (2025)
di: Emde, Cornelius, et al.
Pubblicazione: (2025)
Do as I do (Safely): Mitigating Task-Specific Fine-tuning Risks in Large Language Models
di: Eiras, Francisco, et al.
Pubblicazione: (2024)
di: Eiras, Francisco, et al.
Pubblicazione: (2024)
Characterizing Selective Refusal Bias in Large Language Models
di: Khorramrouz, Adel, et al.
Pubblicazione: (2025)
di: Khorramrouz, Adel, et al.
Pubblicazione: (2025)
Focus On This, Not That! Steering LLMs with Adaptive Feature Specification
di: Lamb, Tom A., et al.
Pubblicazione: (2024)
di: Lamb, Tom A., et al.
Pubblicazione: (2024)
Bias in, Bias out: Annotation Bias in Multilingual Large Language Models
di: Cui, Xia, et al.
Pubblicazione: (2025)
di: Cui, Xia, et al.
Pubblicazione: (2025)
Prompting a Pretrained Transformer Can Be a Universal Approximator
di: Petrov, Aleksandar, et al.
Pubblicazione: (2024)
di: Petrov, Aleksandar, et al.
Pubblicazione: (2024)
When Do Prompting and Prefix-Tuning Work? A Theory of Capabilities and Limitations
di: Petrov, Aleksandar, et al.
Pubblicazione: (2023)
di: Petrov, Aleksandar, et al.
Pubblicazione: (2023)
Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models
di: Zhang, Wenxuan, et al.
Pubblicazione: (2024)
di: Zhang, Wenxuan, et al.
Pubblicazione: (2024)
Beyond Linear Probes: Dynamic Safety Monitoring for Language Models
di: Oldfield, James, et al.
Pubblicazione: (2025)
di: Oldfield, James, et al.
Pubblicazione: (2025)
Fine-tuning can cripple your foundation model; preserving features may be the solution
di: Mukhoti, Jishnu, et al.
Pubblicazione: (2023)
di: Mukhoti, Jishnu, et al.
Pubblicazione: (2023)
Segment, Select, Correct: A Framework for Weakly-Supervised Referring Segmentation
di: Eiras, Francisco, et al.
Pubblicazione: (2023)
di: Eiras, Francisco, et al.
Pubblicazione: (2023)
Uncovering Bias in Large Vision-Language Models with Counterfactuals
di: Howard, Phillip, et al.
Pubblicazione: (2024)
di: Howard, Phillip, et al.
Pubblicazione: (2024)
Benchmarking and Mitigating MCQA Selection Bias of Large Vision-Language Models
di: Atabuzzaman, Md., et al.
Pubblicazione: (2025)
di: Atabuzzaman, Md., et al.
Pubblicazione: (2025)
CogBias: Measuring and Mitigating Cognitive Bias in Large Language Models
di: Huang, Fan, et al.
Pubblicazione: (2026)
di: Huang, Fan, et al.
Pubblicazione: (2026)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
di: Alssum, Lama, et al.
Pubblicazione: (2025)
di: Alssum, Lama, et al.
Pubblicazione: (2025)
Single LLM Debate, MoLaCE: Mixture of Latent Concept Experts Against Confirmation Bias
di: Kim, Hazel, et al.
Pubblicazione: (2025)
di: Kim, Hazel, et al.
Pubblicazione: (2025)
Uncovering Bias in Large Vision-Language Models at Scale with Counterfactuals
di: Howard, Phillip, et al.
Pubblicazione: (2024)
di: Howard, Phillip, et al.
Pubblicazione: (2024)
Uncovering Bias in Foundation Models: Impact, Testing, Harm, and Mitigation
di: Sun, Shuzhou, et al.
Pubblicazione: (2025)
di: Sun, Shuzhou, et al.
Pubblicazione: (2025)
Mitigating the Bias of Large Language Model Evaluation
di: Zhou, Hongli, et al.
Pubblicazione: (2024)
di: Zhou, Hongli, et al.
Pubblicazione: (2024)
Enhancing Neural Network Interpretability with Feature-Aligned Sparse Autoencoders
di: Marks, Luke, et al.
Pubblicazione: (2024)
di: Marks, Luke, et al.
Pubblicazione: (2024)
Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO
di: Zheng, Jinquan, et al.
Pubblicazione: (2026)
di: Zheng, Jinquan, et al.
Pubblicazione: (2026)
BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
Uncovering Implicit Bias in Large Language Models with Concept Learning Dataset
di: Wang, Leroy Z.
Pubblicazione: (2025)
di: Wang, Leroy Z.
Pubblicazione: (2025)
BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models
di: Fan, Zhiting, et al.
Pubblicazione: (2025)
di: Fan, Zhiting, et al.
Pubblicazione: (2025)
On the Coexistence and Ensembling of Watermarks
di: Petrov, Aleksandar, et al.
Pubblicazione: (2025)
di: Petrov, Aleksandar, et al.
Pubblicazione: (2025)
Towards Certification of Uncertainty Calibration under Adversarial Attacks
di: Emde, Cornelius, et al.
Pubblicazione: (2024)
di: Emde, Cornelius, et al.
Pubblicazione: (2024)
Does Context Help Mitigate Gender Bias in Neural Machine Translation?
di: Gete, Harritxu, et al.
Pubblicazione: (2024)
di: Gete, Harritxu, et al.
Pubblicazione: (2024)
Locating and Mitigating Gender Bias in Large Language Models
di: Cai, Yuchen, et al.
Pubblicazione: (2024)
di: Cai, Yuchen, et al.
Pubblicazione: (2024)
Bias in Large Language Models: Origin, Evaluation, and Mitigation
di: Guo, Yufei, et al.
Pubblicazione: (2024)
di: Guo, Yufei, et al.
Pubblicazione: (2024)
Mitigating Label Length Bias in Large Language Models
di: Sanz-Guerrero, Mario, et al.
Pubblicazione: (2025)
di: Sanz-Guerrero, Mario, et al.
Pubblicazione: (2025)
Reducing Selection Bias in Large Language Models
di: Eicher, J. E., et al.
Pubblicazione: (2024)
di: Eicher, J. E., et al.
Pubblicazione: (2024)
Uncovering Political Bias in Large Language Models using Parliamentary Voting Records
di: Chen, Jieying, et al.
Pubblicazione: (2026)
di: Chen, Jieying, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ToolTweak: An Attack on Tool Selection in LLM-based Agents
di: Sneh, Jonathan, et al.
Pubblicazione: (2025) -
MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents
di: Aichberger, Lukas, et al.
Pubblicazione: (2025) -
OMNI-LEAK: Orchestrator Multi-Agent Network Induced Data Leakage
di: Naik, Akshat, et al.
Pubblicazione: (2026) -
Universal In-Context Approximation By Prompting Fully Recurrent Models
di: Petrov, Aleksandar, et al.
Pubblicazione: (2024) -
BiasBuster: a Neural Approach for Accurate Estimation of Population Statistics using Biased Location Data
di: Zeighami, Sepanta, et al.
Pubblicazione: (2024)