Large Language Models are biased to overestimate profoundness
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Herrera-Berg, Eugenio, Browne, Tomás Vergara, León-Villagrá, Pablo, Vives, Marc-Lluís, Calderon, Cristian Buc |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Tracr-Injection: Distilling Algorithms into Pre-trained Language Models
par: Vergara-Browne, Tomás, et autres
Publié: (2025)
par: Vergara-Browne, Tomás, et autres
Publié: (2025)
Deep Natural Language Feature Learning for Interpretable Prediction
par: Urrutia, Felipe, et autres
Publié: (2023)
par: Urrutia, Felipe, et autres
Publié: (2023)
Rethinking Layer Relevance in Large Language Models Beyond Cosine Similarity
par: Hinostroza, Cristian, et autres
Publié: (2026)
par: Hinostroza, Cristian, et autres
Publié: (2026)
From Insights to Actions: The Impact of Interpretability and Analysis Research on NLP
par: Mosbach, Marius, et autres
Publié: (2024)
par: Mosbach, Marius, et autres
Publié: (2024)
Protected group bias and stereotypes in Large Language Models
par: Kotek, Hadas, et autres
Publié: (2024)
par: Kotek, Hadas, et autres
Publié: (2024)
Source framing triggers systematic evaluation bias in Large Language Models
par: Germani, Federico, et autres
Publié: (2025)
par: Germani, Federico, et autres
Publié: (2025)
Towards detecting unanticipated bias in Large Language Models
par: Kruspe, Anna
Publié: (2024)
par: Kruspe, Anna
Publié: (2024)
Leveraging Biases in Large Language Models: "bias-kNN'' for Effective Few-Shot Learning
par: Zhang, Yong, et autres
Publié: (2024)
par: Zhang, Yong, et autres
Publié: (2024)
Identity resolution of software metadata using Large Language Models
par: del Pico, Eva Martín, et autres
Publié: (2025)
par: del Pico, Eva Martín, et autres
Publié: (2025)
Decoupling Positional and Symbolic Attention Behavior in Transformers
par: Urrutia, Felipe, et autres
Publié: (2025)
par: Urrutia, Felipe, et autres
Publié: (2025)
BIPOLAR: Polarization-based granular framework for LLM bias evaluation
par: Pavlíček, Martin, et autres
Publié: (2025)
par: Pavlíček, Martin, et autres
Publié: (2025)
Leveraging Large Language Models for Zero-shot Lay Summarisation in Biomedicine and Beyond
par: Goldsack, Tomas, et autres
Publié: (2025)
par: Goldsack, Tomas, et autres
Publié: (2025)
Large Language Models Preserve Semantic Isotopies in Story Continuations
par: Cavazza, Marc
Publié: (2025)
par: Cavazza, Marc
Publié: (2025)
Eliciting Personality Traits in Large Language Models
par: Hilliard, Airlie, et autres
Publié: (2024)
par: Hilliard, Airlie, et autres
Publié: (2024)
Effective Large Language Model Adaptation for Improved Grounding and Citation Generation
par: Ye, Xi, et autres
Publié: (2023)
par: Ye, Xi, et autres
Publié: (2023)
Open Generative Large Language Models for Galician
par: Gamallo, Pablo, et autres
Publié: (2024)
par: Gamallo, Pablo, et autres
Publié: (2024)
Ask LLMs Directly, "What shapes your bias?": Measuring Social Bias in Large Language Models
par: Shin, Jisu, et autres
Publié: (2024)
par: Shin, Jisu, et autres
Publié: (2024)
Political Ideology Shifts in Large Language Models
par: Bernardelle, Pietro, et autres
Publié: (2025)
par: Bernardelle, Pietro, et autres
Publié: (2025)
It's All About the Confidence: An Unsupervised Approach for Multilingual Historical Entity Linking using Large Language Models
par: Santini, Cristian, et autres
Publié: (2026)
par: Santini, Cristian, et autres
Publié: (2026)
Guaranteed Generation from Large Language Models
par: Kim, Minbeom, et autres
Publié: (2024)
par: Kim, Minbeom, et autres
Publié: (2024)
Controlling Large Language Model Agents with Entropic Activation Steering
par: Rahn, Nate, et autres
Publié: (2024)
par: Rahn, Nate, et autres
Publié: (2024)
Large Language Models and Provenance Metadata for Determining the Relevance of Images and Videos in News Stories
par: Peterka, Tomas, et autres
Publié: (2025)
par: Peterka, Tomas, et autres
Publié: (2025)
Unveiling Performance Challenges of Large Language Models in Low-Resource Healthcare: A Demographic Fairness Perspective
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
Multi-Reward GRPO Fine-Tuning for De-biasing Large Language Models: A Study Based on Chinese-Context Discrimination Data
par: Yixuan, Deng, et autres
Publié: (2025)
par: Yixuan, Deng, et autres
Publié: (2025)
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
par: Zhao, Haozhe, et autres
Publié: (2024)
par: Zhao, Haozhe, et autres
Publié: (2024)
Chain of Agents: Large Language Models Collaborating on Long-Context Tasks
par: Zhang, Yusen, et autres
Publié: (2024)
par: Zhang, Yusen, et autres
Publié: (2024)
Towards Transparent Reasoning: What Drives Faithfulness in Large Language Models?
par: McMillan, Teague, et autres
Publié: (2025)
par: McMillan, Teague, et autres
Publié: (2025)
Large Language Models: A Survey
par: Minaee, Shervin, et autres
Publié: (2024)
par: Minaee, Shervin, et autres
Publié: (2024)
An Ubuntu-Guided Large Language Model Framework for Cognitive Behavioral Mental Health Dialogue
par: Forane, Sontaga G., et autres
Publié: (2026)
par: Forane, Sontaga G., et autres
Publié: (2026)
Exploitation Without Deception: Dark Triad Feature Steering Reveals Separable Antisocial Circuits in Language Models
par: Berg, Cameron, et autres
Publié: (2026)
par: Berg, Cameron, et autres
Publié: (2026)
Impacts of Anthropomorphizing Large Language Models in Learning Environments
par: Schaaff, Kristina, et autres
Publié: (2024)
par: Schaaff, Kristina, et autres
Publié: (2024)
Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
A Comparative Study on Large Language Models for Log Parsing
par: Astekin, Merve, et autres
Publié: (2024)
par: Astekin, Merve, et autres
Publié: (2024)
Dated Data: Tracing Knowledge Cutoffs in Large Language Models
par: Cheng, Jeffrey, et autres
Publié: (2024)
par: Cheng, Jeffrey, et autres
Publié: (2024)
Yet another algorithmic bias: A Discursive Analysis of Large Language Models Reinforcing Dominant Discourses on Gender and Race
par: Bonil, Gustavo, et autres
Publié: (2025)
par: Bonil, Gustavo, et autres
Publié: (2025)
Evaluating Large Language Models on Multiword Expressions in Multilingual and Code-Switched Contexts
par: De Leon, Frances Laureano, et autres
Publié: (2025)
par: De Leon, Frances Laureano, et autres
Publié: (2025)
Krikri: Advancing Open Large Language Models for Greek
par: Roussis, Dimitris, et autres
Publié: (2025)
par: Roussis, Dimitris, et autres
Publié: (2025)
Meltemi: The first open Large Language Model for Greek
par: Voukoutis, Leon, et autres
Publié: (2024)
par: Voukoutis, Leon, et autres
Publié: (2024)
Probing Syntax in Large Language Models: Successes and Remaining Challenges
par: Diego-Simón, Pablo J., et autres
Publié: (2025)
par: Diego-Simón, Pablo J., et autres
Publié: (2025)
Distilling Human-Aligned Privacy Sensitivity Assessment from Large Language Models
par: Loiseau, Gabriel, et autres
Publié: (2026)
par: Loiseau, Gabriel, et autres
Publié: (2026)
Documents similaires
-
Tracr-Injection: Distilling Algorithms into Pre-trained Language Models
par: Vergara-Browne, Tomás, et autres
Publié: (2025) -
Deep Natural Language Feature Learning for Interpretable Prediction
par: Urrutia, Felipe, et autres
Publié: (2023) -
Rethinking Layer Relevance in Large Language Models Beyond Cosine Similarity
par: Hinostroza, Cristian, et autres
Publié: (2026) -
From Insights to Actions: The Impact of Interpretability and Analysis Research on NLP
par: Mosbach, Marius, et autres
Publié: (2024) -
Protected group bias and stereotypes in Large Language Models
par: Kotek, Hadas, et autres
Publié: (2024)