Enregistré dans:
| Auteurs principaux: | Drechsel, Jonathan, Herbold, Steffen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2502.01406 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The GRADIEND Python Package: An End-to-End System for Gradient-Based Feature Learning
par: Drechsel, Jonathan, et autres
Publié: (2026)
par: Drechsel, Jonathan, et autres
Publié: (2026)
Understanding or Memorizing? A Case Study of German Definite Articles in Language Models
par: Drechsel, Jonathan, et autres
Publié: (2026)
par: Drechsel, Jonathan, et autres
Publié: (2026)
MAMUT: A Novel Framework for Modifying Mathematical Formulas for the Generation of Specialized Datasets for Language Model Training
par: Drechsel, Jonathan, et autres
Publié: (2025)
par: Drechsel, Jonathan, et autres
Publié: (2025)
Large Language Models can impersonate politicians and other public figures
par: Herbold, Steffen, et autres
Publié: (2024)
par: Herbold, Steffen, et autres
Publié: (2024)
SortBench: Benchmarking LLMs based on their ability to sort lists
par: Herbold, Steffen
Publié: (2025)
par: Herbold, Steffen
Publié: (2025)
Semantic similarity prediction is better than other semantic similarity measures
par: Herbold, Steffen
Publié: (2023)
par: Herbold, Steffen
Publié: (2023)
FairFlow: Mitigating Dataset Biases through Undecided Learning
par: Cheng, Jiali, et autres
Publié: (2025)
par: Cheng, Jiali, et autres
Publié: (2025)
A Formal Framework for Uncertainty Analysis of Text Generation with Large Language Models
par: Herbold, Steffen, et autres
Publié: (2026)
par: Herbold, Steffen, et autres
Publié: (2026)
On the Hidden Objective Biases of Group-based Reinforcement Learning
par: Fontana, Aleksandar, et autres
Publié: (2026)
par: Fontana, Aleksandar, et autres
Publié: (2026)
BiasGym: A Simple and Generalizable Framework for Analyzing and Removing Biases through Elicitation
par: Islam, Sekh Mainul, et autres
Publié: (2025)
par: Islam, Sekh Mainul, et autres
Publié: (2025)
Do Large Language Models Show Biases in Causal Learning?
par: Carro, Maria Victoria, et autres
Publié: (2024)
par: Carro, Maria Victoria, et autres
Publié: (2024)
Inductive Biases for Zero-shot Systematic Generalization in Language-informed Reinforcement Learning
par: Dijujin, Negin Hashemi, et autres
Publié: (2025)
par: Dijujin, Negin Hashemi, et autres
Publié: (2025)
Demo: Statistically Significant Results On Biases and Errors of LLMs Do Not Guarantee Generalizable Results
par: Liu, Jonathan, et autres
Publié: (2025)
par: Liu, Jonathan, et autres
Publié: (2025)
Superscopes: Amplifying Internal Feature Representations for Language Model Interpretation
par: Jacobi, Jonathan, et autres
Publié: (2025)
par: Jacobi, Jonathan, et autres
Publié: (2025)
Relative Value Biases in Large Language Models
par: Hayes, William M., et autres
Publié: (2024)
par: Hayes, William M., et autres
Publié: (2024)
Large Language Models are Biased Reinforcement Learners
par: Hayes, William M., et autres
Publié: (2024)
par: Hayes, William M., et autres
Publié: (2024)
Empowering Many, Biasing a Few: Generalist Credit Scoring through Large Language Models
par: Feng, Duanyu, et autres
Publié: (2023)
par: Feng, Duanyu, et autres
Publié: (2023)
Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases
par: Hahm, Dongyoon, et autres
Publié: (2026)
par: Hahm, Dongyoon, et autres
Publié: (2026)
Agentifying Patient Dynamics within LLMs through Interacting with Clinical World Model
par: Wu, Minghao, et autres
Publié: (2026)
par: Wu, Minghao, et autres
Publié: (2026)
Exploiting Synergistic Cognitive Biases to Bypass Safety in LLMs
par: Yang, Xikang, et autres
Publié: (2025)
par: Yang, Xikang, et autres
Publié: (2025)
Self-Speculative Biased Decoding for Faster Re-Translation
par: Zeng, Linxiao, et autres
Publié: (2025)
par: Zeng, Linxiao, et autres
Publié: (2025)
Text Injection for Neural Contextual Biasing
par: Meng, Zhong, et autres
Publié: (2024)
par: Meng, Zhong, et autres
Publié: (2024)
Large Language Models are Geographically Biased
par: Manvi, Rohin, et autres
Publié: (2024)
par: Manvi, Rohin, et autres
Publié: (2024)
Heuristics and Biases in AI Decision-Making: Implications for Responsible AGI
par: Saeedi, Payam, et autres
Publié: (2024)
par: Saeedi, Payam, et autres
Publié: (2024)
Catalytic Role Of Noise And Necessity Of Inductive Biases In The Emergence Of Compositional Communication
par: Kuciński, Łukasz, et autres
Publié: (2021)
par: Kuciński, Łukasz, et autres
Publié: (2021)
Between Circuits and Chomsky: Pre-pretraining on Formal Languages Imparts Linguistic Biases
par: Hu, Michael Y., et autres
Publié: (2025)
par: Hu, Michael Y., et autres
Publié: (2025)
Mitigating Biases for Instruction-following Language Models via Bias Neurons Elimination
par: Yang, Nakyeong, et autres
Publié: (2023)
par: Yang, Nakyeong, et autres
Publié: (2023)
BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models
par: Lee, Isack, et autres
Publié: (2024)
par: Lee, Isack, et autres
Publié: (2024)
Long-Short Distance Graph Neural Networks and Improved Curriculum Learning for Emotion Recognition in Conversation
par: Li, Xinran, et autres
Publié: (2025)
par: Li, Xinran, et autres
Publié: (2025)
Reward Models Inherit Value Biases from Pretraining
par: Christian, Brian, et autres
Publié: (2026)
par: Christian, Brian, et autres
Publié: (2026)
Planted in Pretraining, Swayed by Finetuning: A Case Study on the Origins of Cognitive Biases in LLMs
par: Itzhak, Itay, et autres
Publié: (2025)
par: Itzhak, Itay, et autres
Publié: (2025)
FairPy: A Toolkit for Evaluation of Prediction Biases and their Mitigation in Large Language Models
par: Viswanath, Hrishikesh, et autres
Publié: (2023)
par: Viswanath, Hrishikesh, et autres
Publié: (2023)
Do Language Models Exhibit the Same Cognitive Biases in Problem Solving as Human Learners?
par: Opedal, Andreas, et autres
Publié: (2024)
par: Opedal, Andreas, et autres
Publié: (2024)
Switchable Decision: Dynamic Neural Generation Networks
par: Zhang, Shujian, et autres
Publié: (2024)
par: Zhang, Shujian, et autres
Publié: (2024)
Can Small-Scale Data Poisoning Exacerbate Dialect-Linked Biases in Large Language Models?
par: Abbas, Chaymaa, et autres
Publié: (2025)
par: Abbas, Chaymaa, et autres
Publié: (2025)
Laissez-Faire Harms: Algorithmic Biases in Generative Language Models
par: Shieh, Evan, et autres
Publié: (2024)
par: Shieh, Evan, et autres
Publié: (2024)
Enhancing Rare Codes via Probability-Biased Directed Graph Attention for Long-Tail ICD Coding
par: Chen, Tianlei, et autres
Publié: (2025)
par: Chen, Tianlei, et autres
Publié: (2025)
Do Robot Snakes Dream like Electric Sheep? Investigating the Effects of Architectural Inductive Biases on Hallucination
par: Huang, Jerry, et autres
Publié: (2024)
par: Huang, Jerry, et autres
Publié: (2024)
Interactive Training: Feedback-Driven Neural Network Optimization
par: Zhang, Wentao, et autres
Publié: (2025)
par: Zhang, Wentao, et autres
Publié: (2025)
Empirical Capacity Model for Self-Attention Neural Networks
par: Härmä, Aki, et autres
Publié: (2024)
par: Härmä, Aki, et autres
Publié: (2024)
Documents similaires
-
The GRADIEND Python Package: An End-to-End System for Gradient-Based Feature Learning
par: Drechsel, Jonathan, et autres
Publié: (2026) -
Understanding or Memorizing? A Case Study of German Definite Articles in Language Models
par: Drechsel, Jonathan, et autres
Publié: (2026) -
MAMUT: A Novel Framework for Modifying Mathematical Formulas for the Generation of Specialized Datasets for Language Model Training
par: Drechsel, Jonathan, et autres
Publié: (2025) -
Large Language Models can impersonate politicians and other public figures
par: Herbold, Steffen, et autres
Publié: (2024) -
SortBench: Benchmarking LLMs based on their ability to sort lists
par: Herbold, Steffen
Publié: (2025)