Salvato in:
| Autori principali: | Yan, Jianhao, Wang, Futing, Li, Yafu, Zhang, Yue |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2402.13462 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Keys to Robust Edits: from Theoretical Insights to Practical Advances
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
Learning to Reason under Off-Policy Guidance
di: Yan, Jianhao, et al.
Pubblicazione: (2025)
di: Yan, Jianhao, et al.
Pubblicazione: (2025)
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning
di: Li, Yafu, et al.
Pubblicazione: (2025)
di: Li, Yafu, et al.
Pubblicazione: (2025)
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
Spotting AI's Touch: Identifying LLM-Paraphrased Spans in Text
di: Li, Yafu, et al.
Pubblicazione: (2024)
di: Li, Yafu, et al.
Pubblicazione: (2024)
ELICIT: LLM Augmentation via External In-Context Capability
di: Wang, Futing, et al.
Pubblicazione: (2024)
di: Wang, Futing, et al.
Pubblicazione: (2024)
Detecting RLVR Training Data via Structural Convergence of Reasoning
di: Zhang, Hongbo, et al.
Pubblicazione: (2026)
di: Zhang, Hongbo, et al.
Pubblicazione: (2026)
Revisiting Parameter-Based Knowledge Editing in Large Language Models: Theoretical Limits and Empirical Evidence
di: Ren, Wanying, et al.
Pubblicazione: (2026)
di: Ren, Wanying, et al.
Pubblicazione: (2026)
Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
Do Thinking Tokens Help or Trap? Towards More Efficient Large Reasoning Model
di: Ding, Bowen, et al.
Pubblicazione: (2025)
di: Ding, Bowen, et al.
Pubblicazione: (2025)
Measuring Social Norms of Large Language Models
di: Yuan, Ye, et al.
Pubblicazione: (2024)
di: Yuan, Ye, et al.
Pubblicazione: (2024)
Social Debiasing for Fair Multi-modal LLMs
di: Cheng, Harry, et al.
Pubblicazione: (2024)
di: Cheng, Harry, et al.
Pubblicazione: (2024)
Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
di: Fu, Tingchen, et al.
Pubblicazione: (2025)
di: Fu, Tingchen, et al.
Pubblicazione: (2025)
General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
di: Shi, Bingkang, et al.
Pubblicazione: (2023)
di: Shi, Bingkang, et al.
Pubblicazione: (2023)
Multi-LLM Collaborative Search for Complex Problem Solving
di: Yang, Sen, et al.
Pubblicazione: (2025)
di: Yang, Sen, et al.
Pubblicazione: (2025)
UGID: Unified Graph Isomorphism for Debiasing Large Language Models
di: Ding, Zikang, et al.
Pubblicazione: (2026)
di: Ding, Zikang, et al.
Pubblicazione: (2026)
What Have We Achieved on Non-autoregressive Translation?
di: Li, Yafu, et al.
Pubblicazione: (2024)
di: Li, Yafu, et al.
Pubblicazione: (2024)
Unveiling Attractor Cycles in Large Language Models: A Dynamical Systems View of Successive Paraphrasing
di: Wang, Zhilin, et al.
Pubblicazione: (2025)
di: Wang, Zhilin, et al.
Pubblicazione: (2025)
Debiasing Large Language Models via Adaptive Causal Prompting with Sketch-of-Thought
di: Li, Bowen, et al.
Pubblicazione: (2026)
di: Li, Bowen, et al.
Pubblicazione: (2026)
Enhancing the QA Model through a Multi-domain Debiasing Framework
di: Wang, Yuefeng, et al.
Pubblicazione: (2026)
di: Wang, Yuefeng, et al.
Pubblicazione: (2026)
Causal-Guided Active Learning for Debiasing Large Language Models
di: Du, Li, et al.
Pubblicazione: (2024)
di: Du, Li, et al.
Pubblicazione: (2024)
Adapting Large Language Models for Education: Foundational Capabilities, Potentials, and Challenges
di: Li, Qingyao, et al.
Pubblicazione: (2023)
di: Li, Qingyao, et al.
Pubblicazione: (2023)
Debiasing Large Language Models toward Social Factors in Online Behavior Analytics through Prompt Knowledge Tuning
di: Salemi, Hossein, et al.
Pubblicazione: (2026)
di: Salemi, Hossein, et al.
Pubblicazione: (2026)
Debiasing LLMs by Masking Unfairness-Driving Attention Heads
di: Han, Tingxu, et al.
Pubblicazione: (2025)
di: Han, Tingxu, et al.
Pubblicazione: (2025)
MPF: Aligning and Debiasing Language Models post Deployment via Multi Perspective Fusion
di: Guan, Xin, et al.
Pubblicazione: (2025)
di: Guan, Xin, et al.
Pubblicazione: (2025)
Rethinking Entropy Regularization in Large Reasoning Models
di: Jiang, Yuxian, et al.
Pubblicazione: (2025)
di: Jiang, Yuxian, et al.
Pubblicazione: (2025)
NAIPv2: Debiased Pairwise Learning for Efficient Paper Quality Estimation
di: Zhao, Penghai, et al.
Pubblicazione: (2025)
di: Zhao, Penghai, et al.
Pubblicazione: (2025)
Creativity Has Left the Chat: The Price of Debiasing Language Models
di: Mohammadi, Behnam
Pubblicazione: (2024)
di: Mohammadi, Behnam
Pubblicazione: (2024)
Information Gain-Guided Causal Intervention for Autonomous Debiasing Large Language Models
di: Sun, Zhouhao, et al.
Pubblicazione: (2025)
di: Sun, Zhouhao, et al.
Pubblicazione: (2025)
Large, Small or Both: A Novel Data Augmentation Framework Based on Language Models for Debiasing Opinion Summarization
di: Zhang, Yanyue, et al.
Pubblicazione: (2024)
di: Zhang, Yanyue, et al.
Pubblicazione: (2024)
MEGen: Generative Backdoor into Large Language Models via Model Editing
di: Qiu, Jiyang, et al.
Pubblicazione: (2024)
di: Qiu, Jiyang, et al.
Pubblicazione: (2024)
Debiasing Algorithm through Model Adaptation
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2023)
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2023)
Bi-directional Bias Attribution: Debiasing Large Language Models without Modifying Prompts
di: Lin, Yujie, et al.
Pubblicazione: (2026)
di: Lin, Yujie, et al.
Pubblicazione: (2026)
Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
di: Chen, Guanxu, et al.
Pubblicazione: (2025)
di: Chen, Guanxu, et al.
Pubblicazione: (2025)
Pitfalls of Conversational LLMs on News Debiasing
di: Schlicht, Ipek Baris, et al.
Pubblicazione: (2024)
di: Schlicht, Ipek Baris, et al.
Pubblicazione: (2024)
Inference-Time Selective Debiasing to Enhance Fairness in Text Classification Models
di: Kuzmin, Gleb, et al.
Pubblicazione: (2024)
di: Kuzmin, Gleb, et al.
Pubblicazione: (2024)
Debiasing Reward Models via Causally Motivated Inference-Time Intervention
di: Shinoda, Kazutoshi, et al.
Pubblicazione: (2026)
di: Shinoda, Kazutoshi, et al.
Pubblicazione: (2026)
DeFrame: Debiasing Large Language Models Against Framing Effects
di: Lim, Kahee, et al.
Pubblicazione: (2026)
di: Lim, Kahee, et al.
Pubblicazione: (2026)
Model Merging for Knowledge Editing
di: Fu, Zichuan, et al.
Pubblicazione: (2025)
di: Fu, Zichuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Keys to Robust Edits: from Theoretical Insights to Practical Advances
di: Yan, Jianhao, et al.
Pubblicazione: (2024) -
Learning to Reason under Off-Policy Guidance
di: Yan, Jianhao, et al.
Pubblicazione: (2025) -
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models
di: Yan, Jianhao, et al.
Pubblicazione: (2024) -
From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning
di: Li, Yafu, et al.
Pubblicazione: (2025) -
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
di: Xu, Xin, et al.
Pubblicazione: (2025)