Mitigating Self-Preference by Authorship Obfuscation
Fuente:
arXiv
Salvato in:
| Autori principali: | Mahbub, Taslim, Feng, Shi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
JAMDEC: Unsupervised Authorship Obfuscation using Constrained Decoding over Small Language Models
di: Fisher, Jillian, et al.
Pubblicazione: (2024)
di: Fisher, Jillian, et al.
Pubblicazione: (2024)
ALISON: Fast and Effective Stylometric Authorship Obfuscation
di: Xing, Eric, et al.
Pubblicazione: (2024)
di: Xing, Eric, et al.
Pubblicazione: (2024)
Consistency Training while Mitigating Obfuscation via Rate Matching
di: Imran, Sohaib, et al.
Pubblicazione: (2026)
di: Imran, Sohaib, et al.
Pubblicazione: (2026)
Quantifying and Mitigating Self-Preference Bias of LLM Judges
di: Yang, Jinming, et al.
Pubblicazione: (2026)
di: Yang, Jinming, et al.
Pubblicazione: (2026)
CAVE: Controllable Authorship Verification Explanations
di: Ramnath, Sahana, et al.
Pubblicazione: (2024)
di: Ramnath, Sahana, et al.
Pubblicazione: (2024)
Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators
di: Roytburg, Dani, et al.
Pubblicazione: (2025)
di: Roytburg, Dani, et al.
Pubblicazione: (2025)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
di: Li, Jian, et al.
Pubblicazione: (2024)
di: Li, Jian, et al.
Pubblicazione: (2024)
Personalized Author Obfuscation with Large Language Models
di: Shokri, Mohammad, et al.
Pubblicazione: (2025)
di: Shokri, Mohammad, et al.
Pubblicazione: (2025)
PARSI: Persian Authorship Recognition via Stylometric Integration
di: Shahnazari, Kourosh, et al.
Pubblicazione: (2025)
di: Shahnazari, Kourosh, et al.
Pubblicazione: (2025)
LLM one-shot style transfer for Authorship Attribution and Verification
di: Miralles-González, Pablo, et al.
Pubblicazione: (2025)
di: Miralles-González, Pablo, et al.
Pubblicazione: (2025)
Advancing NLP Security by Leveraging LLMs as Adversarial Engines
di: Srinivasan, Sudarshan, et al.
Pubblicazione: (2024)
di: Srinivasan, Sudarshan, et al.
Pubblicazione: (2024)
Inclusion-of-Thoughts: Mitigating Preference Instability via Purifying the Decision Space
di: Madani, Mohammad Reza Ghasemi, et al.
Pubblicazione: (2026)
di: Madani, Mohammad Reza Ghasemi, et al.
Pubblicazione: (2026)
Can LLMs Obfuscate Code? A Systematic Analysis of Large Language Models into Assembly Code Obfuscation
di: Mohseni, Seyedreza, et al.
Pubblicazione: (2024)
di: Mohseni, Seyedreza, et al.
Pubblicazione: (2024)
Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs
di: Li, Qi, et al.
Pubblicazione: (2025)
di: Li, Qi, et al.
Pubblicazione: (2025)
LINGOLY-TOO: Disentangling Reasoning from Knowledge with Templatised Orthographic Obfuscation
di: Khouja, Jude, et al.
Pubblicazione: (2025)
di: Khouja, Jude, et al.
Pubblicazione: (2025)
CollabStory: Multi-LLM Collaborative Story Generation and Authorship Analysis
di: Venkatraman, Saranya, et al.
Pubblicazione: (2024)
di: Venkatraman, Saranya, et al.
Pubblicazione: (2024)
SGPO: Self-Generated Preference Optimization based on Self-Improver
di: Lee, Hyeonji, et al.
Pubblicazione: (2025)
di: Lee, Hyeonji, et al.
Pubblicazione: (2025)
A Bayesian Approach to Harnessing the Power of LLMs in Authorship Attribution
di: Hu, Zhengmian, et al.
Pubblicazione: (2024)
di: Hu, Zhengmian, et al.
Pubblicazione: (2024)
AuthorMix: Modular Authorship Style Transfer via Layer-wise Adapter Mixing
di: Thillainathan, Sarubi, et al.
Pubblicazione: (2026)
di: Thillainathan, Sarubi, et al.
Pubblicazione: (2026)
Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation
di: Zhang, Xiaoying, et al.
Pubblicazione: (2024)
di: Zhang, Xiaoying, et al.
Pubblicazione: (2024)
Preference Consistency Matters: Enhancing Preference Learning in Language Models with Automated Self-Curation of Training Corpora
di: Lee, JoonHo, et al.
Pubblicazione: (2024)
di: Lee, JoonHo, et al.
Pubblicazione: (2024)
Authorship Without Writing: Large Language Models and the Senior Author Analogy
di: Hurshman, Clint, et al.
Pubblicazione: (2025)
di: Hurshman, Clint, et al.
Pubblicazione: (2025)
BARD10: A New Benchmark Reveals Significance of Bangla Stop-Words in Authorship Attribution
di: Moosa, Abdullah Muhammad, et al.
Pubblicazione: (2025)
di: Moosa, Abdullah Muhammad, et al.
Pubblicazione: (2025)
Self-supervised Attribute-aware Dynamic Preference Ranking Alignment
di: Yang, Hongyu, et al.
Pubblicazione: (2025)
di: Yang, Hongyu, et al.
Pubblicazione: (2025)
Self-Boosting Large Language Models with Synthetic Preference Data
di: Dong, Qingxiu, et al.
Pubblicazione: (2024)
di: Dong, Qingxiu, et al.
Pubblicazione: (2024)
MATCHED: Multimodal Authorship-Attribution To Combat Human Trafficking in Escort-Advertisement Data
di: Saxena, Vageesh, et al.
Pubblicazione: (2024)
di: Saxena, Vageesh, et al.
Pubblicazione: (2024)
Counterfactual Probing for Hallucination Detection and Mitigation in Large Language Models
di: Feng, Yijun
Pubblicazione: (2025)
di: Feng, Yijun
Pubblicazione: (2025)
Self-Consistency Preference Optimization
di: Prasad, Archiki, et al.
Pubblicazione: (2024)
di: Prasad, Archiki, et al.
Pubblicazione: (2024)
Self-Preference Bias in Rubric-Based Evaluation of Large Language Models
di: Pombal, José, et al.
Pubblicazione: (2026)
di: Pombal, José, et al.
Pubblicazione: (2026)
CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations
di: Zhang, Mike, et al.
Pubblicazione: (2026)
di: Zhang, Mike, et al.
Pubblicazione: (2026)
SelfAug: Mitigating Catastrophic Forgetting in Retrieval-Augmented Generation via Distribution Self-Alignment
di: Huang, Yuqing, et al.
Pubblicazione: (2025)
di: Huang, Yuqing, et al.
Pubblicazione: (2025)
Spontaneous Reward Hacking in Iterative Self-Refinement
di: Pan, Jane, et al.
Pubblicazione: (2024)
di: Pan, Jane, et al.
Pubblicazione: (2024)
Safer-Instruct: Aligning Language Models with Automated Preference Data
di: Shi, Taiwei, et al.
Pubblicazione: (2023)
di: Shi, Taiwei, et al.
Pubblicazione: (2023)
AMPO: Active Multi-Preference Optimization for Self-play Preference Selection
di: Gupta, Taneesh, et al.
Pubblicazione: (2025)
di: Gupta, Taneesh, et al.
Pubblicazione: (2025)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
di: Wu, Jiulong, et al.
Pubblicazione: (2025)
di: Wu, Jiulong, et al.
Pubblicazione: (2025)
Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing
di: Xu, Kaishuai, et al.
Pubblicazione: (2024)
di: Xu, Kaishuai, et al.
Pubblicazione: (2024)
Multi-Faceted Self-Consistent Preference Alignment for Query Rewriting in Conversational Search
di: Cao, Zhiyu, et al.
Pubblicazione: (2026)
di: Cao, Zhiyu, et al.
Pubblicazione: (2026)
Towards Understanding the Influence of Reward Margin on Preference Model Performance
di: Qin, Bowen, et al.
Pubblicazione: (2024)
di: Qin, Bowen, et al.
Pubblicazione: (2024)
PLaD: Preference-based Large Language Model Distillation with Pseudo-Preference Pairs
di: Zhang, Rongzhi, et al.
Pubblicazione: (2024)
di: Zhang, Rongzhi, et al.
Pubblicazione: (2024)
Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering
di: Mohamed, Anas, et al.
Pubblicazione: (2025)
di: Mohamed, Anas, et al.
Pubblicazione: (2025)
Documenti analoghi
-
JAMDEC: Unsupervised Authorship Obfuscation using Constrained Decoding over Small Language Models
di: Fisher, Jillian, et al.
Pubblicazione: (2024) -
ALISON: Fast and Effective Stylometric Authorship Obfuscation
di: Xing, Eric, et al.
Pubblicazione: (2024) -
Consistency Training while Mitigating Obfuscation via Rate Matching
di: Imran, Sohaib, et al.
Pubblicazione: (2026) -
Quantifying and Mitigating Self-Preference Bias of LLM Judges
di: Yang, Jinming, et al.
Pubblicazione: (2026) -
CAVE: Controllable Authorship Verification Explanations
di: Ramnath, Sahana, et al.
Pubblicazione: (2024)