Learning from Response not Preference: A Stackelberg Approach for LLM Detoxification using Non-parallel Data
Fuente:
arXiv
Guardado en:
| Autores principales: | Xie, Xinhong, Li, Tao, Zhu, Quanyan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLM-Stackelberg Games: Conjectural Reasoning Equilibria and Their Applications to Spearphishing
por: Zhu, Quanyan
Publicado: (2025)
por: Zhu, Quanyan
Publicado: (2025)
Text Detoxification: Data Efficiency, Semantic Preservation and Model Generalization
por: Yu, Jing, et al.
Publicado: (2025)
por: Yu, Jing, et al.
Publicado: (2025)
Parameter-Efficient Detoxification with Contrastive Decoding
por: Niu, Tong, et al.
Publicado: (2024)
por: Niu, Tong, et al.
Publicado: (2024)
Users as Annotators: LLM Preference Learning from Comparison Mode
por: Cai, Zhongze, et al.
Publicado: (2025)
por: Cai, Zhongze, et al.
Publicado: (2025)
MultiParaDetox: Extending Text Detoxification with Parallel Data to New Languages
por: Dementieva, Daryna, et al.
Publicado: (2024)
por: Dementieva, Daryna, et al.
Publicado: (2024)
Multilingual and Explainable Text Detoxification with Parallel Corpora
por: Dementieva, Daryna, et al.
Publicado: (2024)
por: Dementieva, Daryna, et al.
Publicado: (2024)
Toward a Dynamic Stackelberg Game-Theoretic Framework for Agentic AI Defense Against LLM Jailbreaking
por: Han, Zhengye, et al.
Publicado: (2025)
por: Han, Zhengye, et al.
Publicado: (2025)
CAPO: Confidence Aware Preference Optimization Learning for Multilingual Preferences
por: Pokharel, Rhitabrat, et al.
Publicado: (2025)
por: Pokharel, Rhitabrat, et al.
Publicado: (2025)
Test-Time Detoxification without Training or Learning Anything
por: Saglam, Baturay, et al.
Publicado: (2026)
por: Saglam, Baturay, et al.
Publicado: (2026)
RouteLLM: Learning to Route LLMs with Preference Data
por: Ong, Isaac, et al.
Publicado: (2024)
por: Ong, Isaac, et al.
Publicado: (2024)
Clean First, Align Later: Benchmarking Preference Data Cleaning for Reliable LLM Alignment
por: Yeh, Samuel, et al.
Publicado: (2025)
por: Yeh, Samuel, et al.
Publicado: (2025)
Dissecting Human and LLM Preferences
por: Li, Junlong, et al.
Publicado: (2024)
por: Li, Junlong, et al.
Publicado: (2024)
DataChef: Cooking Up Optimal Data Recipes for LLM Adaptation via Reinforcement Learning
por: Chen, Yicheng, et al.
Publicado: (2026)
por: Chen, Yicheng, et al.
Publicado: (2026)
Breaking mBad! Supervised Fine-tuning for Cross-Lingual Detoxification
por: Beniwal, Himanshu, et al.
Publicado: (2025)
por: Beniwal, Himanshu, et al.
Publicado: (2025)
Breaking Bad Molecules: Are MLLMs Ready for Structure-Level Molecular Detoxification?
por: Lin, Fei, et al.
Publicado: (2025)
por: Lin, Fei, et al.
Publicado: (2025)
CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification
por: Wang, Yian, et al.
Publicado: (2026)
por: Wang, Yian, et al.
Publicado: (2026)
ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models
por: Zhang, Kaituo, et al.
Publicado: (2026)
por: Zhang, Kaituo, et al.
Publicado: (2026)
Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization
por: Lu, Junjie, et al.
Publicado: (2025)
por: Lu, Junjie, et al.
Publicado: (2025)
Pref-CTRL: Preference Driven LLM Alignment using Representation Editing
por: Ashrafi, Imranul, et al.
Publicado: (2026)
por: Ashrafi, Imranul, et al.
Publicado: (2026)
DEPO: Dual-Efficiency Preference Optimization for LLM Agents
por: Chen, Sirui, et al.
Publicado: (2025)
por: Chen, Sirui, et al.
Publicado: (2025)
DESTEIN: Navigating Detoxification of Language Models via Universal Steering Pairs and Head-wise Activation Fusion
por: Li, Yu, et al.
Publicado: (2024)
por: Li, Yu, et al.
Publicado: (2024)
Reasoning and Behavioral Equilibria in LLM-Nash Games: From Mindsets to Actions
por: Zhu, Quanyan
Publicado: (2025)
por: Zhu, Quanyan
Publicado: (2025)
Rethinking Human Preference Evaluation of LLM Rationales
por: Li, Ziang, et al.
Publicado: (2025)
por: Li, Ziang, et al.
Publicado: (2025)
LRHP: Learning Representations for Human Preferences via Preference Pairs
por: Wang, Chenglong, et al.
Publicado: (2024)
por: Wang, Chenglong, et al.
Publicado: (2024)
SmurfCat at PAN 2024 TextDetox: Alignment of Multilingual Transformers for Text Detoxification
por: Rykov, Elisei, et al.
Publicado: (2024)
por: Rykov, Elisei, et al.
Publicado: (2024)
SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification
por: Wang, Hongbo, et al.
Publicado: (2025)
por: Wang, Hongbo, et al.
Publicado: (2025)
Detoxification of Large Language Models through Output-layer Fusion with a Calibration Model
por: Tian, Yuanhe, et al.
Publicado: (2025)
por: Tian, Yuanhe, et al.
Publicado: (2025)
CLAVE: An Adaptive Framework for Evaluating Values of LLM Generated Responses
por: Yao, Jing, et al.
Publicado: (2024)
por: Yao, Jing, et al.
Publicado: (2024)
BanglaNirTox: A Large-scale Parallel Corpus for Explainable AI in Bengali Text Detoxification
por: Mohsin, Ayesha Afroza, et al.
Publicado: (2025)
por: Mohsin, Ayesha Afroza, et al.
Publicado: (2025)
Learning LLM Preference over Intra-Dialogue Pairs: A Framework for Utterance-level Understandings
por: Liu, Xuanqing, et al.
Publicado: (2025)
por: Liu, Xuanqing, et al.
Publicado: (2025)
Preference Curriculum: LLMs Should Always Be Pretrained on Their Preferred Data
por: Zhang, Xuemiao, et al.
Publicado: (2025)
por: Zhang, Xuemiao, et al.
Publicado: (2025)
Subjective Behaviors and Preferences in LLM: Language of Browsing
por: Sundaresan, Sai, et al.
Publicado: (2025)
por: Sundaresan, Sai, et al.
Publicado: (2025)
What's In My Human Feedback? Learning Interpretable Descriptions of Preference Data
por: Movva, Rajiv, et al.
Publicado: (2025)
por: Movva, Rajiv, et al.
Publicado: (2025)
Quantifying and Mitigating Self-Preference Bias of LLM Judges
por: Yang, Jinming, et al.
Publicado: (2026)
por: Yang, Jinming, et al.
Publicado: (2026)
Rethinking DPO: The Role of Rejected Responses in Preference Misalignment
por: Cho, Jay Hyeon, et al.
Publicado: (2025)
por: Cho, Jay Hyeon, et al.
Publicado: (2025)
Game Theory Meets LLM and Agentic AI: Reimagining Cybersecurity for the Age of Intelligent Threats
por: Zhu, Quanyan
Publicado: (2025)
por: Zhu, Quanyan
Publicado: (2025)
ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning
por: Melikidze, Davit, et al.
Publicado: (2026)
por: Melikidze, Davit, et al.
Publicado: (2026)
CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning
por: Zhu, Xinyu, et al.
Publicado: (2026)
por: Zhu, Xinyu, et al.
Publicado: (2026)
LLM-guided Semi-Supervised Approaches for Social Media Crisis Data Classification
por: Ativo, Jacob, et al.
Publicado: (2026)
por: Ativo, Jacob, et al.
Publicado: (2026)
Ejemplares similares
-
LLM-Stackelberg Games: Conjectural Reasoning Equilibria and Their Applications to Spearphishing
por: Zhu, Quanyan
Publicado: (2025) -
Text Detoxification: Data Efficiency, Semantic Preservation and Model Generalization
por: Yu, Jing, et al.
Publicado: (2025) -
Parameter-Efficient Detoxification with Contrastive Decoding
por: Niu, Tong, et al.
Publicado: (2024) -
Users as Annotators: LLM Preference Learning from Comparison Mode
por: Cai, Zhongze, et al.
Publicado: (2025) -
MultiParaDetox: Extending Text Detoxification with Parallel Data to New Languages
por: Dementieva, Daryna, et al.
Publicado: (2024)