StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Khan, Ishmam, Thogarrati, Sindhuja, Zhang, Shuo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
POROver: Improving Safety and Reducing Overrefusal in Large Language Models with Overgeneration and Preference Optimization
por: Karaman, Batuhan K., et al.
Publicado: (2024)
por: Karaman, Batuhan K., et al.
Publicado: (2024)
Advantage-Guided Distillation for Preference Alignment in Small Language Models
por: Gao, Shiping, et al.
Publicado: (2025)
por: Gao, Shiping, et al.
Publicado: (2025)
Magnetic Preference Optimization: Achieving Last-iterate Convergence for Language Model Alignment
por: Wang, Mingzhi, et al.
Publicado: (2024)
por: Wang, Mingzhi, et al.
Publicado: (2024)
AMaPO: Adaptive Margin-attached Preference Optimization for Language Model Alignment
por: Deng, Ruibo, et al.
Publicado: (2025)
por: Deng, Ruibo, et al.
Publicado: (2025)
Accelerated Preference Optimization for Large Language Model Alignment
por: He, Jiafan, et al.
Publicado: (2024)
por: He, Jiafan, et al.
Publicado: (2024)
Self-Play Preference Optimization for Language Model Alignment
por: Wu, Yue, et al.
Publicado: (2024)
por: Wu, Yue, et al.
Publicado: (2024)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
por: Xiao, Teng, et al.
Publicado: (2024)
por: Xiao, Teng, et al.
Publicado: (2024)
DiffPO: Diffusion-styled Preference Optimization for Efficient Inference-Time Alignment of Large Language Models
por: Chen, Ruizhe, et al.
Publicado: (2025)
por: Chen, Ruizhe, et al.
Publicado: (2025)
Preference Alignment Improves Language Model-Based TTS
por: Tian, Jinchuan, et al.
Publicado: (2024)
por: Tian, Jinchuan, et al.
Publicado: (2024)
Reducing Hallucinations in LLMs via Factuality-Aware Preference Learning
por: Chaduvula, Sindhuja, et al.
Publicado: (2026)
por: Chaduvula, Sindhuja, et al.
Publicado: (2026)
Topology-Enhanced Alignment for Large Language Models: Trajectory Topology Loss and Topological Preference Optimization
por: Pan, Yurui, et al.
Publicado: (2026)
por: Pan, Yurui, et al.
Publicado: (2026)
Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment
por: Yin, Yueqin, et al.
Publicado: (2024)
por: Yin, Yueqin, et al.
Publicado: (2024)
ContraSolver: Self-Alignment of Language Models by Resolving Internal Preference Contradictions
por: Zhang, Xu, et al.
Publicado: (2024)
por: Zhang, Xu, et al.
Publicado: (2024)
Group Preference Optimization: Few-Shot Alignment of Large Language Models
por: Zhao, Siyan, et al.
Publicado: (2023)
por: Zhao, Siyan, et al.
Publicado: (2023)
Impact of Preference Noise on the Alignment Performance of Generative Language Models
por: Gao, Yang, et al.
Publicado: (2024)
por: Gao, Yang, et al.
Publicado: (2024)
FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment
por: Zhu, Kewen, et al.
Publicado: (2026)
por: Zhu, Kewen, et al.
Publicado: (2026)
Margin Matching Preference Optimization: Enhanced Model Alignment with Granular Feedback
por: Kim, Kyuyoung, et al.
Publicado: (2024)
por: Kim, Kyuyoung, et al.
Publicado: (2024)
Capturing Nuanced Preferences: Preference-Aligned Distillation for Small Language Models
por: Gu, Yanggan, et al.
Publicado: (2025)
por: Gu, Yanggan, et al.
Publicado: (2025)
TODO: Enhancing LLM Alignment with Ternary Preferences
por: Guo, Yuxiang, et al.
Publicado: (2024)
por: Guo, Yuxiang, et al.
Publicado: (2024)
Preference Ranking Optimization for Human Alignment
por: Song, Feifan, et al.
Publicado: (2023)
por: Song, Feifan, et al.
Publicado: (2023)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
A Survey on Personalized and Pluralistic Preference Alignment in Large Language Models
por: Xie, Zhouhang, et al.
Publicado: (2025)
por: Xie, Zhouhang, et al.
Publicado: (2025)
Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models
por: Singh, Joykirat, et al.
Publicado: (2025)
por: Singh, Joykirat, et al.
Publicado: (2025)
BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment
por: Wang, Sizhe, et al.
Publicado: (2024)
por: Wang, Sizhe, et al.
Publicado: (2024)
Exploring LLM-based Data Annotation Strategies for Medical Dialogue Preference Alignment
por: Dou, Chengfeng, et al.
Publicado: (2024)
por: Dou, Chengfeng, et al.
Publicado: (2024)
Human Preferences for Constructive Interactions in Language Model Alignment
por: Kyrychenko, Yara, et al.
Publicado: (2025)
por: Kyrychenko, Yara, et al.
Publicado: (2025)
Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
por: Cheng, Pengyu, et al.
Publicado: (2023)
por: Cheng, Pengyu, et al.
Publicado: (2023)
ProSocialAlign: Preference Conditioned Test Time Alignment in Language Models
por: Banerjee, Somnath, et al.
Publicado: (2025)
por: Banerjee, Somnath, et al.
Publicado: (2025)
Reasoning Strategies in Large Language Models: Can They Follow, Prefer, and Optimize?
por: Zhang, Yanjian, et al.
Publicado: (2025)
por: Zhang, Yanjian, et al.
Publicado: (2025)
CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment
por: Yang, Zhengbang, et al.
Publicado: (2026)
por: Yang, Zhengbang, et al.
Publicado: (2026)
Preference Packing: Efficient Preference Optimization for Large Language Models
por: Cho, Jaekyung
Publicado: (2026)
por: Cho, Jaekyung
Publicado: (2026)
Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment
por: Sun, Shengyang, et al.
Publicado: (2025)
por: Sun, Shengyang, et al.
Publicado: (2025)
FrugalPrompt: Reducing Contextual Overhead in Large Language Models via Token Attribution
por: Raiyan, Syed Rifat, et al.
Publicado: (2025)
por: Raiyan, Syed Rifat, et al.
Publicado: (2025)
ULMA: Unified Language Model Alignment with Human Demonstration and Point-wise Preference
por: Cai, Tianchi, et al.
Publicado: (2023)
por: Cai, Tianchi, et al.
Publicado: (2023)
PMMT: Preference Alignment in Multilingual Machine Translation via LLM Distillation
por: Sun, Shuqiao, et al.
Publicado: (2024)
por: Sun, Shuqiao, et al.
Publicado: (2024)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
por: Xiang, Hao, et al.
Publicado: (2024)
por: Xiang, Hao, et al.
Publicado: (2024)
Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling
por: Deng, Qiyuan, et al.
Publicado: (2025)
por: Deng, Qiyuan, et al.
Publicado: (2025)
Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment
por: Zhang, Yifan, et al.
Publicado: (2024)
por: Zhang, Yifan, et al.
Publicado: (2024)
Language Models as Critical Thinking Tools: A Case Study of Philosophers
por: Ye, Andre, et al.
Publicado: (2024)
por: Ye, Andre, et al.
Publicado: (2024)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
por: Pi, Renjie, et al.
Publicado: (2024)
por: Pi, Renjie, et al.
Publicado: (2024)
Ejemplares similares
-
POROver: Improving Safety and Reducing Overrefusal in Large Language Models with Overgeneration and Preference Optimization
por: Karaman, Batuhan K., et al.
Publicado: (2024) -
Advantage-Guided Distillation for Preference Alignment in Small Language Models
por: Gao, Shiping, et al.
Publicado: (2025) -
Magnetic Preference Optimization: Achieving Last-iterate Convergence for Language Model Alignment
por: Wang, Mingzhi, et al.
Publicado: (2024) -
AMaPO: Adaptive Margin-attached Preference Optimization for Language Model Alignment
por: Deng, Ruibo, et al.
Publicado: (2025) -
Accelerated Preference Optimization for Large Language Model Alignment
por: He, Jiafan, et al.
Publicado: (2024)