Self-Evolutionary Large Language Models through Uncertainty-Enhanced Preference Optimization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Jianing, Zhou, Yang, Zhang, Xiaocheng, Bao, Mengjiao, Yan, Peng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TrendFact: A Benchmark for Explainable Hotspot Perception in Fact-Checking with Natural Language Explanation
von: Zhang, Xiaocheng, et al.
Veröffentlicht: (2024)
von: Zhang, Xiaocheng, et al.
Veröffentlicht: (2024)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
von: Xiang, Hao, et al.
Veröffentlicht: (2024)
von: Xiang, Hao, et al.
Veröffentlicht: (2024)
Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich Languages
von: Zhang, Yuanchi, et al.
Veröffentlicht: (2024)
von: Zhang, Yuanchi, et al.
Veröffentlicht: (2024)
InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models
von: Gu, Yanggan, et al.
Veröffentlicht: (2025)
von: Gu, Yanggan, et al.
Veröffentlicht: (2025)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
von: Li, Jian, et al.
Veröffentlicht: (2024)
von: Li, Jian, et al.
Veröffentlicht: (2024)
Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models
von: Zhang, Huatian, et al.
Veröffentlicht: (2026)
von: Zhang, Huatian, et al.
Veröffentlicht: (2026)
Topology-Enhanced Alignment for Large Language Models: Trajectory Topology Loss and Topological Preference Optimization
von: Pan, Yurui, et al.
Veröffentlicht: (2026)
von: Pan, Yurui, et al.
Veröffentlicht: (2026)
Advancing Large Language Model Attribution through Self-Improving
von: Huang, Lei, et al.
Veröffentlicht: (2024)
von: Huang, Lei, et al.
Veröffentlicht: (2024)
Dynamic Noise Preference Optimization: Self-Improvement of Large Language Models with Self-Synthetic Data
von: Yang, Haoyan, et al.
Veröffentlicht: (2025)
von: Yang, Haoyan, et al.
Veröffentlicht: (2025)
Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoning
von: Wang, Jianing, et al.
Veröffentlicht: (2025)
von: Wang, Jianing, et al.
Veröffentlicht: (2025)
Large Language Model for Multi-objective Evolutionary Optimization
von: Liu, Fei, et al.
Veröffentlicht: (2023)
von: Liu, Fei, et al.
Veröffentlicht: (2023)
Uncertainty is Fragile: Manipulating Uncertainty in Large Language Models
von: Zeng, Qingcheng, et al.
Veröffentlicht: (2024)
von: Zeng, Qingcheng, et al.
Veröffentlicht: (2024)
Weights-Rotated Preference Optimization for Large Language Models
von: Yang, Chenxu, et al.
Veröffentlicht: (2025)
von: Yang, Chenxu, et al.
Veröffentlicht: (2025)
InstructGraph: Boosting Large Language Models via Graph-centric Instruction Tuning and Preference Alignment
von: Wang, Jianing, et al.
Veröffentlicht: (2024)
von: Wang, Jianing, et al.
Veröffentlicht: (2024)
Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling
von: Hou, Bairu, et al.
Veröffentlicht: (2023)
von: Hou, Bairu, et al.
Veröffentlicht: (2023)
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
von: Chen, Guanzheng, et al.
Veröffentlicht: (2025)
von: Chen, Guanzheng, et al.
Veröffentlicht: (2025)
Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment
von: Yin, Yueqin, et al.
Veröffentlicht: (2024)
von: Yin, Yueqin, et al.
Veröffentlicht: (2024)
Aligning Large Language Models with Human Preferences through Representation Engineering
von: Liu, Wenhao, et al.
Veröffentlicht: (2023)
von: Liu, Wenhao, et al.
Veröffentlicht: (2023)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
von: Wang, Weiyun, et al.
Veröffentlicht: (2024)
von: Wang, Weiyun, et al.
Veröffentlicht: (2024)
Enhancing Non-English Capabilities of English-Centric Large Language Models through Deep Supervision Fine-Tuning
von: Huo, Wenshuai, et al.
Veröffentlicht: (2025)
von: Huo, Wenshuai, et al.
Veröffentlicht: (2025)
Preference-Oriented Supervised Fine-Tuning: Favoring Target Model Over Aligned Large Language Models
von: Fan, Yuchen, et al.
Veröffentlicht: (2024)
von: Fan, Yuchen, et al.
Veröffentlicht: (2024)
Preference Packing: Efficient Preference Optimization for Large Language Models
von: Cho, Jaekyung
Veröffentlicht: (2026)
von: Cho, Jaekyung
Veröffentlicht: (2026)
Reasoning Strategies in Large Language Models: Can They Follow, Prefer, and Optimize?
von: Zhang, Yanjian, et al.
Veröffentlicht: (2025)
von: Zhang, Yanjian, et al.
Veröffentlicht: (2025)
Enhancing Multilingual Counterfactual Generation through Alignment-as-Preference Optimization
von: Wang, Yilong, et al.
Veröffentlicht: (2026)
von: Wang, Yilong, et al.
Veröffentlicht: (2026)
HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization
von: Wang, Haolan, et al.
Veröffentlicht: (2025)
von: Wang, Haolan, et al.
Veröffentlicht: (2025)
DiffPO: Diffusion-styled Preference Optimization for Efficient Inference-Time Alignment of Large Language Models
von: Chen, Ruizhe, et al.
Veröffentlicht: (2025)
von: Chen, Ruizhe, et al.
Veröffentlicht: (2025)
Enhancing Knowledge Distillation of Large Language Models through Efficient Multi-Modal Distribution Alignment
von: Peng, Tianyu, et al.
Veröffentlicht: (2024)
von: Peng, Tianyu, et al.
Veröffentlicht: (2024)
Aligning Large Language Models with Searcher Preferences
von: Wu, Wei, et al.
Veröffentlicht: (2026)
von: Wu, Wei, et al.
Veröffentlicht: (2026)
Self-Play Preference Optimization for Language Model Alignment
von: Wu, Yue, et al.
Veröffentlicht: (2024)
von: Wu, Yue, et al.
Veröffentlicht: (2024)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
von: Pi, Renjie, et al.
Veröffentlicht: (2024)
von: Pi, Renjie, et al.
Veröffentlicht: (2024)
Self-Boosting Large Language Models with Synthetic Preference Data
von: Dong, Qingxiu, et al.
Veröffentlicht: (2024)
von: Dong, Qingxiu, et al.
Veröffentlicht: (2024)
GENUINE: Graph Enhanced Multi-level Uncertainty Estimation for Large Language Models
von: Wang, Tuo, et al.
Veröffentlicht: (2025)
von: Wang, Tuo, et al.
Veröffentlicht: (2025)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
von: Wang, Fei, et al.
Veröffentlicht: (2024)
von: Wang, Fei, et al.
Veröffentlicht: (2024)
Mitigating Judgment Preference Bias in Large Language Models through Group-Based Polling
von: Liu, Shuliang, et al.
Veröffentlicht: (2025)
von: Liu, Shuliang, et al.
Veröffentlicht: (2025)
Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models
von: Singh, Joykirat, et al.
Veröffentlicht: (2025)
von: Singh, Joykirat, et al.
Veröffentlicht: (2025)
Users as Annotators: LLM Preference Learning from Comparison Mode
von: Cai, Zhongze, et al.
Veröffentlicht: (2025)
von: Cai, Zhongze, et al.
Veröffentlicht: (2025)
From Implicit to Explicit: Enhancing Self-Recognition in Large Language Models
von: Zhou, Yinghan, et al.
Veröffentlicht: (2025)
von: Zhou, Yinghan, et al.
Veröffentlicht: (2025)
Enhancing Self-Correction in Large Language Models through Multi-Perspective Reflection
von: Costa, Mariana, et al.
Veröffentlicht: (2026)
von: Costa, Mariana, et al.
Veröffentlicht: (2026)
Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop
von: Wang, Yaxuan, et al.
Veröffentlicht: (2026)
von: Wang, Yaxuan, et al.
Veröffentlicht: (2026)
Ensemble Learning for Heterogeneous Large Language Models with Deep Parallel Collaboration
von: Huang, Yichong, et al.
Veröffentlicht: (2024)
von: Huang, Yichong, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
TrendFact: A Benchmark for Explainable Hotspot Perception in Fact-Checking with Natural Language Explanation
von: Zhang, Xiaocheng, et al.
Veröffentlicht: (2024) -
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
von: Xiang, Hao, et al.
Veröffentlicht: (2024) -
Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich Languages
von: Zhang, Yuanchi, et al.
Veröffentlicht: (2024) -
InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models
von: Gu, Yanggan, et al.
Veröffentlicht: (2025) -
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
von: Li, Jian, et al.
Veröffentlicht: (2024)