Self-Evolutionary Large Language Models through Uncertainty-Enhanced Preference Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Jianing, Zhou, Yang, Zhang, Xiaocheng, Bao, Mengjiao, Yan, Peng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TrendFact: A Benchmark for Explainable Hotspot Perception in Fact-Checking with Natural Language Explanation
di: Zhang, Xiaocheng, et al.
Pubblicazione: (2024)
di: Zhang, Xiaocheng, et al.
Pubblicazione: (2024)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
di: Xiang, Hao, et al.
Pubblicazione: (2024)
di: Xiang, Hao, et al.
Pubblicazione: (2024)
Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich Languages
di: Zhang, Yuanchi, et al.
Pubblicazione: (2024)
di: Zhang, Yuanchi, et al.
Pubblicazione: (2024)
InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models
di: Gu, Yanggan, et al.
Pubblicazione: (2025)
di: Gu, Yanggan, et al.
Pubblicazione: (2025)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
di: Li, Jian, et al.
Pubblicazione: (2024)
di: Li, Jian, et al.
Pubblicazione: (2024)
Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models
di: Zhang, Huatian, et al.
Pubblicazione: (2026)
di: Zhang, Huatian, et al.
Pubblicazione: (2026)
Topology-Enhanced Alignment for Large Language Models: Trajectory Topology Loss and Topological Preference Optimization
di: Pan, Yurui, et al.
Pubblicazione: (2026)
di: Pan, Yurui, et al.
Pubblicazione: (2026)
Advancing Large Language Model Attribution through Self-Improving
di: Huang, Lei, et al.
Pubblicazione: (2024)
di: Huang, Lei, et al.
Pubblicazione: (2024)
Dynamic Noise Preference Optimization: Self-Improvement of Large Language Models with Self-Synthetic Data
di: Yang, Haoyan, et al.
Pubblicazione: (2025)
di: Yang, Haoyan, et al.
Pubblicazione: (2025)
Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoning
di: Wang, Jianing, et al.
Pubblicazione: (2025)
di: Wang, Jianing, et al.
Pubblicazione: (2025)
Large Language Model for Multi-objective Evolutionary Optimization
di: Liu, Fei, et al.
Pubblicazione: (2023)
di: Liu, Fei, et al.
Pubblicazione: (2023)
Uncertainty is Fragile: Manipulating Uncertainty in Large Language Models
di: Zeng, Qingcheng, et al.
Pubblicazione: (2024)
di: Zeng, Qingcheng, et al.
Pubblicazione: (2024)
Weights-Rotated Preference Optimization for Large Language Models
di: Yang, Chenxu, et al.
Pubblicazione: (2025)
di: Yang, Chenxu, et al.
Pubblicazione: (2025)
InstructGraph: Boosting Large Language Models via Graph-centric Instruction Tuning and Preference Alignment
di: Wang, Jianing, et al.
Pubblicazione: (2024)
di: Wang, Jianing, et al.
Pubblicazione: (2024)
Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling
di: Hou, Bairu, et al.
Pubblicazione: (2023)
di: Hou, Bairu, et al.
Pubblicazione: (2023)
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)
Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment
di: Yin, Yueqin, et al.
Pubblicazione: (2024)
di: Yin, Yueqin, et al.
Pubblicazione: (2024)
Aligning Large Language Models with Human Preferences through Representation Engineering
di: Liu, Wenhao, et al.
Pubblicazione: (2023)
di: Liu, Wenhao, et al.
Pubblicazione: (2023)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
Enhancing Non-English Capabilities of English-Centric Large Language Models through Deep Supervision Fine-Tuning
di: Huo, Wenshuai, et al.
Pubblicazione: (2025)
di: Huo, Wenshuai, et al.
Pubblicazione: (2025)
Preference-Oriented Supervised Fine-Tuning: Favoring Target Model Over Aligned Large Language Models
di: Fan, Yuchen, et al.
Pubblicazione: (2024)
di: Fan, Yuchen, et al.
Pubblicazione: (2024)
Preference Packing: Efficient Preference Optimization for Large Language Models
di: Cho, Jaekyung
Pubblicazione: (2026)
di: Cho, Jaekyung
Pubblicazione: (2026)
Reasoning Strategies in Large Language Models: Can They Follow, Prefer, and Optimize?
di: Zhang, Yanjian, et al.
Pubblicazione: (2025)
di: Zhang, Yanjian, et al.
Pubblicazione: (2025)
Enhancing Multilingual Counterfactual Generation through Alignment-as-Preference Optimization
di: Wang, Yilong, et al.
Pubblicazione: (2026)
di: Wang, Yilong, et al.
Pubblicazione: (2026)
HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization
di: Wang, Haolan, et al.
Pubblicazione: (2025)
di: Wang, Haolan, et al.
Pubblicazione: (2025)
DiffPO: Diffusion-styled Preference Optimization for Efficient Inference-Time Alignment of Large Language Models
di: Chen, Ruizhe, et al.
Pubblicazione: (2025)
di: Chen, Ruizhe, et al.
Pubblicazione: (2025)
Enhancing Knowledge Distillation of Large Language Models through Efficient Multi-Modal Distribution Alignment
di: Peng, Tianyu, et al.
Pubblicazione: (2024)
di: Peng, Tianyu, et al.
Pubblicazione: (2024)
Aligning Large Language Models with Searcher Preferences
di: Wu, Wei, et al.
Pubblicazione: (2026)
di: Wu, Wei, et al.
Pubblicazione: (2026)
Self-Play Preference Optimization for Language Model Alignment
di: Wu, Yue, et al.
Pubblicazione: (2024)
di: Wu, Yue, et al.
Pubblicazione: (2024)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
di: Pi, Renjie, et al.
Pubblicazione: (2024)
di: Pi, Renjie, et al.
Pubblicazione: (2024)
Self-Boosting Large Language Models with Synthetic Preference Data
di: Dong, Qingxiu, et al.
Pubblicazione: (2024)
di: Dong, Qingxiu, et al.
Pubblicazione: (2024)
GENUINE: Graph Enhanced Multi-level Uncertainty Estimation for Large Language Models
di: Wang, Tuo, et al.
Pubblicazione: (2025)
di: Wang, Tuo, et al.
Pubblicazione: (2025)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
di: Wang, Fei, et al.
Pubblicazione: (2024)
di: Wang, Fei, et al.
Pubblicazione: (2024)
Mitigating Judgment Preference Bias in Large Language Models through Group-Based Polling
di: Liu, Shuliang, et al.
Pubblicazione: (2025)
di: Liu, Shuliang, et al.
Pubblicazione: (2025)
Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models
di: Singh, Joykirat, et al.
Pubblicazione: (2025)
di: Singh, Joykirat, et al.
Pubblicazione: (2025)
Users as Annotators: LLM Preference Learning from Comparison Mode
di: Cai, Zhongze, et al.
Pubblicazione: (2025)
di: Cai, Zhongze, et al.
Pubblicazione: (2025)
From Implicit to Explicit: Enhancing Self-Recognition in Large Language Models
di: Zhou, Yinghan, et al.
Pubblicazione: (2025)
di: Zhou, Yinghan, et al.
Pubblicazione: (2025)
Enhancing Self-Correction in Large Language Models through Multi-Perspective Reflection
di: Costa, Mariana, et al.
Pubblicazione: (2026)
di: Costa, Mariana, et al.
Pubblicazione: (2026)
Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop
di: Wang, Yaxuan, et al.
Pubblicazione: (2026)
di: Wang, Yaxuan, et al.
Pubblicazione: (2026)
Ensemble Learning for Heterogeneous Large Language Models with Deep Parallel Collaboration
di: Huang, Yichong, et al.
Pubblicazione: (2024)
di: Huang, Yichong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
TrendFact: A Benchmark for Explainable Hotspot Perception in Fact-Checking with Natural Language Explanation
di: Zhang, Xiaocheng, et al.
Pubblicazione: (2024) -
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
di: Xiang, Hao, et al.
Pubblicazione: (2024) -
Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich Languages
di: Zhang, Yuanchi, et al.
Pubblicazione: (2024) -
InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models
di: Gu, Yanggan, et al.
Pubblicazione: (2025) -
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
di: Li, Jian, et al.
Pubblicazione: (2024)