Post-training Large Language Models for Diverse High-Quality Responses
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Yilei, Chakraborty, Souradip, Wolf, Lorenz, Paschalidis, Yannis, Pacchiano, Aldo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
When Less is Enough: Efficient Inference via Collaborative Reasoning
von: Chen, Yilei, et al.
Veröffentlicht: (2026)
von: Chen, Yilei, et al.
Veröffentlicht: (2026)
Active Preference Optimization for Sample Efficient RLHF
von: Das, Nirjhar, et al.
Veröffentlicht: (2024)
von: Das, Nirjhar, et al.
Veröffentlicht: (2024)
Multiple-policy Evaluation via Density Estimation
von: Chen, Yilei, et al.
Veröffentlicht: (2024)
von: Chen, Yilei, et al.
Veröffentlicht: (2024)
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
von: Lin, Xiaofeng, et al.
Veröffentlicht: (2026)
von: Lin, Xiaofeng, et al.
Veröffentlicht: (2026)
A Survey on Post-training of Large Language Models
von: Tie, Guiyao, et al.
Veröffentlicht: (2025)
von: Tie, Guiyao, et al.
Veröffentlicht: (2025)
Provable Interactive Learning with Hindsight Instruction Feedback
von: Misra, Dipendra, et al.
Veröffentlicht: (2024)
von: Misra, Dipendra, et al.
Veröffentlicht: (2024)
SAIL: Self-Improving Efficient Online Alignment of Large Language Models
von: Ding, Mucong, et al.
Veröffentlicht: (2024)
von: Ding, Mucong, et al.
Veröffentlicht: (2024)
Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward
von: Misra, Dipendra, et al.
Veröffentlicht: (2026)
von: Misra, Dipendra, et al.
Veröffentlicht: (2026)
Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away
von: Ghosal, Soumya Suvra, et al.
Veröffentlicht: (2026)
von: Ghosal, Soumya Suvra, et al.
Veröffentlicht: (2026)
Aggressive Post-Training Compression on Extremely Large Language Models
von: Zhang, Zining, et al.
Veröffentlicht: (2024)
von: Zhang, Zining, et al.
Veröffentlicht: (2024)
Cognitively Diverse Multiple-Choice Question Generation: A Hybrid Multi-Agent Framework with Large Language Models
von: Tian, Yu, et al.
Veröffentlicht: (2026)
von: Tian, Yu, et al.
Veröffentlicht: (2026)
Simul-LLM: A Framework for Exploring High-Quality Simultaneous Translation with Large Language Models
von: Agostinelli, Victor, et al.
Veröffentlicht: (2023)
von: Agostinelli, Victor, et al.
Veröffentlicht: (2023)
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
von: Tao, Yongding, et al.
Veröffentlicht: (2025)
von: Tao, Yongding, et al.
Veröffentlicht: (2025)
CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering
von: Chen, Baicheng, et al.
Veröffentlicht: (2026)
von: Chen, Baicheng, et al.
Veröffentlicht: (2026)
MaxMin-RLHF: Alignment with Diverse Human Preferences
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2024)
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2024)
Pragyaan: Designing and Curating High-Quality Cultural Post-Training Datasets for Indian Languages
von: Rachamalla, Neel Prabhanjan, et al.
Veröffentlicht: (2025)
von: Rachamalla, Neel Prabhanjan, et al.
Veröffentlicht: (2025)
Multi-hop Question Answering over Knowledge Graphs using Large Language Models
von: Chakraborty, Abir
Veröffentlicht: (2024)
von: Chakraborty, Abir
Veröffentlicht: (2024)
Sparsity Induction for Accurate Post-Training Pruning of Large Language Models
von: Jiang, Minhao, et al.
Veröffentlicht: (2026)
von: Jiang, Minhao, et al.
Veröffentlicht: (2026)
This Is Your Doge, If It Please You: Exploring Deception and Robustness in Mixture of LLMs
von: Wolf, Lorenz, et al.
Veröffentlicht: (2025)
von: Wolf, Lorenz, et al.
Veröffentlicht: (2025)
LLMatic: Neural Architecture Search via Large Language Models and Quality Diversity Optimization
von: Nasir, Muhammad U., et al.
Veröffentlicht: (2023)
von: Nasir, Muhammad U., et al.
Veröffentlicht: (2023)
Reward Model Overoptimisation in Iterated RLHF
von: Wolf, Lorenz, et al.
Veröffentlicht: (2025)
von: Wolf, Lorenz, et al.
Veröffentlicht: (2025)
Semantic-guided Diverse Decoding for Large Language Model
von: Shi, Weijie, et al.
Veröffentlicht: (2025)
von: Shi, Weijie, et al.
Veröffentlicht: (2025)
Fundamental Limitations of Alignment in Large Language Models
von: Wolf, Yotam, et al.
Veröffentlicht: (2023)
von: Wolf, Yotam, et al.
Veröffentlicht: (2023)
Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models
von: Havrilla, Alex, et al.
Veröffentlicht: (2024)
von: Havrilla, Alex, et al.
Veröffentlicht: (2024)
Uncertainty Quantification of Large Language Models through Multi-Dimensional Responses
von: Chen, Tiejin, et al.
Veröffentlicht: (2025)
von: Chen, Tiejin, et al.
Veröffentlicht: (2025)
Pre-trained Large Language Models for Financial Sentiment Analysis
von: Luo, Wei, et al.
Veröffentlicht: (2024)
von: Luo, Wei, et al.
Veröffentlicht: (2024)
Spike No More: Stabilizing the Pre-training of Large Language Models
von: Takase, Sho, et al.
Veröffentlicht: (2023)
von: Takase, Sho, et al.
Veröffentlicht: (2023)
Lost in the Source Language: How Large Language Models Evaluate the Quality of Machine Translation
von: Huang, Xu, et al.
Veröffentlicht: (2024)
von: Huang, Xu, et al.
Veröffentlicht: (2024)
Fluent Alignment with Disfluent Judges: Post-training for Lower-resource Languages
von: Samuel, David, et al.
Veröffentlicht: (2025)
von: Samuel, David, et al.
Veröffentlicht: (2025)
Challenges and Responses in the Practice of Large Language Models
von: Zhu, Hongyin
Veröffentlicht: (2024)
von: Zhu, Hongyin
Veröffentlicht: (2024)
Compositional Hardness of Code in Large Language Models -- A Probabilistic Perspective
von: Wolf, Yotam, et al.
Veröffentlicht: (2024)
von: Wolf, Yotam, et al.
Veröffentlicht: (2024)
DFlow: Diverse Dialogue Flow Simulation with Large Language Models
von: Du, Wanyu, et al.
Veröffentlicht: (2024)
von: Du, Wanyu, et al.
Veröffentlicht: (2024)
Code Comprehension then Auditing for Unsupervised LLM Evaluation
von: Patel, Bhrij, et al.
Veröffentlicht: (2024)
von: Patel, Bhrij, et al.
Veröffentlicht: (2024)
Towards Tracing Trustworthiness Dynamics: Revisiting Pre-training Period of Large Language Models
von: Qian, Chen, et al.
Veröffentlicht: (2024)
von: Qian, Chen, et al.
Veröffentlicht: (2024)
DataMan: Data Manager for Pre-training Large Language Models
von: Peng, Ru, et al.
Veröffentlicht: (2025)
von: Peng, Ru, et al.
Veröffentlicht: (2025)
Understanding Data Temporality Impact on Large Language Models Pre-training
von: Pilchen, Hippolyte, et al.
Veröffentlicht: (2026)
von: Pilchen, Hippolyte, et al.
Veröffentlicht: (2026)
Towards Retrieval Augmented Generation over Large Video Libraries
von: Tevissen, Yannis, et al.
Veröffentlicht: (2024)
von: Tevissen, Yannis, et al.
Veröffentlicht: (2024)
Tracing the Representation Geometry of Language Models from Pretraining to Post-training
von: Li, Melody Zixuan, et al.
Veröffentlicht: (2025)
von: Li, Melody Zixuan, et al.
Veröffentlicht: (2025)
Efficient Post-Training Refinement of Latent Reasoning in Large Language Models
von: Wang, Xinyuan, et al.
Veröffentlicht: (2025)
von: Wang, Xinyuan, et al.
Veröffentlicht: (2025)
Typhoon-S: Minimal Open Post-Training for Sovereign Large Language Models
von: Pipatanakul, Kunat, et al.
Veröffentlicht: (2026)
von: Pipatanakul, Kunat, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
When Less is Enough: Efficient Inference via Collaborative Reasoning
von: Chen, Yilei, et al.
Veröffentlicht: (2026) -
Active Preference Optimization for Sample Efficient RLHF
von: Das, Nirjhar, et al.
Veröffentlicht: (2024) -
Multiple-policy Evaluation via Density Estimation
von: Chen, Yilei, et al.
Veröffentlicht: (2024) -
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
von: Lin, Xiaofeng, et al.
Veröffentlicht: (2026) -
A Survey on Post-training of Large Language Models
von: Tie, Guiyao, et al.
Veröffentlicht: (2025)