Salvato in:
| Autori principali: | Bao, Rong, Zheng, Rui, Dou, Shihan, Wang, Xiao, Zhou, Enyu, Wang, Bo, Zhang, Qi, Ding, Liang, Tao, Dacheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2406.11190 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
Uncertainty Aware Learning for Language Model Alignment
di: Wang, Yikun, et al.
Pubblicazione: (2024)
di: Wang, Yikun, et al.
Pubblicazione: (2024)
Linear Alignment: A Closed-form Solution for Aligning Human Preferences without Tuning and Feedback
di: Gao, Songyang, et al.
Pubblicazione: (2024)
di: Gao, Songyang, et al.
Pubblicazione: (2024)
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
di: Zhou, Enyu, et al.
Pubblicazione: (2024)
di: Zhou, Enyu, et al.
Pubblicazione: (2024)
OOP: Object-Oriented Programming Evaluation Benchmark for Large Language Models
di: Wang, Shuai, et al.
Pubblicazione: (2024)
di: Wang, Shuai, et al.
Pubblicazione: (2024)
LoRAMoE: Alleviate World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
di: Dou, Shihan, et al.
Pubblicazione: (2023)
di: Dou, Shihan, et al.
Pubblicazione: (2023)
Better, Faster: Harnessing Self-Improvement in Large Reasoning Models
di: Zhong, Qihuang, et al.
Pubblicazione: (2026)
di: Zhong, Qihuang, et al.
Pubblicazione: (2026)
E2S2: Encoding-Enhanced Sequence-to-Sequence Pretraining for Language Understanding and Generation
di: Zhong, Qihuang, et al.
Pubblicazione: (2022)
di: Zhong, Qihuang, et al.
Pubblicazione: (2022)
ROSE Doesn't Do That: Boosting the Safety of Instruction-Tuned Large Language Models with Reverse Prompt Contrastive Decoding
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
Revisiting Catastrophic Forgetting in Large Language Model Tuning
di: Li, Hongyu, et al.
Pubblicazione: (2024)
di: Li, Hongyu, et al.
Pubblicazione: (2024)
Reason-KE++: Aligning the Process, Not Just the Outcome, for Faithful LLM Knowledge Editing
di: Wu, Yuchen, et al.
Pubblicazione: (2025)
di: Wu, Yuchen, et al.
Pubblicazione: (2025)
Steering LLMs via Scalable Interactive Oversight
di: Zhou, Enyu, et al.
Pubblicazione: (2026)
di: Zhou, Enyu, et al.
Pubblicazione: (2026)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
di: Lv, Huijie, et al.
Pubblicazione: (2024)
di: Lv, Huijie, et al.
Pubblicazione: (2024)
Internal Consistency and Self-Feedback in Large Language Models: A Survey
di: Liang, Xun, et al.
Pubblicazione: (2024)
di: Liang, Xun, et al.
Pubblicazione: (2024)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
MetaRM: Shifted Distributions Alignment via Meta-Learning
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling
di: Miao, Yuchun, et al.
Pubblicazione: (2024)
di: Miao, Yuchun, et al.
Pubblicazione: (2024)
Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking
di: Miao, Yuchun, et al.
Pubblicazione: (2025)
di: Miao, Yuchun, et al.
Pubblicazione: (2025)
Entropy-Guided Watermarking for LLMs: A Test-Time Framework for Robust and Traceable Text Generation
di: Cai, Shizhan, et al.
Pubblicazione: (2025)
di: Cai, Shizhan, et al.
Pubblicazione: (2025)
Review of Hallucination Understanding in Large Language and Vision Models
di: Ho, Zhengyi, et al.
Pubblicazione: (2025)
di: Ho, Zhengyi, et al.
Pubblicazione: (2025)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
di: Dou, Shihan, et al.
Pubblicazione: (2025)
di: Dou, Shihan, et al.
Pubblicazione: (2025)
A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations
di: Ye, Mang, et al.
Pubblicazione: (2025)
di: Ye, Mang, et al.
Pubblicazione: (2025)
What's Wrong with Your Code Generated by Large Language Models? An Extensive Study
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
Self-Powered LLM Modality Expansion for Large Speech-Text Models
di: Yu, Tengfei, et al.
Pubblicazione: (2024)
di: Yu, Tengfei, et al.
Pubblicazione: (2024)
Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training
di: Zhong, Qihuang, et al.
Pubblicazione: (2026)
di: Zhong, Qihuang, et al.
Pubblicazione: (2026)
ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback
di: Hou, Zhenyu, et al.
Pubblicazione: (2024)
di: Hou, Zhenyu, et al.
Pubblicazione: (2024)
Fairness Mediator: Neutralize Stereotype Associations to Mitigate Bias in Large Language Models
di: Xiao, Yisong, et al.
Pubblicazione: (2025)
di: Xiao, Yisong, et al.
Pubblicazione: (2025)
Revisiting Knowledge Distillation for Autoregressive Language Models
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
Visual Superordinate Abstraction for Robust Concept Learning
di: Zheng, Qi, et al.
Pubblicazione: (2022)
di: Zheng, Qi, et al.
Pubblicazione: (2022)
RL from Physical Feedback: Aligning Large Motion Models with Humanoid Control
di: Yue, Junpeng, et al.
Pubblicazione: (2025)
di: Yue, Junpeng, et al.
Pubblicazione: (2025)
Secrets of RLHF in Large Language Models Part II: Reward Modeling
di: Wang, Binghai, et al.
Pubblicazione: (2024)
di: Wang, Binghai, et al.
Pubblicazione: (2024)
A Critical Evaluation of AI Feedback for Aligning Large Language Models
di: Sharma, Archit, et al.
Pubblicazione: (2024)
di: Sharma, Archit, et al.
Pubblicazione: (2024)
ESceme: Vision-and-Language Navigation with Episodic Scene Memory
di: Zheng, Qi, et al.
Pubblicazione: (2023)
di: Zheng, Qi, et al.
Pubblicazione: (2023)
Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective
di: Li, Tianlong, et al.
Pubblicazione: (2024)
di: Li, Tianlong, et al.
Pubblicazione: (2024)
SAIL: Self-Amplified Iterative Learning for Diffusion Model Alignment with Minimal Human Feedback
di: He, Xiaoxuan, et al.
Pubblicazione: (2026)
di: He, Xiaoxuan, et al.
Pubblicazione: (2026)
Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models
di: Wang, Wenbin, et al.
Pubblicazione: (2024)
di: Wang, Wenbin, et al.
Pubblicazione: (2024)
Learning from Imperfect Data: Towards Efficient Knowledge Distillation of Autoregressive Language Models for Text-to-SQL
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
di: Zhong, Qihuang, et al.
Pubblicazione: (2024)
Error Analysis Prompting Enables Human-Like Translation Evaluation in Large Language Models
di: Lu, Qingyu, et al.
Pubblicazione: (2023)
di: Lu, Qingyu, et al.
Pubblicazione: (2023)
NoVo: Norm Voting off Hallucinations with Attention Heads in Large Language Models
di: Ho, Zheng Yi, et al.
Pubblicazione: (2024)
di: Ho, Zheng Yi, et al.
Pubblicazione: (2024)
$\mathbb{USCD}$: Improving Code Generation of LLMs by Uncertainty-Aware Selective Contrastive Decoding
di: Wang, Shuai, et al.
Pubblicazione: (2024)
di: Wang, Shuai, et al.
Pubblicazione: (2024)
Documenti analoghi
-
StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback
di: Dou, Shihan, et al.
Pubblicazione: (2024) -
Uncertainty Aware Learning for Language Model Alignment
di: Wang, Yikun, et al.
Pubblicazione: (2024) -
Linear Alignment: A Closed-form Solution for Aligning Human Preferences without Tuning and Feedback
di: Gao, Songyang, et al.
Pubblicazione: (2024) -
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
di: Zhou, Enyu, et al.
Pubblicazione: (2024) -
OOP: Object-Oriented Programming Evaluation Benchmark for Large Language Models
di: Wang, Shuai, et al.
Pubblicazione: (2024)