Towards Efficient Exact Optimization of Language Model Alignment
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ji, Haozhe, Lu, Cheng, Niu, Yilin, Ke, Pei, Wang, Hongning, Zhu, Jun, Tang, Jie, Huang, Minlie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Language Model Decoding as Direct Metrics Optimization
von: Ji, Haozhe, et al.
Veröffentlicht: (2023)
von: Ji, Haozhe, et al.
Veröffentlicht: (2023)
Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
von: Cheng, Jiale, et al.
Veröffentlicht: (2023)
von: Cheng, Jiale, et al.
Veröffentlicht: (2023)
AutoDetect: Towards a Unified Framework for Automated Weakness Detection in Large Language Models
von: Cheng, Jiale, et al.
Veröffentlicht: (2024)
von: Cheng, Jiale, et al.
Veröffentlicht: (2024)
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
von: Wen, Bosi, et al.
Veröffentlicht: (2026)
von: Wen, Bosi, et al.
Veröffentlicht: (2026)
IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation
von: Wen, Bosi, et al.
Veröffentlicht: (2025)
von: Wen, Bosi, et al.
Veröffentlicht: (2025)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
von: Zhang, Zhexin, et al.
Veröffentlicht: (2023)
von: Zhang, Zhexin, et al.
Veröffentlicht: (2023)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
von: Ke, Pei, et al.
Veröffentlicht: (2023)
von: Ke, Pei, et al.
Veröffentlicht: (2023)
Learning Task Decomposition to Assist Humans in Competitive Programming
von: Wen, Jiaxin, et al.
Veröffentlicht: (2024)
von: Wen, Jiaxin, et al.
Veröffentlicht: (2024)
ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback
von: Hou, Zhenyu, et al.
Veröffentlicht: (2024)
von: Hou, Zhenyu, et al.
Veröffentlicht: (2024)
The Superalignment of Superhuman Intelligence with Large Language Models
von: Huang, Minlie, et al.
Veröffentlicht: (2024)
von: Huang, Minlie, et al.
Veröffentlicht: (2024)
Does RLHF Scale? Exploring the Impacts From Data, Model, and Method
von: Hou, Zhenyu, et al.
Veröffentlicht: (2024)
von: Hou, Zhenyu, et al.
Veröffentlicht: (2024)
HPSS: Heuristic Prompting Strategy Search for LLM Evaluators
von: Wen, Bosi, et al.
Veröffentlicht: (2025)
von: Wen, Bosi, et al.
Veröffentlicht: (2025)
LongSafety: Evaluating Long-Context Safety of Large Language Models
von: Lu, Yida, et al.
Veröffentlicht: (2025)
von: Lu, Yida, et al.
Veröffentlicht: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
von: Gui, Jiayi, et al.
Veröffentlicht: (2024)
von: Gui, Jiayi, et al.
Veröffentlicht: (2024)
Unlocking Reasoning Potential in Large Langauge Models by Scaling Code-form Planning
von: Wen, Jiaxin, et al.
Veröffentlicht: (2024)
von: Wen, Jiaxin, et al.
Veröffentlicht: (2024)
SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models
von: Cheng, Jiale, et al.
Veröffentlicht: (2024)
von: Cheng, Jiale, et al.
Veröffentlicht: (2024)
Data Selection via Optimal Control for Language Models
von: Gu, Yuxian, et al.
Veröffentlicht: (2024)
von: Gu, Yuxian, et al.
Veröffentlicht: (2024)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
von: Feng, Andrew Zhuoer, et al.
Veröffentlicht: (2026)
von: Feng, Andrew Zhuoer, et al.
Veröffentlicht: (2026)
HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
von: Feng, Andrew Zhuoer, et al.
Veröffentlicht: (2026)
von: Feng, Andrew Zhuoer, et al.
Veröffentlicht: (2026)
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
von: Zhang, Zhexin, et al.
Veröffentlicht: (2024)
von: Zhang, Zhexin, et al.
Veröffentlicht: (2024)
VPO: Aligning Text-to-Video Generation Models with Prompt Optimization
von: Cheng, Jiale, et al.
Veröffentlicht: (2025)
von: Cheng, Jiale, et al.
Veröffentlicht: (2025)
Model Extrapolation Expedites Alignment
von: Zheng, Chujie, et al.
Veröffentlicht: (2024)
von: Zheng, Chujie, et al.
Veröffentlicht: (2024)
SLAM: Towards Efficient Multilingual Reasoning via Selective Language Alignment
von: Fan, Yuchun, et al.
Veröffentlicht: (2025)
von: Fan, Yuchun, et al.
Veröffentlicht: (2025)
CharacterBench: Benchmarking Character Customization of Large Language Models
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2024)
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2024)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
von: Zhang, Zhexin, et al.
Veröffentlicht: (2024)
von: Zhang, Zhexin, et al.
Veröffentlicht: (2024)
AMOR: A Recipe for Building Adaptable Modular Knowledge Agents Through Process Feedback
von: Guan, Jian, et al.
Veröffentlicht: (2024)
von: Guan, Jian, et al.
Veröffentlicht: (2024)
ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectors
von: Zhang, Zhexin, et al.
Veröffentlicht: (2024)
von: Zhang, Zhexin, et al.
Veröffentlicht: (2024)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
von: Yang, Junxiao, et al.
Veröffentlicht: (2026)
von: Yang, Junxiao, et al.
Veröffentlicht: (2026)
Towards Optimal Learning of Language Models
von: Gu, Yuxian, et al.
Veröffentlicht: (2024)
von: Gu, Yuxian, et al.
Veröffentlicht: (2024)
SocialSim: Towards Socialized Simulation of Emotional Support Conversation
von: Chen, Zhuang, et al.
Veröffentlicht: (2025)
von: Chen, Zhuang, et al.
Veröffentlicht: (2025)
Think Socially via Cognitive Reasoning
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2025)
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2025)
Training Language Model to Critique for Better Refinement
von: Yu, Tianshu, et al.
Veröffentlicht: (2025)
von: Yu, Tianshu, et al.
Veröffentlicht: (2025)
Large Language Models Are Not Robust Multiple Choice Selectors
von: Zheng, Chujie, et al.
Veröffentlicht: (2023)
von: Zheng, Chujie, et al.
Veröffentlicht: (2023)
MiniPLM: Knowledge Distillation for Pre-Training Language Models
von: Gu, Yuxian, et al.
Veröffentlicht: (2024)
von: Gu, Yuxian, et al.
Veröffentlicht: (2024)
Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen!
von: Zhang, Zhexin, et al.
Veröffentlicht: (2025)
von: Zhang, Zhexin, et al.
Veröffentlicht: (2025)
Benchmarking Complex Instruction-Following with Multiple Constraints Composition
von: Wen, Bosi, et al.
Veröffentlicht: (2024)
von: Wen, Bosi, et al.
Veröffentlicht: (2024)
Perception of Knowledge Boundary for Large Language Models through Semi-open-ended Question Answering
von: Wen, Zhihua, et al.
Veröffentlicht: (2024)
von: Wen, Zhihua, et al.
Veröffentlicht: (2024)
Alignment for Efficient Tool Calling of Large Language Models
von: Xu, Hongshen, et al.
Veröffentlicht: (2025)
von: Xu, Hongshen, et al.
Veröffentlicht: (2025)
Not Everything is All You Need: Toward Low-Redundant Optimization for Large Language Model Alignment
von: Chen, Zhipeng, et al.
Veröffentlicht: (2024)
von: Chen, Zhipeng, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Language Model Decoding as Direct Metrics Optimization
von: Ji, Haozhe, et al.
Veröffentlicht: (2023) -
Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
von: Cheng, Jiale, et al.
Veröffentlicht: (2023) -
AutoDetect: Towards a Unified Framework for Automated Weakness Detection in Large Language Models
von: Cheng, Jiale, et al.
Veröffentlicht: (2024) -
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
von: Wen, Bosi, et al.
Veröffentlicht: (2026) -
IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation
von: Wen, Bosi, et al.
Veröffentlicht: (2025)