Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Jiale, Liu, Xiao, Zheng, Kehan, Ke, Pei, Wang, Hongning, Dong, Yuxiao, Tang, Jie, Huang, Minlie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AutoDetect: Towards a Unified Framework for Automated Weakness Detection in Large Language Models
por: Cheng, Jiale, et al.
Publicado: (2024)
por: Cheng, Jiale, et al.
Publicado: (2024)
VPO: Aligning Text-to-Video Generation Models with Prompt Optimization
por: Cheng, Jiale, et al.
Publicado: (2025)
por: Cheng, Jiale, et al.
Publicado: (2025)
Language Model Decoding as Direct Metrics Optimization
por: Ji, Haozhe, et al.
Publicado: (2023)
por: Ji, Haozhe, et al.
Publicado: (2023)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
por: Gui, Jiayi, et al.
Publicado: (2024)
por: Gui, Jiayi, et al.
Publicado: (2024)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
por: Ke, Pei, et al.
Publicado: (2023)
por: Ke, Pei, et al.
Publicado: (2023)
ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback
por: Hou, Zhenyu, et al.
Publicado: (2024)
por: Hou, Zhenyu, et al.
Publicado: (2024)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
por: Liu, Xiao, et al.
Publicado: (2023)
por: Liu, Xiao, et al.
Publicado: (2023)
LongSafety: Evaluating Long-Context Safety of Large Language Models
por: Lu, Yida, et al.
Publicado: (2025)
por: Lu, Yida, et al.
Publicado: (2025)
Towards Efficient Exact Optimization of Language Model Alignment
por: Ji, Haozhe, et al.
Publicado: (2024)
por: Ji, Haozhe, et al.
Publicado: (2024)
SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models
por: Cheng, Jiale, et al.
Publicado: (2024)
por: Cheng, Jiale, et al.
Publicado: (2024)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
por: Zhang, Zhexin, et al.
Publicado: (2023)
por: Zhang, Zhexin, et al.
Publicado: (2023)
The Superalignment of Superhuman Intelligence with Large Language Models
por: Huang, Minlie, et al.
Publicado: (2024)
por: Huang, Minlie, et al.
Publicado: (2024)
Inference-Aware Prompt Optimization for Aligning Black-Box Large Language Models
por: Mahmud, Saaduddin, et al.
Publicado: (2025)
por: Mahmud, Saaduddin, et al.
Publicado: (2025)
HPSS: Heuristic Prompting Strategy Search for LLM Evaluators
por: Wen, Bosi, et al.
Publicado: (2025)
por: Wen, Bosi, et al.
Publicado: (2025)
Training Language Model to Critique for Better Refinement
por: Yu, Tianshu, et al.
Publicado: (2025)
por: Yu, Tianshu, et al.
Publicado: (2025)
Does RLHF Scale? Exploring the Impacts From Data, Model, and Method
por: Hou, Zhenyu, et al.
Publicado: (2024)
por: Hou, Zhenyu, et al.
Publicado: (2024)
Learning Task Decomposition to Assist Humans in Competitive Programming
por: Wen, Jiaxin, et al.
Publicado: (2024)
por: Wen, Jiaxin, et al.
Publicado: (2024)
Data Selection via Optimal Control for Language Models
por: Gu, Yuxian, et al.
Publicado: (2024)
por: Gu, Yuxian, et al.
Publicado: (2024)
Unlocking Reasoning Potential in Large Langauge Models by Scaling Code-form Planning
por: Wen, Jiaxin, et al.
Publicado: (2024)
por: Wen, Jiaxin, et al.
Publicado: (2024)
On Prompt-Driven Safeguarding for Large Language Models
por: Zheng, Chujie, et al.
Publicado: (2024)
por: Zheng, Chujie, et al.
Publicado: (2024)
CharacterBench: Benchmarking Character Customization of Large Language Models
por: Zhou, Jinfeng, et al.
Publicado: (2024)
por: Zhou, Jinfeng, et al.
Publicado: (2024)
Large Language Models Are Not Robust Multiple Choice Selectors
por: Zheng, Chujie, et al.
Publicado: (2023)
por: Zheng, Chujie, et al.
Publicado: (2023)
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
por: Wen, Bosi, et al.
Publicado: (2026)
por: Wen, Bosi, et al.
Publicado: (2026)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026)
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026)
BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models
por: Wang, Xinyuan, et al.
Publicado: (2024)
por: Wang, Xinyuan, et al.
Publicado: (2024)
Black-Box On-Policy Distillation of Large Language Models
por: Ye, Tianzhu, et al.
Publicado: (2025)
por: Ye, Tianzhu, et al.
Publicado: (2025)
AutoRE: Document-Level Relation Extraction with Large Language Models
por: Xue, Lilong, et al.
Publicado: (2024)
por: Xue, Lilong, et al.
Publicado: (2024)
MiniPLM: Knowledge Distillation for Pre-Training Language Models
por: Gu, Yuxian, et al.
Publicado: (2024)
por: Gu, Yuxian, et al.
Publicado: (2024)
LongAlign: A Recipe for Long Context Alignment of Large Language Models
por: Bai, Yushi, et al.
Publicado: (2024)
por: Bai, Yushi, et al.
Publicado: (2024)
MiniLLM: On-Policy Distillation of Large Language Models
por: Gu, Yuxian, et al.
Publicado: (2023)
por: Gu, Yuxian, et al.
Publicado: (2023)
ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectors
por: Zhang, Zhexin, et al.
Publicado: (2024)
por: Zhang, Zhexin, et al.
Publicado: (2024)
Instruction Pre-Training: Language Models are Supervised Multitask Learners
por: Cheng, Daixuan, et al.
Publicado: (2024)
por: Cheng, Daixuan, et al.
Publicado: (2024)
Extensive Self-Contrast Enables Feedback-Free Language Model Alignment
por: Liu, Xiao, et al.
Publicado: (2024)
por: Liu, Xiao, et al.
Publicado: (2024)
Understanding the Dilemma of Unlearning for Large Language Models
por: Zhang, Qingjie, et al.
Publicado: (2025)
por: Zhang, Qingjie, et al.
Publicado: (2025)
SafetyBench: Evaluating the Safety of Large Language Models
por: Zhang, Zhexin, et al.
Publicado: (2023)
por: Zhang, Zhexin, et al.
Publicado: (2023)
Perception of Knowledge Boundary for Large Language Models through Semi-open-ended Question Answering
por: Wen, Zhihua, et al.
Publicado: (2024)
por: Wen, Zhihua, et al.
Publicado: (2024)
FedDTPT: Federated Discrete and Transferable Prompt Tuning for Black-Box Large Language Models
por: Wu, Jiaqi, et al.
Publicado: (2024)
por: Wu, Jiaqi, et al.
Publicado: (2024)
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
por: Zhang, Zhexin, et al.
Publicado: (2024)
por: Zhang, Zhexin, et al.
Publicado: (2024)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
por: Wu, Yuhang, et al.
Publicado: (2024)
por: Wu, Yuhang, et al.
Publicado: (2024)
Benchmarking Large Language Model Uncertainty for Prompt Optimization
por: Guo, Pei-Fu, et al.
Publicado: (2024)
por: Guo, Pei-Fu, et al.
Publicado: (2024)
Ejemplares similares
-
AutoDetect: Towards a Unified Framework for Automated Weakness Detection in Large Language Models
por: Cheng, Jiale, et al.
Publicado: (2024) -
VPO: Aligning Text-to-Video Generation Models with Prompt Optimization
por: Cheng, Jiale, et al.
Publicado: (2025) -
Language Model Decoding as Direct Metrics Optimization
por: Ji, Haozhe, et al.
Publicado: (2023) -
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
por: Gui, Jiayi, et al.
Publicado: (2024) -
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
por: Ke, Pei, et al.
Publicado: (2023)