HPSS: Heuristic Prompting Strategy Search for LLM Evaluators
Fuente:
arXiv
Guardado en:
| Autores principales: | Wen, Bosi, Ke, Pei, Sun, Yufei, Wang, Cunxiang, Gu, Xiaotao, Zhou, Jinfeng, Tang, Jie, Wang, Hongning, Huang, Minlie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation
por: Wen, Bosi, et al.
Publicado: (2025)
por: Wen, Bosi, et al.
Publicado: (2025)
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
por: Wen, Bosi, et al.
Publicado: (2026)
por: Wen, Bosi, et al.
Publicado: (2026)
HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026)
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026)
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026)
SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models
por: Cheng, Jiale, et al.
Publicado: (2024)
por: Cheng, Jiale, et al.
Publicado: (2024)
LongSafety: Evaluating Long-Context Safety of Large Language Models
por: Lu, Yida, et al.
Publicado: (2025)
por: Lu, Yida, et al.
Publicado: (2025)
RAVEL: Reasoning Agents for Validating and Evaluating LLM Text Synthesis
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026)
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026)
Benchmarking Complex Instruction-Following with Multiple Constraints Composition
por: Wen, Bosi, et al.
Publicado: (2024)
por: Wen, Bosi, et al.
Publicado: (2024)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
por: Ke, Pei, et al.
Publicado: (2023)
por: Ke, Pei, et al.
Publicado: (2023)
Language Model Decoding as Direct Metrics Optimization
por: Ji, Haozhe, et al.
Publicado: (2023)
por: Ji, Haozhe, et al.
Publicado: (2023)
AutoDetect: Towards a Unified Framework for Automated Weakness Detection in Large Language Models
por: Cheng, Jiale, et al.
Publicado: (2024)
por: Cheng, Jiale, et al.
Publicado: (2024)
Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
por: Cheng, Jiale, et al.
Publicado: (2023)
por: Cheng, Jiale, et al.
Publicado: (2023)
Learning Task Decomposition to Assist Humans in Competitive Programming
por: Wen, Jiaxin, et al.
Publicado: (2024)
por: Wen, Jiaxin, et al.
Publicado: (2024)
Training Language Model to Critique for Better Refinement
por: Yu, Tianshu, et al.
Publicado: (2025)
por: Yu, Tianshu, et al.
Publicado: (2025)
StepMathAgent: A Step-Wise Agent for Evaluating Mathematical Processes through Tree-of-Error
por: Yang, Shu-Xun, et al.
Publicado: (2025)
por: Yang, Shu-Xun, et al.
Publicado: (2025)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
por: Zhang, Zhexin, et al.
Publicado: (2024)
por: Zhang, Zhexin, et al.
Publicado: (2024)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
por: Gui, Jiayi, et al.
Publicado: (2024)
por: Gui, Jiayi, et al.
Publicado: (2024)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
por: Zhang, Zhexin, et al.
Publicado: (2023)
por: Zhang, Zhexin, et al.
Publicado: (2023)
Towards Efficient Exact Optimization of Language Model Alignment
por: Ji, Haozhe, et al.
Publicado: (2024)
por: Ji, Haozhe, et al.
Publicado: (2024)
Think Socially via Cognitive Reasoning
por: Zhou, Jinfeng, et al.
Publicado: (2025)
por: Zhou, Jinfeng, et al.
Publicado: (2025)
VPO: Aligning Text-to-Video Generation Models with Prompt Optimization
por: Cheng, Jiale, et al.
Publicado: (2025)
por: Cheng, Jiale, et al.
Publicado: (2025)
CharacterBench: Benchmarking Character Customization of Large Language Models
por: Zhou, Jinfeng, et al.
Publicado: (2024)
por: Zhou, Jinfeng, et al.
Publicado: (2024)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
por: Liu, Xiao, et al.
Publicado: (2023)
por: Liu, Xiao, et al.
Publicado: (2023)
Unlocking Reasoning Potential in Large Langauge Models by Scaling Code-form Planning
por: Wen, Jiaxin, et al.
Publicado: (2024)
por: Wen, Jiaxin, et al.
Publicado: (2024)
The Superalignment of Superhuman Intelligence with Large Language Models
por: Huang, Minlie, et al.
Publicado: (2024)
por: Huang, Minlie, et al.
Publicado: (2024)
AMOR: A Recipe for Building Adaptable Modular Knowledge Agents Through Process Feedback
por: Guan, Jian, et al.
Publicado: (2024)
por: Guan, Jian, et al.
Publicado: (2024)
SocialSim: Towards Socialized Simulation of Emotional Support Conversation
por: Chen, Zhuang, et al.
Publicado: (2025)
por: Chen, Zhuang, et al.
Publicado: (2025)
SHIELD: Evaluation and Defense Strategies for Copyright Compliance in LLM Text Generation
por: Liu, Xiaoze, et al.
Publicado: (2024)
por: Liu, Xiaoze, et al.
Publicado: (2024)
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
por: Zhang, Zhexin, et al.
Publicado: (2024)
por: Zhang, Zhexin, et al.
Publicado: (2024)
Data Selection via Optimal Control for Language Models
por: Gu, Yuxian, et al.
Publicado: (2024)
por: Gu, Yuxian, et al.
Publicado: (2024)
Prompt Stability Matters: Evaluating and Optimizing Auto-Generated Prompt in General-Purpose Systems
por: Chen, Ke, et al.
Publicado: (2025)
por: Chen, Ke, et al.
Publicado: (2025)
Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen!
por: Zhang, Zhexin, et al.
Publicado: (2025)
por: Zhang, Zhexin, et al.
Publicado: (2025)
ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectors
por: Zhang, Zhexin, et al.
Publicado: (2024)
por: Zhang, Zhexin, et al.
Publicado: (2024)
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
por: Dong, Jianshuo, et al.
Publicado: (2025)
por: Dong, Jianshuo, et al.
Publicado: (2025)
MiniPLM: Knowledge Distillation for Pre-Training Language Models
por: Gu, Yuxian, et al.
Publicado: (2024)
por: Gu, Yuxian, et al.
Publicado: (2024)
Glyph: Scaling Context Windows via Visual-Text Compression
por: Cheng, Jiale, et al.
Publicado: (2025)
por: Cheng, Jiale, et al.
Publicado: (2025)
SocialEval: Evaluating Social Intelligence of Large Language Models
por: Zhou, Jinfeng, et al.
Publicado: (2025)
por: Zhou, Jinfeng, et al.
Publicado: (2025)
MiniLLM: On-Policy Distillation of Large Language Models
por: Gu, Yuxian, et al.
Publicado: (2023)
por: Gu, Yuxian, et al.
Publicado: (2023)
ToMBench: Benchmarking Theory of Mind in Large Language Models
por: Chen, Zhuang, et al.
Publicado: (2024)
por: Chen, Zhuang, et al.
Publicado: (2024)
Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation
por: Tian, Yanzhi, et al.
Publicado: (2026)
por: Tian, Yanzhi, et al.
Publicado: (2026)
Ejemplares similares
-
IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation
por: Wen, Bosi, et al.
Publicado: (2025) -
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
por: Wen, Bosi, et al.
Publicado: (2026) -
HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026) -
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
por: Feng, Andrew Zhuoer, et al.
Publicado: (2026) -
SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models
por: Cheng, Jiale, et al.
Publicado: (2024)