Benchmarking Large Language Models on Controllable Generation under Diversified Instructions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Yihan, Xu, Benfeng, Wang, Quan, Liu, Yi, Mao, Zhendong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Real to Synthetic: Synthesizing Millions of Diversified and Complicated User Instructions with Attributed Grounding
par: Zhu, Chiwei, et autres
Publié: (2025)
par: Zhu, Chiwei, et autres
Publié: (2025)
An Index-based Approach for Efficient and Effective Web Content Extraction
par: Chen, Yihan, et autres
Publié: (2025)
par: Chen, Yihan, et autres
Publié: (2025)
Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking
par: Chen, Yihan, et autres
Publié: (2025)
par: Chen, Yihan, et autres
Publié: (2025)
ExpertPrompting: Instructing Large Language Models to be Distinguished Experts
par: Xu, Benfeng, et autres
Publié: (2023)
par: Xu, Benfeng, et autres
Publié: (2023)
Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach
par: Li, Ruizhe, et autres
Publié: (2025)
par: Li, Ruizhe, et autres
Publié: (2025)
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
par: Du, Mingxuan, et autres
Publié: (2025)
par: Du, Mingxuan, et autres
Publié: (2025)
Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability
par: Zhu, Chiwei, et autres
Publié: (2025)
par: Zhu, Chiwei, et autres
Publié: (2025)
WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora
par: Wang, Pengyu, et autres
Publié: (2026)
par: Wang, Pengyu, et autres
Publié: (2026)
A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces
par: Du, Mingxuan, et autres
Publié: (2026)
par: Du, Mingxuan, et autres
Publié: (2026)
Benchmarking and Improving Compositional Generalization of Multi-aspect Controllable Text Generation
par: Zhong, Tianqi, et autres
Publié: (2024)
par: Zhong, Tianqi, et autres
Publié: (2024)
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools
par: Guo, Zikang, et autres
Publié: (2025)
par: Guo, Zikang, et autres
Publié: (2025)
DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report
par: Li, Ruizhe, et autres
Publié: (2026)
par: Li, Ruizhe, et autres
Publié: (2026)
Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization
par: Liu, Yixin, et autres
Publié: (2023)
par: Liu, Yixin, et autres
Publié: (2023)
FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents
par: Zhu, Chiwei, et autres
Publié: (2026)
par: Zhu, Chiwei, et autres
Publié: (2026)
Mitigating Biases in Language Models via Bias Unlearning
par: Liu, Dianqing, et autres
Publié: (2025)
par: Liu, Dianqing, et autres
Publié: (2025)
Instruction Mining: Instruction Data Selection for Tuning Large Language Models
par: Cao, Yihan, et autres
Publié: (2023)
par: Cao, Yihan, et autres
Publié: (2023)
Wiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia Articles
par: Wang, Shaohan, et autres
Publié: (2026)
par: Wang, Shaohan, et autres
Publié: (2026)
Leveraging Importance Sampling to Detach Alignment Modules from Large Language Models
par: Liu, Yi, et autres
Publié: (2025)
par: Liu, Yi, et autres
Publié: (2025)
TypedThinker: Diversify Large Language Model Reasoning with Typed Thinking
par: Wang, Danqing, et autres
Publié: (2024)
par: Wang, Danqing, et autres
Publié: (2024)
AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios
par: Qi, Yunjia, et autres
Publié: (2025)
par: Qi, Yunjia, et autres
Publié: (2025)
FlipGuard: Defending Preference Alignment against Update Regression with Constrained Optimization
par: Zhu, Mingye, et autres
Publié: (2024)
par: Zhu, Mingye, et autres
Publié: (2024)
TRIDENT: Enhancing Large Language Model Safety with Tri-Dimensional Diversified Red-Teaming Data Synthesis
par: Wu, Xiaorui, et autres
Publié: (2025)
par: Wu, Xiaorui, et autres
Publié: (2025)
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
Benchmarking Political Persuasion Risks Across Frontier Large Language Models
par: Chen, Zhongren, et autres
Publié: (2026)
par: Chen, Zhongren, et autres
Publié: (2026)
Align Documents to Questions: Question-Oriented Document Rewriting for Retrieval-Augmented Generation
par: Li, Jiaang, et autres
Publié: (2026)
par: Li, Jiaang, et autres
Publié: (2026)
Leveraging Robust Optimization for LLM Alignment under Distribution Shifts
par: Zhu, Mingye, et autres
Publié: (2025)
par: Zhu, Mingye, et autres
Publié: (2025)
Resilience of Large Language Models for Noisy Instructions
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
Enhancing Large Language Models Against Inductive Instructions with Dual-critique Prompting
par: Wang, Rui, et autres
Publié: (2023)
par: Wang, Rui, et autres
Publié: (2023)
SimpleStrat: Diversifying Language Model Generation with Stratification
par: Wong, Justin, et autres
Publié: (2024)
par: Wong, Justin, et autres
Publié: (2024)
EIFBENCH: Extremely Complex Instruction Following Benchmark for Large Language Models
par: Zou, Tao, et autres
Publié: (2025)
par: Zou, Tao, et autres
Publié: (2025)
PLANNER: Generating Diversified Paragraph via Latent Language Diffusion Model
par: Zhang, Yizhe, et autres
Publié: (2023)
par: Zhang, Yizhe, et autres
Publié: (2023)
EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning
par: Quan, Yinzhu, et autres
Publié: (2024)
par: Quan, Yinzhu, et autres
Publié: (2024)
The SIFo Benchmark: Investigating the Sequential Instruction Following Ability of Large Language Models
par: Chen, Xinyi, et autres
Publié: (2024)
par: Chen, Xinyi, et autres
Publié: (2024)
LexGenius: An Expert-Level Benchmark for Large Language Models in Legal General Intelligence
par: Liu, Wenjin, et autres
Publié: (2025)
par: Liu, Wenjin, et autres
Publié: (2025)
MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models
par: Yan, Qiao, et autres
Publié: (2025)
par: Yan, Qiao, et autres
Publié: (2025)
Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models
par: Zhang, Huatian, et autres
Publié: (2026)
par: Zhang, Huatian, et autres
Publié: (2026)
KCS: Diversify Multi-hop Question Generation with Knowledge Composition Sampling
par: Wang, Yangfan, et autres
Publié: (2025)
par: Wang, Yangfan, et autres
Publié: (2025)
Improved Unbiased Watermark for Large Language Models
par: Chen, Ruibo, et autres
Publié: (2025)
par: Chen, Ruibo, et autres
Publié: (2025)
IFEval-Audio: Benchmarking Instruction-Following Capability in Audio-based Large Language Models
par: Gao, Yiming, et autres
Publié: (2025)
par: Gao, Yiming, et autres
Publié: (2025)
PodBench: A Comprehensive Benchmark for Instruction-Aware Audio-Oriented Podcast Script Generation
par: Xu, Chenning, et autres
Publié: (2026)
par: Xu, Chenning, et autres
Publié: (2026)
Documents similaires
-
From Real to Synthetic: Synthesizing Millions of Diversified and Complicated User Instructions with Attributed Grounding
par: Zhu, Chiwei, et autres
Publié: (2025) -
An Index-based Approach for Efficient and Effective Web Content Extraction
par: Chen, Yihan, et autres
Publié: (2025) -
Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking
par: Chen, Yihan, et autres
Publié: (2025) -
ExpertPrompting: Instructing Large Language Models to be Distinguished Experts
par: Xu, Benfeng, et autres
Publié: (2023) -
Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach
par: Li, Ruizhe, et autres
Publié: (2025)