Mis-prompt: Benchmarking Large Language Models for Proactive Error Handling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zeng, Jiayi, Feng, Yizhe, He, Mengliang, Lei, Wenhui, Zhang, Wei, Liu, Zeming, Shi, Xiaoming, Zhou, Aimin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability
par: He, Mengliang, et autres
Publié: (2025)
par: He, Mengliang, et autres
Publié: (2025)
Mathematical Language Models: A Survey
par: Liu, Wentao, et autres
Publié: (2023)
par: Liu, Wentao, et autres
Publié: (2023)
DOP: Diagnostic-Oriented Prompting for Large Language Models in Mathematical Correction
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring
par: Mu, Honglin, et autres
Publié: (2024)
par: Mu, Honglin, et autres
Publié: (2024)
GODBench: A Benchmark for Multimodal Large Language Models in Video Comment Art
par: Lei, Yiming, et autres
Publié: (2025)
par: Lei, Yiming, et autres
Publié: (2025)
SpMis: An Investigation of Synthetic Spoken Misinformation Detection
par: Liu, Peizhuo, et autres
Publié: (2024)
par: Liu, Peizhuo, et autres
Publié: (2024)
BP-GPT: Auditory Neural Decoding Using fMRI-prompted LLM
par: Chen, Xiaoyu, et autres
Publié: (2025)
par: Chen, Xiaoyu, et autres
Publié: (2025)
Open-vocabulary Auditory Neural Decoding Using fMRI-prompted LLM
par: Chen, Xiaoyu, et autres
Publié: (2024)
par: Chen, Xiaoyu, et autres
Publié: (2024)
Leveraging Computerized Adaptive Testing for Cost-effective Evaluation of Large Language Models in Medical Benchmarking
par: Zheng, Tianpeng, et autres
Publié: (2026)
par: Zheng, Tianpeng, et autres
Publié: (2026)
Echo: A Large Language Model with Temporal Episodic Memory
par: Liu, WenTao, et autres
Publié: (2025)
par: Liu, WenTao, et autres
Publié: (2025)
FinDABench: Benchmarking Financial Data Analysis Ability of Large Language Models
par: Liu, Shu, et autres
Publié: (2024)
par: Liu, Shu, et autres
Publié: (2024)
RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Models
par: Liu, Jingjing, et autres
Publié: (2025)
par: Liu, Jingjing, et autres
Publié: (2025)
SMRC: Aligning Large Language Models with Student Reasoning for Mathematical Error Correction
par: Zeng, Biaojie, et autres
Publié: (2025)
par: Zeng, Biaojie, et autres
Publié: (2025)
Self-ensemble: Mitigating Confidence Mis-calibration for Large Language Models
par: Xu, Zicheng, et autres
Publié: (2025)
par: Xu, Zicheng, et autres
Publié: (2025)
How Well Do LLMs Handle Cantonese? Benchmarking Cantonese Capabilities of Large Language Models
par: Jiang, Jiyue, et autres
Publié: (2024)
par: Jiang, Jiyue, et autres
Publié: (2024)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
par: Li, Haodong, et autres
Publié: (2024)
par: Li, Haodong, et autres
Publié: (2024)
The Few-shot Dilemma: Over-prompting Large Language Models
par: Tang, Yongjian, et autres
Publié: (2025)
par: Tang, Yongjian, et autres
Publié: (2025)
KVPruner: Structural Pruning for Faster and Memory-Efficient Large Language Models
par: Lv, Bo, et autres
Publié: (2024)
par: Lv, Bo, et autres
Publié: (2024)
DeepSeek's WEIRD Behavior: The cultural alignment of Large Language Models and the effects of prompt language and cultural prompting
par: Luther, James, et autres
Publié: (2025)
par: Luther, James, et autres
Publié: (2025)
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
par: He, Jiayi, et autres
Publié: (2025)
par: He, Jiayi, et autres
Publié: (2025)
LocalGPT: Benchmarking and Advancing Large Language Models for Local Life Services in Meituan
par: Lan, Xiaochong, et autres
Publié: (2025)
par: Lan, Xiaochong, et autres
Publié: (2025)
A Survey on Proactive Defense Strategies Against Misinformation in Large Language Models
par: Liu, Shuliang, et autres
Publié: (2025)
par: Liu, Shuliang, et autres
Publié: (2025)
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
par: Zhang, Min, et autres
Publié: (2025)
par: Zhang, Min, et autres
Publié: (2025)
Multiple-Debias: A Full-process Debiasing Method for Multilingual Pre-trained Language Models
par: Liang, Haoyu, et autres
Publié: (2026)
par: Liang, Haoyu, et autres
Publié: (2026)
LIFBench: Evaluating the Instruction Following Performance and Stability of Large Language Models in Long-Context Scenarios
par: Wu, Xiaodong, et autres
Publié: (2024)
par: Wu, Xiaodong, et autres
Publié: (2024)
STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models
par: Chen, Kai, et autres
Publié: (2025)
par: Chen, Kai, et autres
Publié: (2025)
Examining the Robustness of Large Language Models across Language Complexity
par: Zhang, Jiayi
Publié: (2025)
par: Zhang, Jiayi
Publié: (2025)
Genetic Auto-prompt Learning for Pre-trained Code Intelligence Language Models
par: Feng, Chengzhe, et autres
Publié: (2024)
par: Feng, Chengzhe, et autres
Publié: (2024)
ProBench: Benchmarking Large Language Models in Competitive Programming
par: Yang, Lei, et autres
Publié: (2025)
par: Yang, Lei, et autres
Publié: (2025)
ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection
par: Yan, Yibo, et autres
Publié: (2024)
par: Yan, Yibo, et autres
Publié: (2024)
WundtGPT: Shaping Large Language Models To Be An Empathetic, Proactive Psychologist
par: Ren, Chenyu, et autres
Publié: (2024)
par: Ren, Chenyu, et autres
Publié: (2024)
Enhancing Tool Learning in Large Language Models with Hierarchical Error Checklists
par: Cui, Yue, et autres
Publié: (2025)
par: Cui, Yue, et autres
Publié: (2025)
QA-prompting: Improving Summarization with Large Language Models using Question-Answering
par: Sinha, Neelabh
Publié: (2025)
par: Sinha, Neelabh
Publié: (2025)
What's in a prompt? Language models encode literary style in prompt embeddings
par: Sarfati, Raphaël, et autres
Publié: (2025)
par: Sarfati, Raphaël, et autres
Publié: (2025)
Evaluating Proactive Risk Awareness of Large Language Models
par: Luo, Xuan, et autres
Publié: (2026)
par: Luo, Xuan, et autres
Publié: (2026)
How do Large Language Models Handle Multilingualism?
par: Zhao, Yiran, et autres
Publié: (2024)
par: Zhao, Yiran, et autres
Publié: (2024)
DocMEdit: Towards Document-Level Model Editing
par: Zeng, Li, et autres
Publié: (2025)
par: Zeng, Li, et autres
Publié: (2025)
Soft-prompt Tuning for Large Language Models to Evaluate Bias
par: Tian, Jacob-Junqi, et autres
Publié: (2023)
par: Tian, Jacob-Junqi, et autres
Publié: (2023)
KwaiChat: A Large-Scale Video-Driven Multilingual Mixed-Type Dialogue Corpus
par: Shi, Xiaoming, et autres
Publié: (2025)
par: Shi, Xiaoming, et autres
Publié: (2025)
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
par: Zhang, Yihao, et autres
Publié: (2024)
par: Zhang, Yihao, et autres
Publié: (2024)
Documents similaires
-
Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability
par: He, Mengliang, et autres
Publié: (2025) -
Mathematical Language Models: A Survey
par: Liu, Wentao, et autres
Publié: (2023) -
DOP: Diagnostic-Oriented Prompting for Large Language Models in Mathematical Correction
par: Chen, Hao, et autres
Publié: (2024) -
Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring
par: Mu, Honglin, et autres
Publié: (2024) -
GODBench: A Benchmark for Multimodal Large Language Models in Video Comment Art
par: Lei, Yiming, et autres
Publié: (2025)