Learning to Ask: When LLM Agents Meet Unclear Instruction
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Wenxuan, Shi, Juluan, Ling, Zixuan, Chan, Yuk-Kit, Wang, Chaozheng, Lee, Cheryl, Yuan, Youliang, Huang, Jen-tse, Jiao, Wenxiang, Lyu, Michael R. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Identifying the Achilles' Heel: An Iterative Method for Dynamically Uncovering Factual Errors in Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
CodeCrash: Exposing LLM Fragility to Misleading Natural Language in Code Reasoning
di: Lam, Man Ho, et al.
Pubblicazione: (2025)
di: Lam, Man Ho, et al.
Pubblicazione: (2025)
LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models
di: Wan, Yuxuan, et al.
Pubblicazione: (2024)
di: Wan, Yuxuan, et al.
Pubblicazione: (2024)
A Systematic Evaluation of Large Code Models in API Suggestion: When, Which, and How
di: Wang, Chaozheng, et al.
Pubblicazione: (2024)
di: Wang, Chaozheng, et al.
Pubblicazione: (2024)
UniDebugger: Hierarchical Multi-Agent Framework for Unified Software Debugging
di: Lee, Cheryl, et al.
Pubblicazione: (2024)
di: Lee, Cheryl, et al.
Pubblicazione: (2024)
Rigor, Reliability, and Reproducibility Matter: A Decade-Scale Survey of 572 Code Benchmarks
di: Cao, Jialun, et al.
Pubblicazione: (2025)
di: Cao, Jialun, et al.
Pubblicazione: (2025)
SWE-Chain: Benchmarking Coding Agents on Chained Release-Level Package Upgrades
di: Lam, Man Ho, et al.
Pubblicazione: (2026)
di: Lam, Man Ho, et al.
Pubblicazione: (2026)
New Job, New Gender? Measuring the Social Bias in Image Generation Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher
di: Yuan, Youliang, et al.
Pubblicazione: (2023)
di: Yuan, Youliang, et al.
Pubblicazione: (2023)
Position Paper: Programming Language Techniques for Bridging LLM Code Generation Semantic Gaps
di: Du, Yalong, et al.
Pubblicazione: (2025)
di: Du, Yalong, et al.
Pubblicazione: (2025)
All Languages Matter: On the Multilingual Safety of Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
On the Shortcut Learning in Multilingual Neural Machine Translation
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
Automatically Generating UI Code from Screenshot: A Divide-and-Conquer-Based Approach
di: Wan, Yuxuan, et al.
Pubblicazione: (2024)
di: Wan, Yuxuan, et al.
Pubblicazione: (2024)
The Prompt Alchemist: Automated LLM-Tailored Prompt Optimization for Test Case Generation
di: Gao, Shuzheng, et al.
Pubblicazione: (2025)
di: Gao, Shuzheng, et al.
Pubblicazione: (2025)
SEER: Enhancing Chain-of-Thought Code Generation through Self-Exploring Deep Reasoning
di: Gao, Shuzheng, et al.
Pubblicazione: (2025)
di: Gao, Shuzheng, et al.
Pubblicazione: (2025)
Exploring Multi-Lingual Bias of Large Code Models in Code Generation
di: Wang, Chaozheng, et al.
Pubblicazione: (2024)
di: Wang, Chaozheng, et al.
Pubblicazione: (2024)
ComboBench: Can LLMs Manipulate Physical Devices to Play Virtual Reality Games?
di: Li, Shuqing, et al.
Pubblicazione: (2025)
di: Li, Shuqing, et al.
Pubblicazione: (2025)
A Survey on the Safety and Security Threats of Computer-Using Agents: JARVIS or Ultron?
di: Chen, Ada, et al.
Pubblicazione: (2025)
di: Chen, Ada, et al.
Pubblicazione: (2025)
Chain-of-Jailbreak Attack for Image Generation Models via Editing Step by Step
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
FairCoder: Evaluating Social Bias of LLMs in Code Generation
di: Du, Yongkang, et al.
Pubblicazione: (2025)
di: Du, Yongkang, et al.
Pubblicazione: (2025)
Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training
di: Yuan, Youliang, et al.
Pubblicazione: (2024)
di: Yuan, Youliang, et al.
Pubblicazione: (2024)
Towards Evaluating Proactive Risk Awareness of Multimodal Language Models
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
On the Resilience of LLM-Based Multi-Agent Collaboration with Faulty Agents
di: Huang, Jen-tse, et al.
Pubblicazione: (2024)
di: Huang, Jen-tse, et al.
Pubblicazione: (2024)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
di: Yuan, Youliang, et al.
Pubblicazione: (2025)
How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments
di: Huang, Jen-tse, et al.
Pubblicazione: (2024)
di: Huang, Jen-tse, et al.
Pubblicazione: (2024)
ComUICoder: Component-based Reusable UI Code Generation for Complex Websites via Semantic Segmentation and Element-wise Feedback
di: Xiao, Jingyu, et al.
Pubblicazione: (2026)
di: Xiao, Jingyu, et al.
Pubblicazione: (2026)
SLICEMATE: Accurate and Scalable Static Program Slicing via LLM-Powered Agents
di: Chang, Jianming, et al.
Pubblicazione: (2025)
di: Chang, Jianming, et al.
Pubblicazione: (2025)
RAG or Fine-tuning? A Comparative Study on LCMs-based Code Completion in Industry
di: Wang, Chaozheng, et al.
Pubblicazione: (2025)
di: Wang, Chaozheng, et al.
Pubblicazione: (2025)
SPVR: syntax-to-prompt vulnerability repair based on large language models
di: Wang, Ruoke, et al.
Pubblicazione: (2024)
di: Wang, Ruoke, et al.
Pubblicazione: (2024)
FuzzAgent: Multi-Agent System for Evolutionary Library Fuzzing
di: Lyu, Yunlong, et al.
Pubblicazione: (2026)
di: Lyu, Yunlong, et al.
Pubblicazione: (2026)
Not All Countries Celebrate Thanksgiving: On the Cultural Dominance in Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
Revisiting the Reliability of Psychological Scales on Large Language Models
di: Huang, Jen-tse, et al.
Pubblicazione: (2023)
di: Huang, Jen-tse, et al.
Pubblicazione: (2023)
When Agents Fail: A Comprehensive Study of Bugs in LLM Agents with Automated Labeling
di: Islam, Niful, et al.
Pubblicazione: (2026)
di: Islam, Niful, et al.
Pubblicazione: (2026)
Who is ChatGPT? Benchmarking LLMs' Psychological Portrayal Using PsychoBench
di: Huang, Jen-tse, et al.
Pubblicazione: (2023)
di: Huang, Jen-tse, et al.
Pubblicazione: (2023)
When ChatGPT Meets Smart Contract Vulnerability Detection: How Far Are We?
di: Chen, Chong, et al.
Pubblicazione: (2023)
di: Chen, Chong, et al.
Pubblicazione: (2023)
When Fuzzing Meets LLMs: Challenges and Opportunities
di: Jiang, Yu, et al.
Pubblicazione: (2024)
di: Jiang, Yu, et al.
Pubblicazione: (2024)
A Tale of Two DL Cities: When Library Tests Meet Compiler
di: Shen, Qingchao, et al.
Pubblicazione: (2024)
di: Shen, Qingchao, et al.
Pubblicazione: (2024)
Understanding and Bridging the Planner-Coder Gap: A Systematic Study on the Robustness of Multi-Agent Systems for Code Generation
di: Lyu, Zongyi, et al.
Pubblicazione: (2025)
di: Lyu, Zongyi, et al.
Pubblicazione: (2025)
AgentSZZ: Teaching the LLM Agent to Play Detective with Bug-Inducing Commits
di: Lyu, Yunbo, et al.
Pubblicazione: (2026)
di: Lyu, Yunbo, et al.
Pubblicazione: (2026)
When Fine-Tuning LLMs Meets Data Privacy: An Empirical Study of Federated Learning in LLM-Based Program Repair
di: Luo, Wenqiang, et al.
Pubblicazione: (2024)
di: Luo, Wenqiang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Identifying the Achilles' Heel: An Iterative Method for Dynamically Uncovering Factual Errors in Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2024) -
CodeCrash: Exposing LLM Fragility to Misleading Natural Language in Code Reasoning
di: Lam, Man Ho, et al.
Pubblicazione: (2025) -
LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models
di: Wan, Yuxuan, et al.
Pubblicazione: (2024) -
A Systematic Evaluation of Large Code Models in API Suggestion: When, Which, and How
di: Wang, Chaozheng, et al.
Pubblicazione: (2024) -
UniDebugger: Hierarchical Multi-Agent Framework for Unified Software Debugging
di: Lee, Cheryl, et al.
Pubblicazione: (2024)