I Need Help! Evaluating LLM's Ability to Ask for Users' Support: A Case Study on Text-to-SQL Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Cheng-Kuang, Tam, Zhi Rui, Wu, Chao-Chung, Lin, Chieh-Yen, Lee, Hung-yi, Chen, Yun-Nung |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StreamBench: Towards Benchmarking Continuous Improvement of Language Agents
par: Wu, Cheng-Kuang, et autres
Publié: (2024)
par: Wu, Cheng-Kuang, et autres
Publié: (2024)
Answer, Refuse, or Guess? Investigating Risk-Aware Decision Making in Language Models
par: Wu, Cheng-Kuang, et autres
Publié: (2025)
par: Wu, Cheng-Kuang, et autres
Publié: (2025)
Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning
par: Wu, Chao-Chung, et autres
Publié: (2025)
par: Wu, Chao-Chung, et autres
Publié: (2025)
None of the Above, Less of the Right: Parallel Patterns between Humans and LLMs on Multi-Choice Questions Answering
par: Tam, Zhi Rui, et autres
Publié: (2025)
par: Tam, Zhi Rui, et autres
Publié: (2025)
Language Matters: How Do Multilingual Input and Reasoning Paths Affect Large Reasoning Models?
par: Tam, Zhi Rui, et autres
Publié: (2025)
par: Tam, Zhi Rui, et autres
Publié: (2025)
Let Me Speak Freely? A Study on the Impact of Format Restrictions on Performance of Large Language Models
par: Tam, Zhi Rui, et autres
Publié: (2024)
par: Tam, Zhi Rui, et autres
Publié: (2024)
Expected Harm: Rethinking Safety Evaluation of (Mis)Aligned LLMs
par: Chen, Yen-Shan, et autres
Publié: (2026)
par: Chen, Yen-Shan, et autres
Publié: (2026)
MedVoiceBias: A Controlled Study of Audio LLM Behavior in Clinical Decision-Making
par: Tam, Zhi Rui, et autres
Publié: (2025)
par: Tam, Zhi Rui, et autres
Publié: (2025)
On Calibration of Large Language Models: From Response To Capability
par: Yang, Sin-Han, et autres
Publié: (2026)
par: Yang, Sin-Han, et autres
Publié: (2026)
Text-to-SQL Calibration: No Need to Ask -- Just Rescale Model Probabilities
par: Ramachandran, Ashwin, et autres
Publié: (2024)
par: Ramachandran, Ashwin, et autres
Publié: (2024)
VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan
par: Tam, Zhi Rui, et autres
Publié: (2025)
par: Tam, Zhi Rui, et autres
Publié: (2025)
Need Help?...Ask Your Mentor.
par: Logsdon, Janis
Publié: (1992)
par: Logsdon, Janis
Publié: (1992)
AV-SQL: Decomposing Complex Text-to-SQL Queries with Agentic Views
par: Pham, Minh Tam, et autres
Publié: (2026)
par: Pham, Minh Tam, et autres
Publié: (2026)
Creativity in LLM-based Multi-Agent Systems: A Survey
par: Lin, Yi-Cheng, et autres
Publié: (2025)
par: Lin, Yi-Cheng, et autres
Publié: (2025)
An Efficient and Effective Evaluator for Text2SQL Models on Unseen and Unlabeled Data
par: Pham, Trinh, et autres
Publié: (2026)
par: Pham, Trinh, et autres
Publié: (2026)
Transferring Textual Preferences to Vision-Language Understanding through Model Merging
par: Li, Chen-An, et autres
Publié: (2025)
par: Li, Chen-An, et autres
Publié: (2025)
DogeRM: Equipping Reward Models with Domain Knowledge through Model Merging
par: Lin, Tzu-Han, et autres
Publié: (2024)
par: Lin, Tzu-Han, et autres
Publié: (2024)
FINER-SQL: Boosting Small Language Models for Text-to-SQL
par: Hoang, Thanh Dat, et autres
Publié: (2026)
par: Hoang, Thanh Dat, et autres
Publié: (2026)
Scaling Text2SQL via LLM-efficient Schema Filtering with Functional Dependency Graph Rerankers
par: Hoang, Thanh Dat, et autres
Publié: (2025)
par: Hoang, Thanh Dat, et autres
Publié: (2025)
CBR-to-SQL: Rethinking Retrieval-based Text-to-SQL using Case-based Reasoning in the Healthcare Domain
par: Nguyen, Hung, et autres
Publié: (2026)
par: Nguyen, Hung, et autres
Publié: (2026)
Taming SQL Complexity: LLM-Based Equivalence Evaluation for Text-to-SQL
par: Zeng, Qingyun, et autres
Publié: (2025)
par: Zeng, Qingyun, et autres
Publié: (2025)
RB-SQL: A Retrieval-based LLM Framework for Text-to-SQL
par: Wu, Zhenhe, et autres
Publié: (2024)
par: Wu, Zhenhe, et autres
Publié: (2024)
InstructionCP: A fast approach to transfer Large Language Models into target language
par: Chen, Kuang-Ming, et autres
Publié: (2024)
par: Chen, Kuang-Ming, et autres
Publié: (2024)
LLM-Codec: Neural Audio Codec Meets Language Model Objectives
par: Chung, Ho-Lam, et autres
Publié: (2026)
par: Chung, Ho-Lam, et autres
Publié: (2026)
SpotIt: Evaluating Text-to-SQL Evaluation with Formal Verification
par: Klopfenstein, Rocky, et autres
Publié: (2025)
par: Klopfenstein, Rocky, et autres
Publié: (2025)
LLMs are Biased Evaluators But Not Biased for Retrieval Augmented Generation
par: Chen, Yen-Shan, et autres
Publié: (2024)
par: Chen, Yen-Shan, et autres
Publié: (2024)
Multilingual Text-to-SQL: Benchmarking the Limits of Language Models with Collaborative Language Agents
par: Pham, Khanh Trinh, et autres
Publié: (2025)
par: Pham, Khanh Trinh, et autres
Publié: (2025)
AgentAsk: Multi-Agent Systems Need to Ask
par: Lin, Bohan, et autres
Publié: (2025)
par: Lin, Bohan, et autres
Publié: (2025)
A Survey of Useful LLM Evaluation
par: Peng, Ji-Lun, et autres
Publié: (2024)
par: Peng, Ji-Lun, et autres
Publié: (2024)
Do You Hear What I Mean? Quantifying the Instruction-Perception Gap in Instruction-Guided Expressive Text-To-Speech Systems
par: Lin, Yi-Cheng, et autres
Publié: (2025)
par: Lin, Yi-Cheng, et autres
Publié: (2025)
ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability
par: Piao, Yen-Ting, et autres
Publié: (2026)
par: Piao, Yen-Ting, et autres
Publié: (2026)
LLM-Assisted Relevance Assessments: When Should We Ask LLMs for Help?
par: Takehi, Rikiya, et autres
Publié: (2024)
par: Takehi, Rikiya, et autres
Publié: (2024)
SQLStructEval: Structural Evaluation of LLM Text-to-SQL Generation
par: Zhou, Yixi, et autres
Publié: (2026)
par: Zhou, Yixi, et autres
Publié: (2026)
InstUPR : Instruction-based Unsupervised Passage Reranking with Large Language Models
par: Huang, Chao-Wei, et autres
Publié: (2024)
par: Huang, Chao-Wei, et autres
Publié: (2024)
PairDistill: Pairwise Relevance Distillation for Dense Retrieval
par: Huang, Chao-Wei, et autres
Publié: (2024)
par: Huang, Chao-Wei, et autres
Publié: (2024)
FactAlign: Long-form Factuality Alignment of Large Language Models
par: Huang, Chao-Wei, et autres
Publié: (2024)
par: Huang, Chao-Wei, et autres
Publié: (2024)
FinStat2SQL: A Text2SQL Pipeline for Financial Statement Analysis
par: Nguyen, Quang Hung, et autres
Publié: (2025)
par: Nguyen, Quang Hung, et autres
Publié: (2025)
LLMSQL: Upgrading WikiSQL for the LLM Era of Text-to-SQL
par: Pihulski, Dzmitry, et autres
Publié: (2025)
par: Pihulski, Dzmitry, et autres
Publié: (2025)
ErrorLLM: Modeling SQL Errors for Text-to-SQL Refinement
par: Hong, Zijin, et autres
Publié: (2026)
par: Hong, Zijin, et autres
Publié: (2026)
Is Long Context All You Need? Leveraging LLM's Extended Context for NL2SQL
par: Chung, Yeounoh, et autres
Publié: (2025)
par: Chung, Yeounoh, et autres
Publié: (2025)
Documents similaires
-
StreamBench: Towards Benchmarking Continuous Improvement of Language Agents
par: Wu, Cheng-Kuang, et autres
Publié: (2024) -
Answer, Refuse, or Guess? Investigating Risk-Aware Decision Making in Language Models
par: Wu, Cheng-Kuang, et autres
Publié: (2025) -
Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning
par: Wu, Chao-Chung, et autres
Publié: (2025) -
None of the Above, Less of the Right: Parallel Patterns between Humans and LLMs on Multi-Choice Questions Answering
par: Tam, Zhi Rui, et autres
Publié: (2025) -
Language Matters: How Do Multilingual Input and Reasoning Paths Affect Large Reasoning Models?
par: Tam, Zhi Rui, et autres
Publié: (2025)