StreamBench: Towards Benchmarking Continuous Improvement of Language Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Cheng-Kuang, Tam, Zhi Rui, Lin, Chieh-Yen, Chen, Yun-Nung, Lee, Hung-yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Answer, Refuse, or Guess? Investigating Risk-Aware Decision Making in Language Models
di: Wu, Cheng-Kuang, et al.
Pubblicazione: (2025)
di: Wu, Cheng-Kuang, et al.
Pubblicazione: (2025)
Let Me Speak Freely? A Study on the Impact of Format Restrictions on Performance of Large Language Models
di: Tam, Zhi Rui, et al.
Pubblicazione: (2024)
di: Tam, Zhi Rui, et al.
Pubblicazione: (2024)
Language Matters: How Do Multilingual Input and Reasoning Paths Affect Large Reasoning Models?
di: Tam, Zhi Rui, et al.
Pubblicazione: (2025)
di: Tam, Zhi Rui, et al.
Pubblicazione: (2025)
I Need Help! Evaluating LLM's Ability to Ask for Users' Support: A Case Study on Text-to-SQL Generation
di: Wu, Cheng-Kuang, et al.
Pubblicazione: (2024)
di: Wu, Cheng-Kuang, et al.
Pubblicazione: (2024)
None of the Above, Less of the Right: Parallel Patterns between Humans and LLMs on Multi-Choice Questions Answering
di: Tam, Zhi Rui, et al.
Pubblicazione: (2025)
di: Tam, Zhi Rui, et al.
Pubblicazione: (2025)
Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning
di: Wu, Chao-Chung, et al.
Pubblicazione: (2025)
di: Wu, Chao-Chung, et al.
Pubblicazione: (2025)
On Calibration of Large Language Models: From Response To Capability
di: Yang, Sin-Han, et al.
Pubblicazione: (2026)
di: Yang, Sin-Han, et al.
Pubblicazione: (2026)
VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan
di: Tam, Zhi Rui, et al.
Pubblicazione: (2025)
di: Tam, Zhi Rui, et al.
Pubblicazione: (2025)
Expected Harm: Rethinking Safety Evaluation of (Mis)Aligned LLMs
di: Chen, Yen-Shan, et al.
Pubblicazione: (2026)
di: Chen, Yen-Shan, et al.
Pubblicazione: (2026)
MedVoiceBias: A Controlled Study of Audio LLM Behavior in Clinical Decision-Making
di: Tam, Zhi Rui, et al.
Pubblicazione: (2025)
di: Tam, Zhi Rui, et al.
Pubblicazione: (2025)
DogeRM: Equipping Reward Models with Domain Knowledge through Model Merging
di: Lin, Tzu-Han, et al.
Pubblicazione: (2024)
di: Lin, Tzu-Han, et al.
Pubblicazione: (2024)
Transferring Textual Preferences to Vision-Language Understanding through Model Merging
di: Li, Chen-An, et al.
Pubblicazione: (2025)
di: Li, Chen-An, et al.
Pubblicazione: (2025)
Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency
di: Lin, Guan-Ting, et al.
Pubblicazione: (2026)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2026)
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2026)
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2026)
AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning
di: Lin, Tzu-Han, et al.
Pubblicazione: (2025)
di: Lin, Tzu-Han, et al.
Pubblicazione: (2025)
Creativity in LLM-based Multi-Agent Systems: A Survey
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
InstructionCP: A fast approach to transfer Large Language Models into target language
di: Chen, Kuang-Ming, et al.
Pubblicazione: (2024)
di: Chen, Kuang-Ming, et al.
Pubblicazione: (2024)
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2024)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2024)
Measuring Taiwanese Mandarin Language Understanding
di: Chen, Po-Heng, et al.
Pubblicazione: (2024)
di: Chen, Po-Heng, et al.
Pubblicazione: (2024)
CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
di: Jiang, Hongchao, et al.
Pubblicazione: (2025)
di: Jiang, Hongchao, et al.
Pubblicazione: (2025)
Over-Reasoning and Redundant Calculation of Large Language Models
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2024)
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2024)
Pseudo2Real: Task Arithmetic for Pseudo-Label Correction in Automatic Speech Recognition
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
Exploring Personality-Aware Interactions in Salesperson Dialogue Agents
di: Cheng, Sijia, et al.
Pubblicazione: (2025)
di: Cheng, Sijia, et al.
Pubblicazione: (2025)
Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models
di: Lin, Yu-Xiang, et al.
Pubblicazione: (2025)
di: Lin, Yu-Xiang, et al.
Pubblicazione: (2025)
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
di: Li, Chen-An, et al.
Pubblicazione: (2025)
di: Li, Chen-An, et al.
Pubblicazione: (2025)
From Simulation to Strategy: Automating Personalized Interaction Planning for Conversational Agents
di: Chang, Wen-Yu, et al.
Pubblicazione: (2025)
di: Chang, Wen-Yu, et al.
Pubblicazione: (2025)
The Role of Exploration Modules in Small Language Models for Knowledge Graph Question Answering
di: Cheng, Yi-Jie, et al.
Pubblicazione: (2025)
di: Cheng, Yi-Jie, et al.
Pubblicazione: (2025)
MMMOS: Multi-domain Multi-axis Audio Quality Assessment
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
Rethinking Role-Playing Evaluation: Anonymous Benchmarking and a Systematic Study of Personality Effects
di: Peng, Ji-Lun, et al.
Pubblicazione: (2026)
di: Peng, Ji-Lun, et al.
Pubblicazione: (2026)
Editing the Mind of Giants: An In-Depth Exploration of Pitfalls of Knowledge Editing in Large Language Models
di: Hsueh, Cheng-Hsun, et al.
Pubblicazione: (2024)
di: Hsueh, Cheng-Hsun, et al.
Pubblicazione: (2024)
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
Eyes-on-Me: Scalable RAG Poisoning through Transferable Attention-Steering Attractors
di: Chen, Yen-Shan, et al.
Pubblicazione: (2025)
di: Chen, Yen-Shan, et al.
Pubblicazione: (2025)
Investigating the Effects of Large-Scale Pseudo-Stereo Data and Different Speech Foundation Model on Dialogue Generative Spoken Language Model
di: Fu, Yu-Kuan, et al.
Pubblicazione: (2024)
di: Fu, Yu-Kuan, et al.
Pubblicazione: (2024)
Merging Facts, Crafting Fallacies: Evaluating the Contradictory Nature of Aggregated Factual Claims in Long-Form Generations
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2024)
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2024)
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2025)
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2025)
Visualizing Dialogues: Enhancing Image Selection through Dialogue Understanding with Large Language Models
di: Kao, Chang-Sheng, et al.
Pubblicazione: (2024)
di: Kao, Chang-Sheng, et al.
Pubblicazione: (2024)
Can LLMs Understand the Implication of Emphasized Sentences in Dialogue?
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation
di: Hsu, Chan-Jan, et al.
Pubblicazione: (2026)
di: Hsu, Chan-Jan, et al.
Pubblicazione: (2026)
EMO-Debias: Benchmarking Gender Debiasing Techniques in Multi-Label Speech Emotion Recognition
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Answer, Refuse, or Guess? Investigating Risk-Aware Decision Making in Language Models
di: Wu, Cheng-Kuang, et al.
Pubblicazione: (2025) -
Let Me Speak Freely? A Study on the Impact of Format Restrictions on Performance of Large Language Models
di: Tam, Zhi Rui, et al.
Pubblicazione: (2024) -
Language Matters: How Do Multilingual Input and Reasoning Paths Affect Large Reasoning Models?
di: Tam, Zhi Rui, et al.
Pubblicazione: (2025) -
I Need Help! Evaluating LLM's Ability to Ask for Users' Support: A Case Study on Text-to-SQL Generation
di: Wu, Cheng-Kuang, et al.
Pubblicazione: (2024) -
None of the Above, Less of the Right: Parallel Patterns between Humans and LLMs on Multi-Choice Questions Answering
di: Tam, Zhi Rui, et al.
Pubblicazione: (2025)