PALM-Bench: A Comprehensive Benchmark for Personalized Audio-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yuwen, Qian, Xinyuan, Zhang, Tian-Hao, Gao, Jiaran, Pan, Yuchen, Wang, Xin, Pan, Zhou, Wei, Chen, Wang, Yiming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
IFEval-Audio: Benchmarking Instruction-Following Capability in Audio-based Large Language Models
di: Gao, Yiming, et al.
Pubblicazione: (2025)
di: Gao, Yiming, et al.
Pubblicazione: (2025)
AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
di: Yang, Qian, et al.
Pubblicazione: (2024)
di: Yang, Qian, et al.
Pubblicazione: (2024)
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
di: Zhang, Min, et al.
Pubblicazione: (2025)
di: Zhang, Min, et al.
Pubblicazione: (2025)
CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
di: Nie, Ying, et al.
Pubblicazione: (2024)
di: Nie, Ying, et al.
Pubblicazione: (2024)
PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark
di: Kalahroodi, Mohammad Javad Ranjbar, et al.
Pubblicazione: (2026)
di: Kalahroodi, Mohammad Javad Ranjbar, et al.
Pubblicazione: (2026)
PediaBench: A Comprehensive Chinese Pediatric Dataset for Benchmarking Large Language Models
di: Zhang, Qian, et al.
Pubblicazione: (2024)
di: Zhang, Qian, et al.
Pubblicazione: (2024)
AudioBench: A Universal Benchmark for Audio Large Language Models
di: Wang, Bin, et al.
Pubblicazione: (2024)
di: Wang, Bin, et al.
Pubblicazione: (2024)
Opening the Black Box: A Survey on the Mechanisms of Multi-Step Reasoning in Large Language Models
di: Pan, Liangming, et al.
Pubblicazione: (2026)
di: Pan, Liangming, et al.
Pubblicazione: (2026)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
CRUST-Bench: A Comprehensive Benchmark for C-to-safe-Rust Transpilation
di: Khatry, Anirudh, et al.
Pubblicazione: (2025)
di: Khatry, Anirudh, et al.
Pubblicazione: (2025)
VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbation
di: Qian, Kun, et al.
Pubblicazione: (2024)
di: Qian, Kun, et al.
Pubblicazione: (2024)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
di: Wang, Lu, et al.
Pubblicazione: (2025)
di: Wang, Lu, et al.
Pubblicazione: (2025)
GroupTravelBench: Benchmarking LLM Agents on Multi-Person Travel Planning
di: Cheng, Xiang, et al.
Pubblicazione: (2026)
di: Cheng, Xiang, et al.
Pubblicazione: (2026)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
di: Su, Yuchen, et al.
Pubblicazione: (2026)
di: Su, Yuchen, et al.
Pubblicazione: (2026)
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
di: Li, Bohan, et al.
Pubblicazione: (2025)
di: Li, Bohan, et al.
Pubblicazione: (2025)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
di: Xiong, Zixin, et al.
Pubblicazione: (2026)
di: Xiong, Zixin, et al.
Pubblicazione: (2026)
UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
di: Yang, Rui, et al.
Pubblicazione: (2025)
di: Yang, Rui, et al.
Pubblicazione: (2025)
BioProBench: Comprehensive Dataset and Benchmark in Biological Protocol Understanding and Reasoning
di: Liu, Yuyang, et al.
Pubblicazione: (2025)
di: Liu, Yuyang, et al.
Pubblicazione: (2025)
Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models
di: Pan, Leyi, et al.
Pubblicazione: (2025)
di: Pan, Leyi, et al.
Pubblicazione: (2025)
SonicBench: Dissecting the Physical Perception Bottleneck in Large Audio Language Models
di: Sun, Yirong, et al.
Pubblicazione: (2026)
di: Sun, Yirong, et al.
Pubblicazione: (2026)
SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation
di: Ma, Zhiming, et al.
Pubblicazione: (2025)
di: Ma, Zhiming, et al.
Pubblicazione: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
di: Liu, Mianxin, et al.
Pubblicazione: (2024)
di: Liu, Mianxin, et al.
Pubblicazione: (2024)
T2S-Bench & Structure-of-Thought: Benchmarking and Prompting Comprehensive Text-to-Structure Reasoning
di: Wang, Qinsi, et al.
Pubblicazione: (2026)
di: Wang, Qinsi, et al.
Pubblicazione: (2026)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
di: Zhang, Alexander, et al.
Pubblicazione: (2025)
di: Zhang, Alexander, et al.
Pubblicazione: (2025)
OfficeBench: Benchmarking Language Agents across Multiple Applications for Office Automation
di: Wang, Zilong, et al.
Pubblicazione: (2024)
di: Wang, Zilong, et al.
Pubblicazione: (2024)
BattleAgentBench: A Benchmark for Evaluating Cooperation and Competition Capabilities of Language Models in Multi-Agent Systems
di: Wang, Wei, et al.
Pubblicazione: (2024)
di: Wang, Wei, et al.
Pubblicazione: (2024)
Face-Human-Bench: A Comprehensive Benchmark of Face and Human Understanding for Multi-modal Assistants
di: Qin, Lixiong, et al.
Pubblicazione: (2025)
di: Qin, Lixiong, et al.
Pubblicazione: (2025)
On-Device Language Models: A Comprehensive Review
di: Xu, Jiajun, et al.
Pubblicazione: (2024)
di: Xu, Jiajun, et al.
Pubblicazione: (2024)
CharacterBench: Benchmarking Character Customization of Large Language Models
di: Zhou, Jinfeng, et al.
Pubblicazione: (2024)
di: Zhou, Jinfeng, et al.
Pubblicazione: (2024)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
di: Ma, Yubo, et al.
Pubblicazione: (2024)
di: Ma, Yubo, et al.
Pubblicazione: (2024)
StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
di: Lu, Yuchen, et al.
Pubblicazione: (2025)
di: Lu, Yuchen, et al.
Pubblicazione: (2025)
PersoBench: Benchmarking Personalized Response Generation in Large Language Models
di: Afzoon, Saleh, et al.
Pubblicazione: (2024)
di: Afzoon, Saleh, et al.
Pubblicazione: (2024)
CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)
INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance
di: Chen, Shisong, et al.
Pubblicazione: (2025)
di: Chen, Shisong, et al.
Pubblicazione: (2025)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
di: Li, Kai, et al.
Pubblicazione: (2025)
di: Li, Kai, et al.
Pubblicazione: (2025)
FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models
di: Jiang, Yuxin, et al.
Pubblicazione: (2023)
di: Jiang, Yuxin, et al.
Pubblicazione: (2023)
SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
di: Li, Lijun, et al.
Pubblicazione: (2024)
di: Li, Lijun, et al.
Pubblicazione: (2024)
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
di: Nie, Yiqi, et al.
Pubblicazione: (2026)
di: Nie, Yiqi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
IFEval-Audio: Benchmarking Instruction-Following Capability in Audio-based Large Language Models
di: Gao, Yiming, et al.
Pubblicazione: (2025) -
AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
di: Yang, Qian, et al.
Pubblicazione: (2024) -
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
di: Zhang, Min, et al.
Pubblicazione: (2025) -
CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
di: Nie, Ying, et al.
Pubblicazione: (2024) -
PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark
di: Kalahroodi, Mohammad Javad Ranjbar, et al.
Pubblicazione: (2026)