PALM-Bench: A Comprehensive Benchmark for Personalized Audio-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Yuwen, Qian, Xinyuan, Zhang, Tian-Hao, Gao, Jiaran, Pan, Yuchen, Wang, Xin, Pan, Zhou, Wei, Chen, Wang, Yiming |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
IFEval-Audio: Benchmarking Instruction-Following Capability in Audio-based Large Language Models
von: Gao, Yiming, et al.
Veröffentlicht: (2025)
von: Gao, Yiming, et al.
Veröffentlicht: (2025)
AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
von: Yang, Qian, et al.
Veröffentlicht: (2024)
von: Yang, Qian, et al.
Veröffentlicht: (2024)
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
von: Zhang, Min, et al.
Veröffentlicht: (2025)
von: Zhang, Min, et al.
Veröffentlicht: (2025)
CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
von: Nie, Ying, et al.
Veröffentlicht: (2024)
von: Nie, Ying, et al.
Veröffentlicht: (2024)
PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark
von: Kalahroodi, Mohammad Javad Ranjbar, et al.
Veröffentlicht: (2026)
von: Kalahroodi, Mohammad Javad Ranjbar, et al.
Veröffentlicht: (2026)
PediaBench: A Comprehensive Chinese Pediatric Dataset for Benchmarking Large Language Models
von: Zhang, Qian, et al.
Veröffentlicht: (2024)
von: Zhang, Qian, et al.
Veröffentlicht: (2024)
AudioBench: A Universal Benchmark for Audio Large Language Models
von: Wang, Bin, et al.
Veröffentlicht: (2024)
von: Wang, Bin, et al.
Veröffentlicht: (2024)
Opening the Black Box: A Survey on the Mechanisms of Multi-Step Reasoning in Large Language Models
von: Pan, Liangming, et al.
Veröffentlicht: (2026)
von: Pan, Liangming, et al.
Veröffentlicht: (2026)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
von: Zhou, Chengfeng, et al.
Veröffentlicht: (2025)
von: Zhou, Chengfeng, et al.
Veröffentlicht: (2025)
CRUST-Bench: A Comprehensive Benchmark for C-to-safe-Rust Transpilation
von: Khatry, Anirudh, et al.
Veröffentlicht: (2025)
von: Khatry, Anirudh, et al.
Veröffentlicht: (2025)
VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbation
von: Qian, Kun, et al.
Veröffentlicht: (2024)
von: Qian, Kun, et al.
Veröffentlicht: (2024)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
von: Wang, Lu, et al.
Veröffentlicht: (2025)
von: Wang, Lu, et al.
Veröffentlicht: (2025)
GroupTravelBench: Benchmarking LLM Agents on Multi-Person Travel Planning
von: Cheng, Xiang, et al.
Veröffentlicht: (2026)
von: Cheng, Xiang, et al.
Veröffentlicht: (2026)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
von: Su, Yuchen, et al.
Veröffentlicht: (2026)
von: Su, Yuchen, et al.
Veröffentlicht: (2026)
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
von: Li, Bohan, et al.
Veröffentlicht: (2025)
von: Li, Bohan, et al.
Veröffentlicht: (2025)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
von: Hu, Jiliang, et al.
Veröffentlicht: (2025)
von: Hu, Jiliang, et al.
Veröffentlicht: (2025)
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
von: Xiong, Zixin, et al.
Veröffentlicht: (2026)
von: Xiong, Zixin, et al.
Veröffentlicht: (2026)
UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
von: Xu, Xin, et al.
Veröffentlicht: (2025)
von: Xu, Xin, et al.
Veröffentlicht: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
von: Yang, Rui, et al.
Veröffentlicht: (2025)
von: Yang, Rui, et al.
Veröffentlicht: (2025)
BioProBench: Comprehensive Dataset and Benchmark in Biological Protocol Understanding and Reasoning
von: Liu, Yuyang, et al.
Veröffentlicht: (2025)
von: Liu, Yuyang, et al.
Veröffentlicht: (2025)
Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models
von: Pan, Leyi, et al.
Veröffentlicht: (2025)
von: Pan, Leyi, et al.
Veröffentlicht: (2025)
SonicBench: Dissecting the Physical Perception Bottleneck in Large Audio Language Models
von: Sun, Yirong, et al.
Veröffentlicht: (2026)
von: Sun, Yirong, et al.
Veröffentlicht: (2026)
SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation
von: Ma, Zhiming, et al.
Veröffentlicht: (2025)
von: Ma, Zhiming, et al.
Veröffentlicht: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
von: Liu, Mianxin, et al.
Veröffentlicht: (2024)
von: Liu, Mianxin, et al.
Veröffentlicht: (2024)
T2S-Bench & Structure-of-Thought: Benchmarking and Prompting Comprehensive Text-to-Structure Reasoning
von: Wang, Qinsi, et al.
Veröffentlicht: (2026)
von: Wang, Qinsi, et al.
Veröffentlicht: (2026)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
von: Zhang, Alexander, et al.
Veröffentlicht: (2025)
von: Zhang, Alexander, et al.
Veröffentlicht: (2025)
OfficeBench: Benchmarking Language Agents across Multiple Applications for Office Automation
von: Wang, Zilong, et al.
Veröffentlicht: (2024)
von: Wang, Zilong, et al.
Veröffentlicht: (2024)
BattleAgentBench: A Benchmark for Evaluating Cooperation and Competition Capabilities of Language Models in Multi-Agent Systems
von: Wang, Wei, et al.
Veröffentlicht: (2024)
von: Wang, Wei, et al.
Veröffentlicht: (2024)
Face-Human-Bench: A Comprehensive Benchmark of Face and Human Understanding for Multi-modal Assistants
von: Qin, Lixiong, et al.
Veröffentlicht: (2025)
von: Qin, Lixiong, et al.
Veröffentlicht: (2025)
On-Device Language Models: A Comprehensive Review
von: Xu, Jiajun, et al.
Veröffentlicht: (2024)
von: Xu, Jiajun, et al.
Veröffentlicht: (2024)
CharacterBench: Benchmarking Character Customization of Large Language Models
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2024)
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2024)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
von: Ma, Yubo, et al.
Veröffentlicht: (2024)
von: Ma, Yubo, et al.
Veröffentlicht: (2024)
StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
von: Lu, Yuchen, et al.
Veröffentlicht: (2025)
von: Lu, Yuchen, et al.
Veröffentlicht: (2025)
PersoBench: Benchmarking Personalized Response Generation in Large Language Models
von: Afzoon, Saleh, et al.
Veröffentlicht: (2024)
von: Afzoon, Saleh, et al.
Veröffentlicht: (2024)
CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
von: Song, Xiaoshuai, et al.
Veröffentlicht: (2024)
von: Song, Xiaoshuai, et al.
Veröffentlicht: (2024)
INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance
von: Chen, Shisong, et al.
Veröffentlicht: (2025)
von: Chen, Shisong, et al.
Veröffentlicht: (2025)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
von: Li, Kai, et al.
Veröffentlicht: (2025)
von: Li, Kai, et al.
Veröffentlicht: (2025)
FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models
von: Jiang, Yuxin, et al.
Veröffentlicht: (2023)
von: Jiang, Yuxin, et al.
Veröffentlicht: (2023)
SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
von: Li, Lijun, et al.
Veröffentlicht: (2024)
von: Li, Lijun, et al.
Veröffentlicht: (2024)
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
von: Nie, Yiqi, et al.
Veröffentlicht: (2026)
von: Nie, Yiqi, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
IFEval-Audio: Benchmarking Instruction-Following Capability in Audio-based Large Language Models
von: Gao, Yiming, et al.
Veröffentlicht: (2025) -
AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
von: Yang, Qian, et al.
Veröffentlicht: (2024) -
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
von: Zhang, Min, et al.
Veröffentlicht: (2025) -
CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
von: Nie, Ying, et al.
Veröffentlicht: (2024) -
PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark
von: Kalahroodi, Mohammad Javad Ranjbar, et al.
Veröffentlicht: (2026)