Gespeichert in:
| Hauptverfasser: | Huang, Shuanghong, Xu, Jinlei, Zhou, Youchao, Zhou, Yanghao, Zhao, Xuan, Feng, Chong, Zhang, Wenxuan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2601.12973 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SI-Bench: Benchmarking Social Intelligence of Large Language Models in Human-to-Human Conversations
von: Huang, Shuai, et al.
Veröffentlicht: (2025)
von: Huang, Shuai, et al.
Veröffentlicht: (2025)
SeaLLMs-Audio: Large Audio-Language Models for Southeast Asia
von: Liu, Chaoqun, et al.
Veröffentlicht: (2025)
von: Liu, Chaoqun, et al.
Veröffentlicht: (2025)
Evaluating Robustness of Large Audio Language Models to Audio Injection: An Empirical Study
von: Hou, Guanyu, et al.
Veröffentlicht: (2025)
von: Hou, Guanyu, et al.
Veröffentlicht: (2025)
Language of Thought Shapes Output Diversity in Large Language Models
von: Xu, Shaoyang, et al.
Veröffentlicht: (2026)
von: Xu, Shaoyang, et al.
Veröffentlicht: (2026)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
von: Hu, Jiliang, et al.
Veröffentlicht: (2025)
von: Hu, Jiliang, et al.
Veröffentlicht: (2025)
Disentangling Language and Culture for Evaluating Multilingual Large Language Models
von: Ying, Jiahao, et al.
Veröffentlicht: (2025)
von: Ying, Jiahao, et al.
Veröffentlicht: (2025)
Do Retrieval Augmented Language Models Know When They Don't Know?
von: Zhou, Youchao, et al.
Veröffentlicht: (2025)
von: Zhou, Youchao, et al.
Veröffentlicht: (2025)
AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models
von: Shu, Dong, et al.
Veröffentlicht: (2024)
von: Shu, Dong, et al.
Veröffentlicht: (2024)
Safety Alignment of Large Language Models via Contrasting Safe and Harmful Distributions
von: Zhang, Xiaoyun, et al.
Veröffentlicht: (2024)
von: Zhang, Xiaoyun, et al.
Veröffentlicht: (2024)
Mitigating the Bias of Large Language Model Evaluation
von: Zhou, Hongli, et al.
Veröffentlicht: (2024)
von: Zhou, Hongli, et al.
Veröffentlicht: (2024)
Testing and Evaluation of Large Language Models: Correctness, Non-Toxicity, and Fairness
von: Wang, Wenxuan
Veröffentlicht: (2024)
von: Wang, Wenxuan
Veröffentlicht: (2024)
Subtopic-aware View Sampling and Temporal Aggregation for Long-form Document Matching
von: Zhou, Youchao, et al.
Veröffentlicht: (2024)
von: Zhou, Youchao, et al.
Veröffentlicht: (2024)
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
von: Su, Yanghao, et al.
Veröffentlicht: (2026)
von: Su, Yanghao, et al.
Veröffentlicht: (2026)
UniversalNER: Targeted Distillation from Large Language Models for Open Named Entity Recognition
von: Zhou, Wenxuan, et al.
Veröffentlicht: (2023)
von: Zhou, Wenxuan, et al.
Veröffentlicht: (2023)
AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
von: Yang, Qian, et al.
Veröffentlicht: (2024)
von: Yang, Qian, et al.
Veröffentlicht: (2024)
Offset Unlearning for Large Language Models
von: Huang, James Y., et al.
Veröffentlicht: (2024)
von: Huang, James Y., et al.
Veröffentlicht: (2024)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
von: Wang, Fei, et al.
Veröffentlicht: (2024)
von: Wang, Fei, et al.
Veröffentlicht: (2024)
MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World Conversation
von: Xue, Haochen, et al.
Veröffentlicht: (2025)
von: Xue, Haochen, et al.
Veröffentlicht: (2025)
ESC-Eval: Evaluating Emotion Support Conversations in Large Language Models
von: Zhao, Haiquan, et al.
Veröffentlicht: (2024)
von: Zhao, Haiquan, et al.
Veröffentlicht: (2024)
Evaluating and Enhancing Large Language Models for Conversational Reasoning on Knowledge Graphs
von: Huang, Yuxuan
Veröffentlicht: (2023)
von: Huang, Yuxuan
Veröffentlicht: (2023)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
von: Feng, Bo-Han, et al.
Veröffentlicht: (2026)
von: Feng, Bo-Han, et al.
Veröffentlicht: (2026)
Equipping Retrieval-Augmented Large Language Models with Document Structure Awareness
von: Xu, Lingnan, et al.
Veröffentlicht: (2025)
von: Xu, Lingnan, et al.
Veröffentlicht: (2025)
SafetyBench: Evaluating the Safety of Large Language Models
von: Zhang, Zhexin, et al.
Veröffentlicht: (2023)
von: Zhang, Zhexin, et al.
Veröffentlicht: (2023)
Calibrating the Confidence of Large Language Models by Eliciting Fidelity
von: Zhang, Mozhi, et al.
Veröffentlicht: (2024)
von: Zhang, Mozhi, et al.
Veröffentlicht: (2024)
Design, Results and Industry Implications of the World's First Insurance Large Language Model Evaluation Benchmark
von: Zhou, Hua, et al.
Veröffentlicht: (2025)
von: Zhou, Hua, et al.
Veröffentlicht: (2025)
Pruning General Large Language Models into Customized Expert Models
von: Zhao, Yirao, et al.
Veröffentlicht: (2025)
von: Zhao, Yirao, et al.
Veröffentlicht: (2025)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
von: Su, Yuchen, et al.
Veröffentlicht: (2026)
von: Su, Yuchen, et al.
Veröffentlicht: (2026)
Rethinking the Evaluation for Conversational Recommendation in the Era of Large Language Models
von: Wang, Xiaolei, et al.
Veröffentlicht: (2023)
von: Wang, Xiaolei, et al.
Veröffentlicht: (2023)
Affect Recognition in Conversations Using Large Language Models
von: Feng, Shutong, et al.
Veröffentlicht: (2023)
von: Feng, Shutong, et al.
Veröffentlicht: (2023)
How do Large Language Models Handle Multilingualism?
von: Zhao, Yiran, et al.
Veröffentlicht: (2024)
von: Zhao, Yiran, et al.
Veröffentlicht: (2024)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
von: Chen, Wei-Chih, et al.
Veröffentlicht: (2026)
von: Chen, Wei-Chih, et al.
Veröffentlicht: (2026)
ICLEval: Evaluating In-Context Learning Ability of Large Language Models
von: Chen, Wentong, et al.
Veröffentlicht: (2024)
von: Chen, Wentong, et al.
Veröffentlicht: (2024)
Self-Debias: Self-correcting for Debiasing Large Language Models
von: Feng, Xuan, et al.
Veröffentlicht: (2026)
von: Feng, Xuan, et al.
Veröffentlicht: (2026)
The Rise of Parameter Specialization for Knowledge Storage in Large Language Models
von: Hong, Yihuai, et al.
Veröffentlicht: (2025)
von: Hong, Yihuai, et al.
Veröffentlicht: (2025)
SFTMix: Elevating Language Model Instruction Tuning with Mixup Recipe
von: Xiao, Yuxin, et al.
Veröffentlicht: (2024)
von: Xiao, Yuxin, et al.
Veröffentlicht: (2024)
Multilingual Jailbreak Challenges in Large Language Models
von: Deng, Yue, et al.
Veröffentlicht: (2023)
von: Deng, Yue, et al.
Veröffentlicht: (2023)
Evaluating Large Language Models for Radiology Natural Language Processing
von: Liu, Zhengliang, et al.
Veröffentlicht: (2023)
von: Liu, Zhengliang, et al.
Veröffentlicht: (2023)
DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding
von: Zhou, Jiaming, et al.
Veröffentlicht: (2026)
von: Zhou, Jiaming, et al.
Veröffentlicht: (2026)
Evaluating Proactive Risk Awareness of Large Language Models
von: Luo, Xuan, et al.
Veröffentlicht: (2026)
von: Luo, Xuan, et al.
Veröffentlicht: (2026)
AHELM: A Holistic Evaluation of Audio-Language Models
von: Lee, Tony, et al.
Veröffentlicht: (2025)
von: Lee, Tony, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
SI-Bench: Benchmarking Social Intelligence of Large Language Models in Human-to-Human Conversations
von: Huang, Shuai, et al.
Veröffentlicht: (2025) -
SeaLLMs-Audio: Large Audio-Language Models for Southeast Asia
von: Liu, Chaoqun, et al.
Veröffentlicht: (2025) -
Evaluating Robustness of Large Audio Language Models to Audio Injection: An Empirical Study
von: Hou, Guanyu, et al.
Veröffentlicht: (2025) -
Language of Thought Shapes Output Diversity in Large Language Models
von: Xu, Shaoyang, et al.
Veröffentlicht: (2026) -
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
von: Hu, Jiliang, et al.
Veröffentlicht: (2025)