AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Xilin, Wang, Qiaolin, Wu, Junkai, He, Xiaomin, Xu, Zhongweiyang, Ma, Yinghao, Piao, Minshuo, Yang, Kaiyi, Zheng, Xiuwen, Shimizu, Riki, Chen, Yicong, Firoozi, Arsalan, Mischler, Gavin, Dindar, Sukru Samet, Antonello, Richard, He, Linyang, Hsieh, Tsun-An, Fan, Xulin, Wu, Yulun, Ma, Yuesheng, Amballa, Chaitanya, Chen, Weixiong, Hai, Jiarui, Li, Ruisi, Choudhari, Vishal, Han, Cong, Li, Yinghao Aaron, Flinker, Adeen, Elhilali, Mounya, Benetos, Emmanouil, Hasegawa-Johnson, Mark, Choudhury, Romit Roy, Mesgarani, Nima |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AAD-LLM: Neural Attention-Driven Auditory Scene Understanding
por: Jiang, Xilin, et al.
Publicado: (2025)
por: Jiang, Xilin, et al.
Publicado: (2025)
Layer-wise Minimal Pair Probing Reveals Contextual Grammatical-Conceptual Hierarchy in Speech Representations
por: He, Linyang, et al.
Publicado: (2025)
por: He, Linyang, et al.
Publicado: (2025)
SynSonic: Augmenting Sound Event Detection through Text-to-Audio Diffusion ControlNet and Effective Sample Filtering
por: Hai, Jiarui, et al.
Publicado: (2025)
por: Hai, Jiarui, et al.
Publicado: (2025)
DECAF: Dynamic Envelope Context-Aware Fusion for Speech-Envelope Reconstruction from EEG
por: Thakkar, Karan, et al.
Publicado: (2026)
por: Thakkar, Karan, et al.
Publicado: (2026)
A Scalable Pipeline for Estimating Verb Frame Frequencies Using Large Language Models
por: Morgan, Adam M., et al.
Publicado: (2025)
por: Morgan, Adam M., et al.
Publicado: (2025)
SAR-LM: Symbolic Audio Reasoning with Large Language Models
por: Taheri, Termeh, et al.
Publicado: (2025)
por: Taheri, Termeh, et al.
Publicado: (2025)
SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
por: Wang, Qiaolin, et al.
Publicado: (2025)
por: Wang, Qiaolin, et al.
Publicado: (2025)
Contextual Feature Extraction Hierarchies Converge in Large Language Models and the Brain
por: Mischler, Gavin, et al.
Publicado: (2024)
por: Mischler, Gavin, et al.
Publicado: (2024)
Far from the Shallow: Brain-Predictive Reasoning Embedding through Residual Disentanglement
por: He, Linyang, et al.
Publicado: (2025)
por: He, Linyang, et al.
Publicado: (2025)
Learning Energy-based Variational Latent Prior for VAEs
por: Dutta, Debottam, et al.
Publicado: (2025)
por: Dutta, Debottam, et al.
Publicado: (2025)
XCOMPS: A Multilingual Benchmark of Conceptual Minimal Pairs
por: He, Linyang, et al.
Publicado: (2025)
por: He, Linyang, et al.
Publicado: (2025)
Cross-Referencing Self-Training Network for Sound Event Detection in Audio Mixtures
por: Park, Sangwook, et al.
Publicado: (2021)
por: Park, Sangwook, et al.
Publicado: (2021)
From Chains to DAGs: Probing the Graph Structure of Reasoning in LLMs
por: Zhong, Tianjun, et al.
Publicado: (2026)
por: Zhong, Tianjun, et al.
Publicado: (2026)
Prune, Interpret, Evaluate: A Cross-Layer Transcoder-Native Framework for Efficient Circuit Discovery via Feature Attribution
por: Chen, Qinhao, et al.
Publicado: (2026)
por: Chen, Qinhao, et al.
Publicado: (2026)
ArrayDPS: Unsupervised Blind Speech Separation with a Diffusion Prior
por: Xu, Zhongweiyang, et al.
Publicado: (2025)
por: Xu, Zhongweiyang, et al.
Publicado: (2025)
DeCoR: Defy Knowledge Forgetting by Predicting Earlier Audio Codes
por: Jiang, Xilin, et al.
Publicado: (2023)
por: Jiang, Xilin, et al.
Publicado: (2023)
Contrastive Diffusion Guidance for Spatial Inverse Problems
por: Basu, Sattwik, et al.
Publicado: (2025)
por: Basu, Sattwik, et al.
Publicado: (2025)
FlexSED: Towards Open-Vocabulary Sound Event Detection
por: Hai, Jiarui, et al.
Publicado: (2025)
por: Hai, Jiarui, et al.
Publicado: (2025)
CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following
por: Ma, Yinghao, et al.
Publicado: (2025)
por: Ma, Yinghao, et al.
Publicado: (2025)
Comparison of sEMG Encoding Accuracy Across Speech Modes Using Articulatory and Phoneme Features
por: Le, Chenqian, et al.
Publicado: (2026)
por: Le, Chenqian, et al.
Publicado: (2026)
StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion
por: Li, Yinghao Aaron, et al.
Publicado: (2024)
por: Li, Yinghao Aaron, et al.
Publicado: (2024)
Listen, Chat, and Remix: Text-Guided Soundscape Remixing for Enhanced Auditory Experience
por: Jiang, Xilin, et al.
Publicado: (2024)
por: Jiang, Xilin, et al.
Publicado: (2024)
Perception of dynamic multi-speaker auditory scenes under different modes of attention
por: Graceffo, Stephanie, et al.
Publicado: (2025)
por: Graceffo, Stephanie, et al.
Publicado: (2025)
DreamVoice: Text-Guided Voice Conversion
por: Hai, Jiarui, et al.
Publicado: (2024)
por: Hai, Jiarui, et al.
Publicado: (2024)
MeanFlow-TSE: One-Step Generative Target Speaker Extraction with Mean Flow
por: Shimizu, Riki, et al.
Publicado: (2025)
por: Shimizu, Riki, et al.
Publicado: (2025)
GroupCDL: Interpretable Denoising and Compressed Sensing MRI via Learned Group-Sparsity and Circulant Attention
por: Janjusevic, Nikola, et al.
Publicado: (2024)
por: Janjusevic, Nikola, et al.
Publicado: (2024)
Analysis of Building Indoor Earthquake Evacuation Considering Collaborative Collapse and Debris Distributions of Suspended Ceilings and Masonry Infill Walls
por: Yinghao Duan, et al.
Publicado: (2026)
por: Yinghao Duan, et al.
Publicado: (2026)
SSAMBA: Self-Supervised Audio Representation Learning with Mamba State Space Model
por: Shams, Siavash, et al.
Publicado: (2024)
por: Shams, Siavash, et al.
Publicado: (2024)
Bridging Ears and Eyes: Analyzing Audio and Visual Large Language Models to Humans in Visible Sound Recognition and Reducing Their Sensory Gap via Cross-Modal Distillation
por: Jiang, Xilin, et al.
Publicado: (2025)
por: Jiang, Xilin, et al.
Publicado: (2025)
Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation
por: Li, Yinghao Aaron, et al.
Publicado: (2024)
por: Li, Yinghao Aaron, et al.
Publicado: (2024)
Explicit Context-Driven Neural Acoustic Modeling for High-Fidelity RIR Generation
por: Si, Chen, et al.
Publicado: (2025)
por: Si, Chen, et al.
Publicado: (2025)
Multi-Source Music Generation with Latent Diffusion
por: Xu, Zhongweiyang, et al.
Publicado: (2024)
por: Xu, Zhongweiyang, et al.
Publicado: (2024)
Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
por: Jiang, Xilin, et al.
Publicado: (2024)
por: Jiang, Xilin, et al.
Publicado: (2024)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
por: Wang, Helin, et al.
Publicado: (2024)
por: Wang, Helin, et al.
Publicado: (2024)
A refined simulation method of building earthquake evacuation processes considering multi‐exits and time‐variant velocities
por: Yinghao Duan, et al.
Publicado: (2024)
por: Yinghao Duan, et al.
Publicado: (2024)
CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction
por: Ma, Yinghao, et al.
Publicado: (2026)
por: Ma, Yinghao, et al.
Publicado: (2026)
Large Language Models as Neurolinguistic Subjects: Discrepancy between Performance and Competence
por: He, Linyang, et al.
Publicado: (2024)
por: He, Linyang, et al.
Publicado: (2024)
Discrete Langevin-Inspired Posterior Sampling
por: Amballa, Chaitanya, et al.
Publicado: (2026)
por: Amballa, Chaitanya, et al.
Publicado: (2026)
MusiLingo: Bridging Music and Text with Pre-trained Language Models for Music Captioning and Query Response
por: Deng, Zihao, et al.
Publicado: (2023)
por: Deng, Zihao, et al.
Publicado: (2023)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
por: Hai, Jiarui, et al.
Publicado: (2024)
por: Hai, Jiarui, et al.
Publicado: (2024)
Ejemplares similares
-
AAD-LLM: Neural Attention-Driven Auditory Scene Understanding
por: Jiang, Xilin, et al.
Publicado: (2025) -
Layer-wise Minimal Pair Probing Reveals Contextual Grammatical-Conceptual Hierarchy in Speech Representations
por: He, Linyang, et al.
Publicado: (2025) -
SynSonic: Augmenting Sound Event Detection through Text-to-Audio Diffusion ControlNet and Effective Sample Filtering
por: Hai, Jiarui, et al.
Publicado: (2025) -
DECAF: Dynamic Envelope Context-Aware Fusion for Speech-Envelope Reconstruction from EEG
por: Thakkar, Karan, et al.
Publicado: (2026) -
A Scalable Pipeline for Estimating Verb Frame Frequencies Using Large Language Models
por: Morgan, Adam M., et al.
Publicado: (2025)