Do Models Hear Like Us? Probing the Representational Alignment of Audio LLMs and Naturalistic EEG
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Haoyun, Xiao, Xin, Zhong, Jiang, Tian, Yu, Xiaohua, Dong, Mao, Yu, Wu, Hao, Wei, Kaiwen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Assessing the Alignment of Audio Representations with Timbre Similarity Ratings
por: Tian, Haokun, et al.
Publicado: (2025)
por: Tian, Haokun, et al.
Publicado: (2025)
HearFit+: Personalized Fitness Monitoring via Audio Signals on Smart Speakers
por: Xie, Yadong, et al.
Publicado: (2025)
por: Xie, Yadong, et al.
Publicado: (2025)
Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation
por: Xin, Yifei, et al.
Publicado: (2024)
por: Xin, Yifei, et al.
Publicado: (2024)
Discrete Audio Representations for Automated Audio Captioning
por: Tian, Jingguang, et al.
Publicado: (2025)
por: Tian, Jingguang, et al.
Publicado: (2025)
AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment
por: Chen, Yu, et al.
Publicado: (2025)
por: Chen, Yu, et al.
Publicado: (2025)
Identifying Hearing Difficulty Moments in Conversational Audio
por: Collins, Jack, et al.
Publicado: (2025)
por: Collins, Jack, et al.
Publicado: (2025)
Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
por: Ren, Yong, et al.
Publicado: (2025)
por: Ren, Yong, et al.
Publicado: (2025)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
por: Li, Chenxing, et al.
Publicado: (2024)
por: Li, Chenxing, et al.
Publicado: (2024)
Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers
por: Lin, Liang, et al.
Publicado: (2025)
por: Lin, Liang, et al.
Publicado: (2025)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
por: Hai, Jiarui, et al.
Publicado: (2024)
por: Hai, Jiarui, et al.
Publicado: (2024)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
por: Ren, Yong, et al.
Publicado: (2024)
por: Ren, Yong, et al.
Publicado: (2024)
I Can Hear You: Selective Robust Training for Deepfake Audio Detection
por: Zhang, Zirui, et al.
Publicado: (2024)
por: Zhang, Zirui, et al.
Publicado: (2024)
Video-to-Audio Generation with Fine-grained Temporal Semantics
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
por: Rong, Yan, et al.
Publicado: (2025)
por: Rong, Yan, et al.
Publicado: (2025)
Audio-Driven Reinforcement Learning for Head-Orientation in Naturalistic Environments
por: Ledder, Wessel, et al.
Publicado: (2024)
por: Ledder, Wessel, et al.
Publicado: (2024)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
por: Xi, Yu, et al.
Publicado: (2024)
por: Xi, Yu, et al.
Publicado: (2024)
Naturalistic Music Decoding from EEG Data via Latent Diffusion Models
por: Postolache, Emilian, et al.
Publicado: (2024)
por: Postolache, Emilian, et al.
Publicado: (2024)
Hearing Health in Home Healthcare: Leveraging LLMs for Illness Scoring and ALMs for Vocal Biomarker Extraction
por: Chen, Yu-Wen, et al.
Publicado: (2025)
por: Chen, Yu-Wen, et al.
Publicado: (2025)
WAKE: Watermarking Audio with Key Enrichment
por: Xu, Yaoxun, et al.
Publicado: (2025)
por: Xu, Yaoxun, et al.
Publicado: (2025)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
por: Ratnarajah, Anton, et al.
Publicado: (2023)
por: Ratnarajah, Anton, et al.
Publicado: (2023)
Compositional Audio Representation Learning
por: Sridhar, Sripathi, et al.
Publicado: (2024)
por: Sridhar, Sripathi, et al.
Publicado: (2024)
STFTCodec: High-Fidelity Audio Compression through Time-Frequency Domain Representation
por: Feng, Tao, et al.
Publicado: (2025)
por: Feng, Tao, et al.
Publicado: (2025)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
por: Yao, Dong, et al.
Publicado: (2023)
por: Yao, Dong, et al.
Publicado: (2023)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
por: Wang, Yucheng, et al.
Publicado: (2026)
por: Wang, Yucheng, et al.
Publicado: (2026)
Audio Fingerprinting with Holographic Reduced Representations
por: Fujita, Yusuke, et al.
Publicado: (2024)
por: Fujita, Yusuke, et al.
Publicado: (2024)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
por: Chen, Wenxi, et al.
Publicado: (2024)
por: Chen, Wenxi, et al.
Publicado: (2024)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
por: Xiao, Yang, et al.
Publicado: (2026)
por: Xiao, Yang, et al.
Publicado: (2026)
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?
por: Rouditchenko, Andrew, et al.
Publicado: (2025)
por: Rouditchenko, Andrew, et al.
Publicado: (2025)
SECodec: Structural Entropy-based Compressive Speech Representation Codec for Speech Language Models
por: Wang, Linqin, et al.
Publicado: (2024)
por: Wang, Linqin, et al.
Publicado: (2024)
Automated Analysis of Naturalistic Recordings in Early Childhood: Applications, Challenges, and Opportunities
por: Li, Jialu, et al.
Publicado: (2025)
por: Li, Jialu, et al.
Publicado: (2025)
MSP-Conversation: A Corpus for Naturalistic, Time-Continuous Emotion Recognition
por: Martinez-Lucas, Luz, et al.
Publicado: (2026)
por: Martinez-Lucas, Luz, et al.
Publicado: (2026)
Learning Domain-Robust Bioacoustic Representations for Mosquito Species Classification with Contrastive Learning and Distribution Alignment
por: Hou, Yuanbo, et al.
Publicado: (2025)
por: Hou, Yuanbo, et al.
Publicado: (2025)
HearSmoking: Smoking Detection in Driving Environment via Acoustic Sensing on Smartphones
por: Xie, Yadong, et al.
Publicado: (2025)
por: Xie, Yadong, et al.
Publicado: (2025)
Natural Language Supervision for General-Purpose Audio Representations
por: Elizalde, Benjamin, et al.
Publicado: (2023)
por: Elizalde, Benjamin, et al.
Publicado: (2023)
MINT: Boosting Audio-Language Model via Multi-Target Pre-Training and Instruction Tuning
por: Zhao, Hang, et al.
Publicado: (2024)
por: Zhao, Hang, et al.
Publicado: (2024)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
por: Yang, Dongchao, et al.
Publicado: (2023)
por: Yang, Dongchao, et al.
Publicado: (2023)
Frequency-Based Alignment of EEG and Audio Signals Using Contrastive Learning and SincNet for Auditory Attention Detection
por: Liao, Yuan, et al.
Publicado: (2025)
por: Liao, Yuan, et al.
Publicado: (2025)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
por: Jia, Yuhang, et al.
Publicado: (2025)
por: Jia, Yuhang, et al.
Publicado: (2025)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
por: Lu, Ye-Xin, et al.
Publicado: (2025)
por: Lu, Ye-Xin, et al.
Publicado: (2025)
Ejemplares similares
-
Assessing the Alignment of Audio Representations with Timbre Similarity Ratings
por: Tian, Haokun, et al.
Publicado: (2025) -
HearFit+: Personalized Fitness Monitoring via Audio Signals on Smart Speakers
por: Xie, Yadong, et al.
Publicado: (2025) -
Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation
por: Xin, Yifei, et al.
Publicado: (2024) -
Discrete Audio Representations for Automated Audio Captioning
por: Tian, Jingguang, et al.
Publicado: (2025) -
AV-SSAN: Audio-Visual Selective DoA Estimation through Explicit Multi-Band Semantic-Spatial Alignment
por: Chen, Yu, et al.
Publicado: (2025)