Spatial Audio Processing with Large Language Model on Wearable Devices
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mishra, Ayushi, Bai, Yang, Narayanasamy, Priyadarshan, Garg, Nakul, Roy, Nirupam |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sci-Phi: A Large Language Model Spatial Audio Descriptor
par: Jiang, Xilin, et autres
Publié: (2025)
par: Jiang, Xilin, et autres
Publié: (2025)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
AudioBench: A Universal Benchmark for Audio Large Language Models
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
Direct Simultaneous Translation Activation for Large Audio-Language Models
par: Zhang, Pei, et autres
Publié: (2025)
par: Zhang, Pei, et autres
Publié: (2025)
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
par: Sridhar, Arvind Krishna, et autres
Publié: (2024)
par: Sridhar, Arvind Krishna, et autres
Publié: (2024)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
par: Huang, Ailin, et autres
Publié: (2025)
par: Huang, Ailin, et autres
Publié: (2025)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
par: Liu, Jizhong, et autres
Publié: (2024)
par: Liu, Jizhong, et autres
Publié: (2024)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection
par: Gu, Hao, et autres
Publié: (2025)
par: Gu, Hao, et autres
Publié: (2025)
How Contrastive Decoding Enhances Large Audio Language Models?
par: Lin, Tzu-Quan, et autres
Publié: (2026)
par: Lin, Tzu-Quan, et autres
Publié: (2026)
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
par: Li, Bohan, et autres
Publié: (2025)
par: Li, Bohan, et autres
Publié: (2025)
SpeechVerse: A Large-scale Generalizable Audio Language Model
par: Das, Nilaksh, et autres
Publié: (2024)
par: Das, Nilaksh, et autres
Publié: (2024)
CLAIR-A: Leveraging Large Language Models to Judge Audio Captions
par: Wu, Tsung-Han, et autres
Publié: (2024)
par: Wu, Tsung-Han, et autres
Publié: (2024)
AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation
par: Manakul, Potsawee, et autres
Publié: (2025)
par: Manakul, Potsawee, et autres
Publié: (2025)
Resurfacing Paralinguistic Awareness in Large Audio Language Models
par: Yang, Hao, et autres
Publié: (2026)
par: Yang, Hao, et autres
Publié: (2026)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
par: Lu, Ke-Han, et autres
Publié: (2025)
par: Lu, Ke-Han, et autres
Publié: (2025)
MiMo-Audio: Audio Language Models are Few-Shot Learners
par: Core Team, et autres
Publié: (2025)
par: Core Team, et autres
Publié: (2025)
Mind the Gap! Static and Interactive Evaluations of Large Audio Models
par: Li, Minzhi, et autres
Publié: (2025)
par: Li, Minzhi, et autres
Publié: (2025)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation
par: Mu, Zhaoxi, et autres
Publié: (2025)
par: Mu, Zhaoxi, et autres
Publié: (2025)
High-precision medical speech recognition through synthetic data and semantic correction: UNITED-MEDASR
par: Banerjee, Sourav, et autres
Publié: (2024)
par: Banerjee, Sourav, et autres
Publié: (2024)
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
par: Huang, Hsiao-Ying, et autres
Publié: (2025)
par: Huang, Hsiao-Ying, et autres
Publié: (2025)
Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models
par: Yang, Hao, et autres
Publié: (2024)
par: Yang, Hao, et autres
Publié: (2024)
Reshaping Representation Space to Balance the Safety and Over-rejection in Large Audio Language Models
par: Yang, Hao, et autres
Publié: (2025)
par: Yang, Hao, et autres
Publié: (2025)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
par: Chen, Yiming, et autres
Publié: (2024)
par: Chen, Yiming, et autres
Publié: (2024)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
par: Kuan, Chun-Yi, et autres
Publié: (2025)
par: Kuan, Chun-Yi, et autres
Publié: (2025)
Probing Audio-Generation Capabilities of Text-Based Language Models
par: Anbazhagan, Arjun Prasaath, et autres
Publié: (2025)
par: Anbazhagan, Arjun Prasaath, et autres
Publié: (2025)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
par: Lin, Yi-Cheng, et autres
Publié: (2026)
par: Lin, Yi-Cheng, et autres
Publié: (2026)
Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model
par: Xue, Jinlong, et autres
Publié: (2024)
par: Xue, Jinlong, et autres
Publié: (2024)
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
par: Goel, Arushi, et autres
Publié: (2025)
par: Goel, Arushi, et autres
Publié: (2025)
Attention or Convolution: Transformer Encoders in Audio Language Models for Inference Efficiency
par: Jeon, Sungho, et autres
Publié: (2023)
par: Jeon, Sungho, et autres
Publié: (2023)
How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation
par: Lu, Ke-Han, et autres
Publié: (2026)
par: Lu, Ke-Han, et autres
Publié: (2026)
Language-based Audio Moment Retrieval
par: Munakata, Hokuto, et autres
Publié: (2024)
par: Munakata, Hokuto, et autres
Publié: (2024)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
par: Li, Kai, et autres
Publié: (2025)
par: Li, Kai, et autres
Publié: (2025)
Device-Directed Speech Detection for Follow-up Conversations Using Large Language Models
par: Ognjen, et autres
Publié: (2024)
par: Ognjen, et autres
Publié: (2024)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
Implicit Self-supervised Language Representation for Spoken Language Diarization
par: Mishra, Jagabandhu, et autres
Publié: (2023)
par: Mishra, Jagabandhu, et autres
Publié: (2023)
Documents similaires
-
Sci-Phi: A Large Language Model Spatial Audio Descriptor
par: Jiang, Xilin, et autres
Publié: (2025) -
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
par: Yang, Chih-Kai, et autres
Publié: (2025) -
AudioBench: A Universal Benchmark for Audio Large Language Models
par: Wang, Bin, et autres
Publié: (2024) -
Direct Simultaneous Translation Activation for Large Audio-Language Models
par: Zhang, Pei, et autres
Publié: (2025) -
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
par: Sridhar, Arvind Krishna, et autres
Publié: (2024)