Language-based Audio Moment Retrieval
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Munakata, Hokuto, Nishimura, Taichi, Nakada, Shota, Komatsu, Tatsuya |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries
von: Munakata, Hokuto, et al.
Veröffentlicht: (2025)
von: Munakata, Hokuto, et al.
Veröffentlicht: (2025)
DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information
von: Nakada, Shota, et al.
Veröffentlicht: (2024)
von: Nakada, Shota, et al.
Veröffentlicht: (2024)
ProLAP: Probabilistic Language-Audio Pre-Training
von: Manabe, Toranosuke, et al.
Veröffentlicht: (2025)
von: Manabe, Toranosuke, et al.
Veröffentlicht: (2025)
On the Audio Hallucinations in Large Audio-Video Language Models
von: Nishimura, Taichi, et al.
Veröffentlicht: (2024)
von: Nishimura, Taichi, et al.
Veröffentlicht: (2024)
Song Data Cleansing for End-to-End Neural Singer Diarization Using Neural Analysis and Synthesis Framework
von: Munakata, Hokuto, et al.
Veröffentlicht: (2024)
von: Munakata, Hokuto, et al.
Veröffentlicht: (2024)
Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos
von: Ishikawa, Yuchi, et al.
Veröffentlicht: (2025)
von: Ishikawa, Yuchi, et al.
Veröffentlicht: (2025)
Keep Decoding Parallel with Effective Knowledge Distillation from Language Models to End-to-end Speech Recognisers
von: Hentschel, Michael, et al.
Veröffentlicht: (2024)
von: Hentschel, Michael, et al.
Veröffentlicht: (2024)
Audio Fingerprinting with Holographic Reduced Representations
von: Fujita, Yusuke, et al.
Veröffentlicht: (2024)
von: Fujita, Yusuke, et al.
Veröffentlicht: (2024)
Bridging Language Gaps in Audio-Text Retrieval
von: Yan, Zhiyong, et al.
Veröffentlicht: (2024)
von: Yan, Zhiyong, et al.
Veröffentlicht: (2024)
Lighthouse: A User-Friendly Library for Reproducible Video Moment Retrieval and Highlight Detection
von: Nishimura, Taichi, et al.
Veröffentlicht: (2024)
von: Nishimura, Taichi, et al.
Veröffentlicht: (2024)
Self-Supervised Syllable Discovery Based on Speaker-Disentangled HuBERT
von: Komatsu, Ryota, et al.
Veröffentlicht: (2024)
von: Komatsu, Ryota, et al.
Veröffentlicht: (2024)
AudioBench: A Universal Benchmark for Audio Large Language Models
von: Wang, Bin, et al.
Veröffentlicht: (2024)
von: Wang, Bin, et al.
Veröffentlicht: (2024)
MiMo-Audio: Audio Language Models are Few-Shot Learners
von: Core Team, et al.
Veröffentlicht: (2025)
von: Core Team, et al.
Veröffentlicht: (2025)
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
von: Sridhar, Arvind Krishna, et al.
Veröffentlicht: (2024)
von: Sridhar, Arvind Krishna, et al.
Veröffentlicht: (2024)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
von: Liu, Jizhong, et al.
Veröffentlicht: (2024)
von: Liu, Jizhong, et al.
Veröffentlicht: (2024)
Self-supervised learning method using multiple sampling strategies for general-purpose audio representation
von: Kuroyanagi, Ibuki, et al.
Veröffentlicht: (2025)
von: Kuroyanagi, Ibuki, et al.
Veröffentlicht: (2025)
Quantification of Tenseness in English and Japanese Tense-Lax Vowels: A Lagrangian Model with Indicator θ1 and Force of Tenseness Ftense(t)
von: Ishizaki, Tatsuya
Veröffentlicht: (2025)
von: Ishizaki, Tatsuya
Veröffentlicht: (2025)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection
von: Gu, Hao, et al.
Veröffentlicht: (2025)
von: Gu, Hao, et al.
Veröffentlicht: (2025)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
von: Huang, Ailin, et al.
Veröffentlicht: (2025)
von: Huang, Ailin, et al.
Veröffentlicht: (2025)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
How Contrastive Decoding Enhances Large Audio Language Models?
von: Lin, Tzu-Quan, et al.
Veröffentlicht: (2026)
von: Lin, Tzu-Quan, et al.
Veröffentlicht: (2026)
Probing Audio-Generation Capabilities of Text-Based Language Models
von: Anbazhagan, Arjun Prasaath, et al.
Veröffentlicht: (2025)
von: Anbazhagan, Arjun Prasaath, et al.
Veröffentlicht: (2025)
Spatial Audio Processing with Large Language Model on Wearable Devices
von: Mishra, Ayushi, et al.
Veröffentlicht: (2025)
von: Mishra, Ayushi, et al.
Veröffentlicht: (2025)
Direct Simultaneous Translation Activation for Large Audio-Language Models
von: Zhang, Pei, et al.
Veröffentlicht: (2025)
von: Zhang, Pei, et al.
Veröffentlicht: (2025)
Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model
von: Xue, Jinlong, et al.
Veröffentlicht: (2024)
von: Xue, Jinlong, et al.
Veröffentlicht: (2024)
Boosting Hybrid Autoregressive Transducer-based ASR with Internal Acoustic Model Training and Dual Blank Thresholding
von: Moriya, Takafumi, et al.
Veröffentlicht: (2024)
von: Moriya, Takafumi, et al.
Veröffentlicht: (2024)
SpeechVerse: A Large-scale Generalizable Audio Language Model
von: Das, Nilaksh, et al.
Veröffentlicht: (2024)
von: Das, Nilaksh, et al.
Veröffentlicht: (2024)
CLAIR-A: Leveraging Large Language Models to Judge Audio Captions
von: Wu, Tsung-Han, et al.
Veröffentlicht: (2024)
von: Wu, Tsung-Han, et al.
Veröffentlicht: (2024)
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
von: Li, Bohan, et al.
Veröffentlicht: (2025)
von: Li, Bohan, et al.
Veröffentlicht: (2025)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
von: Chen, Chen, et al.
Veröffentlicht: (2025)
von: Chen, Chen, et al.
Veröffentlicht: (2025)
Sci-Phi: A Large Language Model Spatial Audio Descriptor
von: Jiang, Xilin, et al.
Veröffentlicht: (2025)
von: Jiang, Xilin, et al.
Veröffentlicht: (2025)
Attention or Convolution: Transformer Encoders in Audio Language Models for Inference Efficiency
von: Jeon, Sungho, et al.
Veröffentlicht: (2023)
von: Jeon, Sungho, et al.
Veröffentlicht: (2023)
DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
von: Lu, Ke-Han, et al.
Veröffentlicht: (2025)
von: Lu, Ke-Han, et al.
Veröffentlicht: (2025)
Exploration of Adapter for Noise Robust Automatic Speech Recognition
von: Shi, Hao, et al.
Veröffentlicht: (2024)
von: Shi, Hao, et al.
Veröffentlicht: (2024)
AC/DC: LLM-based Audio Comprehension via Dialogue Continuation
von: Fujita, Yusuke, et al.
Veröffentlicht: (2025)
von: Fujita, Yusuke, et al.
Veröffentlicht: (2025)
SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation
von: Mu, Zhaoxi, et al.
Veröffentlicht: (2025)
von: Mu, Zhaoxi, et al.
Veröffentlicht: (2025)
Universal Score-based Speech Enhancement with High Content Preservation
von: Scheibler, Robin, et al.
Veröffentlicht: (2024)
von: Scheibler, Robin, et al.
Veröffentlicht: (2024)
Alignment-Free Training for Transducer-based Multi-Talker ASR
von: Moriya, Takafumi, et al.
Veröffentlicht: (2024)
von: Moriya, Takafumi, et al.
Veröffentlicht: (2024)
How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation
von: Lu, Ke-Han, et al.
Veröffentlicht: (2026)
von: Lu, Ke-Han, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries
von: Munakata, Hokuto, et al.
Veröffentlicht: (2025) -
DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information
von: Nakada, Shota, et al.
Veröffentlicht: (2024) -
ProLAP: Probabilistic Language-Audio Pre-Training
von: Manabe, Toranosuke, et al.
Veröffentlicht: (2025) -
On the Audio Hallucinations in Large Audio-Video Language Models
von: Nishimura, Taichi, et al.
Veröffentlicht: (2024) -
Song Data Cleansing for End-to-End Neural Singer Diarization Using Neural Analysis and Synthesis Framework
von: Munakata, Hokuto, et al.
Veröffentlicht: (2024)