Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
Fuente:
arXiv
Guardado en:
| Autores principales: | Shi, Yanfeng, Cai, Pengfei, Liu, Jun, Gu, Qing, Jiang, Nan, Dai, Lirong, McLoughlin, Ian, Song, Yan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
por: Cai, Pengfei, et al.
Publicado: (2024)
por: Cai, Pengfei, et al.
Publicado: (2024)
MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection
por: Cai, Pengfei, et al.
Publicado: (2024)
por: Cai, Pengfei, et al.
Publicado: (2024)
Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries
por: Cai, Pengfei, et al.
Publicado: (2025)
por: Cai, Pengfei, et al.
Publicado: (2025)
An Efficient Transfer Learning Method Based on Adapter with Local Attributes for Speech Emotion Recognition
por: Song, Haoyu, et al.
Publicado: (2025)
por: Song, Haoyu, et al.
Publicado: (2025)
Video-to-Audio Generation with Fine-grained Temporal Semantics
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
por: Wang, Yuanyuan, et al.
Publicado: (2024)
por: Wang, Yuanyuan, et al.
Publicado: (2024)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
por: Sun, Luoyi, et al.
Publicado: (2026)
por: Sun, Luoyi, et al.
Publicado: (2026)
FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining
por: Li, Xiquan, et al.
Publicado: (2026)
por: Li, Xiquan, et al.
Publicado: (2026)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
por: Chen, Shunian, et al.
Publicado: (2025)
por: Chen, Shunian, et al.
Publicado: (2025)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
por: Sun, Zhe, et al.
Publicado: (2025)
por: Sun, Zhe, et al.
Publicado: (2025)
Post-Training Quantization for Audio Diffusion Transformers
por: Khandelwal, Tanmay, et al.
Publicado: (2025)
por: Khandelwal, Tanmay, et al.
Publicado: (2025)
Accessible Fine-grained Data Representation via Spatial Audio
por: Liu, Can, et al.
Publicado: (2026)
por: Liu, Can, et al.
Publicado: (2026)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
por: Yang, Dongchao, et al.
Publicado: (2023)
por: Yang, Dongchao, et al.
Publicado: (2023)
CodecFlow: Efficient Bandwidth Extension via Conditional Flow Matching in Neural Codec Latent Space
por: Zhang, Bowen, et al.
Publicado: (2026)
por: Zhang, Bowen, et al.
Publicado: (2026)
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
por: Wu, Shih-Lun, et al.
Publicado: (2023)
por: Wu, Shih-Lun, et al.
Publicado: (2023)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
Full-Frequency Temporal Patching and Structured Masking for Enhanced Audio Classification
por: Makineni, Aditya, et al.
Publicado: (2025)
por: Makineni, Aditya, et al.
Publicado: (2025)
Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs
por: Zhang, Linhao, et al.
Publicado: (2026)
por: Zhang, Linhao, et al.
Publicado: (2026)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
por: Rong, Yan, et al.
Publicado: (2025)
por: Rong, Yan, et al.
Publicado: (2025)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
por: Dai, Yusheng, et al.
Publicado: (2026)
por: Dai, Yusheng, et al.
Publicado: (2026)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
por: Wang, Jieyi, et al.
Publicado: (2026)
por: Wang, Jieyi, et al.
Publicado: (2026)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
por: Sinha, Anshuman, et al.
Publicado: (2024)
por: Sinha, Anshuman, et al.
Publicado: (2024)
AudioRWKV: Efficient and Stable Bidirectional RWKV for Audio Pattern Recognition
por: Xiong, Jiayu, et al.
Publicado: (2025)
por: Xiong, Jiayu, et al.
Publicado: (2025)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
por: Jiang, Yuxuan, et al.
Publicado: (2025)
por: Jiang, Yuxuan, et al.
Publicado: (2025)
Detect All-Type Deepfake Audio: Wavelet Prompt Tuning for Enhanced Auditory Perception
por: Xie, Yuankun, et al.
Publicado: (2025)
por: Xie, Yuankun, et al.
Publicado: (2025)
Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
por: Wei, Xiangyi, et al.
Publicado: (2025)
por: Wei, Xiangyi, et al.
Publicado: (2025)
Language Models as Semantic Teachers: Post-Training Alignment for Medical Audio Understanding
por: Wang, Tsai-Ning, et al.
Publicado: (2025)
por: Wang, Tsai-Ning, et al.
Publicado: (2025)
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
por: Xie, Zeyu, et al.
Publicado: (2024)
por: Xie, Zeyu, et al.
Publicado: (2024)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
por: Guo, Xiaoxuan, et al.
Publicado: (2026)
por: Guo, Xiaoxuan, et al.
Publicado: (2026)
Correlation of Fréchet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant
por: Tailleur, Modan, et al.
Publicado: (2024)
por: Tailleur, Modan, et al.
Publicado: (2024)
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
por: Wu, Daiqing, et al.
Publicado: (2026)
por: Wu, Daiqing, et al.
Publicado: (2026)
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
por: Feng, Jiu, et al.
Publicado: (2024)
por: Feng, Jiu, et al.
Publicado: (2024)
Audio ControlNet for Fine-Grained Audio Generation and Editing
por: Zhu, Haina, et al.
Publicado: (2026)
por: Zhu, Haina, et al.
Publicado: (2026)
Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models
por: Li, Yanda, et al.
Publicado: (2026)
por: Li, Yanda, et al.
Publicado: (2026)
Time-Varying Audio Effect Modeling by End-to-End Adversarial Training
por: Bourdin, Yann, et al.
Publicado: (2025)
por: Bourdin, Yann, et al.
Publicado: (2025)
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
por: Primus, Paul, et al.
Publicado: (2025)
por: Primus, Paul, et al.
Publicado: (2025)
AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders
por: Aparin, Georgii, et al.
Publicado: (2026)
por: Aparin, Georgii, et al.
Publicado: (2026)
Audio-Guided Visual Perception for Audio-Visual Navigation
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
por: Luo, Kaiwen, et al.
Publicado: (2026)
por: Luo, Kaiwen, et al.
Publicado: (2026)
Ejemplares similares
-
Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
por: Cai, Pengfei, et al.
Publicado: (2024) -
MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection
por: Cai, Pengfei, et al.
Publicado: (2024) -
Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries
por: Cai, Pengfei, et al.
Publicado: (2025) -
An Efficient Transfer Learning Method Based on Adapter with Local Attributes for Speech Emotion Recognition
por: Song, Haoyu, et al.
Publicado: (2025) -
Video-to-Audio Generation with Fine-grained Temporal Semantics
por: Hu, Yuchen, et al.
Publicado: (2024)