AudioRWKV: Efficient and Stable Bidirectional RWKV for Audio Pattern Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiong, Jiayu, Xue, Jun, Kwan, Jianlong, Wang, Jing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RWKVTTS: Yet another TTS based on RWKV-7
di: yueyu, Lin, et al.
Pubblicazione: (2025)
di: yueyu, Lin, et al.
Pubblicazione: (2025)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
di: Sun, Zhe, et al.
Pubblicazione: (2025)
di: Sun, Zhe, et al.
Pubblicazione: (2025)
AudioFab: Building A General and Intelligent Audio Factory through Tool Learning
di: Zhu, Cheng, et al.
Pubblicazione: (2025)
di: Zhu, Cheng, et al.
Pubblicazione: (2025)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
Adaptable Symbolic Music Infilling with MIDI-RWKV
di: Zhou-Zheng, Christian, et al.
Pubblicazione: (2025)
di: Zhou-Zheng, Christian, et al.
Pubblicazione: (2025)
RawBMamba: End-to-End Bidirectional State Space Model for Audio Deepfake Detection
di: Chen, Yujie, et al.
Pubblicazione: (2024)
di: Chen, Yujie, et al.
Pubblicazione: (2024)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024)
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024)
Stable Audio 3
di: Evans, Zach, et al.
Pubblicazione: (2026)
di: Evans, Zach, et al.
Pubblicazione: (2026)
Video RWKV:Video Action Recognition Based RWKV
di: Yin, Zhuowen, et al.
Pubblicazione: (2024)
di: Yin, Zhuowen, et al.
Pubblicazione: (2024)
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
di: Li, Yangze, et al.
Pubblicazione: (2024)
di: Li, Yangze, et al.
Pubblicazione: (2024)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
di: Wang, Yuxuan, et al.
Pubblicazione: (2026)
di: Wang, Yuxuan, et al.
Pubblicazione: (2026)
Not in Sync: Unveiling Temporal Bias in Audio Chat Models
di: Yao, Jiayu, et al.
Pubblicazione: (2025)
di: Yao, Jiayu, et al.
Pubblicazione: (2025)
Improving Audio Event Recognition with Consistency Regularization
di: Sadhu, Shanmuka, et al.
Pubblicazione: (2025)
di: Sadhu, Shanmuka, et al.
Pubblicazione: (2025)
Audio Processing using Pattern Recognition for Music Genre Classification
di: Chatterjee, Sivangi, et al.
Pubblicazione: (2024)
di: Chatterjee, Sivangi, et al.
Pubblicazione: (2024)
Hierarchical Activity Recognition and Captioning from Long-Form Audio
di: Zhang, Peng, et al.
Pubblicazione: (2026)
di: Zhang, Peng, et al.
Pubblicazione: (2026)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
di: Tian, Jingqi, et al.
Pubblicazione: (2025)
di: Tian, Jingqi, et al.
Pubblicazione: (2025)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
di: Liu, Chengwei, et al.
Pubblicazione: (2025)
di: Liu, Chengwei, et al.
Pubblicazione: (2025)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
di: Xiong, Zhen, et al.
Pubblicazione: (2025)
di: Xiong, Zhen, et al.
Pubblicazione: (2025)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
di: Wang, Junyou, et al.
Pubblicazione: (2025)
di: Wang, Junyou, et al.
Pubblicazione: (2025)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
Stable Audio Open
di: Evans, Zach, et al.
Pubblicazione: (2024)
di: Evans, Zach, et al.
Pubblicazione: (2024)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
Cocktail-Party Audio-Visual Speech Recognition
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2025)
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2025)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
di: Zhang, Dan, et al.
Pubblicazione: (2026)
di: Zhang, Dan, et al.
Pubblicazione: (2026)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
di: Duan, Yuchen, et al.
Pubblicazione: (2024)
di: Duan, Yuchen, et al.
Pubblicazione: (2024)
Restore-RWKV: Efficient and Effective Medical Image Restoration with RWKV
di: Yang, Zhiwen, et al.
Pubblicazione: (2024)
di: Yang, Zhiwen, et al.
Pubblicazione: (2024)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
AudioToolAgent: An Agentic Framework for Audio-Language Models
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
MUKA: Multi Kernel Audio Adaptation Of Audio-Language Models
di: Bensaid, Reda, et al.
Pubblicazione: (2026)
di: Bensaid, Reda, et al.
Pubblicazione: (2026)
QuarkAudio Technical Report
di: Liu, Chengwei, et al.
Pubblicazione: (2025)
di: Liu, Chengwei, et al.
Pubblicazione: (2025)
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
di: Seth, Ashish, et al.
Pubblicazione: (2026)
di: Seth, Ashish, et al.
Pubblicazione: (2026)
AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing
di: Chen, William, et al.
Pubblicazione: (2026)
di: Chen, William, et al.
Pubblicazione: (2026)
Documenti analoghi
-
RWKVTTS: Yet another TTS based on RWKV-7
di: yueyu, Lin, et al.
Pubblicazione: (2025) -
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
di: Sun, Zhe, et al.
Pubblicazione: (2025) -
AudioFab: Building A General and Intelligent Audio Factory through Tool Learning
di: Zhu, Cheng, et al.
Pubblicazione: (2025) -
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
di: Qiu, Jielin, et al.
Pubblicazione: (2026) -
Adaptable Symbolic Music Infilling with MIDI-RWKV
di: Zhou-Zheng, Christian, et al.
Pubblicazione: (2025)