Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
Fuente:
arXiv
Guardado en:
| Autores principales: | Kong, Zhifeng, Goel, Arushi, Badlani, Rohan, Ping, Wei, Valle, Rafael, Catanzaro, Bryan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Audio Dialogues: Dialogues dataset for audio and music understanding
por: Goel, Arushi, et al.
Publicado: (2024)
por: Goel, Arushi, et al.
Publicado: (2024)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
por: Ghosh, Sreyan, et al.
Publicado: (2025)
por: Ghosh, Sreyan, et al.
Publicado: (2025)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
por: Goel, Arushi, et al.
Publicado: (2025)
por: Goel, Arushi, et al.
Publicado: (2025)
ETTA: Elucidating the Design Space of Text-to-Audio Models
por: Lee, Sang-gil, et al.
Publicado: (2024)
por: Lee, Sang-gil, et al.
Publicado: (2024)
Scaling NVIDIA's Multi-speaker Multi-lingual TTS Systems with Zero-Shot TTS to Indic Languages
por: Arora, Akshit, et al.
Publicado: (2024)
por: Arora, Akshit, et al.
Publicado: (2024)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
por: Ghosh, Sreyan, et al.
Publicado: (2026)
por: Ghosh, Sreyan, et al.
Publicado: (2026)
Music Flamingo: Scaling Music Understanding in Audio Language Models
por: Ghosh, Sreyan, et al.
Publicado: (2025)
por: Ghosh, Sreyan, et al.
Publicado: (2025)
A2SB: Audio-to-Audio Schrodinger Bridges
por: Kong, Zhifeng, et al.
Publicado: (2025)
por: Kong, Zhifeng, et al.
Publicado: (2025)
Improving Text-To-Audio Models with Synthetic Captions
por: Kong, Zhifeng, et al.
Publicado: (2024)
por: Kong, Zhifeng, et al.
Publicado: (2024)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
MiMo-Audio: Audio Language Models are Few-Shot Learners
por: Core Team, et al.
Publicado: (2025)
por: Core Team, et al.
Publicado: (2025)
PALM: Few-Shot Prompt Learning for Audio Language Models
por: Hanif, Asif, et al.
Publicado: (2024)
por: Hanif, Asif, et al.
Publicado: (2024)
Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation
por: Yang, Mu, et al.
Publicado: (2024)
por: Yang, Mu, et al.
Publicado: (2024)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization
por: Hung, Chia-Yu, et al.
Publicado: (2024)
por: Hung, Chia-Yu, et al.
Publicado: (2024)
DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio
por: Nakata, Wataru, et al.
Publicado: (2026)
por: Nakata, Wataru, et al.
Publicado: (2026)
Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment
por: Neekhara, Paarth, et al.
Publicado: (2024)
por: Neekhara, Paarth, et al.
Publicado: (2024)
PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification
por: Seth, Ashish, et al.
Publicado: (2024)
por: Seth, Ashish, et al.
Publicado: (2024)
Pengi: An Audio Language Model for Audio Tasks
por: Deshmukh, Soham, et al.
Publicado: (2023)
por: Deshmukh, Soham, et al.
Publicado: (2023)
SemanticAudio: Audio Generation and Editing in Semantic Space
por: Dai, Zheqi, et al.
Publicado: (2026)
por: Dai, Zheqi, et al.
Publicado: (2026)
Can Quantized Audio Language Models Perform Zero-Shot Spoofing Detection?
por: Dutta, Bikash, et al.
Publicado: (2025)
por: Dutta, Bikash, et al.
Publicado: (2025)
Listen, Analyze, and Adapt to Learn New Attacks: An Exemplar-Free Class Incremental Learning Method for Audio Deepfake Source Tracing
por: Xiao, Yang, et al.
Publicado: (2025)
por: Xiao, Yang, et al.
Publicado: (2025)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
LC-Protonets: Multi-Label Few-Shot Learning for World Music Audio Tagging
por: Papaioannou, Charilaos, et al.
Publicado: (2024)
por: Papaioannou, Charilaos, et al.
Publicado: (2024)
On the Transferability of Large-Scale Self-Supervision to Few-Shot Audio Classification
por: Heggan, Calum, et al.
Publicado: (2024)
por: Heggan, Calum, et al.
Publicado: (2024)
A Generative-First Neural Audio Autoencoder
por: Casebeer, Jonah, et al.
Publicado: (2026)
por: Casebeer, Jonah, et al.
Publicado: (2026)
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2023)
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2023)
Unlocking Large Audio-Language Models for Interactive Language Learning
por: Liu, Hongfu, et al.
Publicado: (2026)
por: Liu, Hongfu, et al.
Publicado: (2026)
The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
por: O'Reilly, Patrick, et al.
Publicado: (2025)
por: O'Reilly, Patrick, et al.
Publicado: (2025)
Zero-Shot Audio Captioning Using Soft and Hard Prompts
por: Zhang, Yiming, et al.
Publicado: (2024)
por: Zhang, Yiming, et al.
Publicado: (2024)
Continuous Audio Language Models
por: Rouard, Simon, et al.
Publicado: (2025)
por: Rouard, Simon, et al.
Publicado: (2025)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
por: Ivry, Amir, et al.
Publicado: (2026)
por: Ivry, Amir, et al.
Publicado: (2026)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
por: Dinkel, Heinrich, et al.
Publicado: (2026)
por: Dinkel, Heinrich, et al.
Publicado: (2026)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
por: Wang, Yuanyuan, et al.
Publicado: (2024)
por: Wang, Yuanyuan, et al.
Publicado: (2024)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
por: Wang, Helin, et al.
Publicado: (2024)
por: Wang, Helin, et al.
Publicado: (2024)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
por: Yang, Dongchao, et al.
Publicado: (2023)
por: Yang, Dongchao, et al.
Publicado: (2023)
S-KEY: Self-supervised Learning of Major and Minor Keys from Audio
por: Kong, Yuexuan, et al.
Publicado: (2025)
por: Kong, Yuexuan, et al.
Publicado: (2025)
Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training
por: Udupa, Sathvik, et al.
Publicado: (2025)
por: Udupa, Sathvik, et al.
Publicado: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
por: Gong, Yitian, et al.
Publicado: (2026)
por: Gong, Yitian, et al.
Publicado: (2026)
Compositional Audio Representation Learning
por: Sridhar, Sripathi, et al.
Publicado: (2024)
por: Sridhar, Sripathi, et al.
Publicado: (2024)
Ejemplares similares
-
Audio Dialogues: Dialogues dataset for audio and music understanding
por: Goel, Arushi, et al.
Publicado: (2024) -
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
por: Ghosh, Sreyan, et al.
Publicado: (2025) -
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
por: Goel, Arushi, et al.
Publicado: (2025) -
ETTA: Elucidating the Design Space of Text-to-Audio Models
por: Lee, Sang-gil, et al.
Publicado: (2024) -
Scaling NVIDIA's Multi-speaker Multi-lingual TTS Systems with Zero-Shot TTS to Indic Languages
por: Arora, Akshit, et al.
Publicado: (2024)