VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Jing, Chen, Sihan, He, Xingjian, Guo, Longteng, Zhu, Xinxin, Wang, Weining, Tang, Jinhui |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AudioSetMix: Enhancing Audio-Language Datasets with LLM-Assisted Augmentations
von: Xu, David
Veröffentlicht: (2024)
von: Xu, David
Veröffentlicht: (2024)
SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models
von: Diao, Xingjian, et al.
Veröffentlicht: (2025)
von: Diao, Xingjian, et al.
Veröffentlicht: (2025)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
von: Liu, Che, et al.
Veröffentlicht: (2025)
von: Liu, Che, et al.
Veröffentlicht: (2025)
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
von: Mei, Xinhao, et al.
Veröffentlicht: (2023)
von: Mei, Xinhao, et al.
Veröffentlicht: (2023)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
von: Wu, Shu, et al.
Veröffentlicht: (2025)
von: Wu, Shu, et al.
Veröffentlicht: (2025)
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
von: Wang, Junyu, et al.
Veröffentlicht: (2025)
von: Wang, Junyu, et al.
Veröffentlicht: (2025)
Resurfacing Paralinguistic Awareness in Large Audio Language Models
von: Yang, Hao, et al.
Veröffentlicht: (2026)
von: Yang, Hao, et al.
Veröffentlicht: (2026)
Learning Audio Concepts from Counterfactual Natural Language
von: Vosoughi, Ali, et al.
Veröffentlicht: (2024)
von: Vosoughi, Ali, et al.
Veröffentlicht: (2024)
Reshaping Representation Space to Balance the Safety and Over-rejection in Large Audio Language Models
von: Yang, Hao, et al.
Veröffentlicht: (2025)
von: Yang, Hao, et al.
Veröffentlicht: (2025)
Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models
von: Yang, Hao, et al.
Veröffentlicht: (2024)
von: Yang, Hao, et al.
Veröffentlicht: (2024)
MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
Quantitative Analysis of Audio-Visual Tasks: An Information-Theoretic Perspective
von: Chen, Chen, et al.
Veröffentlicht: (2024)
von: Chen, Chen, et al.
Veröffentlicht: (2024)
ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction
von: Wu, Wenxuan, et al.
Veröffentlicht: (2025)
von: Wu, Wenxuan, et al.
Veröffentlicht: (2025)
LaunchpadGPT: Language Model as Music Visualization Designer on Launchpad
von: Xu, Siting, et al.
Veröffentlicht: (2023)
von: Xu, Siting, et al.
Veröffentlicht: (2023)
Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance
von: Li, Yuanchao, et al.
Veröffentlicht: (2024)
von: Li, Yuanchao, et al.
Veröffentlicht: (2024)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
von: Chen, Yiming, et al.
Veröffentlicht: (2024)
von: Chen, Yiming, et al.
Veröffentlicht: (2024)
Fine-Tuning MIDI-to-Audio Alignment using a Neural Network on Piano Roll and CQT Representations
von: Murgul, Sebastian, et al.
Veröffentlicht: (2025)
von: Murgul, Sebastian, et al.
Veröffentlicht: (2025)
Zero-Shot End-to-End Spoken Language Understanding via Cross-Modal Selective Self-Training
von: He, Jianfeng, et al.
Veröffentlicht: (2023)
von: He, Jianfeng, et al.
Veröffentlicht: (2023)
Towards Reliable Large Audio Language Model
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
Audio-FLAN: A Preliminary Release
von: Xue, Liumeng, et al.
Veröffentlicht: (2025)
von: Xue, Liumeng, et al.
Veröffentlicht: (2025)
CommonVoice-SpeechRE and RPG-MoGe: Advancing Speech Relation Extraction with a New Dataset and Multi-Order Generative Framework
von: Ning, Jinzhong, et al.
Veröffentlicht: (2025)
von: Ning, Jinzhong, et al.
Veröffentlicht: (2025)
On the Audio Hallucinations in Large Audio-Video Language Models
von: Nishimura, Taichi, et al.
Veröffentlicht: (2024)
von: Nishimura, Taichi, et al.
Veröffentlicht: (2024)
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
von: He, Jiajun, et al.
Veröffentlicht: (2024)
von: He, Jiajun, et al.
Veröffentlicht: (2024)
MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models
von: Weck, Benno, et al.
Veröffentlicht: (2024)
von: Weck, Benno, et al.
Veröffentlicht: (2024)
Missingness-resilient Video-enhanced Multimodal Disfluency Detection
von: Mohapatra, Payal, et al.
Veröffentlicht: (2024)
von: Mohapatra, Payal, et al.
Veröffentlicht: (2024)
Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation
von: Zhou, Ziya, et al.
Veröffentlicht: (2024)
von: Zhou, Ziya, et al.
Veröffentlicht: (2024)
UniSLU: Unified Spoken Language Understanding from Heterogeneous Cross-Task Datasets
von: Sheng, Zhichao, et al.
Veröffentlicht: (2025)
von: Sheng, Zhichao, et al.
Veröffentlicht: (2025)
Ola: Pushing the Frontiers of Omni-Modal Language Model
von: Liu, Zuyan, et al.
Veröffentlicht: (2025)
von: Liu, Zuyan, et al.
Veröffentlicht: (2025)
MMSD-Net: Towards Multi-modal Stuttering Detection
von: Nie, Liangyu, et al.
Veröffentlicht: (2024)
von: Nie, Liangyu, et al.
Veröffentlicht: (2024)
Double Mixture: Towards Continual Event Detection from Speech
von: Kang, Jingqi, et al.
Veröffentlicht: (2024)
von: Kang, Jingqi, et al.
Veröffentlicht: (2024)
MLLM-based Speech Recognition: When and How is Multimodality Beneficial?
von: Guan, Yiwen, et al.
Veröffentlicht: (2025)
von: Guan, Yiwen, et al.
Veröffentlicht: (2025)
Fretting-Transformer: Encoder-Decoder Model for MIDI to Tablature Transcription
von: Hamberger, Anna, et al.
Veröffentlicht: (2025)
von: Hamberger, Anna, et al.
Veröffentlicht: (2025)
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
von: Li, Fengjin, et al.
Veröffentlicht: (2025)
von: Li, Fengjin, et al.
Veröffentlicht: (2025)
Beat-Based Rhythm Quantization of MIDI Performances
von: Wachter, Maximilian, et al.
Veröffentlicht: (2025)
von: Wachter, Maximilian, et al.
Veröffentlicht: (2025)
Beat and Downbeat Tracking in Performance MIDI Using an End-to-End Transformer Architecture
von: Murgul, Sebastian, et al.
Veröffentlicht: (2025)
von: Murgul, Sebastian, et al.
Veröffentlicht: (2025)
Speech Emotion Recognition with ASR Transcripts: A Comprehensive Study on Word Error Rate and Fusion Techniques
von: Li, Yuanchao, et al.
Veröffentlicht: (2024)
von: Li, Yuanchao, et al.
Veröffentlicht: (2024)
Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction
von: Zhao, Yuan, et al.
Veröffentlicht: (2024)
von: Zhao, Yuan, et al.
Veröffentlicht: (2024)
Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning
von: Yang, Chao-Han Huck, et al.
Veröffentlicht: (2025)
von: Yang, Chao-Han Huck, et al.
Veröffentlicht: (2025)
Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM
von: Shahin, Mostafa, et al.
Veröffentlicht: (2025)
von: Shahin, Mostafa, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
AudioSetMix: Enhancing Audio-Language Datasets with LLM-Assisted Augmentations
von: Xu, David
Veröffentlicht: (2024) -
SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models
von: Diao, Xingjian, et al.
Veröffentlicht: (2025) -
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
von: Liu, Che, et al.
Veröffentlicht: (2025) -
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
von: Mei, Xinhao, et al.
Veröffentlicht: (2023) -
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)