DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Ke-Han, Chen, Zhehuai, Fu, Szu-Wei, Yang, Chao-Han Huck, Huang, Sung-Feng, Yang, Chih-Kai, Yu, Chee-En, Chen, Chun-Wei, Chen, Wei-Chih, Huang, Chien-yu, Lin, Yi-Cheng, Lin, Yu-Xiang, Fu, Chi-An, Kuan, Chun-Yi, Ren, Wenze, Chen, Xuanjun, Huang, Wei-Ping, Hu, En-Pei, Lin, Tzu-Quan, Wu, Yuan-Kuei, Huang, Kuan-Po, Huang, Hsiao-Ying, Chou, Huang-Cheng, Chang, Kai-Wei, Chiang, Cheng-Han, Ginsburg, Boris, Wang, Yu-Chiang Frank, Lee, Hung-yi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment
par: Lu, Ke-Han, et autres
Publié: (2024)
par: Lu, Ke-Han, et autres
Publié: (2024)
DeSTA2: Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data
par: Lu, Ke-Han, et autres
Publié: (2024)
par: Lu, Ke-Han, et autres
Publié: (2024)
How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation
par: Lu, Ke-Han, et autres
Publié: (2026)
par: Lu, Ke-Han, et autres
Publié: (2026)
Large Language Model as an Assignment Evaluator: Insights, Feedback, and Challenges in a 1000+ Student Course
par: Chiang, Cheng-Han, et autres
Publié: (2024)
par: Chiang, Cheng-Han, et autres
Publié: (2024)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
par: Kuan, Chun-Yi, et autres
Publié: (2026)
par: Kuan, Chun-Yi, et autres
Publié: (2026)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
Catastrophic Emission of Charges from Near-Extremal Nariai Black Holes
par: Chen, Chiang-Mei, et autres
Publié: (2023)
par: Chen, Chiang-Mei, et autres
Publié: (2023)
Catastrophic Emission of Charges from Near-Extremal Charged Nariai Black Holes. II. Rotation Effect
par: Chen, Chiang-Mei, et autres
Publié: (2024)
par: Chen, Chiang-Mei, et autres
Publié: (2024)
Reciprocal relation of Schwinger pair production between $\textrm{dS}_2$ and $\textrm{AdS}_2$
par: Chen, Chiang-Mei, et autres
Publié: (2025)
par: Chen, Chiang-Mei, et autres
Publié: (2025)
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations
par: Feng, Bo-Han, et autres
Publié: (2025)
par: Feng, Bo-Han, et autres
Publié: (2025)
Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models
par: Kuan, Chun-Yi, et autres
Publié: (2026)
par: Kuan, Chun-Yi, et autres
Publié: (2026)
Listen and Speak Fairly: A Study on Semantic Gender Bias in Speech Integrated Large Language Models
par: Lin, Yi-Cheng, et autres
Publié: (2024)
par: Lin, Yi-Cheng, et autres
Publié: (2024)
Influence of quantum correction on the Schwarzschild black hole polarized image
par: Guo, Sen, et autres
Publié: (2024)
par: Guo, Sen, et autres
Publié: (2024)
Bridging Restoration and Generation Manifolds in One-Step Diffusion for Real-World Super-Resolution
par: Weng, Shyang-En, et autres
Publié: (2026)
par: Weng, Shyang-En, et autres
Publié: (2026)
Braille-to-Speech Generator: Audio Generation Based on Joint Fine-Tuning of CLIP and Fastspeech2
par: Xu, Chun, et autres
Publié: (2024)
par: Xu, Chun, et autres
Publié: (2024)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
par: Chen, Wei-Chih, et autres
Publié: (2026)
par: Chen, Wei-Chih, et autres
Publié: (2026)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
par: Lee, Kuan-Yi, et autres
Publié: (2025)
par: Lee, Kuan-Yi, et autres
Publié: (2025)
Effects of Essential Oil Aromatherapy on Sleep, Depression, and Well‐Being Among Older Adults: Implications for Community Health and Social Care
par: Pei Fen Chiang, et autres
Publié: (2026)
par: Pei Fen Chiang, et autres
Publié: (2026)
An Attention-based Framework with Multistation Information for Earthquake Early Warnings
par: Huang, Yu-Ming, et autres
Publié: (2024)
par: Huang, Yu-Ming, et autres
Publié: (2024)
The first reported case of effective targeted therapy in extrahepatic cholangiocarcinoma harboring an epidermal growth factor receptor exon 19 deletion
par: Ling‐Jen Hung, et autres
Publié: (2025)
par: Ling‐Jen Hung, et autres
Publié: (2025)
TA-Prompting: Enhancing Video Large Language Models for Dense Video Captioning via Temporal Anchors
par: Cheng, Wei-Yuan, et autres
Publié: (2026)
par: Cheng, Wei-Yuan, et autres
Publié: (2026)
Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment
par: Chang, Kai-Po, et autres
Publié: (2025)
par: Chang, Kai-Po, et autres
Publié: (2025)
A Preliminary Exploration with GPT-4o Voice Mode
par: Lin, Yu-Xiang, et autres
Publié: (2025)
par: Lin, Yu-Xiang, et autres
Publié: (2025)
A Metal‐Free Phthalocyanine Additive for Defect Passivation and Processing Tolerance in High‐Efficiency Perovskite Solar Cells
par: Chuan‐Hung Huang, et autres
Publié: (2026)
par: Chuan‐Hung Huang, et autres
Publié: (2026)
Randomized Scheduling for Periodic Multi-Source Systems with PAoI Violation Guarantees
par: Lin, Kuan-Yu, et autres
Publié: (2025)
par: Lin, Kuan-Yu, et autres
Publié: (2025)
Do You Hear What I Mean? Quantifying the Instruction-Perception Gap in Instruction-Guided Expressive Text-To-Speech Systems
par: Lin, Yi-Cheng, et autres
Publié: (2025)
par: Lin, Yi-Cheng, et autres
Publié: (2025)
OVOR: OnePrompt with Virtual Outlier Regularization for Rehearsal-Free Class-Incremental Learning
par: Huang, Wei-Cheng, et autres
Publié: (2024)
par: Huang, Wei-Cheng, et autres
Publié: (2024)
Color analysis and tracking of the reduction of an indigo solution in real‐time using LabVIEW and machine vision
par: Hui‐Yu Chiang, et autres
Publié: (2024)
par: Hui‐Yu Chiang, et autres
Publié: (2024)
Game-Time: Evaluating Temporal Dynamics in Spoken Language Models
par: Chang, Kai-Wei, et autres
Publié: (2025)
par: Chang, Kai-Wei, et autres
Publié: (2025)
Pairing Regularization for Mitigating Many-to-One Collapse in GANs
par: Lin, Kuan-Yu, et autres
Publié: (2026)
par: Lin, Kuan-Yu, et autres
Publié: (2026)
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
par: Ieong, Lok-Lam, et autres
Publié: (2026)
par: Ieong, Lok-Lam, et autres
Publié: (2026)
Differentiable Quantum Architecture Search in Quantum-Enhanced Neural Network Parameter Generation
par: Chen, Samuel Yen-Chi, et autres
Publié: (2025)
par: Chen, Samuel Yen-Chi, et autres
Publié: (2025)
How Contrastive Decoding Enhances Large Audio Language Models?
par: Lin, Tzu-Quan, et autres
Publié: (2026)
par: Lin, Tzu-Quan, et autres
Publié: (2026)
A Modularized Framework for Piecewise-Stationary Restless Bandits
par: Li, Kuan-Ta, et autres
Publié: (2026)
par: Li, Kuan-Ta, et autres
Publié: (2026)
Improving the performance of weak supervision searches using transfer and meta-learning
par: Beauchesne, Hugues, et autres
Publié: (2023)
par: Beauchesne, Hugues, et autres
Publié: (2023)
Personalizing Causal Audio-Driven Facial Motion via Dynamic Multi-modal Retrieval
par: Chu, Xuangeng, et autres
Publié: (2026)
par: Chu, Xuangeng, et autres
Publié: (2026)
Personalized Programming Education: Using Machine Learning to Boost Learning Performance Based on Students' Personality Traits
par: Tseng, Chun-Hsiung, et autres
Publié: (2025)
par: Tseng, Chun-Hsiung, et autres
Publié: (2025)
Documents similaires
-
DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment
par: Lu, Ke-Han, et autres
Publié: (2024) -
DeSTA2: Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data
par: Lu, Ke-Han, et autres
Publié: (2024) -
How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation
par: Lu, Ke-Han, et autres
Publié: (2026) -
Large Language Model as an Assignment Evaluator: Insights, Feedback, and Challenges in a 1000+ Student Course
par: Chiang, Cheng-Han, et autres
Publié: (2024) -
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
par: Kuan, Chun-Yi, et autres
Publié: (2026)