Covo-Audio Technical Report
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Wenfu, Li, Chenxing, Zhang, Liqiang, Zhao, Yiyang, Zou, Yuxiang, Li, Hanzhao, Cui, Mingyu, Zhang, Hao, Wei, Kun, Xu, Le, Huang, Zikang, Xu, Jiajun, Hu, Jiliang, He, Xiang, Xie, Zeyu, Kang, Jiawen, Chen, Youjun, Yu, Meng, Yu, Dong, Chen, Rilin, Di, Linlin, Feng, Shulin, Hu, Na, Liu, Yang, Wang, Bang, Yang, Shan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
par: Hu, Jiliang, et autres
Publié: (2025)
par: Hu, Jiliang, et autres
Publié: (2025)
Video-to-Audio Generation with Fine-grained Temporal Semantics
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
U-Codec: Ultra Low Frame-rate Neural Speech Codec for Fast High-fidelity Speech Generation
par: Yang, Xusheng, et autres
Publié: (2025)
par: Yang, Xusheng, et autres
Publié: (2025)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
par: Ren, Yong, et autres
Publié: (2024)
par: Ren, Yong, et autres
Publié: (2024)
Video-to-Audio Generation with Hidden Alignment
par: Xu, Manjie, et autres
Publié: (2024)
par: Xu, Manjie, et autres
Publié: (2024)
Shadows of three black holes in static equilibrium configuration
par: Li, Dan, et autres
Publié: (2025)
par: Li, Dan, et autres
Publié: (2025)
SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents
par: Xie, Zeyu, et autres
Publié: (2026)
par: Xie, Zeyu, et autres
Publié: (2026)
When Audio Generators Become Good Listeners: Generative Features for Understanding Tasks
par: Xie, Zeyu, et autres
Publié: (2025)
par: Xie, Zeyu, et autres
Publié: (2025)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
par: Zhao, Junqi, et autres
Publié: (2025)
par: Zhao, Junqi, et autres
Publié: (2025)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
par: Wu, Shu, et autres
Publié: (2025)
par: Wu, Shu, et autres
Publié: (2025)
From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models
par: Mu, Zhaoxi, et autres
Publié: (2025)
par: Mu, Zhaoxi, et autres
Publié: (2025)
Experimental Investigation and Seismic Performance Evaluation of the Combined Outrigger and Multilayer Amplified Viscous Damped Substructure System
par: Wenfu He, et autres
Publié: (2025)
par: Wenfu He, et autres
Publié: (2025)
Experimental and Numerical Investigation of the Polymer Damping Multilayer Anisotropic Displacement Amplified System
par: Yuxiang Zhou, et autres
Publié: (2026)
par: Yuxiang Zhou, et autres
Publié: (2026)
LLM-Enhanced Dialogue Management for Full-Duplex Spoken Dialogue Systems
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
Ecological and Life‐History Correlates of Incubation Attentiveness Differ Between Female‐Only and Biparentally Incubating Passerine Birds
par: Qian Hu, et autres
Publié: (2026)
par: Qian Hu, et autres
Publié: (2026)
Photonic Integrated Transmitter for Brillouin Optical Time‐Domain Analysis
par: Zhicheng Jin, et autres
Publié: (2025)
par: Zhicheng Jin, et autres
Publié: (2025)
ConeSep: Cone-based Robust Noise-Unlearning Compositional Network for Composed Image Retrieval
par: Li, Zixu, et autres
Publié: (2026)
par: Li, Zixu, et autres
Publié: (2026)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
par: Li, Chenxing, et autres
Publié: (2024)
par: Li, Chenxing, et autres
Publié: (2024)
HiStyle: Hierarchical Style Embedding Predictor for Text-Prompt-Guided Controllable Speech Synthesis
par: Zhang, Ziyu, et autres
Publié: (2025)
par: Zhang, Ziyu, et autres
Publié: (2025)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
Performance Enhancement of the Combined Outrigger and Negative Stiffness Damped Substructure System: Experimental Investigation and Demand‐Oriented Optimization
par: Wenfu He, et autres
Publié: (2025)
par: Wenfu He, et autres
Publié: (2025)
Online-Optimized RAG for Tool Use and Function Calling
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
When does social media promote firm innovation? The moderating role of strategic flexibility
par: Jiawen Chen, et autres
Publié: (2024)
par: Jiawen Chen, et autres
Publié: (2024)
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
par: Chen, Shihao, et autres
Publié: (2024)
par: Chen, Shihao, et autres
Publié: (2024)
SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis
par: Wang, Helin, et autres
Publié: (2024)
par: Wang, Helin, et autres
Publié: (2024)
FNSE-SBGAN: Far-field Speech Enhancement with Schrodinger Bridge and Generative Adversarial Networks
par: Lei, Tong, et autres
Publié: (2025)
par: Lei, Tong, et autres
Publié: (2025)
SMRU: Split-and-Merge Recurrent-based UNet for Acoustic Echo Cancellation and Noise Suppression
par: Sun, Zhihang, et autres
Publié: (2024)
par: Sun, Zhihang, et autres
Publié: (2024)
Photospheric horizontal magnetic field decrease preceding a major solar eruption
par: Liu, Lijuan, et autres
Publié: (2025)
par: Liu, Lijuan, et autres
Publié: (2025)
Why could a new-born active region produce coronal mass ejections?
par: Yang, Hanzhao, et autres
Publié: (2024)
par: Yang, Hanzhao, et autres
Publié: (2024)
Application analysis of ai technology combined with spiral CT scanning in early lung cancer screening
par: Li, Shulin, et autres
Publié: (2024)
par: Li, Shulin, et autres
Publié: (2024)
Multi-Channel Speech Enhancement for Cocktail Party Speech Emotion Recognition
par: Chen, Youjun, et autres
Publié: (2026)
par: Chen, Youjun, et autres
Publié: (2026)
Early‐Life Famine Experience and Households’ Diversity of Financial Asset Portfolio: Evidence From China
par: Shulin Xu, et autres
Publié: (2025)
par: Shulin Xu, et autres
Publié: (2025)
DegDiT: Controllable Audio Generation with Dynamic Event Graph Guided Diffusion Transformer
par: Liu, Yisu, et autres
Publié: (2025)
par: Liu, Yisu, et autres
Publié: (2025)
Feature Extraction Algorithm Based on Maximizing Circular Margin Discriminant Analysis
par: Jie Xu, et autres
Publié: (2025)
par: Jie Xu, et autres
Publié: (2025)
LCM-SVC: Latent Diffusion Model Based Singing Voice Conversion with Inference Acceleration via Latent Consistency Distillation
par: Chen, Shihao, et autres
Publié: (2024)
par: Chen, Shihao, et autres
Publié: (2024)
Uncertainty-Aware Metabolic Stability Prediction with Dual-View Contrastive Learning
par: Guo, Peijin, et autres
Publié: (2025)
par: Guo, Peijin, et autres
Publié: (2025)
Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
par: He, Xiang, et autres
Publié: (2026)
par: He, Xiang, et autres
Publié: (2026)
OCTOPUS: A Versatile, User-Friendly, and Extensible Public Code for General-Relativistic Ray-Tracing in Spherically Symmetric and Static Spacetimes
par: Hu, Shiyang, et autres
Publié: (2025)
par: Hu, Shiyang, et autres
Publié: (2025)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
par: Wang, Huimeng, et autres
Publié: (2025)
par: Wang, Huimeng, et autres
Publié: (2025)
Distributionally enhanced marginal sensitivity model and bounds
par: Zhang, Yi, et autres
Publié: (2025)
par: Zhang, Yi, et autres
Publié: (2025)
Documents similaires
-
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
par: Hu, Jiliang, et autres
Publié: (2025) -
Video-to-Audio Generation with Fine-grained Temporal Semantics
par: Hu, Yuchen, et autres
Publié: (2024) -
U-Codec: Ultra Low Frame-rate Neural Speech Codec for Fast High-fidelity Speech Generation
par: Yang, Xusheng, et autres
Publié: (2025) -
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
par: Ren, Yong, et autres
Publié: (2024) -
Video-to-Audio Generation with Hidden Alignment
par: Xu, Manjie, et autres
Publié: (2024)