Any2Point: Empowering Any-modality Large Models for Efficient 3D Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tang, Yiwen, Zhang, Ray, Liu, Jiaming, Guo, Zoey, Wang, Dong, Wang, Zhigang, Zhao, Bin, Zhang, Shanghang, Gao, Peng, Li, Hongsheng, Li, Xuelong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows
par: Li, Shufan, et autres
Publié: (2024)
par: Li, Shufan, et autres
Publié: (2024)
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
par: Chen, Shihao, et autres
Publié: (2024)
par: Chen, Shihao, et autres
Publié: (2024)
Efficient Multilingual ASR Finetuning via LoRA Language Experts
par: Li, Jiahong, et autres
Publié: (2025)
par: Li, Jiahong, et autres
Publié: (2025)
Improvement Speaker Similarity for Zero-Shot Any-to-Any Voice Conversion of Whispered and Regular Speech
par: Avdeeva, Anastasia, et autres
Publié: (2024)
par: Avdeeva, Anastasia, et autres
Publié: (2024)
O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversion
par: Tu, Huu Tuong, et autres
Publié: (2025)
par: Tu, Huu Tuong, et autres
Publié: (2025)
OSUM: Advancing Open Speech Understanding Models with Limited Resources in Academia
par: Geng, Xuelong, et autres
Publié: (2025)
par: Geng, Xuelong, et autres
Publié: (2025)
EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion
par: Joglekar, Advait, et autres
Publié: (2025)
par: Joglekar, Advait, et autres
Publié: (2025)
AzeroS: Extending LLM to Speech with Self-Generated Instruction-Free Tuning
par: Shao, Yiwen, et autres
Publié: (2025)
par: Shao, Yiwen, et autres
Publié: (2025)
DIFFA: Large Language Diffusion Models Can Listen and Understand
par: Zhou, Jiaming, et autres
Publié: (2025)
par: Zhou, Jiaming, et autres
Publié: (2025)
Large Language Model Should Understand Pinyin for Chinese ASR Error Correction
par: Li, Yuang, et autres
Publié: (2024)
par: Li, Yuang, et autres
Publié: (2024)
Robust and Efficient Autoregressive Speech Synthesis with Dynamic Chunk-wise Prediction Policy
par: Li, Bohan, et autres
Publié: (2025)
par: Li, Bohan, et autres
Publié: (2025)
CIF-T: A Novel CIF-based Transducer Architecture for Automatic Speech Recognition
par: Zhang, Tian-Hao, et autres
Publié: (2023)
par: Zhang, Tian-Hao, et autres
Publié: (2023)
SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words
par: Ao, Junyi, et autres
Publié: (2024)
par: Ao, Junyi, et autres
Publié: (2024)
MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark
par: Wang, Dingdong, et autres
Publié: (2025)
par: Wang, Dingdong, et autres
Publié: (2025)
SpeechAlign: Aligning Speech Generation to Human Preferences
par: Zhang, Dong, et autres
Publié: (2024)
par: Zhang, Dong, et autres
Publié: (2024)
GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM
par: Song, Yaodong, et autres
Publié: (2025)
par: Song, Yaodong, et autres
Publié: (2025)
Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models
par: Wang, Bin, et autres
Publié: (2025)
par: Wang, Bin, et autres
Publié: (2025)
BoSS: Beyond-Semantic Speech
par: Wang, Qing, et autres
Publié: (2025)
par: Wang, Qing, et autres
Publié: (2025)
Joint Automatic Speech Recognition And Structure Learning For Better Speech Understanding
par: Hu, Jiliang, et autres
Publié: (2025)
par: Hu, Jiliang, et autres
Publié: (2025)
Steering Language Model to Stable Speech Emotion Recognition via Contextual Perception and Chain of Thought
par: Zhao, Zhixian, et autres
Publié: (2025)
par: Zhao, Zhixian, et autres
Publié: (2025)
Dance Any Beat: Blending Beats with Visuals in Dance Video Generation
par: Wang, Xuanchen, et autres
Publié: (2024)
par: Wang, Xuanchen, et autres
Publié: (2024)
Improving Zero-Shot Chinese-English Code-Switching ASR with kNN-CTC and Gated Monolingual Datastores
par: Zhou, Jiaming, et autres
Publié: (2024)
par: Zhou, Jiaming, et autres
Publié: (2024)
LUCY: Linguistic Understanding and Control Yielding Early Stage of Her
par: Gao, Heting, et autres
Publié: (2025)
par: Gao, Heting, et autres
Publié: (2025)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
par: Liu, Jizhong, et autres
Publié: (2024)
par: Liu, Jizhong, et autres
Publié: (2024)
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
par: Kameoka, Hirokazu, et autres
Publié: (2020)
par: Kameoka, Hirokazu, et autres
Publié: (2020)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
par: Huo, Mingyue, et autres
Publié: (2025)
par: Huo, Mingyue, et autres
Publié: (2025)
Enhancing Polyglot Voices by Leveraging Cross-Lingual Fine-Tuning in Any-to-One Voice Conversion
par: Ruggiero, Giuseppe, et autres
Publié: (2024)
par: Ruggiero, Giuseppe, et autres
Publié: (2024)
Diffusion-Based Adversarial Purification for Speaker Verification
par: Bai, Yibo, et autres
Publié: (2023)
par: Bai, Yibo, et autres
Publié: (2023)
Conversational Speech Recognition by Learning Audio-textual Cross-modal Contextual Representation
par: Wei, Kun, et autres
Publié: (2023)
par: Wei, Kun, et autres
Publié: (2023)
Emphasis Rendering for Conversational Text-to-Speech with Multi-modal Multi-scale Context Modeling
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Recent Advances in Speech Language Models: A Survey
par: Cui, Wenqian, et autres
Publié: (2024)
par: Cui, Wenqian, et autres
Publié: (2024)
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
par: Wang, Xuechen, et autres
Publié: (2024)
par: Wang, Xuechen, et autres
Publié: (2024)
Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets
par: Geng, Xuelong, et autres
Publié: (2024)
par: Geng, Xuelong, et autres
Publié: (2024)
Hearing Anywhere in Any Environment
par: Liu, Xiulong, et autres
Publié: (2025)
par: Liu, Xiulong, et autres
Publié: (2025)
Pinyin Regularization in Error Correction for Chinese Speech Recognition with Large Language Models
par: Tang, Zhiyuan, et autres
Publié: (2024)
par: Tang, Zhiyuan, et autres
Publié: (2024)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
par: Zhang, Xin, et autres
Publié: (2023)
par: Zhang, Xin, et autres
Publié: (2023)
Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System
par: Meng, Lingwei, et autres
Publié: (2024)
par: Meng, Lingwei, et autres
Publié: (2024)
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
par: Wang, Shiyao, et autres
Publié: (2024)
par: Wang, Shiyao, et autres
Publié: (2024)
Bridging Language Gaps in Audio-Text Retrieval
par: Yan, Zhiyong, et autres
Publié: (2024)
par: Yan, Zhiyong, et autres
Publié: (2024)
Diffusion Gaussian Mixture Audio Denoise
par: Wang, Pu, et autres
Publié: (2024)
par: Wang, Pu, et autres
Publié: (2024)
Documents similaires
-
OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows
par: Li, Shufan, et autres
Publié: (2024) -
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
par: Chen, Shihao, et autres
Publié: (2024) -
Efficient Multilingual ASR Finetuning via LoRA Language Experts
par: Li, Jiahong, et autres
Publié: (2025) -
Improvement Speaker Similarity for Zero-Shot Any-to-Any Voice Conversion of Whispered and Regular Speech
par: Avdeeva, Anastasia, et autres
Publié: (2024) -
O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversion
par: Tu, Huu Tuong, et autres
Publié: (2025)