Enregistré dans:
| Auteurs principaux: | Zhu, Lei, Wang, Xiaobao, Yang, Jianbiao, Wang, Chenyang, He, Dongxiao, Wang, Longbiao, Dang, Jianwu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2605.02277 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AIMDiT: Modality Augmentation and Interaction via Multimodal Dimension Transformation for Emotion Recognition in Conversations
par: Wu, Sheng, et autres
Publié: (2024)
par: Wu, Sheng, et autres
Publié: (2024)
Enriching Multimodal Sentiment Analysis through Textual Emotional Descriptions of Visual-Audio Content
par: Wu, Sheng, et autres
Publié: (2024)
par: Wu, Sheng, et autres
Publié: (2024)
Integration of Old and New Knowledge for Generalized Intent Discovery: A Consistency-driven Prototype-Prompting Framework
par: Wei, Xiao, et autres
Publié: (2025)
par: Wei, Xiao, et autres
Publié: (2025)
Error Correction by Paying Attention to Both Acoustic and Confidence References for Automatic Speech Recognition
par: Shu, Yuchun, et autres
Publié: (2024)
par: Shu, Yuchun, et autres
Publié: (2024)
Breaking Data Efficiency Dilemma: A Federated and Augmented Learning Framework For Alzheimer's Disease Detection via Speech
par: Wei, Xiao, et autres
Publié: (2026)
par: Wei, Xiao, et autres
Publié: (2026)
ASDA: Audio Spectrogram Differential Attention Mechanism for Self-Supervised Representation Learning
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
Rethinking Contrastive Learning in Graph Anomaly Detection: A Clean-View Perspective
par: Jin, Di, et autres
Publié: (2025)
par: Jin, Di, et autres
Publié: (2025)
A Dynamic Knowledge Update-Driven Model with Large Language Models for Fake News Detection
par: Jin, Di, et autres
Publié: (2025)
par: Jin, Di, et autres
Publié: (2025)
Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
par: Wang, Haoyu, et autres
Publié: (2024)
par: Wang, Haoyu, et autres
Publié: (2024)
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
Scrambled text: training Language Models to correct OCR errors using synthetic data
par: Bourne, Jonathan
Publié: (2024)
par: Bourne, Jonathan
Publié: (2024)
POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation
par: Li, Xuanchen, et autres
Publié: (2025)
par: Li, Xuanchen, et autres
Publié: (2025)
MSR-HuBERT: Self-supervised Pre-training for Adaptation to Multiple Sampling Rates
par: Huang, Zikang, et autres
Publié: (2026)
par: Huang, Zikang, et autres
Publié: (2026)
InstructAudio: Unified speech and music generation with natural language instruction
par: Qiang, Chunyu, et autres
Publié: (2025)
par: Qiang, Chunyu, et autres
Publié: (2025)
An Initial Investigation of Language Adaptation for TTS Systems under Low-resource Scenarios
par: Gong, Cheng, et autres
Publié: (2024)
par: Gong, Cheng, et autres
Publié: (2024)
SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
par: Qiang, Chunyu, et autres
Publié: (2025)
par: Qiang, Chunyu, et autres
Publié: (2025)
Measuring short-form factuality in large language models
par: Wei, Jason, et autres
Publié: (2024)
par: Wei, Jason, et autres
Publié: (2024)
Long-form factuality in large language models
par: Wei, Jerry, et autres
Publié: (2024)
par: Wei, Jerry, et autres
Publié: (2024)
UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions
par: Qiang, Chunyu, et autres
Publié: (2026)
par: Qiang, Chunyu, et autres
Publié: (2026)
VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing
par: Qiang, Chunyu, et autres
Publié: (2024)
par: Qiang, Chunyu, et autres
Publié: (2024)
VERISCORE: Evaluating the factuality of verifiable claims in long-form text generation
par: Song, Yixiao, et autres
Publié: (2024)
par: Song, Yixiao, et autres
Publié: (2024)
VeriFastScore: Speeding up long-form factuality evaluation
par: Rajendhran, Rishanth, et autres
Publié: (2025)
par: Rajendhran, Rishanth, et autres
Publié: (2025)
Collaborative decoding of critical tokens for boosting factuality of large language models
par: Jin, Lifeng, et autres
Publié: (2024)
par: Jin, Lifeng, et autres
Publié: (2024)
MLRIP: Pre-training a military language representation model with informative factual knowledge and professional knowledge base
par: Li, Hui, et autres
Publié: (2022)
par: Li, Hui, et autres
Publié: (2022)
Sailing by the Stars: A Survey on Reward Models and Learning Strategies for Learning from Rewards
par: Wu, Xiaobao
Publié: (2025)
par: Wu, Xiaobao
Publié: (2025)
RE-Searcher: Robust Agentic Search with Goal-oriented Planning and Self-reflection
par: Fu, Daocheng, et autres
Publié: (2025)
par: Fu, Daocheng, et autres
Publié: (2025)
KG-BiLM: Knowledge Graph Embedding via Bidirectional Language Models
par: Chen, Zirui, et autres
Publié: (2025)
par: Chen, Zirui, et autres
Publié: (2025)
LORT: Locally Refined Convolution and Taylor Transformer for Monaural Speech Enhancement
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement
par: Wang, Junyu, et autres
Publié: (2024)
par: Wang, Junyu, et autres
Publié: (2024)
AKEW: Assessing Knowledge Editing in the Wild
par: Wu, Xiaobao, et autres
Publié: (2024)
par: Wu, Xiaobao, et autres
Publié: (2024)
Large Language Models, scientific knowledge and factuality: A framework to streamline human expert evaluation
par: Wysocka, Magdalena, et autres
Publié: (2023)
par: Wysocka, Magdalena, et autres
Publié: (2023)
Enhancing Goal-oriented Proactive Dialogue Systems via Consistency Reflection and Correction
par: Zhang, Didi, et autres
Publié: (2025)
par: Zhang, Didi, et autres
Publié: (2025)
High-precision medical speech recognition through synthetic data and semantic correction: UNITED-MEDASR
par: Banerjee, Sourav, et autres
Publié: (2024)
par: Banerjee, Sourav, et autres
Publié: (2024)
Tag and correct: high precision post-editing approach to correction of speech recognition errors
par: Ziętkiewicz, Tomasz
Publié: (2024)
par: Ziętkiewicz, Tomasz
Publié: (2024)
A safety realignment framework via subspace-oriented model fusion for large language models
par: Yi, Xin, et autres
Publié: (2024)
par: Yi, Xin, et autres
Publié: (2024)
Chain-of-Though (CoT) prompting strategies for medical error detection and correction
par: Wu, Zhaolong, et autres
Publié: (2024)
par: Wu, Zhaolong, et autres
Publié: (2024)
Progressive Residual Extraction based Pre-training for Speech Representation Learning
par: Wang, Tianrui, et autres
Publié: (2024)
par: Wang, Tianrui, et autres
Publié: (2024)
LLMs cannot find reasoning errors, but can correct them given the error location
par: Tyen, Gladys, et autres
Publié: (2023)
par: Tyen, Gladys, et autres
Publié: (2023)
BootTOD: Bootstrap Task-oriented Dialogue Representations by Aligning Diverse Responses
par: Zeng, Weihao, et autres
Publié: (2024)
par: Zeng, Weihao, et autres
Publié: (2024)
Generate Then Correct: Single Shot Global Correction for Aspect Sentiment Quad Prediction
par: He, Shidong, et autres
Publié: (2026)
par: He, Shidong, et autres
Publié: (2026)
Documents similaires
-
AIMDiT: Modality Augmentation and Interaction via Multimodal Dimension Transformation for Emotion Recognition in Conversations
par: Wu, Sheng, et autres
Publié: (2024) -
Enriching Multimodal Sentiment Analysis through Textual Emotional Descriptions of Visual-Audio Content
par: Wu, Sheng, et autres
Publié: (2024) -
Integration of Old and New Knowledge for Generalized Intent Discovery: A Consistency-driven Prototype-Prompting Framework
par: Wei, Xiao, et autres
Publié: (2025) -
Error Correction by Paying Attention to Both Acoustic and Confidence References for Automatic Speech Recognition
par: Shu, Yuchun, et autres
Publié: (2024) -
Breaking Data Efficiency Dilemma: A Federated and Augmented Learning Framework For Alzheimer's Disease Detection via Speech
par: Wei, Xiao, et autres
Publié: (2026)