Multi-Reward GRPO for Stable and Prosodic Single-Codebook TTS LLMs at Scale
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhong, Yicheng, Yang, Peiji, Wang, Zhisheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models
par: Wu, Biao, et autres
Publié: (2026)
par: Wu, Biao, et autres
Publié: (2026)
Content Significance Distribution of Sub-Text Blocks in Articles and Its Application to Article-Organization Assessment
par: Zhou, You, et autres
Publié: (2023)
par: Zhou, You, et autres
Publié: (2023)
BabelDOC: Better Layout-Preserving PDF Translation via Intermediate Representation
par: Yang, Qi, et autres
Publié: (2026)
par: Yang, Qi, et autres
Publié: (2026)
Depthwise Separable Convolutions with Deep Residual Convolutions
par: Hasan, Md Arid, et autres
Publié: (2024)
par: Hasan, Md Arid, et autres
Publié: (2024)
Towards Explainable Fake Image Detection with Multi-Modal Large Language Models
par: Ji, Yikun, et autres
Publié: (2025)
par: Ji, Yikun, et autres
Publié: (2025)
Proximity QA: Unleashing the Power of Multi-Modal Large Language Models for Spatial Proximity Analysis
par: Li, Jianing, et autres
Publié: (2024)
par: Li, Jianing, et autres
Publié: (2024)
R-Genie: Reasoning-Guided Generative Image Editing
par: Zhang, Dong, et autres
Publié: (2025)
par: Zhang, Dong, et autres
Publié: (2025)
Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning
par: Vlachos, Angelos, et autres
Publié: (2025)
par: Vlachos, Angelos, et autres
Publié: (2025)
A Sociolinguistic Analysis of Automatic Speech Recognition Bias in Newcastle English
par: Serditova, Dana, et autres
Publié: (2026)
par: Serditova, Dana, et autres
Publié: (2026)
Cinéaste: A Fine-grained Contextual Movie Question Answering Benchmark
par: Shah, Nisarg A., et autres
Publié: (2025)
par: Shah, Nisarg A., et autres
Publié: (2025)
ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing
par: Bucher, Martin JJ., et autres
Publié: (2025)
par: Bucher, Martin JJ., et autres
Publié: (2025)
VidNum-1.4K: A Comprehensive Benchmark for Video-based Numerical Reasoning
par: Cui, Shaoyang, et autres
Publié: (2026)
par: Cui, Shaoyang, et autres
Publié: (2026)
Enhanced Kalman with Adaptive Appearance Motion SORT for Grounded Generic Multiple Object Tracking
par: Anh, Duy Le Dinh, et autres
Publié: (2024)
par: Anh, Duy Le Dinh, et autres
Publié: (2024)
Predicting 3D Rigid Body Dynamics with Deep Residual Network
par: Oketunji, Abiodun Finbarrs
Publié: (2024)
par: Oketunji, Abiodun Finbarrs
Publié: (2024)
CAMME: Adaptive Deepfake Image Detection with Multi-Modal Cross-Attention
par: Khan, Naseem, et autres
Publié: (2025)
par: Khan, Naseem, et autres
Publié: (2025)
HalalBench: A Multilingual OCR Benchmark for Food Packaging Ingredient Extraction
par: Arief, Hasan
Publié: (2026)
par: Arief, Hasan
Publié: (2026)
An accurate and revised version of optical character recognition-based speech synthesis using LabVIEW
par: Mehta, Prateek, et autres
Publié: (2025)
par: Mehta, Prateek, et autres
Publié: (2025)
Hyperspectral Images Efficient Spatial and Spectral non-Linear Model with Bidirectional Feature Learning
par: Yang, Judy X, et autres
Publié: (2024)
par: Yang, Judy X, et autres
Publié: (2024)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Unsupervised Band Selection Using Fused HSI and LiDAR Attention Integrating With Autoencoder
par: Yang, Judy X, et autres
Publié: (2024)
par: Yang, Judy X, et autres
Publié: (2024)
HSIMamba: Hyperpsectral Imaging Efficient Feature Learning with Bidirectional State Space for Classification
par: Yang, Judy X, et autres
Publié: (2024)
par: Yang, Judy X, et autres
Publié: (2024)
PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment
par: Halpern, Bence Mark, et autres
Publié: (2026)
par: Halpern, Bence Mark, et autres
Publié: (2026)
Steer-MoE: Efficient Audio-Language Alignment with a Mixture-of-Experts Steering Module
par: Feng, Ruitao, et autres
Publié: (2025)
par: Feng, Ruitao, et autres
Publié: (2025)
MyoSem: Aligning Electromyography to Natural-Language Action Semantics for Hand Action Understanding
par: Wang, Chiyue, et autres
Publié: (2026)
par: Wang, Chiyue, et autres
Publié: (2026)
BlasBench: An Open Benchmark for Irish Speech Recognition
par: Raj, Jyoutir, et autres
Publié: (2026)
par: Raj, Jyoutir, et autres
Publié: (2026)
Evaluation Before Generation: A Paradigm for Robust Multimodal Sentiment Analysis with Missing Modalities
par: Chen, Rongfei, et autres
Publié: (2026)
par: Chen, Rongfei, et autres
Publié: (2026)
Enhancing Sports Strategy with Video Analytics and Data Mining: Assessing the effectiveness of Multimodal LLMs in tennis video analysis
par: Teo, Charlton
Publié: (2025)
par: Teo, Charlton
Publié: (2025)
Leveraging large multimodal models for audio-video deepfake detection: a pilot study
par: Cao, Songjun, et autres
Publié: (2026)
par: Cao, Songjun, et autres
Publié: (2026)
Towards Blind and Low-Vision Accessibility of Lightweight VLMs and Custom LLM-Evals
par: Baghel, Shruti Singh, et autres
Publié: (2025)
par: Baghel, Shruti Singh, et autres
Publié: (2025)
The American Sign Language Knowledge Graph: Infusing ASL Models with Linguistic Knowledge
par: Kezar, Lee, et autres
Publié: (2024)
par: Kezar, Lee, et autres
Publié: (2024)
CCS: Clinical Consensus Selection for Radiology Report Generation
par: Zhang, Xi, et autres
Publié: (2026)
par: Zhang, Xi, et autres
Publié: (2026)
The Binding Effect: Analyzing How Multi-Dimensional Cues Form Gender Bias in Instruction TTS
par: Chen, Kuan-Yu, et autres
Publié: (2026)
par: Chen, Kuan-Yu, et autres
Publié: (2026)
Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors
par: Sun, Jiachen, et autres
Publié: (2024)
par: Sun, Jiachen, et autres
Publié: (2024)
Open-Set Supervised 3D Anomaly Detection: An Industrial Dataset and a Generalisable Framework for Unknown Defects
par: Liang, Hanzhe, et autres
Publié: (2026)
par: Liang, Hanzhe, et autres
Publié: (2026)
Only Whats Necessary: Pareto Optimal Data Minimization for Privacy Preserving Video Anomaly Detection
par: Aslam, Nazia, et autres
Publié: (2026)
par: Aslam, Nazia, et autres
Publié: (2026)
Scaling Large Vision-Language Models for Enhanced Multimodal Comprehension In Biomedical Image Analysis
par: Umeike, Robinson, et autres
Publié: (2025)
par: Umeike, Robinson, et autres
Publié: (2025)
HuMoCon: Concept Discovery for Human Motion Understanding
par: Fang, Qihang, et autres
Publié: (2025)
par: Fang, Qihang, et autres
Publié: (2025)
GroundCap: A Visually Grounded Image Captioning Dataset
par: Oliveira, Daniel A. P., et autres
Publié: (2025)
par: Oliveira, Daniel A. P., et autres
Publié: (2025)
Relative Drawing Identification Complexity is Invariant to Modality in Vision-Language Models
par: Freitas, Diogo, et autres
Publié: (2025)
par: Freitas, Diogo, et autres
Publié: (2025)
More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage
par: He, Wei
Publié: (2026)
par: He, Wei
Publié: (2026)
Documents similaires
-
DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models
par: Wu, Biao, et autres
Publié: (2026) -
Content Significance Distribution of Sub-Text Blocks in Articles and Its Application to Article-Organization Assessment
par: Zhou, You, et autres
Publié: (2023) -
BabelDOC: Better Layout-Preserving PDF Translation via Intermediate Representation
par: Yang, Qi, et autres
Publié: (2026) -
Depthwise Separable Convolutions with Deep Residual Convolutions
par: Hasan, Md Arid, et autres
Publié: (2024) -
Towards Explainable Fake Image Detection with Multi-Modal Large Language Models
par: Ji, Yikun, et autres
Publié: (2025)