Multi-Reward GRPO for Stable and Prosodic Single-Codebook TTS LLMs at Scale
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhong, Yicheng, Yang, Peiji, Wang, Zhisheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models
di: Wu, Biao, et al.
Pubblicazione: (2026)
di: Wu, Biao, et al.
Pubblicazione: (2026)
Content Significance Distribution of Sub-Text Blocks in Articles and Its Application to Article-Organization Assessment
di: Zhou, You, et al.
Pubblicazione: (2023)
di: Zhou, You, et al.
Pubblicazione: (2023)
BabelDOC: Better Layout-Preserving PDF Translation via Intermediate Representation
di: Yang, Qi, et al.
Pubblicazione: (2026)
di: Yang, Qi, et al.
Pubblicazione: (2026)
Depthwise Separable Convolutions with Deep Residual Convolutions
di: Hasan, Md Arid, et al.
Pubblicazione: (2024)
di: Hasan, Md Arid, et al.
Pubblicazione: (2024)
Towards Explainable Fake Image Detection with Multi-Modal Large Language Models
di: Ji, Yikun, et al.
Pubblicazione: (2025)
di: Ji, Yikun, et al.
Pubblicazione: (2025)
Proximity QA: Unleashing the Power of Multi-Modal Large Language Models for Spatial Proximity Analysis
di: Li, Jianing, et al.
Pubblicazione: (2024)
di: Li, Jianing, et al.
Pubblicazione: (2024)
R-Genie: Reasoning-Guided Generative Image Editing
di: Zhang, Dong, et al.
Pubblicazione: (2025)
di: Zhang, Dong, et al.
Pubblicazione: (2025)
Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning
di: Vlachos, Angelos, et al.
Pubblicazione: (2025)
di: Vlachos, Angelos, et al.
Pubblicazione: (2025)
A Sociolinguistic Analysis of Automatic Speech Recognition Bias in Newcastle English
di: Serditova, Dana, et al.
Pubblicazione: (2026)
di: Serditova, Dana, et al.
Pubblicazione: (2026)
Cinéaste: A Fine-grained Contextual Movie Question Answering Benchmark
di: Shah, Nisarg A., et al.
Pubblicazione: (2025)
di: Shah, Nisarg A., et al.
Pubblicazione: (2025)
ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing
di: Bucher, Martin JJ., et al.
Pubblicazione: (2025)
di: Bucher, Martin JJ., et al.
Pubblicazione: (2025)
VidNum-1.4K: A Comprehensive Benchmark for Video-based Numerical Reasoning
di: Cui, Shaoyang, et al.
Pubblicazione: (2026)
di: Cui, Shaoyang, et al.
Pubblicazione: (2026)
Enhanced Kalman with Adaptive Appearance Motion SORT for Grounded Generic Multiple Object Tracking
di: Anh, Duy Le Dinh, et al.
Pubblicazione: (2024)
di: Anh, Duy Le Dinh, et al.
Pubblicazione: (2024)
Predicting 3D Rigid Body Dynamics with Deep Residual Network
di: Oketunji, Abiodun Finbarrs
Pubblicazione: (2024)
di: Oketunji, Abiodun Finbarrs
Pubblicazione: (2024)
CAMME: Adaptive Deepfake Image Detection with Multi-Modal Cross-Attention
di: Khan, Naseem, et al.
Pubblicazione: (2025)
di: Khan, Naseem, et al.
Pubblicazione: (2025)
HalalBench: A Multilingual OCR Benchmark for Food Packaging Ingredient Extraction
di: Arief, Hasan
Pubblicazione: (2026)
di: Arief, Hasan
Pubblicazione: (2026)
An accurate and revised version of optical character recognition-based speech synthesis using LabVIEW
di: Mehta, Prateek, et al.
Pubblicazione: (2025)
di: Mehta, Prateek, et al.
Pubblicazione: (2025)
Hyperspectral Images Efficient Spatial and Spectral non-Linear Model with Bidirectional Feature Learning
di: Yang, Judy X, et al.
Pubblicazione: (2024)
di: Yang, Judy X, et al.
Pubblicazione: (2024)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Unsupervised Band Selection Using Fused HSI and LiDAR Attention Integrating With Autoencoder
di: Yang, Judy X, et al.
Pubblicazione: (2024)
di: Yang, Judy X, et al.
Pubblicazione: (2024)
HSIMamba: Hyperpsectral Imaging Efficient Feature Learning with Bidirectional State Space for Classification
di: Yang, Judy X, et al.
Pubblicazione: (2024)
di: Yang, Judy X, et al.
Pubblicazione: (2024)
PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment
di: Halpern, Bence Mark, et al.
Pubblicazione: (2026)
di: Halpern, Bence Mark, et al.
Pubblicazione: (2026)
Steer-MoE: Efficient Audio-Language Alignment with a Mixture-of-Experts Steering Module
di: Feng, Ruitao, et al.
Pubblicazione: (2025)
di: Feng, Ruitao, et al.
Pubblicazione: (2025)
MyoSem: Aligning Electromyography to Natural-Language Action Semantics for Hand Action Understanding
di: Wang, Chiyue, et al.
Pubblicazione: (2026)
di: Wang, Chiyue, et al.
Pubblicazione: (2026)
BlasBench: An Open Benchmark for Irish Speech Recognition
di: Raj, Jyoutir, et al.
Pubblicazione: (2026)
di: Raj, Jyoutir, et al.
Pubblicazione: (2026)
Evaluation Before Generation: A Paradigm for Robust Multimodal Sentiment Analysis with Missing Modalities
di: Chen, Rongfei, et al.
Pubblicazione: (2026)
di: Chen, Rongfei, et al.
Pubblicazione: (2026)
Enhancing Sports Strategy with Video Analytics and Data Mining: Assessing the effectiveness of Multimodal LLMs in tennis video analysis
di: Teo, Charlton
Pubblicazione: (2025)
di: Teo, Charlton
Pubblicazione: (2025)
Leveraging large multimodal models for audio-video deepfake detection: a pilot study
di: Cao, Songjun, et al.
Pubblicazione: (2026)
di: Cao, Songjun, et al.
Pubblicazione: (2026)
Towards Blind and Low-Vision Accessibility of Lightweight VLMs and Custom LLM-Evals
di: Baghel, Shruti Singh, et al.
Pubblicazione: (2025)
di: Baghel, Shruti Singh, et al.
Pubblicazione: (2025)
The American Sign Language Knowledge Graph: Infusing ASL Models with Linguistic Knowledge
di: Kezar, Lee, et al.
Pubblicazione: (2024)
di: Kezar, Lee, et al.
Pubblicazione: (2024)
CCS: Clinical Consensus Selection for Radiology Report Generation
di: Zhang, Xi, et al.
Pubblicazione: (2026)
di: Zhang, Xi, et al.
Pubblicazione: (2026)
The Binding Effect: Analyzing How Multi-Dimensional Cues Form Gender Bias in Instruction TTS
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2026)
di: Chen, Kuan-Yu, et al.
Pubblicazione: (2026)
Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors
di: Sun, Jiachen, et al.
Pubblicazione: (2024)
di: Sun, Jiachen, et al.
Pubblicazione: (2024)
Open-Set Supervised 3D Anomaly Detection: An Industrial Dataset and a Generalisable Framework for Unknown Defects
di: Liang, Hanzhe, et al.
Pubblicazione: (2026)
di: Liang, Hanzhe, et al.
Pubblicazione: (2026)
Only Whats Necessary: Pareto Optimal Data Minimization for Privacy Preserving Video Anomaly Detection
di: Aslam, Nazia, et al.
Pubblicazione: (2026)
di: Aslam, Nazia, et al.
Pubblicazione: (2026)
Scaling Large Vision-Language Models for Enhanced Multimodal Comprehension In Biomedical Image Analysis
di: Umeike, Robinson, et al.
Pubblicazione: (2025)
di: Umeike, Robinson, et al.
Pubblicazione: (2025)
HuMoCon: Concept Discovery for Human Motion Understanding
di: Fang, Qihang, et al.
Pubblicazione: (2025)
di: Fang, Qihang, et al.
Pubblicazione: (2025)
GroundCap: A Visually Grounded Image Captioning Dataset
di: Oliveira, Daniel A. P., et al.
Pubblicazione: (2025)
di: Oliveira, Daniel A. P., et al.
Pubblicazione: (2025)
Relative Drawing Identification Complexity is Invariant to Modality in Vision-Language Models
di: Freitas, Diogo, et al.
Pubblicazione: (2025)
di: Freitas, Diogo, et al.
Pubblicazione: (2025)
More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage
di: He, Wei
Pubblicazione: (2026)
di: He, Wei
Pubblicazione: (2026)
Documenti analoghi
-
DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models
di: Wu, Biao, et al.
Pubblicazione: (2026) -
Content Significance Distribution of Sub-Text Blocks in Articles and Its Application to Article-Organization Assessment
di: Zhou, You, et al.
Pubblicazione: (2023) -
BabelDOC: Better Layout-Preserving PDF Translation via Intermediate Representation
di: Yang, Qi, et al.
Pubblicazione: (2026) -
Depthwise Separable Convolutions with Deep Residual Convolutions
di: Hasan, Md Arid, et al.
Pubblicazione: (2024) -
Towards Explainable Fake Image Detection with Multi-Modal Large Language Models
di: Ji, Yikun, et al.
Pubblicazione: (2025)