Enregistré dans:
| Auteurs principaux: | Kang, Wonjune, Wang, Yun, Zhang, Shun, Hinsvark, Arthur, He, Qing |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2401.06321 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Prompting Large Language Models with Audio for General-Purpose Speech Summarization
par: Kang, Wonjune, et autres
Publié: (2024)
par: Kang, Wonjune, et autres
Publié: (2024)
Expressive Speech Retrieval using Natural Language Descriptions of Speaking Style
par: Kang, Wonjune, et autres
Publié: (2025)
par: Kang, Wonjune, et autres
Publié: (2025)
ConGraT: Self-Supervised Contrastive Pretraining for Joint Graph and Text Embeddings
par: Brannon, William, et autres
Publié: (2023)
par: Brannon, William, et autres
Publié: (2023)
CLAG: Adaptive Memory Organization via Agent-Driven Clustering for Small Language Model Agents
par: Roh, Taeyun, et autres
Publié: (2026)
par: Roh, Taeyun, et autres
Publié: (2026)
An investigation of phrase break prediction in an End-to-End TTS system
par: Vadapalli, Anandaswarup
Publié: (2023)
par: Vadapalli, Anandaswarup
Publié: (2023)
TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch
par: Song, Xingchen, et autres
Publié: (2024)
par: Song, Xingchen, et autres
Publié: (2024)
TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer
par: Bataev, Vladimir, et autres
Publié: (2025)
par: Bataev, Vladimir, et autres
Publié: (2025)
FullFront: Benchmarking MLLMs Across the Full Front-End Engineering Workflow
par: Sun, Haoyu, et autres
Publié: (2025)
par: Sun, Haoyu, et autres
Publié: (2025)
ScholaWrite: A Dataset of End-to-End Scholarly Writing Process
par: Le, Khanh Chi, et autres
Publié: (2025)
par: Le, Khanh Chi, et autres
Publié: (2025)
F5-TTS-RO: Extending F5-TTS to Romanian TTS via Lightweight Input Adaptation
par: Chivereanu, Radu-Gabriel, et autres
Publié: (2025)
par: Chivereanu, Radu-Gabriel, et autres
Publié: (2025)
Schema-Aware Multi-Task Learning for Complex Text-to-SQL
par: Wu, Yangjun, et autres
Publié: (2024)
par: Wu, Yangjun, et autres
Publié: (2024)
MunTTS: A Text-to-Speech System for Mundari
par: Gumma, Varun, et autres
Publié: (2024)
par: Gumma, Varun, et autres
Publié: (2024)
MOSS-TTS Technical Report
par: Gong, Yitian, et autres
Publié: (2026)
par: Gong, Yitian, et autres
Publié: (2026)
Leveraging Graph Structures and Large Language Models for End-to-End Synthetic Task-Oriented Dialogues
par: Medjad, Maya, et autres
Publié: (2025)
par: Medjad, Maya, et autres
Publié: (2025)
A Multi-Task Evaluation of LLMs' Processing of Academic Text Input
par: Li, Tianyi, et autres
Publié: (2025)
par: Li, Tianyi, et autres
Publié: (2025)
WAFFLE: Finetuning Multi-Modal Models for Automated Front-End Development
par: Liang, Shanchao, et autres
Publié: (2024)
par: Liang, Shanchao, et autres
Publié: (2024)
EE-TTS: Emphatic Expressive TTS with Linguistic Information
par: Zhong, Yi, et autres
Publié: (2023)
par: Zhong, Yi, et autres
Publié: (2023)
The Role of Natural Language Processing Tasks in Automatic Literary Character Network Construction
par: Amalvy, Arthur, et autres
Publié: (2024)
par: Amalvy, Arthur, et autres
Publié: (2024)
TMD-TTS: A Unified Tibetan Multi-Dialect Text-to-Speech Framework for Ü-Tsang, Amdo and Kham Speech Dataset Generation
par: Liu, Yutong, et autres
Publié: (2025)
par: Liu, Yutong, et autres
Publié: (2025)
ChatCFD: An LLM-Driven Agent for End-to-End CFD Automation with Structured Knowledge and Reasoning
par: Fan, E, et autres
Publié: (2025)
par: Fan, E, et autres
Publié: (2025)
Qwen3-TTS Technical Report
par: Hu, Hangrui, et autres
Publié: (2026)
par: Hu, Hangrui, et autres
Publié: (2026)
TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision
par: Zhai, Yukun, et autres
Publié: (2023)
par: Zhai, Yukun, et autres
Publié: (2023)
TextBandit: Evaluating Probabilistic Reasoning in LLMs Through Language-Only Decision Tasks
par: Lim, Jimin, et autres
Publié: (2025)
par: Lim, Jimin, et autres
Publié: (2025)
WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning
par: Wei, Zhepei, et autres
Publié: (2025)
par: Wei, Zhepei, et autres
Publié: (2025)
Bayesian Multi-Task Transfer Learning for Soft Prompt Tuning
par: Lee, Haeju, et autres
Publié: (2024)
par: Lee, Haeju, et autres
Publié: (2024)
Beyond Single-Task: Robust Multi-Task Length Generalization for LLMs
par: Hu, Yi, et autres
Publié: (2025)
par: Hu, Yi, et autres
Publié: (2025)
MahaTTS: A Unified Framework for Multilingual Text-to-Speech Synthesis
par: Singh, Jaskaran, et autres
Publié: (2025)
par: Singh, Jaskaran, et autres
Publié: (2025)
Multi-Task Learning with LLMs for Implicit Sentiment Analysis: Data-level and Task-level Automatic Weight Learning
par: Lai, Wenna, et autres
Publié: (2024)
par: Lai, Wenna, et autres
Publié: (2024)
RephraseTTS: Dynamic Length Text based Speech Insertion with Speaker Style Transfer
par: Matiyali, Neeraj, et autres
Publié: (2025)
par: Matiyali, Neeraj, et autres
Publié: (2025)
ManchuTTS: Towards High-Quality Manchu Speech Synthesis via Flow Matching and Hierarchical Text Representation
par: Wang, Suhua, et autres
Publié: (2025)
par: Wang, Suhua, et autres
Publié: (2025)
AgentTTS: Large Language Model Agent for Test-time Compute-optimal Scaling Strategy in Complex Tasks
par: Wang, Fali, et autres
Publié: (2025)
par: Wang, Fali, et autres
Publié: (2025)
End-to-End Beam Retrieval for Multi-Hop Question Answering
par: Zhang, Jiahao, et autres
Publié: (2023)
par: Zhang, Jiahao, et autres
Publié: (2023)
More Data, Fewer Diacritics: Scaling Arabic TTS
par: Musleh, Ahmed, et autres
Publié: (2026)
par: Musleh, Ahmed, et autres
Publié: (2026)
FormalASR: End-to-End Spoken Chinese to Formal Text
par: Ning, Wanyi, et autres
Publié: (2026)
par: Ning, Wanyi, et autres
Publié: (2026)
E2E-AFG: An End-to-End Model with Adaptive Filtering for Retrieval-Augmented Generation
par: Jiang, Yun, et autres
Publié: (2024)
par: Jiang, Yun, et autres
Publié: (2024)
FMSD-TTS: Few-shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for Ü-Tsang, Amdo and Kham Speech Dataset Generation
par: Liu, Yutong, et autres
Publié: (2025)
par: Liu, Yutong, et autres
Publié: (2025)
MELD: Multi-Task Equilibrated Learning Detector for AI-Generated Text
par: Li, Chenjun, et autres
Publié: (2026)
par: Li, Chenjun, et autres
Publié: (2026)
FAID: Fine-Grained AI-Generated Text Detection Using Multi-Task Auxiliary and Multi-Level Contrastive Learning
par: Ta, Minh Ngoc, et autres
Publié: (2025)
par: Ta, Minh Ngoc, et autres
Publié: (2025)
Multi-Task Reinforcement Learning for Enhanced Multimodal LLM-as-a-Judge
par: Wu, Junjie, et autres
Publié: (2026)
par: Wu, Junjie, et autres
Publié: (2026)
Enhancing End-to-End Multi-Task Dialogue Systems: A Study on Intrinsic Motivation Reinforcement Learning Algorithms for Improved Training and Adaptability
par: Kamuni, Navin, et autres
Publié: (2024)
par: Kamuni, Navin, et autres
Publié: (2024)
Documents similaires
-
Prompting Large Language Models with Audio for General-Purpose Speech Summarization
par: Kang, Wonjune, et autres
Publié: (2024) -
Expressive Speech Retrieval using Natural Language Descriptions of Speaking Style
par: Kang, Wonjune, et autres
Publié: (2025) -
ConGraT: Self-Supervised Contrastive Pretraining for Joint Graph and Text Embeddings
par: Brannon, William, et autres
Publié: (2023) -
CLAG: Adaptive Memory Organization via Agent-Driven Clustering for Small Language Model Agents
par: Roh, Taeyun, et autres
Publié: (2026) -
An investigation of phrase break prediction in an End-to-End TTS system
par: Vadapalli, Anandaswarup
Publié: (2023)