LLM-Driven Multimodal Opinion Expression Identification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jia, Bonian, Chen, Huiyao, Sun, Yueheng, Zhang, Meishan, Zhang, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BrainECHO: Semantic Brain Signal Decoding through Vector-Quantized Spectrogram Reconstruction for Whisper-Enhanced Text Generation
par: Li, Jilong, et autres
Publié: (2024)
par: Li, Jilong, et autres
Publié: (2024)
Speech ReaLLM -- Real-time Streaming Speech Recognition with Multimodal LLMs by Teaching the Flow of Time
par: Seide, Frank, et autres
Publié: (2024)
par: Seide, Frank, et autres
Publié: (2024)
SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation
par: Yu, Wenyi, et autres
Publié: (2024)
par: Yu, Wenyi, et autres
Publié: (2024)
Efficient Streaming LLM for Speech Recognition
par: Jia, Junteng, et autres
Publié: (2024)
par: Jia, Junteng, et autres
Publié: (2024)
VoiceBench: Benchmarking LLM-Based Voice Assistants
par: Chen, Yiming, et autres
Publié: (2024)
par: Chen, Yiming, et autres
Publié: (2024)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
par: Ma, Ziyang, et autres
Publié: (2023)
par: Ma, Ziyang, et autres
Publié: (2023)
Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
par: Wang, Jun, et autres
Publié: (2025)
par: Wang, Jun, et autres
Publié: (2025)
KidSpeak: A General Multi-purpose LLM for Kids' Speech Recognition and Screening
par: Sharma, Rohan, et autres
Publié: (2025)
par: Sharma, Rohan, et autres
Publié: (2025)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
par: Zhang, Shaolei, et autres
Publié: (2024)
par: Zhang, Shaolei, et autres
Publié: (2024)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
par: Ma, Zhengrui, et autres
Publié: (2024)
par: Ma, Zhengrui, et autres
Publié: (2024)
Low-Rank and Sparse Model Merging for Multi-Lingual Speech Recognition and Translation
par: Zhao, Qiuming, et autres
Publié: (2025)
par: Zhao, Qiuming, et autres
Publié: (2025)
LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis
par: Fang, Qingkai, et autres
Publié: (2025)
par: Fang, Qingkai, et autres
Publié: (2025)
SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval
par: Lin, Yueqian, et autres
Publié: (2024)
par: Lin, Yueqian, et autres
Publié: (2024)
Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
par: Wang, Xiong, et autres
Publié: (2024)
par: Wang, Xiong, et autres
Publié: (2024)
A Novel Data Augmentation Approach for Automatic Speaking Assessment on Opinion Expressions
par: Wang, Chung-Chun, et autres
Publié: (2025)
par: Wang, Chung-Chun, et autres
Publié: (2025)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
par: Song, Zheshu, et autres
Publié: (2024)
par: Song, Zheshu, et autres
Publié: (2024)
DM-Codec: Distilling Multimodal Representations for Speech Tokenization
par: Ahasan, Md Mubtasim, et autres
Publié: (2024)
par: Ahasan, Md Mubtasim, et autres
Publié: (2024)
WavLLM: Towards Robust and Adaptive Speech Large Language Model
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
Weak Supervision Techniques towards Enhanced ASR Models in Industry-level CRM Systems
par: Wang, Zhongsheng, et autres
Publié: (2025)
par: Wang, Zhongsheng, et autres
Publié: (2025)
Optimizing Speech Multi-View Feature Fusion through Conditional Computation
par: Shan, Weiqiao, et autres
Publié: (2025)
par: Shan, Weiqiao, et autres
Publié: (2025)
Effective Noise-aware Data Simulation for Domain-adaptive Speech Enhancement Leveraging Dynamic Stochastic Perturbation
par: Wang, Chien-Chun, et autres
Publié: (2024)
par: Wang, Chien-Chun, et autres
Publié: (2024)
OpenS2S: Advancing Fully Open-Source End-to-End Empathetic Large Speech Language Model
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
Data-Centric Improvements for Enhancing Multi-Modal Understanding in Spoken Conversation Modeling
par: Chen, Maximillian, et autres
Publié: (2024)
par: Chen, Maximillian, et autres
Publié: (2024)
MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models
par: Deng, Yayue, et autres
Publié: (2025)
par: Deng, Yayue, et autres
Publié: (2025)
Ming-UniAudio: Speech LLM for Joint Understanding, Generation and Editing with Unified Representation
par: Yan, Canxiang, et autres
Publié: (2025)
par: Yan, Canxiang, et autres
Publié: (2025)
An Embarrassingly Simple Approach for LLM with Strong ASR Capacity
par: Ma, Ziyang, et autres
Publié: (2024)
par: Ma, Ziyang, et autres
Publié: (2024)
Speech Prefix-Tuning with RNNT Loss for Improving LLM Predictions
par: Baskar, Murali Karthick, et autres
Publié: (2024)
par: Baskar, Murali Karthick, et autres
Publié: (2024)
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
par: Zhang, Wenyu, et autres
Publié: (2024)
par: Zhang, Wenyu, et autres
Publié: (2024)
Hello-Chat: Towards Realistic Social Audio Interactions
par: Hou, Yueran, et autres
Publié: (2026)
par: Hou, Yueran, et autres
Publié: (2026)
From Scores to Preferences: Redefining MOS Benchmarking for Speech Quality Reward Modeling
par: Cao, Yifei, et autres
Publié: (2025)
par: Cao, Yifei, et autres
Publié: (2025)
An LLM Benchmark for Addressee Recognition in Multi-modal Multi-party Dialogue
par: Inoue, Koji, et autres
Publié: (2025)
par: Inoue, Koji, et autres
Publié: (2025)
Enhancing Dialogue Annotation with Speaker Characteristics Leveraging a Frozen LLM
par: Thebaud, Thomas, et autres
Publié: (2025)
par: Thebaud, Thomas, et autres
Publié: (2025)
A Unified Speech LLM for Diarization and Speech Recognition in Multilingual Conversations
par: Saengthong, Phurich, et autres
Publié: (2025)
par: Saengthong, Phurich, et autres
Publié: (2025)
Channel-Aware Domain-Adaptive Generative Adversarial Network for Robust Speech Recognition
par: Wang, Chien-Chun, et autres
Publié: (2024)
par: Wang, Chien-Chun, et autres
Publié: (2024)
TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition
par: Yang, Cheng-Yeh, et autres
Publié: (2026)
par: Yang, Cheng-Yeh, et autres
Publié: (2026)
Jointly Fine-Tuning "BERT-like" Self Supervised Models to Improve Multimodal Speech Emotion Recognition
par: Siriwardhana, Shamane, et autres
Publié: (2020)
par: Siriwardhana, Shamane, et autres
Publié: (2020)
SPBA: Utilizing Speech Large Language Model for Backdoor Attacks on Speech Classification Models
par: Yao, Wenhan, et autres
Publié: (2025)
par: Yao, Wenhan, et autres
Publié: (2025)
Optimizing the role of human evaluation in LLM-based spoken document summarization systems
par: Kroll, Margaret, et autres
Publié: (2024)
par: Kroll, Margaret, et autres
Publié: (2024)
Iterative LLM-based improvement for French Clinical Interview Transcription and Speaker Diarization
par: Marie, Ambre, et autres
Publié: (2026)
par: Marie, Ambre, et autres
Publié: (2026)
CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models
par: He, Jiajun, et autres
Publié: (2025)
par: He, Jiajun, et autres
Publié: (2025)
Documents similaires
-
BrainECHO: Semantic Brain Signal Decoding through Vector-Quantized Spectrogram Reconstruction for Whisper-Enhanced Text Generation
par: Li, Jilong, et autres
Publié: (2024) -
Speech ReaLLM -- Real-time Streaming Speech Recognition with Multimodal LLMs by Teaching the Flow of Time
par: Seide, Frank, et autres
Publié: (2024) -
SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation
par: Yu, Wenyi, et autres
Publié: (2024) -
Efficient Streaming LLM for Speech Recognition
par: Jia, Junteng, et autres
Publié: (2024) -
VoiceBench: Benchmarking LLM-Based Voice Assistants
par: Chen, Yiming, et autres
Publié: (2024)