AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Dingkun, Patel, Krish, Kankipati, Ajay, Gupta, Akshaj, Li, Zeyi Austin, Shukla, Mohul, Narang, Vibhor, Kofman, Sara, Ye, Zongli, Wang, Grace, Shi, Xiaoyu, Li, Tingle, Lin, Guan-Ting, Cheng, Kan Jen, Chou, Huang-Cheng, Lian, Jiachen, Anumanchipalli, Gopala |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Spoken Dialogue Systems
di: Liu, Jingwen, et al.
Pubblicazione: (2025)
di: Liu, Jingwen, et al.
Pubblicazione: (2025)
Audio Texture Manipulation by Exemplar-Based Analogy
di: Cheng, Kan Jen, et al.
Pubblicazione: (2025)
di: Cheng, Kan Jen, et al.
Pubblicazione: (2025)
Enabling Conversational Behavior Reasoning Capabilities in Full-Duplex Speech
di: Pan, Shuchang, et al.
Pubblicazione: (2025)
di: Pan, Shuchang, et al.
Pubblicazione: (2025)
Towards Hierarchical Spoken Language Dysfluency Modeling
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
Asymmetric Hierarchical Anchoring for Audio-Visual Joint Representation: Resolving Information Allocation Ambiguity for Robust Cross-Modal Generalization
di: Wu, Bixing, et al.
Pubblicazione: (2026)
di: Wu, Bixing, et al.
Pubblicazione: (2026)
Speech World Model: Causal State-Action Planning with Explicit Reasoning for Speech
di: Zhou, Xuanru, et al.
Pubblicazione: (2025)
di: Zhou, Xuanru, et al.
Pubblicazione: (2025)
Self-Supervised Audio-Visual Soundscape Stylization
di: Li, Tingle, et al.
Pubblicazione: (2024)
di: Li, Tingle, et al.
Pubblicazione: (2024)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
TART: A Comprehensive Tool for Technique-Aware Audio-to-Tab Guitar Transcription
di: Gupta, Akshaj, et al.
Pubblicazione: (2025)
di: Gupta, Akshaj, et al.
Pubblicazione: (2025)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
VAR-MATH: Probing True Mathematical Reasoning in LLMS via Symbolic Multi-Instance Benchmarks
di: Yao, Jian, et al.
Pubblicazione: (2025)
di: Yao, Jian, et al.
Pubblicazione: (2025)
Negotiating with LLMS: Prompt Hacks, Skill Gaps, and Reasoning Deficits
di: Schneider, Johannes, et al.
Pubblicazione: (2023)
di: Schneider, Johannes, et al.
Pubblicazione: (2023)
Teaching Machines to Speak Using Articulatory Control
di: Anand, Akshay, et al.
Pubblicazione: (2025)
di: Anand, Akshay, et al.
Pubblicazione: (2025)
A Unified Framework for Model Editing
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
Is Bigger Edit Batch Size Always Better? -- An Empirical Study on Model Editing with Llama-3
di: Yoon, Junsang, et al.
Pubblicazione: (2024)
di: Yoon, Junsang, et al.
Pubblicazione: (2024)
Rebuilding ROME : Resolving Model Collapse during Sequential Model Editing
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
Geometric Interpretation of Layer Normalization and a Comparative Analysis with RMSNorm
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
Model Editing at Scale leads to Gradual and Catastrophic Forgetting
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
StyleStream: Real-Time Zero-Shot Voice Style Conversion
di: Liu, Yisi, et al.
Pubblicazione: (2026)
di: Liu, Yisi, et al.
Pubblicazione: (2026)
Self-Assessment Tests are Unreliable Measures of LLM Personality
di: Gupta, Akshat, et al.
Pubblicazione: (2023)
di: Gupta, Akshat, et al.
Pubblicazione: (2023)
LCS-CTC: Leveraging Soft Alignments to Enhance Phonetic Transcription Robustness
di: Ye, Zongli, et al.
Pubblicazione: (2025)
di: Ye, Zongli, et al.
Pubblicazione: (2025)
EMO-Debias: Benchmarking Gender Debiasing Techniques in Multi-Label Speech Emotion Recognition
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
Sounding that Object: Interactive Object-Aware Image to Audio Generation
di: Li, Tingle, et al.
Pubblicazione: (2025)
di: Li, Tingle, et al.
Pubblicazione: (2025)
The MUSE Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMS
di: Carone, Brandon James, et al.
Pubblicazione: (2025)
di: Carone, Brandon James, et al.
Pubblicazione: (2025)
From Ising to Potts: Physics-inspired Potts machines of coupled oscillators for low-energy sampling and combinatorial optimization
di: Cheng, Yi, et al.
Pubblicazione: (2025)
di: Cheng, Yi, et al.
Pubblicazione: (2025)
Training oscillator Ising machines to assign the dynamic stability of their equilibrium points
di: Cheng, Yi, et al.
Pubblicazione: (2025)
di: Cheng, Yi, et al.
Pubblicazione: (2025)
How Do LLMs Use Their Depth?
di: Gupta, Akshat, et al.
Pubblicazione: (2025)
di: Gupta, Akshat, et al.
Pubblicazione: (2025)
Efficient Knowledge Editing via Minimal Precomputation
di: Gupta, Akshat, et al.
Pubblicazione: (2025)
di: Gupta, Akshat, et al.
Pubblicazione: (2025)
EMO-SUPERB: An In-depth Look at Speech Emotion Recognition
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
di: Xu, Weihan, et al.
Pubblicazione: (2025)
di: Xu, Weihan, et al.
Pubblicazione: (2025)
The Sound of Simulation: Learning Multimodal Sim-to-Real Robot Policies with Generative Audio
di: Wang, Renhao, et al.
Pubblicazione: (2025)
di: Wang, Renhao, et al.
Pubblicazione: (2025)
HuPER: A Human-Inspired Framework for Phonetic Perception
di: Guo, Chenxu, et al.
Pubblicazione: (2026)
di: Guo, Chenxu, et al.
Pubblicazione: (2026)
EMO-Codec: An In-Depth Look at Emotion Preservation capacity of Legacy and Neural Codec Models With Subjective and Objective Evaluations
di: Ren, Wenze, et al.
Pubblicazione: (2024)
di: Ren, Wenze, et al.
Pubblicazione: (2024)
RT-VC: Real-Time Zero-Shot Voice Conversion with Speech Articulatory Coding
di: Liu, Yisi, et al.
Pubblicazione: (2025)
di: Liu, Yisi, et al.
Pubblicazione: (2025)
Multimodal Segmentation for Vocal Tract Modeling
di: Jain, Rishi, et al.
Pubblicazione: (2024)
di: Jain, Rishi, et al.
Pubblicazione: (2024)
The Oracle Has Spoken: A Multi-Aspect Evaluation of Dialogue in Pythia
di: Chen, Zixun, et al.
Pubblicazione: (2025)
di: Chen, Zixun, et al.
Pubblicazione: (2025)
EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models
di: Fang, Yiyang, et al.
Pubblicazione: (2026)
di: Fang, Yiyang, et al.
Pubblicazione: (2026)
Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning
di: Liu, Qihao, et al.
Pubblicazione: (2025)
di: Liu, Qihao, et al.
Pubblicazione: (2025)
Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning
di: Xu, Ke, et al.
Pubblicazione: (2026)
di: Xu, Ke, et al.
Pubblicazione: (2026)
Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning
di: Cheng, Dongjie, et al.
Pubblicazione: (2026)
di: Cheng, Dongjie, et al.
Pubblicazione: (2026)
Documenti analoghi
-
EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Spoken Dialogue Systems
di: Liu, Jingwen, et al.
Pubblicazione: (2025) -
Audio Texture Manipulation by Exemplar-Based Analogy
di: Cheng, Kan Jen, et al.
Pubblicazione: (2025) -
Enabling Conversational Behavior Reasoning Capabilities in Full-Duplex Speech
di: Pan, Shuchang, et al.
Pubblicazione: (2025) -
Towards Hierarchical Spoken Language Dysfluency Modeling
di: Lian, Jiachen, et al.
Pubblicazione: (2024) -
Asymmetric Hierarchical Anchoring for Audio-Visual Joint Representation: Resolving Information Allocation Ambiguity for Robust Cross-Modal Generalization
di: Wu, Bixing, et al.
Pubblicazione: (2026)