Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Qize, Bai, Detao, Peng, Yi-Xing, Wei, Xihan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding
por: Zhao, Jiaxing, et al.
Publicado: (2025)
por: Zhao, Jiaxing, et al.
Publicado: (2025)
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
por: Yang, Qize, et al.
Publicado: (2025)
por: Yang, Qize, et al.
Publicado: (2025)
R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning
por: Zhao, Jiaxing, et al.
Publicado: (2025)
por: Zhao, Jiaxing, et al.
Publicado: (2025)
HumanOmni-Speaker: Identifying Who said What and When
por: Bai, Detao, et al.
Publicado: (2026)
por: Bai, Detao, et al.
Publicado: (2026)
ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding
por: Peng, Yi-Xing, et al.
Publicado: (2025)
por: Peng, Yi-Xing, et al.
Publicado: (2025)
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
por: Bai, Detao, et al.
Publicado: (2025)
por: Bai, Detao, et al.
Publicado: (2025)
OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder
por: Bai, Detao, et al.
Publicado: (2026)
por: Bai, Detao, et al.
Publicado: (2026)
ViSpeak: Visual Instruction Feedback in Streaming Videos
por: Fu, Shenghao, et al.
Publicado: (2025)
por: Fu, Shenghao, et al.
Publicado: (2025)
EmoFace: Audio-driven Emotional 3D Face Animation
por: Liu, Chang, et al.
Publicado: (2024)
por: Liu, Chang, et al.
Publicado: (2024)
Detail-Enhanced Intra- and Inter-modal Interaction for Audio-Visual Emotion Recognition
por: Shi, Tong, et al.
Publicado: (2024)
por: Shi, Tong, et al.
Publicado: (2024)
LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning
por: Fu, Shenghao, et al.
Publicado: (2025)
por: Fu, Shenghao, et al.
Publicado: (2025)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
por: Yang, Hao, et al.
Publicado: (2026)
por: Yang, Hao, et al.
Publicado: (2026)
Frozen-DETR: Enhancing DETR with Image Understanding from Frozen Foundation Models
por: Fu, Shenghao, et al.
Publicado: (2024)
por: Fu, Shenghao, et al.
Publicado: (2024)
EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models
por: Xing, Bohao, et al.
Publicado: (2025)
por: Xing, Bohao, et al.
Publicado: (2025)
Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video
por: Choi, Chanhyuk, et al.
Publicado: (2026)
por: Choi, Chanhyuk, et al.
Publicado: (2026)
EALD-MLLM: Emotion Analysis in Long-sequential and De-identity videos with Multi-modal Large Language Model
por: Li, Deng, et al.
Publicado: (2024)
por: Li, Deng, et al.
Publicado: (2024)
Mamba-Enhanced Text-Audio-Video Alignment Network for Emotion Recognition in Conversations
por: Li, Xinran, et al.
Publicado: (2024)
por: Li, Xinran, et al.
Publicado: (2024)
FEALLM: Advancing Facial Emotion Analysis in Multimodal Large Language Models with Emotional Synergy and Reasoning
por: Hu, Zhuozhao, et al.
Publicado: (2025)
por: Hu, Zhuozhao, et al.
Publicado: (2025)
Moodifier: MLLM-Enhanced Emotion-Driven Image Editing
por: Ye, Jiarong, et al.
Publicado: (2025)
por: Ye, Jiarong, et al.
Publicado: (2025)
EmoVid: A Multimodal Emotion Video Dataset for Emotion-Centric Video Understanding and Generation
por: Qiu, Zongyang, et al.
Publicado: (2025)
por: Qiu, Zongyang, et al.
Publicado: (2025)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
por: Wu, Peiran, et al.
Publicado: (2025)
por: Wu, Peiran, et al.
Publicado: (2025)
EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness
por: Sun, Yueru, et al.
Publicado: (2026)
por: Sun, Yueru, et al.
Publicado: (2026)
eMotions: A Large-Scale Dataset and Audio-Visual Fusion Network for Emotion Analysis in Short-form Videos
por: Wu, Xuecheng, et al.
Publicado: (2025)
por: Wu, Xuecheng, et al.
Publicado: (2025)
A Hierarchical Semantic Distillation Framework for Open-Vocabulary Object Detection
por: Fu, Shenghao, et al.
Publicado: (2025)
por: Fu, Shenghao, et al.
Publicado: (2025)
ESGaussianFace: Emotional and Stylized Audio-Driven Facial Animation via 3D Gaussian Splatting
por: Ma, Chuhang, et al.
Publicado: (2026)
por: Ma, Chuhang, et al.
Publicado: (2026)
Nuanced Emotion Recognition Based on a Segment-based MLLM Framework Leveraging Qwen3-Omni for AH Detection
por: Tang, Liang, et al.
Publicado: (2026)
por: Tang, Liang, et al.
Publicado: (2026)
SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers
por: Fei, Zhengcong, et al.
Publicado: (2025)
por: Fei, Zhengcong, et al.
Publicado: (2025)
Face-MLLM: A Large Face Perception Model
por: Sun, Haomiao, et al.
Publicado: (2024)
por: Sun, Haomiao, et al.
Publicado: (2024)
Lightweight Models for Emotional Analysis in Video
por: Nguyen, Quoc-Tien, et al.
Publicado: (2025)
por: Nguyen, Quoc-Tien, et al.
Publicado: (2025)
Multimodal Video Emotion Recognition with Reliable Reasoning Priors
por: Wang, Zhepeng, et al.
Publicado: (2025)
por: Wang, Zhepeng, et al.
Publicado: (2025)
SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM
por: Yu, An, et al.
Publicado: (2025)
por: Yu, An, et al.
Publicado: (2025)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
por: Ma, Ziyang, et al.
Publicado: (2025)
por: Ma, Ziyang, et al.
Publicado: (2025)
OmniTalker: One-shot Real-time Text-Driven Talking Audio-Video Generation With Multimodal Style Mimicking
por: Wang, Zhongjian, et al.
Publicado: (2025)
por: Wang, Zhongjian, et al.
Publicado: (2025)
Video Emotion Open-vocabulary Recognition Based on Multimodal Large Language Model
por: Ge, Mengying, et al.
Publicado: (2024)
por: Ge, Mengying, et al.
Publicado: (2024)
GMTalker: Gaussian Mixture-based Audio-Driven Emotional Talking Video Portraits
por: Xia, Yibo, et al.
Publicado: (2023)
por: Xia, Yibo, et al.
Publicado: (2023)
LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models
por: Fu, Shenghao, et al.
Publicado: (2025)
por: Fu, Shenghao, et al.
Publicado: (2025)
DreamView: Injecting View-specific Text Guidance into Text-to-3D Generation
por: Yan, Junkai, et al.
Publicado: (2024)
por: Yan, Junkai, et al.
Publicado: (2024)
Text-Driven Emotionally Continuous Talking Face Generation
por: Yang, Hao, et al.
Publicado: (2026)
por: Yang, Hao, et al.
Publicado: (2026)
CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLM
por: Xu, Jingwei, et al.
Publicado: (2024)
por: Xu, Jingwei, et al.
Publicado: (2024)
DEEMO: De-identity Multimodal Emotion Recognition and Reasoning
por: Li, Deng, et al.
Publicado: (2025)
por: Li, Deng, et al.
Publicado: (2025)
Ejemplares similares
-
HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding
por: Zhao, Jiaxing, et al.
Publicado: (2025) -
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
por: Yang, Qize, et al.
Publicado: (2025) -
R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning
por: Zhao, Jiaxing, et al.
Publicado: (2025) -
HumanOmni-Speaker: Identifying Who said What and When
por: Bai, Detao, et al.
Publicado: (2026) -
ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding
por: Peng, Yi-Xing, et al.
Publicado: (2025)