Video Emotion Open-vocabulary Recognition Based on Multimodal Large Language Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Ge, Mengying, Tang, Dongkai, Li, Mingyang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OpenVIS: Open-vocabulary Video Instance Segmentation
por: Guo, Pinxue, et al.
Publicado: (2023)
por: Guo, Pinxue, et al.
Publicado: (2023)
Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition
por: Xuan, Shiyu, et al.
Publicado: (2026)
por: Xuan, Shiyu, et al.
Publicado: (2026)
LocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language Model
por: Wang, Dongkai, et al.
Publicado: (2024)
por: Wang, Dongkai, et al.
Publicado: (2024)
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
por: Cheng, Zesen, et al.
Publicado: (2024)
por: Cheng, Zesen, et al.
Publicado: (2024)
Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach
por: Wu, Daiqing, et al.
Publicado: (2025)
por: Wu, Daiqing, et al.
Publicado: (2025)
From Semantics, Scene to Instance-awareness: Distilling Foundation Model for Grounded Open-vocabulary Situation Recognition
por: Cai, Chen, et al.
Publicado: (2025)
por: Cai, Chen, et al.
Publicado: (2025)
EmoSign: A Multimodal Dataset for Understanding Emotions in American Sign Language
por: Chua, Phoebe, et al.
Publicado: (2025)
por: Chua, Phoebe, et al.
Publicado: (2025)
Contextual Emotion Recognition using Large Vision Language Models
por: Etesam, Yasaman, et al.
Publicado: (2024)
por: Etesam, Yasaman, et al.
Publicado: (2024)
Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
por: Chen, Boyu, et al.
Publicado: (2024)
por: Chen, Boyu, et al.
Publicado: (2024)
EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models
por: Xing, Bohao, et al.
Publicado: (2025)
por: Xing, Bohao, et al.
Publicado: (2025)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
por: Wang, Jiankang, et al.
Publicado: (2025)
por: Wang, Jiankang, et al.
Publicado: (2025)
Multimodal Video Emotion Recognition with Reliable Reasoning Priors
por: Wang, Zhepeng, et al.
Publicado: (2025)
por: Wang, Zhepeng, et al.
Publicado: (2025)
ICANet: A Method of Short Video Emotion Recognition Driven by Multimodal Data
por: Wu, Xuecheng, et al.
Publicado: (2022)
por: Wu, Xuecheng, et al.
Publicado: (2022)
Multi-Grained Cross-modal Alignment for Learning Open-vocabulary Semantic Segmentation from Text Supervision
por: Liu, Yajie, et al.
Publicado: (2024)
por: Liu, Yajie, et al.
Publicado: (2024)
Decoupled Hierarchical Distillation for Multimodal Emotion Recognition
por: Li, Yong, et al.
Publicado: (2026)
por: Li, Yong, et al.
Publicado: (2026)
Semantic Consistent Language Gaussian Splatting for Point-Level Open-vocabulary Querying
por: Yin, Hairong, et al.
Publicado: (2025)
por: Yin, Hairong, et al.
Publicado: (2025)
OpenTie: Open-vocabulary Sequential Rebar Tying System
por: Liu, Mingze, et al.
Publicado: (2025)
por: Liu, Mingze, et al.
Publicado: (2025)
End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting
por: Wang, Yongqi, et al.
Publicado: (2024)
por: Wang, Yongqi, et al.
Publicado: (2024)
Feature-Based Dual Visual Feature Extraction Model for Compound Multimodal Emotion Recognition
por: Liu, Ran, et al.
Publicado: (2025)
por: Liu, Ran, et al.
Publicado: (2025)
FEALLM: Advancing Facial Emotion Analysis in Multimodal Large Language Models with Emotional Synergy and Reasoning
por: Hu, Zhuozhao, et al.
Publicado: (2025)
por: Hu, Zhuozhao, et al.
Publicado: (2025)
From Data to Modeling: Fully Open-vocabulary Scene Graph Generation
por: Chen, Zuyao, et al.
Publicado: (2025)
por: Chen, Zuyao, et al.
Publicado: (2025)
SEED-Story: Multimodal Long Story Generation with Large Language Model
por: Yang, Shuai, et al.
Publicado: (2024)
por: Yang, Shuai, et al.
Publicado: (2024)
EmoLLM: Multimodal Emotional Understanding Meets Large Language Models
por: Yang, Qu, et al.
Publicado: (2024)
por: Yang, Qu, et al.
Publicado: (2024)
TiCAL:Typicality-Based Consistency-Aware Learning for Multimodal Emotion Recognition
por: Yin, Wen, et al.
Publicado: (2025)
por: Yin, Wen, et al.
Publicado: (2025)
Evaluating Multimodal Large Language Models for Heterogeneous Face Recognition
por: Shahreza, Hatef Otroshi, et al.
Publicado: (2026)
por: Shahreza, Hatef Otroshi, et al.
Publicado: (2026)
OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-Time Self-Aware Emotional Speech Synthesis
por: Luo, Run, et al.
Publicado: (2025)
por: Luo, Run, et al.
Publicado: (2025)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
por: Wu, Jianzong, et al.
Publicado: (2024)
por: Wu, Jianzong, et al.
Publicado: (2024)
DEEMO: De-identity Multimodal Emotion Recognition and Reasoning
por: Li, Deng, et al.
Publicado: (2025)
por: Li, Deng, et al.
Publicado: (2025)
PosSAM: Panoptic Open-vocabulary Segment Anything
por: VS, Vibashan, et al.
Publicado: (2024)
por: VS, Vibashan, et al.
Publicado: (2024)
Weakly Supervised 3D Open-vocabulary Segmentation
por: Liu, Kunhao, et al.
Publicado: (2023)
por: Liu, Kunhao, et al.
Publicado: (2023)
Open-vocabulary object 6D pose estimation
por: Corsetti, Jaime, et al.
Publicado: (2023)
por: Corsetti, Jaime, et al.
Publicado: (2023)
OV-NeRF: Open-vocabulary Neural Radiance Fields with Vision and Language Foundation Models for 3D Semantic Understanding
por: Liao, Guibiao, et al.
Publicado: (2024)
por: Liao, Guibiao, et al.
Publicado: (2024)
AlignVTOFF: Texture-Spatial Feature Alignment for High-Fidelity Virtual Try-Off
por: Zhu, Yihan, et al.
Publicado: (2026)
por: Zhu, Yihan, et al.
Publicado: (2026)
ST-LLM: Large Language Models Are Effective Temporal Learners
por: Liu, Ruyang, et al.
Publicado: (2024)
por: Liu, Ruyang, et al.
Publicado: (2024)
A Trustworthy Method for Multimodal Emotion Recognition
por: Xue, Junxiao, et al.
Publicado: (2025)
por: Xue, Junxiao, et al.
Publicado: (2025)
Leveraging CLIP Encoder for Multimodal Emotion Recognition
por: Song, Yehun, et al.
Publicado: (2025)
por: Song, Yehun, et al.
Publicado: (2025)
Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark
por: Hu, Jinpeng, et al.
Publicado: (2025)
por: Hu, Jinpeng, et al.
Publicado: (2025)
Textualized and Feature-based Models for Compound Multimodal Emotion Recognition in the Wild
por: Richet, Nicolas, et al.
Publicado: (2024)
por: Richet, Nicolas, et al.
Publicado: (2024)
METOR: A Unified Framework for Mutual Enhancement of Objects and Relationships in Open-vocabulary Video Visual Relationship Detection
por: Wang, Yongqi, et al.
Publicado: (2025)
por: Wang, Yongqi, et al.
Publicado: (2025)
GaussianGrasper: 3D Language Gaussian Splatting for Open-vocabulary Robotic Grasping
por: Zheng, Yuhang, et al.
Publicado: (2024)
por: Zheng, Yuhang, et al.
Publicado: (2024)
Ejemplares similares
-
OpenVIS: Open-vocabulary Video Instance Segmentation
por: Guo, Pinxue, et al.
Publicado: (2023) -
Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition
por: Xuan, Shiyu, et al.
Publicado: (2026) -
LocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language Model
por: Wang, Dongkai, et al.
Publicado: (2024) -
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
por: Cheng, Zesen, et al.
Publicado: (2024) -
Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach
por: Wu, Daiqing, et al.
Publicado: (2025)