UniEmoX: Cross-modal Semantic-Guided Large-Scale Pretraining for Universal Scene Emotion Perception
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Chuang, Sun, Xiao, Liu, Zhi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy
di: Huang, Jiahao, et al.
Pubblicazione: (2026)
di: Huang, Jiahao, et al.
Pubblicazione: (2026)
MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models
di: Chen, Tianwei, et al.
Pubblicazione: (2026)
di: Chen, Tianwei, et al.
Pubblicazione: (2026)
Comparative Study of Vision-Based Metric Measurement for Large-Scale Planar Scenes
di: Sun, ZhiXin
Pubblicazione: (2026)
di: Sun, ZhiXin
Pubblicazione: (2026)
UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries
di: Zhu, Yijie, et al.
Pubblicazione: (2025)
di: Zhu, Yijie, et al.
Pubblicazione: (2025)
EmoVIT: Revolutionizing Emotion Insights with Visual Instruction Tuning
di: Xie, Hongxia, et al.
Pubblicazione: (2024)
di: Xie, Hongxia, et al.
Pubblicazione: (2024)
FindingEmo: An Image Dataset for Emotion Recognition in the Wild
di: Mertens, Laurent, et al.
Pubblicazione: (2024)
di: Mertens, Laurent, et al.
Pubblicazione: (2024)
EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness
di: Sun, Yueru, et al.
Pubblicazione: (2026)
di: Sun, Yueru, et al.
Pubblicazione: (2026)
Explore the Limits of Omni-modal Pretraining at Scale
di: Zhang, Yiyuan, et al.
Pubblicazione: (2024)
di: Zhang, Yiyuan, et al.
Pubblicazione: (2024)
xModel-KD: Cross-modal Knowledge Distillation for 3D Scene Perception using LiDAR
di: Pathmanathan, Thenukan, et al.
Pubblicazione: (2026)
di: Pathmanathan, Thenukan, et al.
Pubblicazione: (2026)
HexPlane Representation for 3D Semantic Scene Understanding
di: Chen, Zeren, et al.
Pubblicazione: (2025)
di: Chen, Zeren, et al.
Pubblicazione: (2025)
UniHM: Universal Human Motion Generation with Object Interactions in Indoor Scenes
di: Geng, Zichen, et al.
Pubblicazione: (2025)
di: Geng, Zichen, et al.
Pubblicazione: (2025)
EmoNet-Face: An Expert-Annotated Benchmark for Synthetic Emotion Recognition
di: Schuhmann, Christoph, et al.
Pubblicazione: (2025)
di: Schuhmann, Christoph, et al.
Pubblicazione: (2025)
LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment
di: Zhu, Bin, et al.
Pubblicazione: (2023)
di: Zhu, Bin, et al.
Pubblicazione: (2023)
Spectral Discrepancy and Cross-modal Semantic Consistency Learning for Object Detection in Hyperspectral Image
di: He, Xiao, et al.
Pubblicazione: (2025)
di: He, Xiao, et al.
Pubblicazione: (2025)
EmoFeedback$^2$: Reinforcement of Continuous Emotional Image Generation via LVLM-based Reward and Textual Feedback
di: Jia, Jingyang, et al.
Pubblicazione: (2025)
di: Jia, Jingyang, et al.
Pubblicazione: (2025)
EmoNeXt: an Adapted ConvNeXt for Facial Emotion Recognition
di: Boudouri, Yassine El, et al.
Pubblicazione: (2025)
di: Boudouri, Yassine El, et al.
Pubblicazione: (2025)
EmoCAM: Toward Understanding What Drives CNN-based Emotion Recognition
di: Doulfoukar, Youssef, et al.
Pubblicazione: (2024)
di: Doulfoukar, Youssef, et al.
Pubblicazione: (2024)
TACFN: Transformer-based Adaptive Cross-modal Fusion Network for Multimodal Emotion Recognition
di: Liu, Feng, et al.
Pubblicazione: (2025)
di: Liu, Feng, et al.
Pubblicazione: (2025)
Can a Second-View Image Be a Language? Geometric and Semantic Cross-Modal Reasoning for X-ray Prohibited Item Detection
di: Peng, Chuang, et al.
Pubblicazione: (2025)
di: Peng, Chuang, et al.
Pubblicazione: (2025)
Hierarchical Multi-modal Transformer for Cross-modal Long Document Classification
di: Liu, Tengfei, et al.
Pubblicazione: (2024)
di: Liu, Tengfei, et al.
Pubblicazione: (2024)
EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs
di: Hu, He, et al.
Pubblicazione: (2026)
di: Hu, He, et al.
Pubblicazione: (2026)
Cross-modal Information Flow in Multimodal Large Language Models
di: Zhang, Zhi, et al.
Pubblicazione: (2024)
di: Zhang, Zhi, et al.
Pubblicazione: (2024)
Spatial Transcriptomics as Images for Large-Scale Pretraining
di: Zhu, Yishun, et al.
Pubblicazione: (2026)
di: Zhu, Yishun, et al.
Pubblicazione: (2026)
EmoGist: Efficient In-Context Learning for Visual Emotion Understanding
di: Seoh, Ronald, et al.
Pubblicazione: (2025)
di: Seoh, Ronald, et al.
Pubblicazione: (2025)
AnomalyControl: Learning Cross-modal Semantic Features for Controllable Anomaly Synthesis
di: He, Shidan, et al.
Pubblicazione: (2024)
di: He, Shidan, et al.
Pubblicazione: (2024)
CoEmoGen: Towards Semantically-Coherent and Scalable Emotional Image Content Generation
di: Yuan, Kaishen, et al.
Pubblicazione: (2025)
di: Yuan, Kaishen, et al.
Pubblicazione: (2025)
ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking
di: Ge, Jiawei, et al.
Pubblicazione: (2026)
di: Ge, Jiawei, et al.
Pubblicazione: (2026)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
EmoStory: Emotion-Aware Story Generation
di: Yang, Jingyuan, et al.
Pubblicazione: (2026)
di: Yang, Jingyuan, et al.
Pubblicazione: (2026)
TinyEmo: Scaling down Emotional Reasoning via Metric Projection
di: Gutierrez, Cristian
Pubblicazione: (2024)
di: Gutierrez, Cristian
Pubblicazione: (2024)
EmoHead: Emotional Talking Head via Manipulating Semantic Expression Parameters
di: Shen, Xuli, et al.
Pubblicazione: (2025)
di: Shen, Xuli, et al.
Pubblicazione: (2025)
EmoMeta: A Multimodal Dataset for Fine-grained Emotion Classification in Chinese Metaphors
di: Lu, Xingyuan, et al.
Pubblicazione: (2025)
di: Lu, Xingyuan, et al.
Pubblicazione: (2025)
Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency
di: Wen, Ziqi, et al.
Pubblicazione: (2026)
di: Wen, Ziqi, et al.
Pubblicazione: (2026)
SceneX: Procedural Controllable Large-scale Scene Generation
di: Zhou, Mengqi, et al.
Pubblicazione: (2024)
di: Zhou, Mengqi, et al.
Pubblicazione: (2024)
UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception
di: Song, Xinyang, et al.
Pubblicazione: (2025)
di: Song, Xinyang, et al.
Pubblicazione: (2025)
SeLIP: Similarity Enhanced Contrastive Language Image Pretraining for Multi-modal Head MRI
di: Liu, Zhiyang, et al.
Pubblicazione: (2025)
di: Liu, Zhiyang, et al.
Pubblicazione: (2025)
Explaining Multi-modal Large Language Models by Analyzing their Vision Perception
di: Giulivi, Loris, et al.
Pubblicazione: (2024)
di: Giulivi, Loris, et al.
Pubblicazione: (2024)
UniGaussian: Driving Scene Reconstruction from Multiple Camera Models via Unified Gaussian Representations
di: Ren, Yuan, et al.
Pubblicazione: (2024)
di: Ren, Yuan, et al.
Pubblicazione: (2024)
Memory-based Cross-modal Semantic Alignment Network for Radiology Report Generation
di: Tao, Yitian, et al.
Pubblicazione: (2024)
di: Tao, Yitian, et al.
Pubblicazione: (2024)
Vision-Core Guided Contrastive Learning for Balanced Multi-modal Prognosis Prediction of Stroke
di: Chen, Liren, et al.
Pubblicazione: (2026)
di: Chen, Liren, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy
di: Huang, Jiahao, et al.
Pubblicazione: (2026) -
MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models
di: Chen, Tianwei, et al.
Pubblicazione: (2026) -
Comparative Study of Vision-Based Metric Measurement for Large-Scale Planar Scenes
di: Sun, ZhiXin
Pubblicazione: (2026) -
UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries
di: Zhu, Yijie, et al.
Pubblicazione: (2025) -
EmoVIT: Revolutionizing Emotion Insights with Visual Instruction Tuning
di: Xie, Hongxia, et al.
Pubblicazione: (2024)