UniEmoX: Cross-modal Semantic-Guided Large-Scale Pretraining for Universal Scene Emotion Perception
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Chuang, Sun, Xiao, Liu, Zhi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy
par: Huang, Jiahao, et autres
Publié: (2026)
par: Huang, Jiahao, et autres
Publié: (2026)
MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models
par: Chen, Tianwei, et autres
Publié: (2026)
par: Chen, Tianwei, et autres
Publié: (2026)
Comparative Study of Vision-Based Metric Measurement for Large-Scale Planar Scenes
par: Sun, ZhiXin
Publié: (2026)
par: Sun, ZhiXin
Publié: (2026)
UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries
par: Zhu, Yijie, et autres
Publié: (2025)
par: Zhu, Yijie, et autres
Publié: (2025)
EmoVIT: Revolutionizing Emotion Insights with Visual Instruction Tuning
par: Xie, Hongxia, et autres
Publié: (2024)
par: Xie, Hongxia, et autres
Publié: (2024)
FindingEmo: An Image Dataset for Emotion Recognition in the Wild
par: Mertens, Laurent, et autres
Publié: (2024)
par: Mertens, Laurent, et autres
Publié: (2024)
EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness
par: Sun, Yueru, et autres
Publié: (2026)
par: Sun, Yueru, et autres
Publié: (2026)
Explore the Limits of Omni-modal Pretraining at Scale
par: Zhang, Yiyuan, et autres
Publié: (2024)
par: Zhang, Yiyuan, et autres
Publié: (2024)
xModel-KD: Cross-modal Knowledge Distillation for 3D Scene Perception using LiDAR
par: Pathmanathan, Thenukan, et autres
Publié: (2026)
par: Pathmanathan, Thenukan, et autres
Publié: (2026)
HexPlane Representation for 3D Semantic Scene Understanding
par: Chen, Zeren, et autres
Publié: (2025)
par: Chen, Zeren, et autres
Publié: (2025)
UniHM: Universal Human Motion Generation with Object Interactions in Indoor Scenes
par: Geng, Zichen, et autres
Publié: (2025)
par: Geng, Zichen, et autres
Publié: (2025)
EmoNet-Face: An Expert-Annotated Benchmark for Synthetic Emotion Recognition
par: Schuhmann, Christoph, et autres
Publié: (2025)
par: Schuhmann, Christoph, et autres
Publié: (2025)
LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment
par: Zhu, Bin, et autres
Publié: (2023)
par: Zhu, Bin, et autres
Publié: (2023)
Spectral Discrepancy and Cross-modal Semantic Consistency Learning for Object Detection in Hyperspectral Image
par: He, Xiao, et autres
Publié: (2025)
par: He, Xiao, et autres
Publié: (2025)
EmoFeedback$^2$: Reinforcement of Continuous Emotional Image Generation via LVLM-based Reward and Textual Feedback
par: Jia, Jingyang, et autres
Publié: (2025)
par: Jia, Jingyang, et autres
Publié: (2025)
EmoNeXt: an Adapted ConvNeXt for Facial Emotion Recognition
par: Boudouri, Yassine El, et autres
Publié: (2025)
par: Boudouri, Yassine El, et autres
Publié: (2025)
EmoCAM: Toward Understanding What Drives CNN-based Emotion Recognition
par: Doulfoukar, Youssef, et autres
Publié: (2024)
par: Doulfoukar, Youssef, et autres
Publié: (2024)
TACFN: Transformer-based Adaptive Cross-modal Fusion Network for Multimodal Emotion Recognition
par: Liu, Feng, et autres
Publié: (2025)
par: Liu, Feng, et autres
Publié: (2025)
Can a Second-View Image Be a Language? Geometric and Semantic Cross-Modal Reasoning for X-ray Prohibited Item Detection
par: Peng, Chuang, et autres
Publié: (2025)
par: Peng, Chuang, et autres
Publié: (2025)
Hierarchical Multi-modal Transformer for Cross-modal Long Document Classification
par: Liu, Tengfei, et autres
Publié: (2024)
par: Liu, Tengfei, et autres
Publié: (2024)
EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs
par: Hu, He, et autres
Publié: (2026)
par: Hu, He, et autres
Publié: (2026)
Cross-modal Information Flow in Multimodal Large Language Models
par: Zhang, Zhi, et autres
Publié: (2024)
par: Zhang, Zhi, et autres
Publié: (2024)
Spatial Transcriptomics as Images for Large-Scale Pretraining
par: Zhu, Yishun, et autres
Publié: (2026)
par: Zhu, Yishun, et autres
Publié: (2026)
EmoGist: Efficient In-Context Learning for Visual Emotion Understanding
par: Seoh, Ronald, et autres
Publié: (2025)
par: Seoh, Ronald, et autres
Publié: (2025)
AnomalyControl: Learning Cross-modal Semantic Features for Controllable Anomaly Synthesis
par: He, Shidan, et autres
Publié: (2024)
par: He, Shidan, et autres
Publié: (2024)
CoEmoGen: Towards Semantically-Coherent and Scalable Emotional Image Content Generation
par: Yuan, Kaishen, et autres
Publié: (2025)
par: Yuan, Kaishen, et autres
Publié: (2025)
ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking
par: Ge, Jiawei, et autres
Publié: (2026)
par: Ge, Jiawei, et autres
Publié: (2026)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
par: Zhang, Yudong, et autres
Publié: (2024)
par: Zhang, Yudong, et autres
Publié: (2024)
EmoStory: Emotion-Aware Story Generation
par: Yang, Jingyuan, et autres
Publié: (2026)
par: Yang, Jingyuan, et autres
Publié: (2026)
TinyEmo: Scaling down Emotional Reasoning via Metric Projection
par: Gutierrez, Cristian
Publié: (2024)
par: Gutierrez, Cristian
Publié: (2024)
EmoHead: Emotional Talking Head via Manipulating Semantic Expression Parameters
par: Shen, Xuli, et autres
Publié: (2025)
par: Shen, Xuli, et autres
Publié: (2025)
EmoMeta: A Multimodal Dataset for Fine-grained Emotion Classification in Chinese Metaphors
par: Lu, Xingyuan, et autres
Publié: (2025)
par: Lu, Xingyuan, et autres
Publié: (2025)
Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency
par: Wen, Ziqi, et autres
Publié: (2026)
par: Wen, Ziqi, et autres
Publié: (2026)
SceneX: Procedural Controllable Large-scale Scene Generation
par: Zhou, Mengqi, et autres
Publié: (2024)
par: Zhou, Mengqi, et autres
Publié: (2024)
UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception
par: Song, Xinyang, et autres
Publié: (2025)
par: Song, Xinyang, et autres
Publié: (2025)
SeLIP: Similarity Enhanced Contrastive Language Image Pretraining for Multi-modal Head MRI
par: Liu, Zhiyang, et autres
Publié: (2025)
par: Liu, Zhiyang, et autres
Publié: (2025)
Explaining Multi-modal Large Language Models by Analyzing their Vision Perception
par: Giulivi, Loris, et autres
Publié: (2024)
par: Giulivi, Loris, et autres
Publié: (2024)
UniGaussian: Driving Scene Reconstruction from Multiple Camera Models via Unified Gaussian Representations
par: Ren, Yuan, et autres
Publié: (2024)
par: Ren, Yuan, et autres
Publié: (2024)
Memory-based Cross-modal Semantic Alignment Network for Radiology Report Generation
par: Tao, Yitian, et autres
Publié: (2024)
par: Tao, Yitian, et autres
Publié: (2024)
Vision-Core Guided Contrastive Learning for Balanced Multi-modal Prognosis Prediction of Stroke
par: Chen, Liren, et autres
Publié: (2026)
par: Chen, Liren, et autres
Publié: (2026)
Documents similaires
-
Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy
par: Huang, Jiahao, et autres
Publié: (2026) -
MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models
par: Chen, Tianwei, et autres
Publié: (2026) -
Comparative Study of Vision-Based Metric Measurement for Large-Scale Planar Scenes
par: Sun, ZhiXin
Publié: (2026) -
UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries
par: Zhu, Yijie, et autres
Publié: (2025) -
EmoVIT: Revolutionizing Emotion Insights with Visual Instruction Tuning
par: Xie, Hongxia, et autres
Publié: (2024)