MODA: MOdular Duplex Attention for Multimodal Perception, Cognition, and Emotion Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Zhicheng, Xia, Wuyou, Zhao, Chenxi, Yan, Zhou, Liu, Xiaoqiang, Zhu, Yongjie, Qin, Wenyu, Wan, Pengfei, Zhang, Di, Yang, Jufeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models
por: Zhang, Zhicheng, et al.
Publicado: (2025)
por: Zhang, Zhicheng, et al.
Publicado: (2025)
Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning
por: Zhang, Zhicheng, et al.
Publicado: (2026)
por: Zhang, Zhicheng, et al.
Publicado: (2026)
LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing
por: Wang, Weicheng, et al.
Publicado: (2026)
por: Wang, Weicheng, et al.
Publicado: (2026)
Analytic Score Optimization for Multi Dimension Video Quality Assessment
por: Lin, Boda, et al.
Publicado: (2026)
por: Lin, Boda, et al.
Publicado: (2026)
Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
por: Jiang, Haonan, et al.
Publicado: (2026)
por: Jiang, Haonan, et al.
Publicado: (2026)
KPM-Bench: A Kinematic Parsing Motion Benchmark for Fine-grained Motion-centric Video Understanding
por: Lin, Boda, et al.
Publicado: (2026)
por: Lin, Boda, et al.
Publicado: (2026)
SWAN: Synergistic Wavelet-Attention Network for Infrared Small Target Detection
por: Jing, Yuxin, et al.
Publicado: (2025)
por: Jing, Yuxin, et al.
Publicado: (2025)
MOLE: MOdular Learning FramEwork via Mutual Information Maximization
por: Li, Tianchao, et al.
Publicado: (2023)
por: Li, Tianchao, et al.
Publicado: (2023)
Is Cognition Consistent with Perception? Assessing and Mitigating Multimodal Knowledge Conflicts in Document Understanding
por: Shao, Zirui, et al.
Publicado: (2024)
por: Shao, Zirui, et al.
Publicado: (2024)
Cafe-Talk: Generating 3D Talking Face Animation with Multimodal Coarse- and Fine-grained Control
por: Chen, Hejia, et al.
Publicado: (2025)
por: Chen, Hejia, et al.
Publicado: (2025)
Enhanced biodegradable copolymers: Synthesis and characterization of high molecular weight poly(L‐lactide‐ r ‐ε‐caprolactone)
por: Liu Dongyang, et al.
Publicado: (2024)
por: Liu Dongyang, et al.
Publicado: (2024)
FlexDuo: A Pluggable System for Enabling Full-Duplex Capabilities in Speech Dialogue Systems
por: Liao, Borui, et al.
Publicado: (2025)
por: Liao, Borui, et al.
Publicado: (2025)
FSATFusion: Frequency-Spatial Attention Transformer for Infrared and Visible Image Fusion
por: Zhang, Tianpei, et al.
Publicado: (2025)
por: Zhang, Tianpei, et al.
Publicado: (2025)
Selective Variable Convolution Meets Dynamic Content-Guided Attention for Infrared Small Target Detection
por: Chen, Yirui, et al.
Publicado: (2025)
por: Chen, Yirui, et al.
Publicado: (2025)
LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control
por: Guo, Jianzhu, et al.
Publicado: (2024)
por: Guo, Jianzhu, et al.
Publicado: (2024)
Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training
por: Luo, Xiangyang, et al.
Publicado: (2026)
por: Luo, Xiangyang, et al.
Publicado: (2026)
MECO: A Multimodal Dataset for Emotion and Cognitive Understanding in Older Adults
por: Chen, Hongbin, et al.
Publicado: (2026)
por: Chen, Hongbin, et al.
Publicado: (2026)
Attention Mechanism based Cognition-level Scene Understanding
por: Tang, Xuejiao, et al.
Publicado: (2022)
por: Tang, Xuejiao, et al.
Publicado: (2022)
LAKE-RED: Camouflaged Images Generation by Latent Background Knowledge Retrieval-Augmented Diffusion
por: Zhao, Pancheng, et al.
Publicado: (2024)
por: Zhao, Pancheng, et al.
Publicado: (2024)
JuFengWang/scripts: RNA-editing analysis Scripts
por: Jufeng Wang
Publicado: (2025)
por: Jufeng Wang
Publicado: (2025)
Bridging Cognition and Emotion: Empathy-Driven Multimodal Misinformation Detection
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation
por: Chen, Ming, et al.
Publicado: (2025)
por: Chen, Ming, et al.
Publicado: (2025)
SCOP: Evaluating the Comprehension Process of Large Language Models from a Cognitive View
por: Xiao, Yongjie, et al.
Publicado: (2025)
por: Xiao, Yongjie, et al.
Publicado: (2025)
Coupled Degradation Modeling and Fusion: A VLM-Guided Degradation-Coupled Network for Degradation-Aware Infrared and Visible Image Fusion
por: Zhang, Tianpei, et al.
Publicado: (2025)
por: Zhang, Tianpei, et al.
Publicado: (2025)
WIFE-Fusion:Wavelet-aware Intra-inter Frequency Enhancement for Multi-model Image Fusion
por: Zhang, Tianpei, et al.
Publicado: (2025)
por: Zhang, Tianpei, et al.
Publicado: (2025)
Dual-Domain Perspective on Degradation-Aware Fusion: A VLM-Guided Robust Infrared and Visible Image Fusion Framework
por: Zhang, Tianpei, et al.
Publicado: (2025)
por: Zhang, Tianpei, et al.
Publicado: (2025)
Seeing is Not Understanding: A Benchmark on Perception-Cognition Disparities in Large Language Models
por: Li, Haokun, et al.
Publicado: (2025)
por: Li, Haokun, et al.
Publicado: (2025)
Attribute-Grounded Selective Reasoning for Artwork Emotion Understanding with Multimodal Large Language Models
por: Zhang, Cheng, et al.
Publicado: (2026)
por: Zhang, Cheng, et al.
Publicado: (2026)
MCANet: Medical Image Segmentation with Multi-Scale Cross-Axis Attention
por: Shao, Hao, et al.
Publicado: (2023)
por: Shao, Hao, et al.
Publicado: (2023)
HumanAesExpert: Advancing a Multi-Modality Foundation Model for Human Image Aesthetic Assessment
por: Liao, Zhichao, et al.
Publicado: (2025)
por: Liao, Zhichao, et al.
Publicado: (2025)
Point Cloud Quantization through Multimodal Prompting for 3D Understanding
por: Li, Hongxuan, et al.
Publicado: (2025)
por: Li, Hongxuan, et al.
Publicado: (2025)
OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models
por: Zou, Jialv, et al.
Publicado: (2025)
por: Zou, Jialv, et al.
Publicado: (2025)
Towards Understanding Graphical Perception in Large Multimodal Models
por: Zhang, Kai, et al.
Publicado: (2025)
por: Zhang, Kai, et al.
Publicado: (2025)
CM$^3$: Calibrating Multimodal Recommendation
por: Zhou, Xin, et al.
Publicado: (2025)
por: Zhou, Xin, et al.
Publicado: (2025)
FAC$^2$E: Better Understanding Large Language Model Capabilities by Dissociating Language and Cognition
por: Wang, Xiaoqiang, et al.
Publicado: (2024)
por: Wang, Xiaoqiang, et al.
Publicado: (2024)
LAM-YOLO: Drones-based Small Object Detection on Lighting-Occlusion Attention Mechanism YOLO
por: Zheng, Yuchen, et al.
Publicado: (2024)
por: Zheng, Yuchen, et al.
Publicado: (2024)
DuplexMamba: Enhancing Real-time Speech Conversations with Duplex and Streaming Capabilities
por: Lu, Xiangyu, et al.
Publicado: (2025)
por: Lu, Xiangyu, et al.
Publicado: (2025)
SIM-Assisted End-to-End Co-Frequency Co-Time Full-Duplex System
por: Zhang, Yida, et al.
Publicado: (2025)
por: Zhang, Yida, et al.
Publicado: (2025)
Referees’ Emotions and Performance Perception: The Importance of Stress and Cognitive Appraisal
por: D. Nogueira
Publicado: (2022)
por: D. Nogueira
Publicado: (2022)
Intelligent mode-locked NPR fiber laser based on laser speckle characteristics
por: Pu, Yongjie, et al.
Publicado: (2023)
por: Pu, Yongjie, et al.
Publicado: (2023)
Ejemplares similares
-
VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models
por: Zhang, Zhicheng, et al.
Publicado: (2025) -
Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning
por: Zhang, Zhicheng, et al.
Publicado: (2026) -
LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing
por: Wang, Weicheng, et al.
Publicado: (2026) -
Analytic Score Optimization for Multi Dimension Video Quality Assessment
por: Lin, Boda, et al.
Publicado: (2026) -
Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
por: Jiang, Haonan, et al.
Publicado: (2026)