Salvato in:
| Autori principali: | Cong, Kaixuan, Wang, Yifan, Xue, Rongkun, Jiang, Yuyang, Feng, Yiming, Yang, Jing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2507.09323 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cs2K: Class-specific and Class-shared Knowledge Guidance for Incremental Semantic Segmentation
di: Cong, Wei, et al.
Pubblicazione: (2024)
di: Cong, Wei, et al.
Pubblicazione: (2024)
Inconsistency-Aware Cross-Attention for Audio-Visual Fusion in Dimensional Emotion Recognition
di: Rajasekhar, G, et al.
Pubblicazione: (2024)
di: Rajasekhar, G, et al.
Pubblicazione: (2024)
RFPPO: Motion Dynamic RRT based Fluid Field - PPO for Dynamic TF/TA Routing Planning
di: Xue, Rongkun, et al.
Pubblicazione: (2024)
di: Xue, Rongkun, et al.
Pubblicazione: (2024)
Detail-Enhanced Intra- and Inter-modal Interaction for Audio-Visual Emotion Recognition
di: Shi, Tong, et al.
Pubblicazione: (2024)
di: Shi, Tong, et al.
Pubblicazione: (2024)
FusionBERT: Multi-View Image-3D Retrieval via Cross-Attention Visual Fusion and Normal-Aware 3D Encoder
di: Li, Wei, et al.
Pubblicazione: (2026)
di: Li, Wei, et al.
Pubblicazione: (2026)
Hierarchical Augmentation and Distillation for Class Incremental Audio-Visual Video Recognition
di: Zuo, Yukun, et al.
Pubblicazione: (2024)
di: Zuo, Yukun, et al.
Pubblicazione: (2024)
When Eyes and Ears Disagree: Can MLLMs Discern Audio-Visual Confusion?
di: Ye, Qilang, et al.
Pubblicazione: (2025)
di: Ye, Qilang, et al.
Pubblicazione: (2025)
Contrastive Learning for Multimodal Human Activity Recognition with Limited Labeled Data
di: Jing, Long, et al.
Pubblicazione: (2026)
di: Jing, Long, et al.
Pubblicazione: (2026)
Pretrained Reversible Generation as Unsupervised Visual Representation Learning
di: Xue, Rongkun, et al.
Pubblicazione: (2024)
di: Xue, Rongkun, et al.
Pubblicazione: (2024)
InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
ConfusionBench: An Expert-Validated Benchmark for Confusion Recognition and Localization in Educational Videos
di: Dong, Lu, et al.
Pubblicazione: (2026)
di: Dong, Lu, et al.
Pubblicazione: (2026)
Context-Aware Aerial Object Detection: Leveraging Inter-Object and Background Relationships
di: Ren, Botao, et al.
Pubblicazione: (2024)
di: Ren, Botao, et al.
Pubblicazione: (2024)
Vision Language Models for Dynamic Human Activity Recognition in Healthcare Settings
di: Abid, Abderrazek, et al.
Pubblicazione: (2025)
di: Abid, Abderrazek, et al.
Pubblicazione: (2025)
eMotions: A Large-Scale Dataset and Audio-Visual Fusion Network for Emotion Analysis in Short-form Videos
di: Wu, Xuecheng, et al.
Pubblicazione: (2025)
di: Wu, Xuecheng, et al.
Pubblicazione: (2025)
Dynamic Attention and Bi-directional Fusion for Safety Helmet Wearing Detection
di: Feng, Junwei, et al.
Pubblicazione: (2024)
di: Feng, Junwei, et al.
Pubblicazione: (2024)
DTFSal: Audio-Visual Dynamic Token Fusion for Video Saliency Prediction
di: Hooshanfar, Kiana, et al.
Pubblicazione: (2025)
di: Hooshanfar, Kiana, et al.
Pubblicazione: (2025)
Understanding Open-Set Recognition by Jacobian Norm and Inter-Class Separation
di: Park, Jaewoo, et al.
Pubblicazione: (2022)
di: Park, Jaewoo, et al.
Pubblicazione: (2022)
Noise-Tolerant Learning for Audio-Visual Action Recognition
di: Han, Haochen, et al.
Pubblicazione: (2022)
di: Han, Haochen, et al.
Pubblicazione: (2022)
Dynamic Multi-Target Fusion for Efficient Audio-Visual Navigation
di: Yu, Yinfeng, et al.
Pubblicazione: (2025)
di: Yu, Yinfeng, et al.
Pubblicazione: (2025)
Evaluating Attribute Confusion in Fashion Text-to-Image Generation
di: Liu, Ziyue, et al.
Pubblicazione: (2025)
di: Liu, Ziyue, et al.
Pubblicazione: (2025)
Cross Attentional Audio-Visual Fusion for Dimensional Emotion Recognition
di: Praveen, R. Gnana, et al.
Pubblicazione: (2021)
di: Praveen, R. Gnana, et al.
Pubblicazione: (2021)
The Comparability of Model Fusion to Measured Data in Confuser Rejection
di: Flynn, Conor, et al.
Pubblicazione: (2025)
di: Flynn, Conor, et al.
Pubblicazione: (2025)
DyCAF-Net: Dynamic Class-Aware Fusion Network
di: Jahin, Md Abrar, et al.
Pubblicazione: (2025)
di: Jahin, Md Abrar, et al.
Pubblicazione: (2025)
Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
di: She, Yifei, et al.
Pubblicazione: (2025)
di: She, Yifei, et al.
Pubblicazione: (2025)
SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing
di: Liang, Sen, et al.
Pubblicazione: (2026)
di: Liang, Sen, et al.
Pubblicazione: (2026)
Confidence-driven Gradient Modulation for Multimodal Human Activity Recognition: A Dynamic Contrastive Dual-Path Learning Approach
di: Ji, Panpan, et al.
Pubblicazione: (2025)
di: Ji, Panpan, et al.
Pubblicazione: (2025)
Efficient Audio-Visual Fusion for Video Classification
di: Awan, Mahrukh, et al.
Pubblicazione: (2024)
di: Awan, Mahrukh, et al.
Pubblicazione: (2024)
Universal Incremental Learning: Mitigating Confusion from Inter- and Intra-task Distribution Randomness
di: Luo, Sheng, et al.
Pubblicazione: (2025)
di: Luo, Sheng, et al.
Pubblicazione: (2025)
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
di: Li, Huilai, et al.
Pubblicazione: (2025)
di: Li, Huilai, et al.
Pubblicazione: (2025)
CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models
di: Dang, Yunkai, et al.
Pubblicazione: (2026)
di: Dang, Yunkai, et al.
Pubblicazione: (2026)
WiFi based Human Fall and Activity Recognition using Transformer based Encoder Decoder and Graph Neural Networks
di: Cho, Younggeol, et al.
Pubblicazione: (2025)
di: Cho, Younggeol, et al.
Pubblicazione: (2025)
Triple Spectral Fusion for Sensor-based Human Activity Recognition
di: Zhang, Ye, et al.
Pubblicazione: (2026)
di: Zhang, Ye, et al.
Pubblicazione: (2026)
AdaFedFR: Federated Face Recognition with Adaptive Inter-Class Representation Learning
di: Qiu, Di, et al.
Pubblicazione: (2024)
di: Qiu, Di, et al.
Pubblicazione: (2024)
Class-Aware Mask-Guided Feature Refinement for Scene Text Recognition
di: Yang, Mingkun, et al.
Pubblicazione: (2024)
di: Yang, Mingkun, et al.
Pubblicazione: (2024)
IDSelect: A RL-Based Cost-Aware Selection Agent for Video-based Multi-Modal Person Recognition
di: Ji, Yuyang, et al.
Pubblicazione: (2026)
di: Ji, Yuyang, et al.
Pubblicazione: (2026)
InterMamba: Efficient Human-Human Interaction Generation with Adaptive Spatio-Temporal Mamba
di: Wu, Zizhao, et al.
Pubblicazione: (2025)
di: Wu, Zizhao, et al.
Pubblicazione: (2025)
Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification
di: Awan, Mahrukh, et al.
Pubblicazione: (2024)
di: Awan, Mahrukh, et al.
Pubblicazione: (2024)
Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026)
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026)
Uni-Encoder Meets Multi-Encoders: Representation Before Fusion for Brain Tumor Segmentation with Missing Modalities
di: Song, Peibo, et al.
Pubblicazione: (2026)
di: Song, Peibo, et al.
Pubblicazione: (2026)
DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs
di: Zhao, Jiahe, et al.
Pubblicazione: (2025)
di: Zhao, Jiahe, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Cs2K: Class-specific and Class-shared Knowledge Guidance for Incremental Semantic Segmentation
di: Cong, Wei, et al.
Pubblicazione: (2024) -
Inconsistency-Aware Cross-Attention for Audio-Visual Fusion in Dimensional Emotion Recognition
di: Rajasekhar, G, et al.
Pubblicazione: (2024) -
RFPPO: Motion Dynamic RRT based Fluid Field - PPO for Dynamic TF/TA Routing Planning
di: Xue, Rongkun, et al.
Pubblicazione: (2024) -
Detail-Enhanced Intra- and Inter-modal Interaction for Audio-Visual Emotion Recognition
di: Shi, Tong, et al.
Pubblicazione: (2024) -
FusionBERT: Multi-View Image-3D Retrieval via Cross-Attention Visual Fusion and Normal-Aware 3D Encoder
di: Li, Wei, et al.
Pubblicazione: (2026)