Opening the Black Box: Preliminary Insights into Affective Modeling in Multimodal Foundation Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Zhen, Zeng, Runhao, Zhao, Sicheng, Hu, Xiping |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries
por: Zhang, Zhen, et al.
Publicado: (2026)
por: Zhang, Zhen, et al.
Publicado: (2026)
Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models
por: Zhang, Jingrui, et al.
Publicado: (2026)
por: Zhang, Jingrui, et al.
Publicado: (2026)
Emotion Recognition from Skeleton Data: A Comprehensive Survey
por: Lu, Haifeng, et al.
Publicado: (2025)
por: Lu, Haifeng, et al.
Publicado: (2025)
Temporal Action Detection Model Compression by Progressive Block Drop
por: Chen, Xiaoyong, et al.
Publicado: (2025)
por: Chen, Xiaoyong, et al.
Publicado: (2025)
Revisiting Cross-Architecture Distillation: Adaptive Dual-Teacher Transfer for Lightweight Video Models
por: Peng, Ying, et al.
Publicado: (2025)
por: Peng, Ying, et al.
Publicado: (2025)
Towards Stable Cross-Domain Depression Recognition under Missing Modalities
por: Chen, Jiuyi, et al.
Publicado: (2025)
por: Chen, Jiuyi, et al.
Publicado: (2025)
Learning to Generate Gradients for Test-Time Adaptation via Test-Time Training Layers
por: Deng, Qi, et al.
Publicado: (2024)
por: Deng, Qi, et al.
Publicado: (2024)
Opening the Black Box of 3D Reconstruction Error Analysis with VECTOR
por: Fygenson, Racquel, et al.
Publicado: (2024)
por: Fygenson, Racquel, et al.
Publicado: (2024)
OVG-HQ: Online Video Grounding with Hybrid-modal Queries
por: Zeng, Runhao, et al.
Publicado: (2025)
por: Zeng, Runhao, et al.
Publicado: (2025)
Robust Adaptation of Foundation Models with Black-Box Visual Prompting
por: Oh, Changdae, et al.
Publicado: (2024)
por: Oh, Changdae, et al.
Publicado: (2024)
VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models
por: Zhang, Zhicheng, et al.
Publicado: (2025)
por: Zhang, Zhicheng, et al.
Publicado: (2025)
OBSeg: Accurate and Fast Instance Segmentation Framework Using Segmentation Foundation Models with Oriented Bounding Box Prompts
por: Zhou, Zhen, et al.
Publicado: (2024)
por: Zhou, Zhen, et al.
Publicado: (2024)
Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation
por: Zeng, Runhao, et al.
Publicado: (2025)
por: Zeng, Runhao, et al.
Publicado: (2025)
Transferable Adversarial Attacks on Black-Box Vision-Language Models
por: Hu, Kai, et al.
Publicado: (2025)
por: Hu, Kai, et al.
Publicado: (2025)
AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
por: Li, Xiping, et al.
Publicado: (2025)
por: Li, Xiping, et al.
Publicado: (2025)
Motif Channel Opened in a White-Box: Stereo Matching via Motif Correlation Graph
por: Chen, Ziyang, et al.
Publicado: (2024)
por: Chen, Ziyang, et al.
Publicado: (2024)
StimuVAR: Spatiotemporal Stimuli-aware Video Affective Reasoning with Multimodal Large Language Models
por: Guo, Yuxiang, et al.
Publicado: (2024)
por: Guo, Yuxiang, et al.
Publicado: (2024)
Scaling Video Pretraining for Surgical Foundation Models
por: Lu, Sicheng, et al.
Publicado: (2026)
por: Lu, Sicheng, et al.
Publicado: (2026)
GloPath: An Entity-Centric Foundation Model for Glomerular Lesion Assessment and Clinicopathological Insights
por: He, Qiming, et al.
Publicado: (2026)
por: He, Qiming, et al.
Publicado: (2026)
Benchmarking the Robustness of Temporal Action Detection Models Against Temporal Corruptions
por: Zeng, Runhao, et al.
Publicado: (2024)
por: Zeng, Runhao, et al.
Publicado: (2024)
Test-Time Hinting for Black-Box Vision-Language Models
por: Hou, Kaihua, et al.
Publicado: (2026)
por: Hou, Kaihua, et al.
Publicado: (2026)
VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding
por: Zhang, Boqiang, et al.
Publicado: (2025)
por: Zhang, Boqiang, et al.
Publicado: (2025)
Box-Free Model Watermarks Are Prone to Black-Box Removal Attacks
por: An, Haonan, et al.
Publicado: (2024)
por: An, Haonan, et al.
Publicado: (2024)
Multimodal Fusion with Pre-Trained Model Features in Affective Behaviour Analysis In-the-wild
por: Wen, Zhuofan, et al.
Publicado: (2024)
por: Wen, Zhuofan, et al.
Publicado: (2024)
Allegro: Open the Black Box of Commercial-Level Video Generation Model
por: Zhou, Yuan, et al.
Publicado: (2024)
por: Zhou, Yuan, et al.
Publicado: (2024)
DiffExplainer: Unveiling Black Box Models Via Counterfactual Generation
por: Fang, Yingying, et al.
Publicado: (2024)
por: Fang, Yingying, et al.
Publicado: (2024)
JIGMARK: A Black-Box Approach for Enhancing Image Watermarks against Diffusion Model Edits
por: Pan, Minzhou, et al.
Publicado: (2024)
por: Pan, Minzhou, et al.
Publicado: (2024)
Video2Reward: Generating Reward Function from Videos for Legged Robot Behavior Learning
por: Zeng, Runhao, et al.
Publicado: (2024)
por: Zeng, Runhao, et al.
Publicado: (2024)
Unveiling the Black Box: Independent Functional Module Evaluation for Bird's-Eye-View Perception Model
por: Zhang, Ludan, et al.
Publicado: (2024)
por: Zhang, Ludan, et al.
Publicado: (2024)
GPT as Psychologist? Preliminary Evaluations for GPT-4V on Visual Affective Computing
por: Lu, Hao, et al.
Publicado: (2024)
por: Lu, Hao, et al.
Publicado: (2024)
Breaking the Black-Box: Confidence-Guided Model Inversion Attack for Distribution Shift
por: Liu, Xinhao, et al.
Publicado: (2024)
por: Liu, Xinhao, et al.
Publicado: (2024)
Learning Instance-Specific Parameters of Black-Box Models Using Differentiable Surrogates
por: Khondaker, Arnisha, et al.
Publicado: (2024)
por: Khondaker, Arnisha, et al.
Publicado: (2024)
Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models
por: Shen, Ruiqi, et al.
Publicado: (2025)
por: Shen, Ruiqi, et al.
Publicado: (2025)
VAEVQ: Enhancing Discrete Visual Tokenization through Variational Modeling
por: Yang, Sicheng, et al.
Publicado: (2025)
por: Yang, Sicheng, et al.
Publicado: (2025)
BoxTuning: Directly Injecting the Object Box for Multimodal Model Fine-Tuning
por: Qian, Zekun, et al.
Publicado: (2026)
por: Qian, Zekun, et al.
Publicado: (2026)
The Dawn of Video Generation: Preliminary Explorations with SORA-like Models
por: Zeng, Ailing, et al.
Publicado: (2024)
por: Zeng, Ailing, et al.
Publicado: (2024)
Make me an Expert: Distilling from Generalist Black-Box Models into Specialized Models for Semantic Segmentation
por: Benigmim, Yasser, et al.
Publicado: (2025)
por: Benigmim, Yasser, et al.
Publicado: (2025)
Parameter-efficient Tuning of Large-scale Multimodal Foundation Model
por: Wang, Haixin, et al.
Publicado: (2023)
por: Wang, Haixin, et al.
Publicado: (2023)
FUSAR-KLIP: Towards Multimodal Foundation Models for Remote Sensing
por: Yang, Yi, et al.
Publicado: (2025)
por: Yang, Yi, et al.
Publicado: (2025)
Neural Plasticity-Inspired Multimodal Foundation Model for Earth Observation
por: Xiong, Zhitong, et al.
Publicado: (2024)
por: Xiong, Zhitong, et al.
Publicado: (2024)
Ejemplares similares
-
AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries
por: Zhang, Zhen, et al.
Publicado: (2026) -
Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models
por: Zhang, Jingrui, et al.
Publicado: (2026) -
Emotion Recognition from Skeleton Data: A Comprehensive Survey
por: Lu, Haifeng, et al.
Publicado: (2025) -
Temporal Action Detection Model Compression by Progressive Block Drop
por: Chen, Xiaoyong, et al.
Publicado: (2025) -
Revisiting Cross-Architecture Distillation: Adaptive Dual-Teacher Transfer for Lightweight Video Models
por: Peng, Ying, et al.
Publicado: (2025)