Enregistré dans:
| Auteurs principaux: | Li, Yifan, Dao, Anh, Bao, Wentao, Tan, Zhen, Chen, Tianlong, Liu, Huan, Kong, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2404.05052 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Window Token Concatenation for Efficient Visual Large Language Models
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
IndustryEQA: Pushing the Frontiers of Embodied Question Answering in Industrial Scenarios
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
Visual Large Language Models for Generalized and Specialized Applications
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
Weakly Supervised Learning for Facial Affective Behavior Analysis : A Review
par: Praveen, R. Gnana, et autres
Publié: (2021)
par: Praveen, R. Gnana, et autres
Publié: (2021)
Robust Light-Weight Facial Affective Behavior Recognition with CLIP
par: Lin, Li, et autres
Publié: (2024)
par: Lin, Li, et autres
Publié: (2024)
Scalable Audio-Visual Masked Autoencoders for Efficient Affective Video Facial Analysis
par: Wu, Xuecheng, et autres
Publié: (2025)
par: Wu, Xuecheng, et autres
Publié: (2025)
IndustryNav: Exploring Spatial Reasoning of Embodied Agents in Dynamic Industrial Navigation
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
EMO-LLaMA: Enhancing Facial Emotion Understanding with Instruction Tuning
par: Xing, Bohao, et autres
Publié: (2024)
par: Xing, Bohao, et autres
Publié: (2024)
Open Set Face Forgery Detection via Dual-Level Evidence Collection
par: Cai, Zhongyi, et autres
Publié: (2025)
par: Cai, Zhongyi, et autres
Publié: (2025)
Learning to Localize Actions in Instructional Videos with LLM-Based Multi-Pathway Text-Video Alignment
par: Chen, Yuxiao, et autres
Publié: (2024)
par: Chen, Yuxiao, et autres
Publié: (2024)
Prompting Language-Informed Distribution for Compositional Zero-Shot Learning
par: Bao, Wentao, et autres
Publié: (2023)
par: Bao, Wentao, et autres
Publié: (2023)
Affective Behaviour Analysis via Progressive Learning
par: Liu, Chen, et autres
Publié: (2024)
par: Liu, Chen, et autres
Publié: (2024)
Facial Dynamics in Video: Instruction Tuning for Improved Facial Expression Perception and Contextual Awareness
par: Zhao, Jiaxing, et autres
Publié: (2025)
par: Zhao, Jiaxing, et autres
Publié: (2025)
Solution for 8th Competition on Affective & Behavior Analysis in-the-wild
par: Yu, Jun, et autres
Publié: (2025)
par: Yu, Jun, et autres
Publié: (2025)
Task-Aware Resolution Optimization for Visual Large Language Models
par: Luo, Weiqing, et autres
Publié: (2025)
par: Luo, Weiqing, et autres
Publié: (2025)
FairSkin: Fair Diffusion for Skin Disease Image Generation
par: Zhang, Ruichen, et autres
Publié: (2024)
par: Zhang, Ruichen, et autres
Publié: (2024)
MissBench: Benchmarking Multimodal Affective Analysis under Imbalanced Missing Modalities
par: Pham, Tien Anh, et autres
Publié: (2026)
par: Pham, Tien Anh, et autres
Publié: (2026)
Affective Behavior Analysis using Task-adaptive and AU-assisted Graph Network
par: Li, Xiaodong, et autres
Publié: (2024)
par: Li, Xiaodong, et autres
Publié: (2024)
Affective Behaviour Analysis via Integrating Multi-Modal Knowledge
par: Zhang, Wei, et autres
Publié: (2024)
par: Zhang, Wei, et autres
Publié: (2024)
The 6th Affective Behavior Analysis in-the-wild (ABAW) Competition
par: Kollias, Dimitrios, et autres
Publié: (2024)
par: Kollias, Dimitrios, et autres
Publié: (2024)
Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection
par: Bao, Wentao, et autres
Publié: (2024)
par: Bao, Wentao, et autres
Publié: (2024)
CausalAffect: Causal Discovery for Facial Affective Understanding
par: Hu, Guanyu, et autres
Publié: (2025)
par: Hu, Guanyu, et autres
Publié: (2025)
CoIDO: Efficient Data Selection for Visual Instruction Tuning via Coupled Importance-Diversity Optimization
par: Yan, Yichen, et autres
Publié: (2025)
par: Yan, Yichen, et autres
Publié: (2025)
A Generative Framework for Self-Supervised Facial Representation Learning
par: He, Ruian, et autres
Publié: (2023)
par: He, Ruian, et autres
Publié: (2023)
To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model
par: Zhao, Chengshuai, et autres
Publié: (2026)
par: Zhao, Chengshuai, et autres
Publié: (2026)
Self-Corrected Flow Distillation for Consistent One-Step and Few-Step Text-to-Image Generation
par: Dao, Quan, et autres
Publié: (2024)
par: Dao, Quan, et autres
Publié: (2024)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
par: Li, Zeju, et autres
Publié: (2024)
par: Li, Zeju, et autres
Publié: (2024)
VAST: Vivify Your Talking Avatar via Zero-Shot Expressive Facial Style Transfer
par: Chen, Liyang, et autres
Publié: (2023)
par: Chen, Liyang, et autres
Publié: (2023)
A$^{3}$lign-DFER: Pioneering Comprehensive Dynamic Affective Alignment for Dynamic Facial Expression Recognition with CLIP
par: Tao, Zeng, et autres
Publié: (2024)
par: Tao, Zeng, et autres
Publié: (2024)
Unified Multi-modal Diagnostic Framework with Reconstruction Pre-training and Heterogeneity-combat Tuning
par: Zhang, Yupei, et autres
Publié: (2024)
par: Zhang, Yupei, et autres
Publié: (2024)
Technical Approach for the EMI Challenge in the 8th Affective Behavior Analysis in-the-Wild Competition
par: Yu, Jun, et autres
Publié: (2025)
par: Yu, Jun, et autres
Publié: (2025)
CFCPalsy: Facial Image Synthesis with Cross-Fusion Cycle Diffusion Model for Facial Paralysis Individuals
par: Gao, Weixiang, et autres
Publié: (2024)
par: Gao, Weixiang, et autres
Publié: (2024)
BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
par: Liu, Ruyang, et autres
Publié: (2023)
par: Liu, Ruyang, et autres
Publié: (2023)
Streaming Video Instruction Tuning
par: Xia, Jiaer, et autres
Publié: (2025)
par: Xia, Jiaer, et autres
Publié: (2025)
PPBoost: Progressive Prompt Boosting for Text-Driven Medical Image Segmentation
par: Li, Xuchen, et autres
Publié: (2025)
par: Li, Xuchen, et autres
Publié: (2025)
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
par: Du, Yifan, et autres
Publié: (2023)
par: Du, Yifan, et autres
Publié: (2023)
Face-LLaVA: Facial Expression and Attribute Understanding through Instruction Tuning
par: Chaubey, Ashutosh, et autres
Publié: (2025)
par: Chaubey, Ashutosh, et autres
Publié: (2025)
AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis
par: She, Dong, et autres
Publié: (2026)
par: She, Dong, et autres
Publié: (2026)
StreamingTalker: Audio-driven 3D Facial Animation with Autoregressive Diffusion Model
par: Yang, Yifan, et autres
Publié: (2025)
par: Yang, Yifan, et autres
Publié: (2025)
Mixture of Cluster-conditional LoRA Experts for Vision-language Instruction Tuning
par: Gou, Yunhao, et autres
Publié: (2023)
par: Gou, Yunhao, et autres
Publié: (2023)
Documents similaires
-
Window Token Concatenation for Efficient Visual Large Language Models
par: Li, Yifan, et autres
Publié: (2025) -
IndustryEQA: Pushing the Frontiers of Embodied Question Answering in Industrial Scenarios
par: Li, Yifan, et autres
Publié: (2025) -
Visual Large Language Models for Generalized and Specialized Applications
par: Li, Yifan, et autres
Publié: (2025) -
Weakly Supervised Learning for Facial Affective Behavior Analysis : A Review
par: Praveen, R. Gnana, et autres
Publié: (2021) -
Robust Light-Weight Facial Affective Behavior Recognition with CLIP
par: Lin, Li, et autres
Publié: (2024)