Towards LLM-centric Affective Visual Customization via Efficient and Precise Emotion Manipulating
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Jiamin, Gu, Xuqian, Wang, Jingjing, Lu, Jiahong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Sherlock: Towards Multi-scene Video Abnormal Event Extraction and Localization via a Global-local Spatial-sensitive LLM
por: Ma, Junxiao, et al.
Publicado: (2025)
por: Ma, Junxiao, et al.
Publicado: (2025)
Omni-SILA: Towards Omni-scene Driven Visual Sentiment Identifying, Locating and Attributing in Videos
por: Luo, Jiamin, et al.
Publicado: (2025)
por: Luo, Jiamin, et al.
Publicado: (2025)
Analyzing Image Beyond Visual Aspect: Image Emotion Classification via Multiple-Affective Captioning
por: Zhou, Zibo, et al.
Publicado: (2025)
por: Zhou, Zibo, et al.
Publicado: (2025)
Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors
por: Zhang, Peixuan, et al.
Publicado: (2025)
por: Zhang, Peixuan, et al.
Publicado: (2025)
Tuning-Free Visual Customization via View Iterative Self-Attention Control
por: Li, Xiaojie, et al.
Publicado: (2024)
por: Li, Xiaojie, et al.
Publicado: (2024)
Affective Image Editing: Shaping Emotional Factors via Text Descriptions
por: Zhang, Peixuan, et al.
Publicado: (2025)
por: Zhang, Peixuan, et al.
Publicado: (2025)
Scalable Audio-Visual Masked Autoencoders for Efficient Affective Video Facial Analysis
por: Wu, Xuecheng, et al.
Publicado: (2025)
por: Wu, Xuecheng, et al.
Publicado: (2025)
Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation
por: Jia, Guoli, et al.
Publicado: (2025)
por: Jia, Guoli, et al.
Publicado: (2025)
CLIP-Gaze: Towards General Gaze Estimation via Visual-Linguistic Model
por: Yin, Pengwei, et al.
Publicado: (2024)
por: Yin, Pengwei, et al.
Publicado: (2024)
Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach
por: Wu, Daiqing, et al.
Publicado: (2025)
por: Wu, Daiqing, et al.
Publicado: (2025)
AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control
por: Chen, Shi, et al.
Publicado: (2026)
por: Chen, Shi, et al.
Publicado: (2026)
Click to Grasp: Zero-Shot Precise Manipulation via Visual Diffusion Descriptors
por: Tsagkas, Nikolaos, et al.
Publicado: (2024)
por: Tsagkas, Nikolaos, et al.
Publicado: (2024)
EmoSpace: Fine-Grained Emotion Prototype Learning for Immersive Affective Content Generation
por: Wang, Bingyuan, et al.
Publicado: (2026)
por: Wang, Bingyuan, et al.
Publicado: (2026)
VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models
por: Zhang, Zhicheng, et al.
Publicado: (2025)
por: Zhang, Zhicheng, et al.
Publicado: (2025)
Object-centric Video Question Answering with Visual Grounding and Referring
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
Efficient Multimodal Learning from Data-centric Perspective
por: He, Muyang, et al.
Publicado: (2024)
por: He, Muyang, et al.
Publicado: (2024)
EmoEdit: Evoking Emotions through Image Manipulation
por: Yang, Jingyuan, et al.
Publicado: (2024)
por: Yang, Jingyuan, et al.
Publicado: (2024)
EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models
por: Zhang, Jiacheng, et al.
Publicado: (2024)
por: Zhang, Jiacheng, et al.
Publicado: (2024)
EmoKGEdit: Training-free Affective Injection via Visual Cue Transformation
por: Zhang, Jing, et al.
Publicado: (2026)
por: Zhang, Jing, et al.
Publicado: (2026)
ActionSink: Toward Precise Robot Manipulation with Dynamic Integration of Action Flow
por: Guo, Shanshan, et al.
Publicado: (2025)
por: Guo, Shanshan, et al.
Publicado: (2025)
Towards General Multimodal Visual Tracking
por: Lu, Andong, et al.
Publicado: (2025)
por: Lu, Andong, et al.
Publicado: (2025)
IDMR: Towards Instance-Driven Precise Visual Correspondence in Multimodal Retrieval
por: Liu, Bangwei, et al.
Publicado: (2025)
por: Liu, Bangwei, et al.
Publicado: (2025)
UniGarmentManip: A Unified Framework for Category-Level Garment Manipulation via Dense Visual Correspondence
por: Wu, Ruihai, et al.
Publicado: (2024)
por: Wu, Ruihai, et al.
Publicado: (2024)
MooD: Perception-Enhanced Efficient Affective Image Editing via Continuous Valence-Arousal Modeling
por: Yin, Xinyi, et al.
Publicado: (2026)
por: Yin, Xinyi, et al.
Publicado: (2026)
Towards mitigating uncann(eye)ness in face swaps via gaze-centric loss terms
por: Wilson, Ethan, et al.
Publicado: (2024)
por: Wilson, Ethan, et al.
Publicado: (2024)
EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing
por: Chen, Lan, et al.
Publicado: (2026)
por: Chen, Lan, et al.
Publicado: (2026)
MUSE: Manipulating Unified Framework for Synthesizing Emotions in Images via Test-Time Optimization
por: Xia, Yingjie, et al.
Publicado: (2025)
por: Xia, Yingjie, et al.
Publicado: (2025)
Context-Aware Academic Emotion Dataset and Benchmark
por: Zhao, Luming, et al.
Publicado: (2025)
por: Zhao, Luming, et al.
Publicado: (2025)
MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts
por: Tao, Wei, et al.
Publicado: (2025)
por: Tao, Wei, et al.
Publicado: (2025)
Aesthetic Matters in Music Perception for Image Stylization: A Emotion-driven Music-to-Visual Manipulation
por: Xu, Junjie, et al.
Publicado: (2025)
por: Xu, Junjie, et al.
Publicado: (2025)
VASparse: Towards Efficient Visual Hallucination Mitigation via Visual-Aware Token Sparsification
por: Zhuang, Xianwei, et al.
Publicado: (2025)
por: Zhuang, Xianwei, et al.
Publicado: (2025)
GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation
por: Qian, Jingjing, et al.
Publicado: (2025)
por: Qian, Jingjing, et al.
Publicado: (2025)
PIDiff: Image Customization for Personalized Identities with Diffusion Models
por: Gu, Jinyu, et al.
Publicado: (2025)
por: Gu, Jinyu, et al.
Publicado: (2025)
MuSHRoom: Multi-Sensor Hybrid Room Dataset for Joint 3D Reconstruction and Novel View Synthesis
por: Ren, Xuqian, et al.
Publicado: (2023)
por: Ren, Xuqian, et al.
Publicado: (2023)
EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation
por: Yang, Shiyuan, et al.
Publicado: (2026)
por: Yang, Shiyuan, et al.
Publicado: (2026)
End-to-end Semantic-centric Video-based Multimodal Affective Computing
por: Lin, Ronghao, et al.
Publicado: (2024)
por: Lin, Ronghao, et al.
Publicado: (2024)
CustomTTT: Motion and Appearance Customized Video Generation via Test-Time Training
por: Bi, Xiuli, et al.
Publicado: (2024)
por: Bi, Xiuli, et al.
Publicado: (2024)
PhyCustom: Towards Realistic Physical Customization in Text-to-Image Generation
por: Wu, Fan, et al.
Publicado: (2025)
por: Wu, Fan, et al.
Publicado: (2025)
EmoHead: Emotional Talking Head via Manipulating Semantic Expression Parameters
por: Shen, Xuli, et al.
Publicado: (2025)
por: Shen, Xuli, et al.
Publicado: (2025)
DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework
por: Zhang, Yani, et al.
Publicado: (2025)
por: Zhang, Yani, et al.
Publicado: (2025)
Ejemplares similares
-
Sherlock: Towards Multi-scene Video Abnormal Event Extraction and Localization via a Global-local Spatial-sensitive LLM
por: Ma, Junxiao, et al.
Publicado: (2025) -
Omni-SILA: Towards Omni-scene Driven Visual Sentiment Identifying, Locating and Attributing in Videos
por: Luo, Jiamin, et al.
Publicado: (2025) -
Analyzing Image Beyond Visual Aspect: Image Emotion Classification via Multiple-Affective Captioning
por: Zhou, Zibo, et al.
Publicado: (2025) -
Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors
por: Zhang, Peixuan, et al.
Publicado: (2025) -
Tuning-Free Visual Customization via View Iterative Self-Attention Control
por: Li, Xiaojie, et al.
Publicado: (2024)