FaceInsight: A Multimodal Large Language Model for Face Perception
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Jingzhi, Luo, Changjiang, Chen, Ruoyu, Zhang, Hua, Ren, Wenqi, Gan, Jianhou, Cao, Xiaochun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Phantom-Insight: Adaptive Multi-cue Fusion for Video Camouflaged Object Detection with Multimodal LLM
by: Zhang, Hua, et al.
Published: (2025)
by: Zhang, Hua, et al.
Published: (2025)
Semi-Supervised State-Space Model with Dynamic Stacking Filter for Real-World Video Deraining
by: Sun, Shangquan, et al.
Published: (2025)
by: Sun, Shangquan, et al.
Published: (2025)
A Hybrid Transformer-Mamba Network for Single Image Deraining
by: Sun, Shangquan, et al.
Published: (2024)
by: Sun, Shangquan, et al.
Published: (2024)
FaceShield: Explainable Face Anti-Spoofing with Multimodal Large Language Models
by: Wang, Hongyang, et al.
Published: (2025)
by: Wang, Hongyang, et al.
Published: (2025)
Less is More: Fewer Interpretable Region via Submodular Subset Selection
by: Chen, Ruoyu, et al.
Published: (2024)
by: Chen, Ruoyu, et al.
Published: (2024)
Generalized Semantic Contrastive Learning via Embedding Side Information for Few-Shot Object Detection
by: Chen, Ruoyu, et al.
Published: (2025)
by: Chen, Ruoyu, et al.
Published: (2025)
SHIELD : An Evaluation Benchmark for Face Spoofing and Forgery Detection with Multimodal Large Language Models
by: Shi, Yichen, et al.
Published: (2024)
by: Shi, Yichen, et al.
Published: (2024)
Logit Standardization in Knowledge Distillation
by: Sun, Shangquan, et al.
Published: (2024)
by: Sun, Shangquan, et al.
Published: (2024)
Face-MLLM: A Large Face Perception Model
by: Sun, Haomiao, et al.
Published: (2024)
by: Sun, Haomiao, et al.
Published: (2024)
Multigrain-aware Semantic Prototype Scanning and Tri-Token Prompt Learning Embraced High-Order RWKV for Pan-Sharpening
by: Li, Junfeng, et al.
Published: (2026)
by: Li, Junfeng, et al.
Published: (2026)
Interpreting Object-level Foundation Models via Visual Precision Search
by: Chen, Ruoyu, et al.
Published: (2024)
by: Chen, Ruoyu, et al.
Published: (2024)
Universal Camouflage Attack on Vision-Language Models for Autonomous Driving
by: Kong, Dehong, et al.
Published: (2025)
by: Kong, Dehong, et al.
Published: (2025)
Less is More: Efficient Black-box Attribution via Minimal Interpretable Subset Selection
by: Chen, Ruoyu, et al.
Published: (2025)
by: Chen, Ruoyu, et al.
Published: (2025)
Towards Real-World Blind Face Restoration with Generative Diffusion Prior
by: Chen, Xiaoxu, et al.
Published: (2023)
by: Chen, Xiaoxu, et al.
Published: (2023)
Poisoned Forgery Face: Towards Backdoor Attacks on Face Forgery Detection
by: Liang, Jiawei, et al.
Published: (2024)
by: Liang, Jiawei, et al.
Published: (2024)
Evaluating Multimodal Large Language Models for Heterogeneous Face Recognition
by: Shahreza, Hatef Otroshi, et al.
Published: (2026)
by: Shahreza, Hatef Otroshi, et al.
Published: (2026)
Agent4FaceForgery: Multi-Agent LLM Framework for Realistic Face Forgery Detection
by: Lai, Yingxin, et al.
Published: (2025)
by: Lai, Yingxin, et al.
Published: (2025)
FaceLLM: A Multimodal Large Language Model for Face Understanding
by: Shahreza, Hatef Otroshi, et al.
Published: (2025)
by: Shahreza, Hatef Otroshi, et al.
Published: (2025)
Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
by: Zhang, Guosheng, et al.
Published: (2025)
by: Zhang, Guosheng, et al.
Published: (2025)
FaceLinkGen: Rethinking Identity Leakage in Privacy-Preserving Face Recognition with Identity Extraction
by: Guo, Wenqi, et al.
Published: (2026)
by: Guo, Wenqi, et al.
Published: (2026)
VLForgery Face Triad: Detection, Localization and Attribution via Multimodal Large Language Models
by: He, Xinan, et al.
Published: (2025)
by: He, Xinan, et al.
Published: (2025)
Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing
by: Zhang, Honglu, et al.
Published: (2025)
by: Zhang, Honglu, et al.
Published: (2025)
Faceptor: A Generalist Model for Face Perception
by: Qin, Lixiong, et al.
Published: (2024)
by: Qin, Lixiong, et al.
Published: (2024)
DADM: Dual Alignment of Domain and Modality for Face Anti-spoofing
by: Yang, Jingyi, et al.
Published: (2025)
by: Yang, Jingyi, et al.
Published: (2025)
Benchmarking Multimodal Large Language Models for Face Recognition
by: Shahreza, Hatef Otroshi, et al.
Published: (2025)
by: Shahreza, Hatef Otroshi, et al.
Published: (2025)
4KDehazeFlow: Ultra-High-Definition Image Dehazing via Flow Matching
by: Chen, Xingchi, et al.
Published: (2025)
by: Chen, Xingchi, et al.
Published: (2025)
Learning Representation and Synergy Invariances: A Povable Framework for Generalized Multimodal Face Anti-Spoofing
by: Lin, Xun, et al.
Published: (2025)
by: Lin, Xun, et al.
Published: (2025)
FaceXBench: Evaluating Multimodal LLMs on Face Understanding
by: Narayan, Kartik, et al.
Published: (2025)
by: Narayan, Kartik, et al.
Published: (2025)
3D Priors-Guided Diffusion for Blind Face Restoration
by: Lu, Xiaobin, et al.
Published: (2024)
by: Lu, Xiaobin, et al.
Published: (2024)
PhaseWin Search Framework Enable Efficient Object-Level Interpretation
by: Gu, Zihan, et al.
Published: (2025)
by: Gu, Zihan, et al.
Published: (2025)
Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses
by: Wang, Yuji, et al.
Published: (2025)
by: Wang, Yuji, et al.
Published: (2025)
QuantFace: Efficient Quantization for Face Restoration
by: Li, Jiatong, et al.
Published: (2025)
by: Li, Jiatong, et al.
Published: (2025)
FaceBench: A Multi-View Multi-Level Facial Attribute VQA Dataset for Benchmarking Face Perception MLLMs
by: Wang, Xiaoqin, et al.
Published: (2025)
by: Wang, Xiaoqin, et al.
Published: (2025)
GenFace: A Large-Scale Fine-Grained Face Forgery Benchmark and Cross Appearance-Edge Learning
by: Zhang, Yaning, et al.
Published: (2024)
by: Zhang, Yaning, et al.
Published: (2024)
Degradation-Guided One-Step Image Super-Resolution with Diffusion Priors
by: Zhang, Aiping, et al.
Published: (2024)
by: Zhang, Aiping, et al.
Published: (2024)
Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face Detector
by: Guo, Xiao, et al.
Published: (2025)
by: Guo, Xiao, et al.
Published: (2025)
ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models
by: Wang, Ziyue, et al.
Published: (2024)
by: Wang, Ziyue, et al.
Published: (2024)
Can Vision-Language Models Answer Face to Face Questions in the Real-World?
by: Pourreza, Reza, et al.
Published: (2025)
by: Pourreza, Reza, et al.
Published: (2025)
AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models
by: Zheng, Kai, et al.
Published: (2026)
by: Zheng, Kai, et al.
Published: (2026)
SplatFace: Gaussian Splat Face Reconstruction Leveraging an Optimizable Surface
by: Luo, Jiahao, et al.
Published: (2024)
by: Luo, Jiahao, et al.
Published: (2024)
Similar Items
-
Phantom-Insight: Adaptive Multi-cue Fusion for Video Camouflaged Object Detection with Multimodal LLM
by: Zhang, Hua, et al.
Published: (2025) -
Semi-Supervised State-Space Model with Dynamic Stacking Filter for Real-World Video Deraining
by: Sun, Shangquan, et al.
Published: (2025) -
A Hybrid Transformer-Mamba Network for Single Image Deraining
by: Sun, Shangquan, et al.
Published: (2024) -
FaceShield: Explainable Face Anti-Spoofing with Multimodal Large Language Models
by: Wang, Hongyang, et al.
Published: (2025) -
Less is More: Fewer Interpretable Region via Submodular Subset Selection
by: Chen, Ruoyu, et al.
Published: (2024)