FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Fufangchen, Tan, Songbai, Qiu, Xuerui, Xun, Linrui, Jiang, Wenhao, Zheng, Jinkai, Fan, Hehe, Gao, Jian, Yan, Danfeng, Li, Ming |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SitLLM: Large Language Models for Sitting Posture Health Understanding via Pressure Sensor Data
by: Gao, Jian, et al.
Published: (2025)
by: Gao, Jian, et al.
Published: (2025)
reCSE: Portable Reshaping Features for Sentence Embedding in Self-supervised Contrastive Learning
by: Zhao, Fufangchen, et al.
Published: (2024)
by: Zhao, Fufangchen, et al.
Published: (2024)
UniF$^2$ace: A Unified Fine-grained Face Understanding and Generation Model
by: Li, Junzhe, et al.
Published: (2025)
by: Li, Junzhe, et al.
Published: (2025)
4DPC$^2$hat: Towards Dynamic Point Cloud Understanding with Failure-Aware Bootstrapping
by: Zhang, Xindan, et al.
Published: (2026)
by: Zhang, Xindan, et al.
Published: (2026)
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
by: Zhao, Fufangchen, et al.
Published: (2025)
by: Zhao, Fufangchen, et al.
Published: (2025)
Scaling Video Understanding via Compact Latent Multi-Agent Collaboration
by: Chen, Kerui, et al.
Published: (2026)
by: Chen, Kerui, et al.
Published: (2026)
VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding
by: Lin, Kuanwei, et al.
Published: (2026)
by: Lin, Kuanwei, et al.
Published: (2026)
Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO
by: Zeng, Zhiyuan, et al.
Published: (2026)
by: Zeng, Zhiyuan, et al.
Published: (2026)
Safe-VAR: Safe Visual Autoregressive Model for Text-to-Image Generative Watermarking
by: Wang, Ziyi, et al.
Published: (2025)
by: Wang, Ziyi, et al.
Published: (2025)
Efficient NAS with FaDE on Hierarchical Spaces
by: Neumeyer, Simon, et al.
Published: (2024)
by: Neumeyer, Simon, et al.
Published: (2024)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
by: Zhang, Yue, et al.
Published: (2024)
by: Zhang, Yue, et al.
Published: (2024)
TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
by: Li, Wei, et al.
Published: (2024)
by: Li, Wei, et al.
Published: (2024)
DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection
by: Qi, Hongyuan, et al.
Published: (2026)
by: Qi, Hongyuan, et al.
Published: (2026)
SciEducator: Scientific Video Understanding and Educating via Deming-Cycle Multi-Agent System
by: Xu, Zhiyu, et al.
Published: (2025)
by: Xu, Zhiyu, et al.
Published: (2025)
MotionGRPO: Overcoming Low Intra-Group Diversity in GRPO-Based Egocentric Motion Recovery
by: Yao, Nanjie, et al.
Published: (2026)
by: Yao, Nanjie, et al.
Published: (2026)
Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts
by: Zhang, Yue, et al.
Published: (2025)
by: Zhang, Yue, et al.
Published: (2025)
VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing
by: Yang, Xiangpeng, et al.
Published: (2025)
by: Yang, Xiangpeng, et al.
Published: (2025)
Memory-Augmented Query Intent Understanding for Efficient Chat-based Image Retrieval
by: Chen, Xianke, et al.
Published: (2026)
by: Chen, Xianke, et al.
Published: (2026)
ProtChatGPT: Towards Understanding Proteins with Large Language Models
by: Wang, Chao, et al.
Published: (2024)
by: Wang, Chao, et al.
Published: (2024)
MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding
by: Su, Yuhao, et al.
Published: (2025)
by: Su, Yuhao, et al.
Published: (2025)
HiStyle: Hierarchical Style Embedding Predictor for Text-Prompt-Guided Controllable Speech Synthesis
by: Zhang, Ziyu, et al.
Published: (2025)
by: Zhang, Ziyu, et al.
Published: (2025)
EMO2: End-Effector Guided Audio-Driven Avatar Video Generation
by: Tian, Linrui, et al.
Published: (2025)
by: Tian, Linrui, et al.
Published: (2025)
Consistency Matters: Explore LLMs Consistency From a Black-Box Perspective
by: Zhao, Fufangchen, et al.
Published: (2024)
by: Zhao, Fufangchen, et al.
Published: (2024)
SimCT: A Simple Consistency Test Protocol in LLMs Development Lifecycle
by: Zhao, Fufangchen, et al.
Published: (2024)
by: Zhao, Fufangchen, et al.
Published: (2024)
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
by: Li, Haoyuan, et al.
Published: (2025)
by: Li, Haoyuan, et al.
Published: (2025)
EVA: Zero-shot Accurate Attributes and Multi-Object Video Editing
by: Yang, Xiangpeng, et al.
Published: (2024)
by: Yang, Xiangpeng, et al.
Published: (2024)
EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity
by: Zhang, Xingjian, et al.
Published: (2025)
by: Zhang, Xingjian, et al.
Published: (2025)
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
by: Zhou, Zhenglin, et al.
Published: (2025)
by: Zhou, Zhenglin, et al.
Published: (2025)
Enhancing Large Language Models through Structured Reasoning
by: Dong, Yubo, et al.
Published: (2025)
by: Dong, Yubo, et al.
Published: (2025)
GRAPE: Let GRPO Supervise Query Rewriting by Ranking for Retrieval
by: Zhang, Zhaohua, et al.
Published: (2025)
by: Zhang, Zhaohua, et al.
Published: (2025)
DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding
by: Xiong, Junyu, et al.
Published: (2025)
by: Xiong, Junyu, et al.
Published: (2025)
TV-Dialogue: Crafting Theme-Aware Video Dialogues with Immersive Interaction
by: Wang, Sai, et al.
Published: (2025)
by: Wang, Sai, et al.
Published: (2025)
Prompt-Aware Controllable Shadow Removal
by: Chen, Kerui, et al.
Published: (2025)
by: Chen, Kerui, et al.
Published: (2025)
CoS: Chain-of-Shot Prompting for Long Video Understanding
by: Hu, Jian, et al.
Published: (2025)
by: Hu, Jian, et al.
Published: (2025)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
by: Guo, Danfeng, et al.
Published: (2024)
by: Guo, Danfeng, et al.
Published: (2024)
Endowing GPT-4 with a Humanoid Body: Building the Bridge Between Off-the-Shelf VLMs and the Physical World
by: Jian, Yingzhao, et al.
Published: (2025)
by: Jian, Yingzhao, et al.
Published: (2025)
Knowledge-Guided Prompt Learning for Deepfake Facial Image Detection
by: Wang, Hao, et al.
Published: (2025)
by: Wang, Hao, et al.
Published: (2025)
One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement
by: Zhou, Yixiao, et al.
Published: (2026)
by: Zhou, Yixiao, et al.
Published: (2026)
BVINet: Unlocking Blind Video Inpainting with Zero Annotations
by: Wu, Zhiliang, et al.
Published: (2025)
by: Wu, Zhiliang, et al.
Published: (2025)
Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL
by: Zhou, Yixiao, et al.
Published: (2026)
by: Zhou, Yixiao, et al.
Published: (2026)
Similar Items
-
SitLLM: Large Language Models for Sitting Posture Health Understanding via Pressure Sensor Data
by: Gao, Jian, et al.
Published: (2025) -
reCSE: Portable Reshaping Features for Sentence Embedding in Self-supervised Contrastive Learning
by: Zhao, Fufangchen, et al.
Published: (2024) -
UniF$^2$ace: A Unified Fine-grained Face Understanding and Generation Model
by: Li, Junzhe, et al.
Published: (2025) -
4DPC$^2$hat: Towards Dynamic Point Cloud Understanding with Failure-Aware Bootstrapping
by: Zhang, Xindan, et al.
Published: (2026) -
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
by: Zhao, Fufangchen, et al.
Published: (2025)