TEASER: Token Enhanced Spatial Modeling for Expressions Reconstruction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Yunfei, Zhu, Lei, Lin, Lijian, Zhu, Ye, Zhang, Ailing, Li, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Qffusion: Controllable Portrait Video Editing via Quadrant-Grid Attention Learning
par: Li, Maomao, et autres
Publié: (2025)
par: Li, Maomao, et autres
Publié: (2025)
PEAR: Pixel-aligned Expressive humAn mesh Recovery
par: Wu, Jiahao, et autres
Publié: (2026)
par: Wu, Jiahao, et autres
Publié: (2026)
MANGO:Natural Multi-speaker 3D Talking Head Generation via 2D-Lifted Enhancement
par: Zhu, Lei, et autres
Publié: (2026)
par: Zhu, Lei, et autres
Publié: (2026)
GPAvatar: Generalizable and Precise Head Avatar from Image(s)
par: Chu, Xuangeng, et autres
Publié: (2024)
par: Chu, Xuangeng, et autres
Publié: (2024)
GUAVA: Generalizable Upper Body 3D Gaussian Avatar
par: Zhang, Dongbin, et autres
Publié: (2025)
par: Zhang, Dongbin, et autres
Publié: (2025)
HRAvatar: High-Quality and Relightable Gaussian Head Avatar
par: Zhang, Dongbin, et autres
Publié: (2025)
par: Zhang, Dongbin, et autres
Publié: (2025)
Identity-Preserving Video Dubbing Using Motion Warping
par: Liu, Runzhen, et autres
Publié: (2025)
par: Liu, Runzhen, et autres
Publié: (2025)
CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation
par: Luo, Xiangyang, et autres
Publié: (2025)
par: Luo, Xiangyang, et autres
Publié: (2025)
The Model Knows Which Tokens Matter: Automatic Token Selection via Noise Gating
par: He, Landi, et autres
Publié: (2026)
par: He, Landi, et autres
Publié: (2026)
Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models
par: He, Landi, et autres
Publié: (2026)
par: He, Landi, et autres
Publié: (2026)
Information Bottleneck Approach to Spatial Attention Learning
par: Lai, Qiuxia, et autres
Publié: (2021)
par: Lai, Qiuxia, et autres
Publié: (2021)
Enhancing Vision-Language Model with Unmasked Token Alignment
par: Liu, Jihao, et autres
Publié: (2024)
par: Liu, Jihao, et autres
Publié: (2024)
Fewer Tokens, Greater Scaling: Self-Adaptive Visual Bases for Efficient and Expansive Representation Learning
par: Young, Shawn, et autres
Publié: (2025)
par: Young, Shawn, et autres
Publié: (2025)
Score-based Generative Priors Guided Model-driven Network for MRI Reconstruction
par: Qiao, Xiaoyu, et autres
Publié: (2024)
par: Qiao, Xiaoyu, et autres
Publié: (2024)
DiffSHEG: A Diffusion-Based Approach for Real-Time Speech-driven Holistic 3D Expression and Gesture Generation
par: Chen, Junming, et autres
Publié: (2024)
par: Chen, Junming, et autres
Publié: (2024)
Unmixing-Guided Spatial-Spectral Mamba with Clustering Tokens for Hyperspectral Image Classification
par: Zhu, Yimin, et autres
Publié: (2026)
par: Zhu, Yimin, et autres
Publié: (2026)
Enhancing Visual Grounding and Generalization: A Multi-Task Cycle Training Approach for Vision-Language Models
par: Yang, Xiaoyu, et autres
Publié: (2023)
par: Yang, Xiaoyu, et autres
Publié: (2023)
Compound Expression Recognition via Multi Model Ensemble
par: Yu, Jun, et autres
Publié: (2024)
par: Yu, Jun, et autres
Publié: (2024)
GPSToken: Gaussian Parameterized Spatially-adaptive Tokenization for Image Representation and Generation
par: Zhang, Zhengqiang, et autres
Publié: (2025)
par: Zhang, Zhengqiang, et autres
Publié: (2025)
FREE-Edit: Using Editing-aware Injection in Rectified Flow Models for Zero-shot Image-Driven Video Editing
par: Li, Maomao, et autres
Publié: (2026)
par: Li, Maomao, et autres
Publié: (2026)
A Video is Worth 256 Bases: Spatial-Temporal Expectation-Maximization Inversion for Zero-Shot Video Editing
par: Li, Maomao, et autres
Publié: (2023)
par: Li, Maomao, et autres
Publié: (2023)
X-Pose: Detecting Any Keypoints
par: Yang, Jie, et autres
Publié: (2023)
par: Yang, Jie, et autres
Publié: (2023)
Open-World Human-Object Interaction Detection via Multi-modal Prompts
par: Yang, Jie, et autres
Publié: (2024)
par: Yang, Jie, et autres
Publié: (2024)
CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers
par: Li, Zhuojin, et autres
Publié: (2026)
par: Li, Zhuojin, et autres
Publié: (2026)
AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
par: Zhang, Weichen, et autres
Publié: (2025)
par: Zhang, Weichen, et autres
Publié: (2025)
TokenPacker: Efficient Visual Projector for Multimodal LLM
par: Li, Wentong, et autres
Publié: (2024)
par: Li, Wentong, et autres
Publié: (2024)
LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs
par: Lou, Haoran, et autres
Publié: (2025)
par: Lou, Haoran, et autres
Publié: (2025)
TC-SSA: Token Compression via Semantic Slot Aggregation for Gigapixel Pathology Reasoning
par: Chen, Zhuo, et autres
Publié: (2026)
par: Chen, Zhuo, et autres
Publié: (2026)
PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution
par: Li, Wenxue, et autres
Publié: (2026)
par: Li, Wenxue, et autres
Publié: (2026)
Complementarity-driven Representation Learning for Multi-modal Knowledge Graph Completion
par: Li, Lijian
Publié: (2025)
par: Li, Lijian
Publié: (2025)
Mixed Prototype Consistency Learning for Semi-supervised Medical Image Segmentation
par: Li, Lijian
Publié: (2024)
par: Li, Lijian
Publié: (2024)
VQ-Seg: Vector-Quantized Token Perturbation for Semi-Supervised Medical Image Segmentation
par: Yang, Sicheng, et autres
Publié: (2026)
par: Yang, Sicheng, et autres
Publié: (2026)
ICAL: Implicit Character-Aided Learning for Enhanced Handwritten Mathematical Expression Recognition
par: Zhu, Jianhua, et autres
Publié: (2024)
par: Zhu, Jianhua, et autres
Publié: (2024)
Towards Joint Quantization and Token Pruning of Vision-Language Models
par: Li, Xinqing, et autres
Publié: (2026)
par: Li, Xinqing, et autres
Publié: (2026)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
par: Tan, Xudong, et autres
Publié: (2025)
par: Tan, Xudong, et autres
Publié: (2025)
Window Token Concatenation for Efficient Visual Large Language Models
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation
par: Li, Yuchen, et autres
Publié: (2026)
par: Li, Yuchen, et autres
Publié: (2026)
Towards Sequence Modeling Alignment between Tokenizer and Autoregressive Model
par: Wu, Pingyu, et autres
Publié: (2025)
par: Wu, Pingyu, et autres
Publié: (2025)
Reconstructing Retinal Visual Images from 3T fMRI Data Enhanced by Unsupervised Learning
par: Xiong, Yujian, et autres
Publié: (2024)
par: Xiong, Yujian, et autres
Publié: (2024)
S2TD-Face: Reconstruct a Detailed 3D Face with Controllable Texture from a Single Sketch
par: Wang, Zidu, et autres
Publié: (2024)
par: Wang, Zidu, et autres
Publié: (2024)
Documents similaires
-
Qffusion: Controllable Portrait Video Editing via Quadrant-Grid Attention Learning
par: Li, Maomao, et autres
Publié: (2025) -
PEAR: Pixel-aligned Expressive humAn mesh Recovery
par: Wu, Jiahao, et autres
Publié: (2026) -
MANGO:Natural Multi-speaker 3D Talking Head Generation via 2D-Lifted Enhancement
par: Zhu, Lei, et autres
Publié: (2026) -
GPAvatar: Generalizable and Precise Head Avatar from Image(s)
par: Chu, Xuangeng, et autres
Publié: (2024) -
GUAVA: Generalizable Upper Body 3D Gaussian Avatar
par: Zhang, Dongbin, et autres
Publié: (2025)