GvT: A Graph-based Vision Transformer with Talking-Heads Utilizing Sparsity, Trained from Scratch on Small Datasets
Fuente:
arXiv
Salvato in:
| Autori principali: | Shan, Dongjing, chen, guiqiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning Online Scale Transformation for Talking Head Video Generation
di: Hong, Fa-Ting, et al.
Pubblicazione: (2024)
di: Hong, Fa-Ting, et al.
Pubblicazione: (2024)
EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion
di: Wang, Haotian, et al.
Pubblicazione: (2024)
di: Wang, Haotian, et al.
Pubblicazione: (2024)
PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation
di: Ling, Jun, et al.
Pubblicazione: (2024)
di: Ling, Jun, et al.
Pubblicazione: (2024)
Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code
di: Lin, Haobo, et al.
Pubblicazione: (2026)
di: Lin, Haobo, et al.
Pubblicazione: (2026)
Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models
di: Li, Zhiqi, et al.
Pubblicazione: (2025)
di: Li, Zhiqi, et al.
Pubblicazione: (2025)
Lightning Fast Caching-based Parallel Denoising Prediction for Accelerating Talking Head Generation
di: Long, Jianzhi, et al.
Pubblicazione: (2025)
di: Long, Jianzhi, et al.
Pubblicazione: (2025)
Enhancing Self-Supervised Talking Head Forgery Detection via a Training-Free Dual-System Framework
di: Liu, Ke, et al.
Pubblicazione: (2026)
di: Liu, Ke, et al.
Pubblicazione: (2026)
FaceEditTalker: Controllable Talking Head Generation with Facial Attribute Editing
di: Feng, Guanwen, et al.
Pubblicazione: (2025)
di: Feng, Guanwen, et al.
Pubblicazione: (2025)
Vision Transformers Don't Need Trained Registers
di: Jiang, Nick, et al.
Pubblicazione: (2025)
di: Jiang, Nick, et al.
Pubblicazione: (2025)
Unsupervised Training of Vision Transformers with Synthetic Negatives
di: Giakoumoglou, Nikolaos, et al.
Pubblicazione: (2025)
di: Giakoumoglou, Nikolaos, et al.
Pubblicazione: (2025)
Wildfire Detection Using Vision Transformer with the Wildfire Dataset
di: Vuppari, Gowtham Raj, et al.
Pubblicazione: (2025)
di: Vuppari, Gowtham Raj, et al.
Pubblicazione: (2025)
GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation
di: Xu, Xuwei, et al.
Pubblicazione: (2023)
di: Xu, Xuwei, et al.
Pubblicazione: (2023)
Scratching Visual Transformer's Back with Uniform Attention
di: Hyeon-Woo, Nam, et al.
Pubblicazione: (2022)
di: Hyeon-Woo, Nam, et al.
Pubblicazione: (2022)
Landmark-guided Diffusion Model for High-fidelity and Temporally Coherent Talking Head Generation
di: Tan, Jintao, et al.
Pubblicazione: (2024)
di: Tan, Jintao, et al.
Pubblicazione: (2024)
NLDF: Neural Light Dynamic Fields for Efficient 3D Talking Head Generation
di: Guanchen, Niu
Pubblicazione: (2024)
di: Guanchen, Niu
Pubblicazione: (2024)
TLCM: Training-efficient Latent Consistency Model for Image Generation with 2-8 Steps
di: Xie, Qingsong, et al.
Pubblicazione: (2024)
di: Xie, Qingsong, et al.
Pubblicazione: (2024)
EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control
di: Weng, Yuzhe, et al.
Pubblicazione: (2026)
di: Weng, Yuzhe, et al.
Pubblicazione: (2026)
Human-Guided Image Generation for Expanding Small-Scale Training Image Datasets
di: Chen, Changjian, et al.
Pubblicazione: (2024)
di: Chen, Changjian, et al.
Pubblicazione: (2024)
Dynamic Pondering Sparsity-aware Mixture-of-Experts Transformer for Event Stream based Visual Object Tracking
di: Wang, Shiao, et al.
Pubblicazione: (2026)
di: Wang, Shiao, et al.
Pubblicazione: (2026)
DAWN: Dynamic Frame Avatar with Non-autoregressive Diffusion Framework for Talking Head Video Generation
di: Cheng, Hanbo, et al.
Pubblicazione: (2024)
di: Cheng, Hanbo, et al.
Pubblicazione: (2024)
Training Neural Networks from Scratch with Parallel Low-Rank Adapters
di: Huh, Minyoung, et al.
Pubblicazione: (2024)
di: Huh, Minyoung, et al.
Pubblicazione: (2024)
UniPTS: A Unified Framework for Proficient Post-Training Sparsity
di: Xie, Jingjing, et al.
Pubblicazione: (2024)
di: Xie, Jingjing, et al.
Pubblicazione: (2024)
Post-Disaster Affected Area Segmentation with a Vision Transformer (ViT)-based EVAP Model using Sentinel-2 and Formosat-5 Imagery
di: Chu, Yi-Shan, et al.
Pubblicazione: (2025)
di: Chu, Yi-Shan, et al.
Pubblicazione: (2025)
Frozen Vision Transformers for Dense Prediction on Small Datasets: A Case Study in Arrow Localization
di: Shepherd, Maxwell
Pubblicazione: (2026)
di: Shepherd, Maxwell
Pubblicazione: (2026)
Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head Generation
di: Shi, Hanlei, et al.
Pubblicazione: (2025)
di: Shi, Hanlei, et al.
Pubblicazione: (2025)
Passive Dementia Screening via Facial Temporal Micro-Dynamics Analysis of In-the-Wild Talking-Head Video
di: Cenacchi, Filippo, et al.
Pubblicazione: (2025)
di: Cenacchi, Filippo, et al.
Pubblicazione: (2025)
SDTalk: Structured Facial Priors and Dual-Branch Motion Fields for Generalizable Gaussian Talking Head Synthesis
di: Jia, Peng, et al.
Pubblicazione: (2026)
di: Jia, Peng, et al.
Pubblicazione: (2026)
COST: Contrastive One-Stage Transformer for Vision-Language Small Object Tracking
di: Zhang, Chunhui, et al.
Pubblicazione: (2025)
di: Zhang, Chunhui, et al.
Pubblicazione: (2025)
DeiT-LT Distillation Strikes Back for Vision Transformer Training on Long-Tailed Datasets
di: Rangwani, Harsh, et al.
Pubblicazione: (2024)
di: Rangwani, Harsh, et al.
Pubblicazione: (2024)
Stretching Each Dollar: Diffusion Training from Scratch on a Micro-Budget
di: Sehwag, Vikash, et al.
Pubblicazione: (2024)
di: Sehwag, Vikash, et al.
Pubblicazione: (2024)
Spiking Vision Transformer with Saccadic Attention
di: Wang, Shuai, et al.
Pubblicazione: (2025)
di: Wang, Shuai, et al.
Pubblicazione: (2025)
How Do Training Methods Influence the Utilization of Vision Models?
di: Gavrikov, Paul, et al.
Pubblicazione: (2024)
di: Gavrikov, Paul, et al.
Pubblicazione: (2024)
Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
Enhancing Breast Cancer Detection with Vision Transformers and Graph Neural Networks
di: Cai, Yeming, et al.
Pubblicazione: (2025)
di: Cai, Yeming, et al.
Pubblicazione: (2025)
Hierarchical Vision Transformer Enhanced by Graph Convolutional Network for Image Classification
di: Jiao, Haibin
Pubblicazione: (2026)
di: Jiao, Haibin
Pubblicazione: (2026)
Small Object Few-shot Segmentation for Vision-based Industrial Inspection
di: Zhang, Zilong, et al.
Pubblicazione: (2024)
di: Zhang, Zilong, et al.
Pubblicazione: (2024)
EFTViT: Efficient Federated Training of Vision Transformers with Masked Images on Resource-Constrained Clients
di: Wu, Meihan, et al.
Pubblicazione: (2024)
di: Wu, Meihan, et al.
Pubblicazione: (2024)
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
di: Zou, Dongyun, et al.
Pubblicazione: (2026)
di: Zou, Dongyun, et al.
Pubblicazione: (2026)
Trio-ViT: Post-Training Quantization and Acceleration for Softmax-Free Efficient Vision Transformer
di: Shi, Huihong, et al.
Pubblicazione: (2024)
di: Shi, Huihong, et al.
Pubblicazione: (2024)
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders
di: Lee, Dohun, et al.
Pubblicazione: (2025)
di: Lee, Dohun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Learning Online Scale Transformation for Talking Head Video Generation
di: Hong, Fa-Ting, et al.
Pubblicazione: (2024) -
EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion
di: Wang, Haotian, et al.
Pubblicazione: (2024) -
PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation
di: Ling, Jun, et al.
Pubblicazione: (2024) -
Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code
di: Lin, Haobo, et al.
Pubblicazione: (2026) -
Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models
di: Li, Zhiqi, et al.
Pubblicazione: (2025)