T2S-GPT: Dynamic Vector Quantization for Autoregressive Sign Language Production from Text
Fuente:
arXiv
Salvato in:
| Autori principali: | Yin, Aoxiong, Li, Haoyuan, Shen, Kai, Tang, Siliang, Zhuang, Yueting |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Best of Both Worlds: Integrating Language Models and Diffusion Models for Video Generation
di: Yin, Aoxiong, et al.
Pubblicazione: (2025)
di: Yin, Aoxiong, et al.
Pubblicazione: (2025)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation
di: Lin, Tianwei, et al.
Pubblicazione: (2025)
di: Lin, Tianwei, et al.
Pubblicazione: (2025)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
di: Zhang, Wenqiao, et al.
Pubblicazione: (2024)
di: Zhang, Wenqiao, et al.
Pubblicazione: (2024)
CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark
di: Wang, Wei, et al.
Pubblicazione: (2026)
di: Wang, Wei, et al.
Pubblicazione: (2026)
Advanced Sign Language Video Generation with Compressed and Quantized Multi-Condition Tokenization
di: Wang, Cong, et al.
Pubblicazione: (2025)
di: Wang, Cong, et al.
Pubblicazione: (2025)
HalluciDoctor: Mitigating Hallucinatory Toxicity in Visual Instruction Data
di: Yu, Qifan, et al.
Pubblicazione: (2023)
di: Yu, Qifan, et al.
Pubblicazione: (2023)
FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL
di: Pan, Kaihang, et al.
Pubblicazione: (2025)
di: Pan, Kaihang, et al.
Pubblicazione: (2025)
Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
di: Ge, Zhiqi, et al.
Pubblicazione: (2024)
di: Ge, Zhiqi, et al.
Pubblicazione: (2024)
Towards Meta-Cognitive Knowledge Editing for Multimodal LLMs
di: Fan, Zhaoyu, et al.
Pubblicazione: (2025)
di: Fan, Zhaoyu, et al.
Pubblicazione: (2025)
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
di: Gao, Mingjian, et al.
Pubblicazione: (2026)
di: Gao, Mingjian, et al.
Pubblicazione: (2026)
Channel-wise Vector Quantization
di: Song, Wei, et al.
Pubblicazione: (2026)
di: Song, Wei, et al.
Pubblicazione: (2026)
HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models
di: Zhou, Ziqin, et al.
Pubblicazione: (2025)
di: Zhou, Ziqin, et al.
Pubblicazione: (2025)
Aligned Vector Quantization for Edge-Cloud Collabrative Vision-Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2024)
di: Liu, Xiao, et al.
Pubblicazione: (2024)
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
di: Li, Haoyuan, et al.
Pubblicazione: (2025)
di: Li, Haoyuan, et al.
Pubblicazione: (2025)
Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
di: Zheng, Zirui, et al.
Pubblicazione: (2025)
di: Zheng, Zirui, et al.
Pubblicazione: (2025)
From Easy to Hard: Learning Curricular Shape-aware Features for Robust Panoptic Scene Graph Generation
di: Shi, Hanrong, et al.
Pubblicazione: (2024)
di: Shi, Hanrong, et al.
Pubblicazione: (2024)
FPQVAR: Floating Point Quantization for Visual Autoregressive Model with FPGA Hardware Co-design
di: Wei, Renjie, et al.
Pubblicazione: (2025)
di: Wei, Renjie, et al.
Pubblicazione: (2025)
TokenUnify: Scaling Up Autoregressive Pretraining for Neuron Segmentation
di: Chen, Yinda, et al.
Pubblicazione: (2024)
di: Chen, Yinda, et al.
Pubblicazione: (2024)
KKA: Improving Vision Anomaly Detection through Anomaly-related Knowledge from Large Language Models
di: Chen, Dong, et al.
Pubblicazione: (2025)
di: Chen, Dong, et al.
Pubblicazione: (2025)
AutoSign: Direct Pose-to-Text Translation for Continuous Sign Language Recognition
di: Johnny, Samuel Ebimobowei, et al.
Pubblicazione: (2025)
di: Johnny, Samuel Ebimobowei, et al.
Pubblicazione: (2025)
Modality-Aware and Anatomical Vector-Quantized Autoencoding for Multimodal Brain MRI
di: Li, Mingjie, et al.
Pubblicazione: (2026)
di: Li, Mingjie, et al.
Pubblicazione: (2026)
Large Sign Language Models: Toward 3D American Sign Language Translation
di: Zhang, Sen, et al.
Pubblicazione: (2025)
di: Zhang, Sen, et al.
Pubblicazione: (2025)
A Survey on Vision Autoregressive Model
di: Jiang, Kai, et al.
Pubblicazione: (2024)
di: Jiang, Kai, et al.
Pubblicazione: (2024)
GMFVAD: Using Grained Multi-modal Feature to Improve Video Anomaly Detection
di: Dai, Guangyu, et al.
Pubblicazione: (2025)
di: Dai, Guangyu, et al.
Pubblicazione: (2025)
Distilling Vision-Language Foundation Models: A Data-Free Approach via Prompt Diversification
di: Xuan, Yunyi, et al.
Pubblicazione: (2024)
di: Xuan, Yunyi, et al.
Pubblicazione: (2024)
MPDIoU: A Loss for Efficient and Accurate Bounding Box Regression
di: Ma, Siliang, et al.
Pubblicazione: (2023)
di: Ma, Siliang, et al.
Pubblicazione: (2023)
Training-Free Text-Guided Image Editing with Visual Autoregressive Model
di: Wang, Yufei, et al.
Pubblicazione: (2025)
di: Wang, Yufei, et al.
Pubblicazione: (2025)
DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
di: Bousselham, Walid, et al.
Pubblicazione: (2026)
di: Bousselham, Walid, et al.
Pubblicazione: (2026)
SignMouth: Leveraging Mouthing Cues for Sign Language Translation by Multimodal Contrastive Fusion
di: Wu, Wenfang, et al.
Pubblicazione: (2025)
di: Wu, Wenfang, et al.
Pubblicazione: (2025)
Co-generation of Layout and Shape from Text via Autoregressive 3D Diffusion
di: Tang, Zhenggang, et al.
Pubblicazione: (2026)
di: Tang, Zhenggang, et al.
Pubblicazione: (2026)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
di: Li, Yongqi, et al.
Pubblicazione: (2024)
di: Li, Yongqi, et al.
Pubblicazione: (2024)
Driving by the Rules: A Benchmark for Integrating Traffic Sign Regulations into Vectorized HD Map
di: Chang, Xinyuan, et al.
Pubblicazione: (2024)
di: Chang, Xinyuan, et al.
Pubblicazione: (2024)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
di: Li, Hongxing, et al.
Pubblicazione: (2025)
di: Li, Hongxing, et al.
Pubblicazione: (2025)
PUREVQ-GAN: Defending Data Poisoning Attacks through Vector-Quantized Bottlenecks
di: Branch, Alexander, et al.
Pubblicazione: (2025)
di: Branch, Alexander, et al.
Pubblicazione: (2025)
VARGPT-v1.1: Improve Visual Autoregressive Large Unified Model via Iterative Instruction Tuning and Reinforcement Learning
di: Zhuang, Xianwei, et al.
Pubblicazione: (2025)
di: Zhuang, Xianwei, et al.
Pubblicazione: (2025)
ControlVAR: Exploring Controllable Visual Autoregressive Modeling
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
DESign: Dynamic Context-Aware Convolution and Efficient Subnet Regularization for Continuous Sign Language Recognition
di: Liu, Sheng, et al.
Pubblicazione: (2025)
di: Liu, Sheng, et al.
Pubblicazione: (2025)
A Permuted Autoregressive Approach to Word-Level Recognition for Urdu Digital Text
di: Mustafa, Ahmed, et al.
Pubblicazione: (2024)
di: Mustafa, Ahmed, et al.
Pubblicazione: (2024)
EQ-CBM: A Probabilistic Concept Bottleneck with Energy-based Models and Quantized Vectors
di: Kim, Sangwon, et al.
Pubblicazione: (2024)
di: Kim, Sangwon, et al.
Pubblicazione: (2024)
Documenti analoghi
-
The Best of Both Worlds: Integrating Language Models and Diffusion Models for Video Generation
di: Yin, Aoxiong, et al.
Pubblicazione: (2025) -
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
di: Qin, Bosheng, et al.
Pubblicazione: (2023) -
HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation
di: Lin, Tianwei, et al.
Pubblicazione: (2025) -
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
di: Zhang, Wenqiao, et al.
Pubblicazione: (2024) -
CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark
di: Wang, Wei, et al.
Pubblicazione: (2026)