Advanced Sign Language Video Generation with Compressed and Quantized Multi-Condition Tokenization
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Cong, Deng, Zexuan, Jiang, Zhiwei, Yin, Yafeng, Shen, Fei, Cheng, Zifeng, Ge, Shiping, Gan, Shiwei, Gu, Qing |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multi-Prompting Decoder Helps Better Language Understanding
by: Cheng, Zifeng, et al.
Published: (2024)
by: Cheng, Zifeng, et al.
Published: (2024)
A Debiased Nearest Neighbors Framework for Multi-Label Text Classification
by: Cheng, Zifeng, et al.
Published: (2024)
by: Cheng, Zifeng, et al.
Published: (2024)
RegionMarker: A Region-Triggered Semantic Watermarking Framework for Embedding-as-a-Service Copyright Protection
by: Yang, Shufan, et al.
Published: (2025)
by: Yang, Shufan, et al.
Published: (2025)
Graph Network for Sign Language Tasks
by: Gan, Shiwei, et al.
Published: (2025)
by: Gan, Shiwei, et al.
Published: (2025)
Token Prepending: A Training-Free Approach for Eliciting Better Sentence Embeddings from LLMs
by: Fu, Yuchen, et al.
Published: (2024)
by: Fu, Yuchen, et al.
Published: (2024)
Implicit Location-Caption Alignment via Complementary Masking for Weakly-Supervised Dense Video Captioning
by: Ge, Shiping, et al.
Published: (2024)
by: Ge, Shiping, et al.
Published: (2024)
InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models
by: Liu, Xinxin, et al.
Published: (2026)
by: Liu, Xinxin, et al.
Published: (2026)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
by: Cheng, Zifeng, et al.
Published: (2025)
by: Cheng, Zifeng, et al.
Published: (2025)
Contrastive Prompting Enhances Sentence Embeddings in LLMs through Inference-Time Steering
by: Cheng, Zifeng, et al.
Published: (2025)
by: Cheng, Zifeng, et al.
Published: (2025)
Cross-Modal Prototype Augmentation and Dual-Grained Prompt Learning for Social Media Popularity Prediction
by: Zhou, Ao, et al.
Published: (2025)
by: Zhou, Ao, et al.
Published: (2025)
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
by: Zhou, Ao, et al.
Published: (2025)
by: Zhou, Ao, et al.
Published: (2025)
V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation
by: Wang, Cong, et al.
Published: (2024)
by: Wang, Cong, et al.
Published: (2024)
SSVQ: Unleashing the Potential of Vector Quantization with Sign-Splitting
by: Li, Shuaiting, et al.
Published: (2025)
by: Li, Shuaiting, et al.
Published: (2025)
Ensembling Diffusion Models via Adaptive Feature Aggregation
by: Wang, Cong, et al.
Published: (2024)
by: Wang, Cong, et al.
Published: (2024)
CoST: Contrastive Quantization based Semantic Tokenization for Generative Recommendation
by: Zhu, Jieming, et al.
Published: (2024)
by: Zhu, Jieming, et al.
Published: (2024)
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
by: Li, Yizhuo, et al.
Published: (2024)
by: Li, Yizhuo, et al.
Published: (2024)
Advancing Pose-Guided Image Synthesis with Progressive Conditional Diffusion Models
by: Shen, Fei, et al.
Published: (2023)
by: Shen, Fei, et al.
Published: (2023)
Signs as Tokens: A Retrieval-Enhanced Multilingual Sign Language Generator
by: Zuo, Ronglai, et al.
Published: (2024)
by: Zuo, Ronglai, et al.
Published: (2024)
Beyond Token Eviction: Mixed-Dimension Budget Allocation for Efficient KV Cache Compression
by: Miao, Ruijie, et al.
Published: (2026)
by: Miao, Ruijie, et al.
Published: (2026)
Image and Video Tokenization with Binary Spherical Quantization
by: Zhao, Yue, et al.
Published: (2024)
by: Zhao, Yue, et al.
Published: (2024)
Switchable Token-Specific Codebook Quantization For Face Image Compression
by: Wang, Yongbo, et al.
Published: (2025)
by: Wang, Yongbo, et al.
Published: (2025)
T2S-GPT: Dynamic Vector Quantization for Autoregressive Sign Language Production from Text
by: Yin, Aoxiong, et al.
Published: (2024)
by: Yin, Aoxiong, et al.
Published: (2024)
xRAG: Extreme Context Compression for Retrieval-augmented Generation with One Token
by: Cheng, Xin, et al.
Published: (2024)
by: Cheng, Xin, et al.
Published: (2024)
MambaVideo for Discrete Video Tokenization with Channel-Split Quantization
by: Argaw, Dawit Mureja, et al.
Published: (2025)
by: Argaw, Dawit Mureja, et al.
Published: (2025)
Learning Graph Quantized Tokenizers
by: Wang, Limei, et al.
Published: (2024)
by: Wang, Limei, et al.
Published: (2024)
TVC: Tokenized Video Compression with Ultra-Low Bit Rate
by: Zhou, Lebin, et al.
Published: (2025)
by: Zhou, Lebin, et al.
Published: (2025)
High Dynamic Range Video Compression: A Large-Scale Benchmark Dataset and A Learned Bit-depth Scalable Compression Algorithm
by: Tian, Zhaoyi, et al.
Published: (2025)
by: Tian, Zhaoyi, et al.
Published: (2025)
Empowering Visual Artists with Tokenized Digital Assets with NFTs
by: Li, Ruiqiang, et al.
Published: (2024)
by: Li, Ruiqiang, et al.
Published: (2024)
Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMs
by: Cheng, Wenhua, et al.
Published: (2023)
by: Cheng, Wenhua, et al.
Published: (2023)
MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding
by: Wu, Peiran, et al.
Published: (2025)
by: Wu, Peiran, et al.
Published: (2025)
Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM
by: Wang, Han, et al.
Published: (2024)
by: Wang, Han, et al.
Published: (2024)
A new proof of the Lemmens-Seidel conjecture
by: Ge, Chuanyuan, et al.
Published: (2025)
by: Ge, Chuanyuan, et al.
Published: (2025)
Equiangular lines via nodal domains
by: Ge, Chuanyuan, et al.
Published: (2025)
by: Ge, Chuanyuan, et al.
Published: (2025)
VocalNet-M2: Advancing Low-Latency Spoken Language Modeling via Integrated Multi-Codebook Tokenization and Multi-Token Prediction
by: Wang, Yuhao, et al.
Published: (2025)
by: Wang, Yuhao, et al.
Published: (2025)
Scalable Image Tokenization with Index Backpropagation Quantization
by: Shi, Fengyuan, et al.
Published: (2024)
by: Shi, Fengyuan, et al.
Published: (2024)
TC-AE: Unlocking Token Capacity for Deep Compression Autoencoders
by: Li, Teng, et al.
Published: (2026)
by: Li, Teng, et al.
Published: (2026)
Plug-and-Play Versatile Compressed Video Enhancement
by: Zeng, Huimin, et al.
Published: (2025)
by: Zeng, Huimin, et al.
Published: (2025)
Multi-Scale Geometric Autoencoder
by: Zhan, Qipeng, et al.
Published: (2025)
by: Zhan, Qipeng, et al.
Published: (2025)
Improving Access to the American Sign Language Video Collection
by: Gu, Fang F.
Published: (2005)
by: Gu, Fang F.
Published: (2005)
Edge-connectivity and non-negative Lin-Lu-Yau curvature
by: Liu, Shiping, et al.
Published: (2025)
by: Liu, Shiping, et al.
Published: (2025)
Similar Items
-
Multi-Prompting Decoder Helps Better Language Understanding
by: Cheng, Zifeng, et al.
Published: (2024) -
A Debiased Nearest Neighbors Framework for Multi-Label Text Classification
by: Cheng, Zifeng, et al.
Published: (2024) -
RegionMarker: A Region-Triggered Semantic Watermarking Framework for Embedding-as-a-Service Copyright Protection
by: Yang, Shufan, et al.
Published: (2025) -
Graph Network for Sign Language Tasks
by: Gan, Shiwei, et al.
Published: (2025) -
Token Prepending: A Training-Free Approach for Eliciting Better Sentence Embeddings from LLMs
by: Fu, Yuchen, et al.
Published: (2024)