BitLM: Unlocking Multi-Token Language Generation with Bitwise Continuous Diffusion
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhuang, Shaobin, Ai, Yuang, Han, Jiaming, Li, Xiaohui, Huang, Huaibo, Yue, Xiangyu, Hu, Xuefeng, Xu, Kun, Wang, Yali, Chen, Hao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BitDance: Scaling Autoregressive Generative Models with Binary Tokens
di: Ai, Yuang, et al.
Pubblicazione: (2026)
di: Ai, Yuang, et al.
Pubblicazione: (2026)
UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model
di: Zhuang, Shaobin, et al.
Pubblicazione: (2026)
di: Zhuang, Shaobin, et al.
Pubblicazione: (2026)
DiCo: Revitalizing ConvNets for Scalable and Efficient Diffusion Modeling
di: Ai, Yuang, et al.
Pubblicazione: (2025)
di: Ai, Yuang, et al.
Pubblicazione: (2025)
Random Wins All: Rethinking Grouping Strategies for Vision Tokens
di: Fan, Qihang, et al.
Pubblicazione: (2026)
di: Fan, Qihang, et al.
Pubblicazione: (2026)
LoRA-IR: Taming Low-Rank Experts for Efficient All-in-One Image Restoration
di: Ai, Yuang, et al.
Pubblicazione: (2024)
di: Ai, Yuang, et al.
Pubblicazione: (2024)
GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing
di: Zhu, Zifeng, et al.
Pubblicazione: (2026)
di: Zhu, Zifeng, et al.
Pubblicazione: (2026)
Rectifying Magnitude Neglect in Linear Attention
di: Fan, Qihang, et al.
Pubblicazione: (2025)
di: Fan, Qihang, et al.
Pubblicazione: (2025)
BitMark: Watermarking Bitwise Autoregressive Image Generative Models
di: Kerner, Louis, et al.
Pubblicazione: (2025)
di: Kerner, Louis, et al.
Pubblicazione: (2025)
UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
di: Yue, Zhengrong, et al.
Pubblicazione: (2025)
di: Yue, Zhengrong, et al.
Pubblicazione: (2025)
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
di: Guo, Yiwei, et al.
Pubblicazione: (2026)
di: Guo, Yiwei, et al.
Pubblicazione: (2026)
MUSES: 3D-Controllable Image Generation via Multi-Modal Agent Collaboration
di: Ding, Yanbo, et al.
Pubblicazione: (2024)
di: Ding, Yanbo, et al.
Pubblicazione: (2024)
V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents
di: Yue, Zhengrong, et al.
Pubblicazione: (2025)
di: Yue, Zhengrong, et al.
Pubblicazione: (2025)
Multimodal Prompt Perceiver: Empower Adaptiveness, Generalizability and Fidelity for All-in-One Image Restoration
di: Ai, Yuang, et al.
Pubblicazione: (2023)
di: Ai, Yuang, et al.
Pubblicazione: (2023)
Breaking Complexity Barriers: High-Resolution Image Restoration with Rank Enhanced Linear Attention
di: Ai, Yuang, et al.
Pubblicazione: (2025)
di: Ai, Yuang, et al.
Pubblicazione: (2025)
Uncertainty-Aware Source-Free Adaptive Image Super-Resolution with Wavelet Augmentation Transformer
di: Ai, Yuang, et al.
Pubblicazione: (2023)
di: Ai, Yuang, et al.
Pubblicazione: (2023)
WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
TransAgent: Transfer Vision-Language Foundation Models with Heterogeneous Agent Collaboration
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning
di: Han, Xiaotian, et al.
Pubblicazione: (2024)
di: Han, Xiaotian, et al.
Pubblicazione: (2024)
DreamClear: High-Capacity Real-World Image Restoration with Privacy-Safe Dataset Curation
di: Ai, Yuang, et al.
Pubblicazione: (2024)
di: Ai, Yuang, et al.
Pubblicazione: (2024)
Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Models
di: Ge, Shiran, et al.
Pubblicazione: (2025)
di: Ge, Shiran, et al.
Pubblicazione: (2025)
MaskBit: Embedding-free Image Generation via Bit Tokens
di: Weber, Mark, et al.
Pubblicazione: (2024)
di: Weber, Mark, et al.
Pubblicazione: (2024)
LinearSR: Unlocking Linear Attention for Stable and Efficient Image Super-Resolution
di: Li, Xiaohui, et al.
Pubblicazione: (2025)
di: Li, Xiaohui, et al.
Pubblicazione: (2025)
Multimodal Long Video Modeling Based on Temporal Dynamic Context
di: Hao, Haoran, et al.
Pubblicazione: (2025)
di: Hao, Haoran, et al.
Pubblicazione: (2025)
RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models
di: Hao, Haoran, et al.
Pubblicazione: (2024)
di: Hao, Haoran, et al.
Pubblicazione: (2024)
Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation
di: Feng, Yunhai, et al.
Pubblicazione: (2025)
di: Feng, Yunhai, et al.
Pubblicazione: (2025)
Video-GPT via Next Clip Diffusion
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
Stopping Computation for Converged Tokens in Masked Diffusion-LM Decoding
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
Unlocking the Potential of Difficulty Prior in RL-based Multimodal Reasoning
di: Chen, Mingrui, et al.
Pubblicazione: (2025)
di: Chen, Mingrui, et al.
Pubblicazione: (2025)
LM-Fix: Lightweight Bit-Flip Detection and Rapid Recovery Framework for Language Models
di: Tahmasivand, Ahmad, et al.
Pubblicazione: (2025)
di: Tahmasivand, Ahmad, et al.
Pubblicazione: (2025)
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization
di: Jo, Daejin, et al.
Pubblicazione: (2025)
di: Jo, Daejin, et al.
Pubblicazione: (2025)
Binary Numbers and Bitwise Magic: A Fun Guide
di: Samruddhi Bhabad
Pubblicazione: (2025)
di: Samruddhi Bhabad
Pubblicazione: (2025)
On the Performance under Hard and Soft Bitwise Mismatched-Decoding
di: Yoshida, Tsuyoshi, et al.
Pubblicazione: (2020)
di: Yoshida, Tsuyoshi, et al.
Pubblicazione: (2020)
Trainable Bitwise Soft Quantization for Input Feature Compression
di: Schrödter, Karsten, et al.
Pubblicazione: (2026)
di: Schrödter, Karsten, et al.
Pubblicazione: (2026)
DiffVSR: Revealing an Effective Recipe for Taming Robust Video Super-Resolution Against Complex Degradations
di: Li, Xiaohui, et al.
Pubblicazione: (2025)
di: Li, Xiaohui, et al.
Pubblicazione: (2025)
MapBERT: Bitwise Masked Modeling for Real-Time Semantic Mapping Generation
di: Deng, Yijie, et al.
Pubblicazione: (2025)
di: Deng, Yijie, et al.
Pubblicazione: (2025)
Vlogger: Make Your Dream A Vlog
di: Zhuang, Shaobin, et al.
Pubblicazione: (2024)
di: Zhuang, Shaobin, et al.
Pubblicazione: (2024)
Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis
di: Han, Jian, et al.
Pubblicazione: (2024)
di: Han, Jian, et al.
Pubblicazione: (2024)
Vision Transformer with Super Token Sampling
di: Huang, Huaibo, et al.
Pubblicazione: (2022)
di: Huang, Huaibo, et al.
Pubblicazione: (2022)
Semantic Equitable Clustering: A Simple and Effective Strategy for Clustering Vision Tokens
di: Fan, Qihang, et al.
Pubblicazione: (2024)
di: Fan, Qihang, et al.
Pubblicazione: (2024)
SoupLM: Model Integration in Large Language and Multi-Modal Models
di: Bai, Yue, et al.
Pubblicazione: (2024)
di: Bai, Yue, et al.
Pubblicazione: (2024)
Documenti analoghi
-
BitDance: Scaling Autoregressive Generative Models with Binary Tokens
di: Ai, Yuang, et al.
Pubblicazione: (2026) -
UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model
di: Zhuang, Shaobin, et al.
Pubblicazione: (2026) -
DiCo: Revitalizing ConvNets for Scalable and Efficient Diffusion Modeling
di: Ai, Yuang, et al.
Pubblicazione: (2025) -
Random Wins All: Rethinking Grouping Strategies for Vision Tokens
di: Fan, Qihang, et al.
Pubblicazione: (2026) -
LoRA-IR: Taming Low-Rank Experts for Efficient All-in-One Image Restoration
di: Ai, Yuang, et al.
Pubblicazione: (2024)