ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters
Fuente:
arXiv
Guardado en:
| Autores principales: | Hansen-Estruch, Philippe, Chen, Jiahui, Ramanujan, Vivek, Zohar, Orr, Ping, Yan, Sinha, Animesh, Georgopoulos, Markos, Schoenfeld, Edgar, Hou, Ji, Juefei-Xu, Felix, Vishwanath, Sriram, Thabet, Ali |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Unified Auto-Encoding with Masked Diffusion
por: Hansen-Estruch, Philippe, et al.
Publicado: (2024)
por: Hansen-Estruch, Philippe, et al.
Publicado: (2024)
Learnings from Scaling Visual Tokenizers for Reconstruction and Generation
por: Hansen-Estruch, Philippe, et al.
Publicado: (2025)
por: Hansen-Estruch, Philippe, et al.
Publicado: (2025)
MultiTok: Variable-Length Tokenization for Efficient LLMs Adapted from LZW Compression
por: Elias, Noel, et al.
Publicado: (2024)
por: Elias, Noel, et al.
Publicado: (2024)
Apollo: An Exploration of Video Understanding in Large Multimodal Models
por: Zohar, Orr, et al.
Publicado: (2024)
por: Zohar, Orr, et al.
Publicado: (2024)
Judge Decoding: Faster Speculative Sampling Requires Going Beyond Model Alignment
por: Bachmann, Gregor, et al.
Publicado: (2025)
por: Bachmann, Gregor, et al.
Publicado: (2025)
Autoregressive Distillation of Diffusion Transformers
por: Kim, Yeongmin, et al.
Publicado: (2025)
por: Kim, Yeongmin, et al.
Publicado: (2025)
StreamDiT: Real-Time Streaming Text-to-Video Generation
por: Kodaira, Akio, et al.
Publicado: (2025)
por: Kodaira, Akio, et al.
Publicado: (2025)
Minimax Rates for Hyperbolic Hierarchical Learning
por: Rawal, Divit, et al.
Publicado: (2026)
por: Rawal, Divit, et al.
Publicado: (2026)
Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders
por: Dokme, Atahan, et al.
Publicado: (2026)
por: Dokme, Atahan, et al.
Publicado: (2026)
FlexiDiT: Your Diffusion Transformer Can Easily Generate High-Quality Samples with Less Compute
por: Anagnostidis, Sotiris, et al.
Publicado: (2025)
por: Anagnostidis, Sotiris, et al.
Publicado: (2025)
NativeTok: Native Visual Tokenization for Improved Image Generation
por: Wu, Bin, et al.
Publicado: (2026)
por: Wu, Bin, et al.
Publicado: (2026)
GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image Generation
por: Xiong, Tianwei, et al.
Publicado: (2025)
por: Xiong, Tianwei, et al.
Publicado: (2025)
ProofBridge: Auto-Formalization of Natural Language Proofs in Lean via Joint Embeddings
por: Jana, Prithwish, et al.
Publicado: (2025)
por: Jana, Prithwish, et al.
Publicado: (2025)
Mean Field Analysis of Blockchain Systems
por: Georghiades, Yanni, et al.
Publicado: (2026)
por: Georghiades, Yanni, et al.
Publicado: (2026)
Symbolic Regression via Latent Iterative Refinement
por: Chu, Xieting, et al.
Publicado: (2026)
por: Chu, Xieting, et al.
Publicado: (2026)
Algebraic generators of the skein algebra of a surface
por: Santharoubane, Ramanujan
Publicado: (2018)
por: Santharoubane, Ramanujan
Publicado: (2018)
Los suicidios / Joan Estruch, Salvador Cardús
por: Estruch, Joan
Publicado: (1982)
por: Estruch, Joan
Publicado: (1982)
Fundar, gobernar y rezar. Una aproximación a los vínculos entre sociedad, política y religión en el Jujuy colonial (1656-1776)
por: Dolores Estruch
Publicado: (2009)
por: Dolores Estruch
Publicado: (2009)
Paula López Caballero y Christophe Giudicelli (eds.), Regímenes de alteridad. Estados-Nación y alteridades indígenas en América Latina, 1810-1950, México, Universidad de los Andes / Universidad Nacional de Villa María / Universidad Nacional Autónoma de México, 2019, 292 páginas
por: Dolores Estruch
Publicado: (2020)
por: Dolores Estruch
Publicado: (2020)
Similarity Functions for Structured Data.An Application to Decision Trees
por: V. Estruch
Publicado: (2006)
por: V. Estruch
Publicado: (2006)
Ritual, cambio social y secularización. Un estudio de caso en el Jujuy de fines del período colonial
por: Dolores Estruch
Publicado: (2017)
por: Dolores Estruch
Publicado: (2017)
LA JUSTICIA Y LA ESPERA EN UNA JURISDICCIÓN COLONIAL EN LOS MÁRGENES DE LA MONARQUÍA, SAN SALVADOR DE JUJUY
por: Dolores Estruch
Publicado: (2020)
por: Dolores Estruch
Publicado: (2020)
Sivik Psychosomaticism test and test of Operational Style. Construct validity: relationship with a Swedish Mood Adjective Check List MACL
por: Rebecca Schoenfeld
Publicado: (2002)
por: Rebecca Schoenfeld
Publicado: (2002)
Improving DeFi Mechanisms with Dynamic Games and Optimal Control: A Case Study in Stablecoins
por: Strohmeyer, Nicholas, et al.
Publicado: (2024)
por: Strohmeyer, Nicholas, et al.
Publicado: (2024)
Leveraging the Context through Multi-Round Interactions for Jailbreaking Attacks
por: Cheng, Yixin, et al.
Publicado: (2024)
por: Cheng, Yixin, et al.
Publicado: (2024)
Multilinear Operator Networks
por: Cheng, Yixin, et al.
Publicado: (2024)
por: Cheng, Yixin, et al.
Publicado: (2024)
Discrete Graph Auto-Encoder
por: Boget, Yoann, et al.
Publicado: (2023)
por: Boget, Yoann, et al.
Publicado: (2023)
Quantum Circuit AutoEncoder
por: Wu, Jun, et al.
Publicado: (2023)
por: Wu, Jun, et al.
Publicado: (2023)
Differential Informed Auto-Encoder
por: Zhang, Jinrui
Publicado: (2024)
por: Zhang, Jinrui
Publicado: (2024)
Las transformaciones en la Salud Pública Cubana
por: Luis Estruch Rancaño
Publicado: (2013)
por: Luis Estruch Rancaño
Publicado: (2013)
17 años construyendo una idea. Nuestro homenaje al Comandante en Jefe Fidel Castro Ruz, en su 90 cumpleaños
por: Luis Estruch Rancaño
Publicado: (2016)
por: Luis Estruch Rancaño
Publicado: (2016)
UNIVERSIDAD SALUDABLE EN LA ESCUELA LATINOAMERICANA DE MEDICINA
por: Luis Estruch Rancaño
Publicado: (2017)
por: Luis Estruch Rancaño
Publicado: (2017)
AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
por: Chen, Bowei, et al.
Publicado: (2025)
por: Chen, Bowei, et al.
Publicado: (2025)
When Worse is Better: Navigating the compression-generation tradeoff in visual tokenization
por: Ramanujan, Vivek, et al.
Publicado: (2024)
por: Ramanujan, Vivek, et al.
Publicado: (2024)
Hybrid Beamforming for Millimeter Wave Full-Duplex under Limited Receive Dynamic Range
por: Roberts, Ian P., et al.
Publicado: (2020)
por: Roberts, Ian P., et al.
Publicado: (2020)
Enhancing K-user Interference Alignment for Discrete Constellations via Learning
por: Mishra, Rajesh, et al.
Publicado: (2024)
por: Mishra, Rajesh, et al.
Publicado: (2024)
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
por: Wang, Xiaohan, et al.
Publicado: (2024)
por: Wang, Xiaohan, et al.
Publicado: (2024)
Beyond safety net value(s): Tourist hotel rooms for people experiencing homelessness
por: Naomi C. Schoenfeld
Publicado: (2025)
por: Naomi C. Schoenfeld
Publicado: (2025)
Hacia un nuevo modelo de gobernanza para la promoción de la salud
por: Esther Nissán Schoenfeld
Publicado: (2019)
por: Esther Nissán Schoenfeld
Publicado: (2019)
Como Nós Pensamos
por: Alan H. Schoenfeld
Publicado: (2012)
por: Alan H. Schoenfeld
Publicado: (2012)
Ejemplares similares
-
Unified Auto-Encoding with Masked Diffusion
por: Hansen-Estruch, Philippe, et al.
Publicado: (2024) -
Learnings from Scaling Visual Tokenizers for Reconstruction and Generation
por: Hansen-Estruch, Philippe, et al.
Publicado: (2025) -
MultiTok: Variable-Length Tokenization for Efficient LLMs Adapted from LZW Compression
por: Elias, Noel, et al.
Publicado: (2024) -
Apollo: An Exploration of Video Understanding in Large Multimodal Models
por: Zohar, Orr, et al.
Publicado: (2024) -
Judge Decoding: Faster Speculative Sampling Requires Going Beyond Model Alignment
por: Bachmann, Gregor, et al.
Publicado: (2025)