1.58-bit FLUX
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Chenglin, Liu, Celong, Deng, Xueqing, Kim, Dongwon, Mei, Xing, Shen, Xiaohui, Chen, Liang-Chieh |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional Tokens
by: Kim, Dongwon, et al.
Published: (2025)
by: Kim, Dongwon, et al.
Published: (2025)
COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation
by: Deng, Xueqing, et al.
Published: (2025)
by: Deng, Xueqing, et al.
Published: (2025)
COCONut: Modernizing COCO Segmentation
by: Deng, Xueqing, et al.
Published: (2024)
by: Deng, Xueqing, et al.
Published: (2024)
Randomized Autoregressive Visual Generation
by: Yu, Qihang, et al.
Published: (2024)
by: Yu, Qihang, et al.
Published: (2024)
NanoFLUX: Distillation-Driven Compression of Large Text-to-Image Generation Models for Mobile Devices
by: Chavhan, Ruchika, et al.
Published: (2026)
by: Chavhan, Ruchika, et al.
Published: (2026)
An intuitive multi-frequency feature representation for SO(3)-equivariant networks
by: Son, Dongwon, et al.
Published: (2024)
by: Son, Dongwon, et al.
Published: (2024)
DEF-oriCORN: efficient 3D scene understanding for robust language-directed manipulation without demonstrations
by: Son, Dongwon, et al.
Published: (2024)
by: Son, Dongwon, et al.
Published: (2024)
Does FLUX Already Know How to Perform Physically Plausible Image Composition?
by: Lu, Shilin, et al.
Published: (2025)
by: Lu, Shilin, et al.
Published: (2025)
An Image is Worth 32 Tokens for Reconstruction and Generation
by: Yu, Qihang, et al.
Published: (2024)
by: Yu, Qihang, et al.
Published: (2024)
Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models
by: Yang, Jiaxi, et al.
Published: (2026)
by: Yang, Jiaxi, et al.
Published: (2026)
Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference
by: Kang, Beomseok, et al.
Published: (2026)
by: Kang, Beomseok, et al.
Published: (2026)
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
by: Yuan, Zhengqing, et al.
Published: (2024)
by: Yuan, Zhengqing, et al.
Published: (2024)
Proto-OOD: Enhancing OOD Object Detection with Prototype Feature Similarity
by: Chen, Junkun, et al.
Published: (2024)
by: Chen, Junkun, et al.
Published: (2024)
ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation
by: Athar, Ali, et al.
Published: (2024)
by: Athar, Ali, et al.
Published: (2024)
Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding
by: Li, Chenglin, et al.
Published: (2025)
by: Li, Chenglin, et al.
Published: (2025)
Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Model
by: Kim, Dongwon, et al.
Published: (2026)
by: Kim, Dongwon, et al.
Published: (2026)
MeteorPred: A Meteorological Multimodal Large Model and Dataset for Severe Weather Event Prediction
by: Tang, Shuo, et al.
Published: (2025)
by: Tang, Shuo, et al.
Published: (2025)
A Simple Video Segmenter by Tracking Objects Along Axial Trajectories
by: He, Ju, et al.
Published: (2023)
by: He, Ju, et al.
Published: (2023)
Seeing Beyond 8bits: Subjective and Objective Quality Assessment of HDR-UGC Videos
by: Saini, Shreshth, et al.
Published: (2026)
by: Saini, Shreshth, et al.
Published: (2026)
Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection
by: Han, Mingfei, et al.
Published: (2025)
by: Han, Mingfei, et al.
Published: (2025)
BitNet b1.58 Reloaded: State-of-the-art Performance Also on Smaller Networks
by: Nielsen, Jacob, et al.
Published: (2024)
by: Nielsen, Jacob, et al.
Published: (2024)
Exploring the Limits of Semantic Image Compression at Micro-bits per Pixel
by: Dotzel, Jordan, et al.
Published: (2024)
by: Dotzel, Jordan, et al.
Published: (2024)
A Generalized Label Shift Perspective for Cross-Domain Gaze Estimation
by: Yang, Hao-Ran, et al.
Published: (2025)
by: Yang, Hao-Ran, et al.
Published: (2025)
AttnMod: Attention-Based New Art Styles
by: Su, Shih-Chieh
Published: (2024)
by: Su, Shih-Chieh
Published: (2024)
VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models
by: Li, Chenglin, et al.
Published: (2024)
by: Li, Chenglin, et al.
Published: (2024)
CORENet: Cross-Modal 4D Radar Denoising Network with LiDAR Supervision for Autonomous Driving
by: Liu, Fuyang, et al.
Published: (2025)
by: Liu, Fuyang, et al.
Published: (2025)
When Small Guides Large: Cross-Model Co-Learning for Test-Time Adaptation
by: Yi, Chang'an, et al.
Published: (2025)
by: Yi, Chang'an, et al.
Published: (2025)
Deeply Supervised Flow-Based Generative Models
by: Shin, Inkyu, et al.
Published: (2025)
by: Shin, Inkyu, et al.
Published: (2025)
InsectMamba: Insect Pest Classification with State Space Model
by: Wang, Qianning, et al.
Published: (2024)
by: Wang, Qianning, et al.
Published: (2024)
UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images
by: Li, Siqi, et al.
Published: (2025)
by: Li, Siqi, et al.
Published: (2025)
2K-Characters-10K-Stories: A Quality-Gated Stylized Narrative Dataset with Disentangled Control and Sequence Consistency
by: Yin, Xingxi, et al.
Published: (2025)
by: Yin, Xingxi, et al.
Published: (2025)
Measuring the Unspoken: A Disentanglement Model and Benchmark for Psychological Analysis in the Wild
by: Feng, Yigui, et al.
Published: (2025)
by: Feng, Yigui, et al.
Published: (2025)
Pomo3D: 3D-Aware Portrait Accessorizing and More
by: Liu, Tzu-Chieh, et al.
Published: (2024)
by: Liu, Tzu-Chieh, et al.
Published: (2024)
An interpretable framework using foundation models for fish sex identification
by: Miao, Zheng, et al.
Published: (2026)
by: Miao, Zheng, et al.
Published: (2026)
Truth in the Few: High-Value Data Selection for Efficient Multi-Modal Reasoning
by: Li, Shenshen, et al.
Published: (2025)
by: Li, Shenshen, et al.
Published: (2025)
SDQ-LLM: Sigma-Delta Quantization for 1-bit LLMs of any size
by: Xia, Junhao, et al.
Published: (2025)
by: Xia, Junhao, et al.
Published: (2025)
MaskBit: Embedding-free Image Generation via Bit Tokens
by: Weber, Mark, et al.
Published: (2024)
by: Weber, Mark, et al.
Published: (2024)
Fake-in-Facext: Towards Fine-Grained Explainable DeepFake Analysis
by: Qin, Lixiong, et al.
Published: (2025)
by: Qin, Lixiong, et al.
Published: (2025)
ColorEdit: Training-free Image-Guided Color editing with diffusion model
by: Yin, Xingxi, et al.
Published: (2024)
by: Yin, Xingxi, et al.
Published: (2024)
Depth Map Denoising Network and Lightweight Fusion Network for Enhanced 3D Face Recognition
by: Xu, Ruizhuo, et al.
Published: (2024)
by: Xu, Ruizhuo, et al.
Published: (2024)
Similar Items
-
Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional Tokens
by: Kim, Dongwon, et al.
Published: (2025) -
COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation
by: Deng, Xueqing, et al.
Published: (2025) -
COCONut: Modernizing COCO Segmentation
by: Deng, Xueqing, et al.
Published: (2024) -
Randomized Autoregressive Visual Generation
by: Yu, Qihang, et al.
Published: (2024) -
NanoFLUX: Distillation-Driven Compression of Large Text-to-Image Generation Models for Mobile Devices
by: Chavhan, Ruchika, et al.
Published: (2026)