Bytes Are All You Need: Transformers Operating Directly On File Bytes
Fuente:
arXiv
Saved in:
| Main Authors: | Horton, Maxwell, Mehta, Sachin, Farhadi, Ali, Rastegari, Mohammad |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Diffusion Models as Masked Audio-Video Learners
by: Nunez, Elvis, et al.
Published: (2023)
by: Nunez, Elvis, et al.
Published: (2023)
CatLIP: CLIP-level Visual Recognition Accuracy with 2.7x Faster Pre-training on Web-scale Image-Text Data
by: Mehta, Sachin, et al.
Published: (2024)
by: Mehta, Sachin, et al.
Published: (2024)
ByteNet: Rethinking Multimedia File Fragment Classification through Visual Perspectives
by: Liu, Wenyang, et al.
Published: (2024)
by: Liu, Wenyang, et al.
Published: (2024)
Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific Models
by: Vemulapalli, Raviteja, et al.
Published: (2023)
by: Vemulapalli, Raviteja, et al.
Published: (2023)
Byte-level generative predictions for forensics multimedia carving
by: Lee, Jaewon, et al.
Published: (2026)
by: Lee, Jaewon, et al.
Published: (2026)
ByteMorph: Benchmarking Instruction-Guided Image Editing with Non-Rigid Motions
by: Chang, Di, et al.
Published: (2025)
by: Chang, Di, et al.
Published: (2025)
Pairwise Comparisons Are All You Need
by: Chahine, Nicolas, et al.
Published: (2024)
by: Chahine, Nicolas, et al.
Published: (2024)
ByteEdit: Boost, Comply and Accelerate Generative Image Editing
by: Ren, Yuxi, et al.
Published: (2024)
by: Ren, Yuxi, et al.
Published: (2024)
ParameterNet: Parameters Are All You Need
by: Han, Kai, et al.
Published: (2023)
by: Han, Kai, et al.
Published: (2023)
MaTe: Images Are All You Need for Material Transfer via Diffusion Transformer
by: Huang, Nisha, et al.
Published: (2026)
by: Huang, Nisha, et al.
Published: (2026)
Unlearnable 3D Point Clouds: Class-wise Transformation Is All You Need
by: Wang, Xianlong, et al.
Published: (2024)
by: Wang, Xianlong, et al.
Published: (2024)
[MASK] is All You Need
by: Hu, Vincent Tao, et al.
Published: (2024)
by: Hu, Vincent Tao, et al.
Published: (2024)
GenFormer -- Generated Images are All You Need to Improve Robustness of Transformers on Small Datasets
by: Oehri, Sven, et al.
Published: (2024)
by: Oehri, Sven, et al.
Published: (2024)
Is Discretization Fusion All You Need for Collaborative Perception?
by: Yang, Kang, et al.
Published: (2025)
by: Yang, Kang, et al.
Published: (2025)
Attention Is All You Need For Mixture-of-Depths Routing
by: Gadhikar, Advait, et al.
Published: (2024)
by: Gadhikar, Advait, et al.
Published: (2024)
PixelBytes: Catching Unified Representation for Multimodal Generation
by: Furfaro, Fabien
Published: (2024)
by: Furfaro, Fabien
Published: (2024)
PixelBytes: Catching Unified Embedding for Multimodal Generation
by: Furfaro, Fabien
Published: (2024)
by: Furfaro, Fabien
Published: (2024)
Zoom and Shift are All You Need
by: Qin, Jiahao
Published: (2024)
by: Qin, Jiahao
Published: (2024)
Positive Label Is All You Need for Multi-Label Classification
by: Yuan, Zhixiang, et al.
Published: (2023)
by: Yuan, Zhixiang, et al.
Published: (2023)
Unsupervised Real-World Denoising: Sparsity is All You Need
by: Chihaoui, Hamadi, et al.
Published: (2025)
by: Chihaoui, Hamadi, et al.
Published: (2025)
Search is All You Need for Few-shot Anomaly Detection
by: Wang, Qishan, et al.
Published: (2025)
by: Wang, Qishan, et al.
Published: (2025)
Exchange Is All You Need for Remote Sensing Change Detection
by: Dong, Sijun, et al.
Published: (2026)
by: Dong, Sijun, et al.
Published: (2026)
Moving Object Segmentation: All You Need Is SAM (and Flow)
by: Xie, Junyu, et al.
Published: (2024)
by: Xie, Junyu, et al.
Published: (2024)
Emu3: Next-Token Prediction is All You Need
by: Wang, Xinlong, et al.
Published: (2024)
by: Wang, Xinlong, et al.
Published: (2024)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
by: Zhang, Wanpeng, et al.
Published: (2025)
by: Zhang, Wanpeng, et al.
Published: (2025)
Sparse Prior Is Not All You Need: When Differential Directionality Meets Saliency Coherence for Infrared Small Target Detection
by: Zhou, Fei, et al.
Published: (2024)
by: Zhou, Fei, et al.
Published: (2024)
Performance is not All You Need: Sustainability Considerations for Algorithms
by: Li, Xiang, et al.
Published: (2025)
by: Li, Xiang, et al.
Published: (2025)
3D representation in 512-Byte:Variational tokenizer is the key for autoregressive 3D generation
by: Zhang, Jinzhi, et al.
Published: (2024)
by: Zhang, Jinzhi, et al.
Published: (2024)
Low-Resolution Editing is All You Need for High-Resolution Editing
by: Lee, Junsung, et al.
Published: (2025)
by: Lee, Junsung, et al.
Published: (2025)
Similarity Memory Prior is All You Need for Medical Image Segmentation
by: Tang, Hao, et al.
Published: (2025)
by: Tang, Hao, et al.
Published: (2025)
SVAC: Scaling Is All You Need For Referring Video Object Segmentation
by: Zhang, Li, et al.
Published: (2025)
by: Zhang, Li, et al.
Published: (2025)
Distraction is All You Need for Multimodal Large Language Model Jailbreaking
by: Yang, Zuopeng, et al.
Published: (2025)
by: Yang, Zuopeng, et al.
Published: (2025)
All You Need to Know About Training Image Retrieval Models
by: Berton, Gabriele, et al.
Published: (2025)
by: Berton, Gabriele, et al.
Published: (2025)
Transferable-guided Attention Is All You Need for Video Domain Adaptation
by: Sacilotti, André, et al.
Published: (2024)
by: Sacilotti, André, et al.
Published: (2024)
Ideal Registration? Segmentation is All You Need
by: Chen, Xiang, et al.
Published: (2025)
by: Chen, Xiang, et al.
Published: (2025)
Enpowering Your Pansharpening Models with Generalizability: Unified Distribution is All You Need
by: Cui, Yongchuan, et al.
Published: (2025)
by: Cui, Yongchuan, et al.
Published: (2025)
A Single Image and Multimodality Is All You Need for Novel View Synthesis
by: Javadi, Amirhosein, et al.
Published: (2026)
by: Javadi, Amirhosein, et al.
Published: (2026)
SAM-CLIP: Merging Vision Foundation Models towards Semantic and Spatial Understanding
by: Wang, Haoxiang, et al.
Published: (2023)
by: Wang, Haoxiang, et al.
Published: (2023)
Memory augment is All You Need for image restoration
by: Zhang, Xiao Feng, et al.
Published: (2023)
by: Zhang, Xiao Feng, et al.
Published: (2023)
CliffordNet: All You Need is Geometric Algebra
by: Ji, Zhongping
Published: (2026)
by: Ji, Zhongping
Published: (2026)
Similar Items
-
Diffusion Models as Masked Audio-Video Learners
by: Nunez, Elvis, et al.
Published: (2023) -
CatLIP: CLIP-level Visual Recognition Accuracy with 2.7x Faster Pre-training on Web-scale Image-Text Data
by: Mehta, Sachin, et al.
Published: (2024) -
ByteNet: Rethinking Multimedia File Fragment Classification through Visual Perspectives
by: Liu, Wenyang, et al.
Published: (2024) -
Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific Models
by: Vemulapalli, Raviteja, et al.
Published: (2023) -
Byte-level generative predictions for forensics multimedia carving
by: Lee, Jaewon, et al.
Published: (2026)