Bytes Are All You Need: Transformers Operating Directly On File Bytes
Fuente:
arXiv
Guardado en:
| Autores principales: | Horton, Maxwell, Mehta, Sachin, Farhadi, Ali, Rastegari, Mohammad |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Diffusion Models as Masked Audio-Video Learners
por: Nunez, Elvis, et al.
Publicado: (2023)
por: Nunez, Elvis, et al.
Publicado: (2023)
CatLIP: CLIP-level Visual Recognition Accuracy with 2.7x Faster Pre-training on Web-scale Image-Text Data
por: Mehta, Sachin, et al.
Publicado: (2024)
por: Mehta, Sachin, et al.
Publicado: (2024)
ByteNet: Rethinking Multimedia File Fragment Classification through Visual Perspectives
por: Liu, Wenyang, et al.
Publicado: (2024)
por: Liu, Wenyang, et al.
Publicado: (2024)
Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific Models
por: Vemulapalli, Raviteja, et al.
Publicado: (2023)
por: Vemulapalli, Raviteja, et al.
Publicado: (2023)
Byte-level generative predictions for forensics multimedia carving
por: Lee, Jaewon, et al.
Publicado: (2026)
por: Lee, Jaewon, et al.
Publicado: (2026)
ByteMorph: Benchmarking Instruction-Guided Image Editing with Non-Rigid Motions
por: Chang, Di, et al.
Publicado: (2025)
por: Chang, Di, et al.
Publicado: (2025)
Pairwise Comparisons Are All You Need
por: Chahine, Nicolas, et al.
Publicado: (2024)
por: Chahine, Nicolas, et al.
Publicado: (2024)
ByteEdit: Boost, Comply and Accelerate Generative Image Editing
por: Ren, Yuxi, et al.
Publicado: (2024)
por: Ren, Yuxi, et al.
Publicado: (2024)
ParameterNet: Parameters Are All You Need
por: Han, Kai, et al.
Publicado: (2023)
por: Han, Kai, et al.
Publicado: (2023)
MaTe: Images Are All You Need for Material Transfer via Diffusion Transformer
por: Huang, Nisha, et al.
Publicado: (2026)
por: Huang, Nisha, et al.
Publicado: (2026)
Unlearnable 3D Point Clouds: Class-wise Transformation Is All You Need
por: Wang, Xianlong, et al.
Publicado: (2024)
por: Wang, Xianlong, et al.
Publicado: (2024)
[MASK] is All You Need
por: Hu, Vincent Tao, et al.
Publicado: (2024)
por: Hu, Vincent Tao, et al.
Publicado: (2024)
GenFormer -- Generated Images are All You Need to Improve Robustness of Transformers on Small Datasets
por: Oehri, Sven, et al.
Publicado: (2024)
por: Oehri, Sven, et al.
Publicado: (2024)
Is Discretization Fusion All You Need for Collaborative Perception?
por: Yang, Kang, et al.
Publicado: (2025)
por: Yang, Kang, et al.
Publicado: (2025)
Attention Is All You Need For Mixture-of-Depths Routing
por: Gadhikar, Advait, et al.
Publicado: (2024)
por: Gadhikar, Advait, et al.
Publicado: (2024)
PixelBytes: Catching Unified Representation for Multimodal Generation
por: Furfaro, Fabien
Publicado: (2024)
por: Furfaro, Fabien
Publicado: (2024)
PixelBytes: Catching Unified Embedding for Multimodal Generation
por: Furfaro, Fabien
Publicado: (2024)
por: Furfaro, Fabien
Publicado: (2024)
Zoom and Shift are All You Need
por: Qin, Jiahao
Publicado: (2024)
por: Qin, Jiahao
Publicado: (2024)
Positive Label Is All You Need for Multi-Label Classification
por: Yuan, Zhixiang, et al.
Publicado: (2023)
por: Yuan, Zhixiang, et al.
Publicado: (2023)
Unsupervised Real-World Denoising: Sparsity is All You Need
por: Chihaoui, Hamadi, et al.
Publicado: (2025)
por: Chihaoui, Hamadi, et al.
Publicado: (2025)
Search is All You Need for Few-shot Anomaly Detection
por: Wang, Qishan, et al.
Publicado: (2025)
por: Wang, Qishan, et al.
Publicado: (2025)
Exchange Is All You Need for Remote Sensing Change Detection
por: Dong, Sijun, et al.
Publicado: (2026)
por: Dong, Sijun, et al.
Publicado: (2026)
Moving Object Segmentation: All You Need Is SAM (and Flow)
por: Xie, Junyu, et al.
Publicado: (2024)
por: Xie, Junyu, et al.
Publicado: (2024)
Emu3: Next-Token Prediction is All You Need
por: Wang, Xinlong, et al.
Publicado: (2024)
por: Wang, Xinlong, et al.
Publicado: (2024)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
por: Zhang, Wanpeng, et al.
Publicado: (2025)
por: Zhang, Wanpeng, et al.
Publicado: (2025)
Sparse Prior Is Not All You Need: When Differential Directionality Meets Saliency Coherence for Infrared Small Target Detection
por: Zhou, Fei, et al.
Publicado: (2024)
por: Zhou, Fei, et al.
Publicado: (2024)
Performance is not All You Need: Sustainability Considerations for Algorithms
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
3D representation in 512-Byte:Variational tokenizer is the key for autoregressive 3D generation
por: Zhang, Jinzhi, et al.
Publicado: (2024)
por: Zhang, Jinzhi, et al.
Publicado: (2024)
Low-Resolution Editing is All You Need for High-Resolution Editing
por: Lee, Junsung, et al.
Publicado: (2025)
por: Lee, Junsung, et al.
Publicado: (2025)
Similarity Memory Prior is All You Need for Medical Image Segmentation
por: Tang, Hao, et al.
Publicado: (2025)
por: Tang, Hao, et al.
Publicado: (2025)
SVAC: Scaling Is All You Need For Referring Video Object Segmentation
por: Zhang, Li, et al.
Publicado: (2025)
por: Zhang, Li, et al.
Publicado: (2025)
Distraction is All You Need for Multimodal Large Language Model Jailbreaking
por: Yang, Zuopeng, et al.
Publicado: (2025)
por: Yang, Zuopeng, et al.
Publicado: (2025)
All You Need to Know About Training Image Retrieval Models
por: Berton, Gabriele, et al.
Publicado: (2025)
por: Berton, Gabriele, et al.
Publicado: (2025)
Transferable-guided Attention Is All You Need for Video Domain Adaptation
por: Sacilotti, André, et al.
Publicado: (2024)
por: Sacilotti, André, et al.
Publicado: (2024)
Ideal Registration? Segmentation is All You Need
por: Chen, Xiang, et al.
Publicado: (2025)
por: Chen, Xiang, et al.
Publicado: (2025)
Enpowering Your Pansharpening Models with Generalizability: Unified Distribution is All You Need
por: Cui, Yongchuan, et al.
Publicado: (2025)
por: Cui, Yongchuan, et al.
Publicado: (2025)
A Single Image and Multimodality Is All You Need for Novel View Synthesis
por: Javadi, Amirhosein, et al.
Publicado: (2026)
por: Javadi, Amirhosein, et al.
Publicado: (2026)
SAM-CLIP: Merging Vision Foundation Models towards Semantic and Spatial Understanding
por: Wang, Haoxiang, et al.
Publicado: (2023)
por: Wang, Haoxiang, et al.
Publicado: (2023)
Memory augment is All You Need for image restoration
por: Zhang, Xiao Feng, et al.
Publicado: (2023)
por: Zhang, Xiao Feng, et al.
Publicado: (2023)
CliffordNet: All You Need is Geometric Algebra
por: Ji, Zhongping
Publicado: (2026)
por: Ji, Zhongping
Publicado: (2026)
Ejemplares similares
-
Diffusion Models as Masked Audio-Video Learners
por: Nunez, Elvis, et al.
Publicado: (2023) -
CatLIP: CLIP-level Visual Recognition Accuracy with 2.7x Faster Pre-training on Web-scale Image-Text Data
por: Mehta, Sachin, et al.
Publicado: (2024) -
ByteNet: Rethinking Multimedia File Fragment Classification through Visual Perspectives
por: Liu, Wenyang, et al.
Publicado: (2024) -
Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific Models
por: Vemulapalli, Raviteja, et al.
Publicado: (2023) -
Byte-level generative predictions for forensics multimedia carving
por: Lee, Jaewon, et al.
Publicado: (2026)