PixelBytes: Catching Unified Representation for Multimodal Generation
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Furfaro, Fabien |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PixelBytes: Catching Unified Embedding for Multimodal Generation
par: Furfaro, Fabien
Publié: (2024)
par: Furfaro, Fabien
Publié: (2024)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
par: Zhang, Wanpeng, et autres
Publié: (2025)
par: Zhang, Wanpeng, et autres
Publié: (2025)
Enhancing Multimodal Unified Representations for Cross Modal Generalization
par: Huang, Hai, et autres
Publié: (2024)
par: Huang, Hai, et autres
Publié: (2024)
From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities
par: Zhang, Wanpeng, et autres
Publié: (2024)
par: Zhang, Wanpeng, et autres
Publié: (2024)
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
par: Liu, Ye, et autres
Publié: (2025)
par: Liu, Ye, et autres
Publié: (2025)
Catch-Up Mix: Catch-Up Class for Struggling Filters in CNN
par: Kang, Minsoo, et autres
Publié: (2024)
par: Kang, Minsoo, et autres
Publié: (2024)
UniEval: Unified Holistic Evaluation for Unified Multimodal Understanding and Generation
par: Li, Yi, et autres
Publié: (2025)
par: Li, Yi, et autres
Publié: (2025)
Semantic Generative Tuning for Unified Multimodal Models
par: Yu, Songsong, et autres
Publié: (2026)
par: Yu, Songsong, et autres
Publié: (2026)
GLaMM: Pixel Grounding Large Multimodal Model
par: Rasheed, Hanoona, et autres
Publié: (2023)
par: Rasheed, Hanoona, et autres
Publié: (2023)
Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models
par: Kim, Jeonghwan, et autres
Publié: (2026)
par: Kim, Jeonghwan, et autres
Publié: (2026)
The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents
par: Sun, Yuwei, et autres
Publié: (2026)
par: Sun, Yuwei, et autres
Publié: (2026)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
par: Qu, Liao, et autres
Publié: (2024)
par: Qu, Liao, et autres
Publié: (2024)
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
par: Mao, Jiawei, et autres
Publié: (2025)
par: Mao, Jiawei, et autres
Publié: (2025)
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
par: Liu, Zeyu, et autres
Publié: (2026)
par: Liu, Zeyu, et autres
Publié: (2026)
Towards a Multimodal Large Language Model with Pixel-Level Insight for Biomedicine
par: Huang, Xiaoshuang, et autres
Publié: (2024)
par: Huang, Xiaoshuang, et autres
Publié: (2024)
OmniCam: Unified Multimodal Video Generation via Camera Control
par: Yang, Xiaoda, et autres
Publié: (2025)
par: Yang, Xiaoda, et autres
Publié: (2025)
NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
par: Zhang, Huichao, et autres
Publié: (2026)
par: Zhang, Huichao, et autres
Publié: (2026)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
Archon: A Unified Multimodal Model for Holistic Digital Human Generation
par: Bao, Chong, et autres
Publié: (2026)
par: Bao, Chong, et autres
Publié: (2026)
CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook
par: Chen, Zeyu, et autres
Publié: (2026)
par: Chen, Zeyu, et autres
Publié: (2026)
RaPD: Resolution-Agnostic Pixel Diffusion via Semantics-Enriched Implicit Representations
par: Ge, Yanhao, et autres
Publié: (2026)
par: Ge, Yanhao, et autres
Publié: (2026)
Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification
par: Chen, Zizhao, et autres
Publié: (2026)
par: Chen, Zizhao, et autres
Publié: (2026)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
par: Jiao, Yang, et autres
Publié: (2025)
par: Jiao, Yang, et autres
Publié: (2025)
UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding
par: Xu, Chenkai, et autres
Publié: (2025)
par: Xu, Chenkai, et autres
Publié: (2025)
Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation
par: AI, Inclusion, et autres
Publié: (2025)
par: AI, Inclusion, et autres
Publié: (2025)
PixelGen: Improving Pixel Diffusion with Perceptual Supervision
par: Ma, Zehong, et autres
Publié: (2026)
par: Ma, Zehong, et autres
Publié: (2026)
CAFe: Unifying Representation and Generation with Contrastive-Autoregressive Finetuning
par: Yu, Hao, et autres
Publié: (2025)
par: Yu, Hao, et autres
Publié: (2025)
From Skeletons to Pixels: Few-Shot Precise Event Spotting via Representation and Prediction Distillation
par: Yeoh, Zhong Han Ervin, et autres
Publié: (2026)
par: Yeoh, Zhong Han Ervin, et autres
Publié: (2026)
UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing
par: Li, Yiheng, et autres
Publié: (2024)
par: Li, Yiheng, et autres
Publié: (2024)
UniFashion: A Unified Vision-Language Model for Multimodal Fashion Retrieval and Generation
par: Zhao, Xiangyu, et autres
Publié: (2024)
par: Zhao, Xiangyu, et autres
Publié: (2024)
Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
par: Pu, Yuandong, et autres
Publié: (2025)
par: Pu, Yuandong, et autres
Publié: (2025)
PixelArena: A benchmark for Pixel-Precision Visual Intelligence
par: Liang, Feng, et autres
Publié: (2025)
par: Liang, Feng, et autres
Publié: (2025)
Pixel-Aligned Multi-View Generation with Depth Guided Decoder
par: Tang, Zhenggang, et autres
Publié: (2024)
par: Tang, Zhenggang, et autres
Publié: (2024)
L2P: Unlocking Latent Potential for Pixel Generation
par: Chen, Zhennan, et autres
Publié: (2026)
par: Chen, Zhennan, et autres
Publié: (2026)
PixelMan: Consistent Object Editing with Diffusion Models via Pixel Manipulation and Generation
par: Jiang, Liyao, et autres
Publié: (2024)
par: Jiang, Liyao, et autres
Publié: (2024)
SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding
par: Sheng, Zihao, et autres
Publié: (2025)
par: Sheng, Zihao, et autres
Publié: (2025)
Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation
par: Wu, Chengyue, et autres
Publié: (2024)
par: Wu, Chengyue, et autres
Publié: (2024)
MergeVQ: A Unified Framework for Visual Generation and Representation with Disentangled Token Merging and Quantization
par: Li, Siyuan, et autres
Publié: (2025)
par: Li, Siyuan, et autres
Publié: (2025)
Understanding and Harnessing Sparsity in Unified Multimodal Models
par: He, Shwai, et autres
Publié: (2025)
par: He, Shwai, et autres
Publié: (2025)
Humor in Pixels: Benchmarking Large Multimodal Models Understanding of Online Comics
par: Ryan, Yuriel, et autres
Publié: (2025)
par: Ryan, Yuriel, et autres
Publié: (2025)
Documents similaires
-
PixelBytes: Catching Unified Embedding for Multimodal Generation
par: Furfaro, Fabien
Publié: (2024) -
Unified Multimodal Understanding via Byte-Pair Visual Encoding
par: Zhang, Wanpeng, et autres
Publié: (2025) -
Enhancing Multimodal Unified Representations for Cross Modal Generalization
par: Huang, Hai, et autres
Publié: (2024) -
From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities
par: Zhang, Wanpeng, et autres
Publié: (2024) -
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
par: Liu, Ye, et autres
Publié: (2025)