OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence
Fuente:
arXiv
Salvato in:
| Autori principali: | Tang, Feilong, An, Xiang, Yan, Yunyao, Xie, Yin, Qin, Bin, Yang, Kaicheng, Shen, Yifei, Zhang, Yuanhan, Li, Chunyuan, Feng, Shikun, Chen, Changrui, Tan, Huajie, Hu, Ming, Zhang, Manyuan, Li, Bo, Feng, Ziyong, Liu, Ziwei, Ge, Zongyuan, Deng, Jiankang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
di: An, Xiang, et al.
Pubblicazione: (2026)
di: An, Xiang, et al.
Pubblicazione: (2026)
LLaVA-OneVision: Easy Visual Task Transfer
di: Li, Bo, et al.
Pubblicazione: (2024)
di: Li, Bo, et al.
Pubblicazione: (2024)
LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
di: An, Xiang, et al.
Pubblicazione: (2025)
di: An, Xiang, et al.
Pubblicazione: (2025)
Multi-label Cluster Discrimination for Visual Representation Learning
di: An, Xiang, et al.
Pubblicazione: (2024)
di: An, Xiang, et al.
Pubblicazione: (2024)
RWKV-CLIP: A Robust Vision-Language Representation Learner
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
PaCo-FR: Patch-Pixel Aligned End-to-End Codebook Learning for Facial Representation Pre-training
di: Xie, Yin, et al.
Pubblicazione: (2025)
di: Xie, Yin, et al.
Pubblicazione: (2025)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning
di: Gu, Tiancheng, et al.
Pubblicazione: (2025)
di: Gu, Tiancheng, et al.
Pubblicazione: (2025)
LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
di: Li, Feng, et al.
Pubblicazione: (2024)
di: Li, Feng, et al.
Pubblicazione: (2024)
CLIP-CID: Efficient CLIP Distillation via Cluster-Instance Discrimination
di: Yang, Kaicheng, et al.
Pubblicazione: (2024)
di: Yang, Kaicheng, et al.
Pubblicazione: (2024)
AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
di: Chen, Bowei, et al.
Pubblicazione: (2025)
di: Chen, Bowei, et al.
Pubblicazione: (2025)
RealSyn: An Effective and Scalable Multimodal Interleaved Document Transformation Paradigm
di: Gu, Tiancheng, et al.
Pubblicazione: (2025)
di: Gu, Tiancheng, et al.
Pubblicazione: (2025)
Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs
di: Gu, Tiancheng, et al.
Pubblicazione: (2025)
di: Gu, Tiancheng, et al.
Pubblicazione: (2025)
Gradient-Attention Guided Dual-Masking Synergetic Framework for Robust Text-based Person Retrieval
di: Zheng, Tianlu, et al.
Pubblicazione: (2025)
di: Zheng, Tianlu, et al.
Pubblicazione: (2025)
High-Fidelity Facial Albedo Estimation via Texture Quantization
di: Ran, Zimin, et al.
Pubblicazione: (2024)
di: Ran, Zimin, et al.
Pubblicazione: (2024)
CodecCap: High-Fidelity Codec-Inspired Residual Modeling for Dense Video Captioning
di: Lin, Zihan, et al.
Pubblicazione: (2026)
di: Lin, Zihan, et al.
Pubblicazione: (2026)
1st Place Solution to the 1st SkatingVerse Challenge
di: Sun, Tao, et al.
Pubblicazione: (2024)
di: Sun, Tao, et al.
Pubblicazione: (2024)
OneVision: An End-to-End Generative Framework for Multi-view E-commerce Vision Search
di: Zheng, Zexin, et al.
Pubblicazione: (2025)
di: Zheng, Zexin, et al.
Pubblicazione: (2025)
Long Context Transfer from Language to Vision
di: Zhang, Peiyuan, et al.
Pubblicazione: (2024)
di: Zhang, Peiyuan, et al.
Pubblicazione: (2024)
ORID: Organ-Regional Information Driven Framework for Radiology Report Generation
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
ViCToR: Improving Visual Comprehension via Token Reconstruction for Pretraining LMMs
di: Xie, Yin, et al.
Pubblicazione: (2024)
di: Xie, Yin, et al.
Pubblicazione: (2024)
OSCAR: One-Step Diffusion Codec Across Multiple Bit-rates
di: Guo, Jinpei, et al.
Pubblicazione: (2025)
di: Guo, Jinpei, et al.
Pubblicazione: (2025)
Decoupled Global-Local Alignment for Improving Compositional Understanding
di: Hu, Xiaoxing, et al.
Pubblicazione: (2025)
di: Hu, Xiaoxing, et al.
Pubblicazione: (2025)
Efficient, Validation-Free Intrinsic Quality Estimation for Large-Scale Face Recognition Datasets
di: Chen, Zhichao, et al.
Pubblicazione: (2026)
di: Chen, Zhichao, et al.
Pubblicazione: (2026)
LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
di: Zhang, Kaichen, et al.
Pubblicazione: (2024)
di: Zhang, Kaichen, et al.
Pubblicazione: (2024)
StableCodec: Taming One-Step Diffusion for Extreme Image Compression
di: Zhang, Tianyu, et al.
Pubblicazione: (2025)
di: Zhang, Tianyu, et al.
Pubblicazione: (2025)
IDAdapter: Learning Mixed Features for Tuning-Free Personalization of Text-to-Image Models
di: Cui, Siying, et al.
Pubblicazione: (2024)
di: Cui, Siying, et al.
Pubblicazione: (2024)
SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
di: Qiang, Chunyu, et al.
Pubblicazione: (2025)
di: Qiang, Chunyu, et al.
Pubblicazione: (2025)
Hunting Attributes: Context Prototype-Aware Learning for Weakly Supervised Semantic Segmentation
di: Tang, Feilong, et al.
Pubblicazione: (2024)
di: Tang, Feilong, et al.
Pubblicazione: (2024)
CodecLM: Aligning Language Models with Tailored Synthetic Data
di: Wang, Zifeng, et al.
Pubblicazione: (2024)
di: Wang, Zifeng, et al.
Pubblicazione: (2024)
Region-based Cluster Discrimination for Visual Representation Learning
di: Xie, Yin, et al.
Pubblicazione: (2025)
di: Xie, Yin, et al.
Pubblicazione: (2025)
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
di: Zhang, Ruohong, et al.
Pubblicazione: (2024)
di: Zhang, Ruohong, et al.
Pubblicazione: (2024)
DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners
di: Luo, Xiaoxue, et al.
Pubblicazione: (2025)
di: Luo, Xiaoxue, et al.
Pubblicazione: (2025)
Transferring Annotator- and Instance-dependent Transition Matrix for Learning from Crowds
di: Li, Shikun, et al.
Pubblicazione: (2023)
di: Li, Shikun, et al.
Pubblicazione: (2023)
Generalized Category Discovery under Domain Shift: A Frequency Domain Perspective
di: Feng, Wei, et al.
Pubblicazione: (2025)
di: Feng, Wei, et al.
Pubblicazione: (2025)
MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning
di: Liu, Xiaoyang, et al.
Pubblicazione: (2024)
di: Liu, Xiaoyang, et al.
Pubblicazione: (2024)
DermAgent: A Self-Reflective Agentic System for Dermatological Image Analysis with Multi-Tool Reasoning and Traceable Decision-Making
di: Liu, Yize, et al.
Pubblicazione: (2026)
di: Liu, Yize, et al.
Pubblicazione: (2026)
OneThinker: All-in-one Reasoning Model for Image and Video
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning
di: Zheng, Dian, et al.
Pubblicazione: (2026)
di: Zheng, Dian, et al.
Pubblicazione: (2026)
UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards
di: Wang, Jun, et al.
Pubblicazione: (2026)
di: Wang, Jun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
di: An, Xiang, et al.
Pubblicazione: (2026) -
LLaVA-OneVision: Easy Visual Task Transfer
di: Li, Bo, et al.
Pubblicazione: (2024) -
LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
di: An, Xiang, et al.
Pubblicazione: (2025) -
Multi-label Cluster Discrimination for Visual Representation Learning
di: An, Xiang, et al.
Pubblicazione: (2024) -
RWKV-CLIP: A Robust Vision-Language Representation Learner
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)