ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution
Fuente:
arXiv
Salvato in:
| Autori principali: | Cui, Long, Wang, Weiyun, Shao, Jie, Wen, Zichen, Luo, Gen, Zhang, Linfeng, Zhang, Yanting, Qiao, Yu, Wang, Wenhai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
di: Yang, Yantai, et al.
Pubblicazione: (2025)
di: Yang, Yantai, et al.
Pubblicazione: (2025)
Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models
di: Ke, Junlong, et al.
Pubblicazione: (2026)
di: Ke, Junlong, et al.
Pubblicazione: (2026)
Sequential Diffusion Language Models
di: Liu, Yangzhou, et al.
Pubblicazione: (2025)
di: Liu, Yangzhou, et al.
Pubblicazione: (2025)
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
di: Luo, Gen, et al.
Pubblicazione: (2025)
di: Luo, Gen, et al.
Pubblicazione: (2025)
UniViTAR: Unified Vision Transformer with Native Resolution
di: Qiao, Limeng, et al.
Pubblicazione: (2025)
di: Qiao, Limeng, et al.
Pubblicazione: (2025)
AgentSlimming: Towards Efficient and Cost-Aware Multi-Agent Systems
di: Chen, Yulang, et al.
Pubblicazione: (2026)
di: Chen, Yulang, et al.
Pubblicazione: (2026)
NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
di: Tian, Changyao, et al.
Pubblicazione: (2025)
di: Tian, Changyao, et al.
Pubblicazione: (2025)
Point or Line? Using Line-based Representation for Panoptic Symbol Spotting in CAD Drawings
di: Wei, Xingguang, et al.
Pubblicazione: (2025)
di: Wei, Xingguang, et al.
Pubblicazione: (2025)
MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
di: Lei, Zhenxin, et al.
Pubblicazione: (2025)
di: Lei, Zhenxin, et al.
Pubblicazione: (2025)
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
di: Chen, Junting, et al.
Pubblicazione: (2025)
di: Chen, Junting, et al.
Pubblicazione: (2025)
GenExam: A Multidisciplinary Text-to-Image Exam
di: Wang, Zhaokai, et al.
Pubblicazione: (2025)
di: Wang, Zhaokai, et al.
Pubblicazione: (2025)
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
di: Zou, Dongyun, et al.
Pubblicazione: (2026)
di: Zou, Dongyun, et al.
Pubblicazione: (2026)
Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning
di: Ke, Junlong, et al.
Pubblicazione: (2026)
di: Ke, Junlong, et al.
Pubblicazione: (2026)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
di: Wen, Zichen, et al.
Pubblicazione: (2025)
di: Wen, Zichen, et al.
Pubblicazione: (2025)
Outlier-Aware Post-Training Quantization for Image Super-Resolution
di: Wang, Hailing, et al.
Pubblicazione: (2025)
di: Wang, Hailing, et al.
Pubblicazione: (2025)
Dynamic-Aware Video Distillation: Optimizing Temporal Resolution Based on Video Semantics
di: Zhao, Yinjie, et al.
Pubblicazione: (2025)
di: Zhao, Yinjie, et al.
Pubblicazione: (2025)
Diffusion LLM with Native Variable Generation Lengths: Let [EOS] Lead the Way
di: Yang, Yicun, et al.
Pubblicazione: (2025)
di: Yang, Yicun, et al.
Pubblicazione: (2025)
Learning Optimal Distributionally Robust Individualized Treatment Rules Integrating Multi-Source Data
di: Cui, Wenhai, et al.
Pubblicazione: (2026)
di: Cui, Wenhai, et al.
Pubblicazione: (2026)
STAMICS: Splat, Track And Map with Integrated Consistency and Semantics for Dense RGB-D SLAM
di: Wang, Yongxu, et al.
Pubblicazione: (2025)
di: Wang, Yongxu, et al.
Pubblicazione: (2025)
Demystify Transformers & Convolutions in Modern Image Deep Networks
di: Hu, Xiaowei, et al.
Pubblicazione: (2022)
di: Hu, Xiaowei, et al.
Pubblicazione: (2022)
Semantic-Aware Adversarial Training for Reliable Deep Hashing Retrieval
di: Yuan, Xu, et al.
Pubblicazione: (2023)
di: Yuan, Xu, et al.
Pubblicazione: (2023)
Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More
di: Wen, Zichen, et al.
Pubblicazione: (2025)
di: Wen, Zichen, et al.
Pubblicazione: (2025)
Needle In A Multimodal Haystack
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
di: Duan, Yuchen, et al.
Pubblicazione: (2024)
di: Duan, Yuchen, et al.
Pubblicazione: (2024)
A Fault Diagnosis Method for Avionics Equipment Based on SMOTEWB‐LGBM
di: Gen Li, et al.
Pubblicazione: (2024)
di: Gen Li, et al.
Pubblicazione: (2024)
ExtraVAR: Stage-Aware RoPE Remapping for Resolution Extrapolation in Visual Autoregressive Models
di: Yan, Feihong, et al.
Pubblicazione: (2026)
di: Yan, Feihong, et al.
Pubblicazione: (2026)
Trio-ViT: Post-Training Quantization and Acceleration for Softmax-Free Efficient Vision Transformer
di: Shi, Huihong, et al.
Pubblicazione: (2024)
di: Shi, Huihong, et al.
Pubblicazione: (2024)
Thinking Inside the Mask: In-Place Prompting in Diffusion LLMs
di: Jin, Xiangqi, et al.
Pubblicazione: (2025)
di: Jin, Xiangqi, et al.
Pubblicazione: (2025)
OminiAdapt: Learning Cross-Task Invariance for Robust and Environment-Aware Robotic Manipulation
di: Wang, Yongxu, et al.
Pubblicazione: (2025)
di: Wang, Yongxu, et al.
Pubblicazione: (2025)
Maximizing the spectral radius of graphs of given size with forbidden a subgraph
di: Zhang, Yanting, et al.
Pubblicazione: (2024)
di: Zhang, Yanting, et al.
Pubblicazione: (2024)
The All-Seeing Project V2: Towards General Relation Comprehension of the Open World
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
REEF: Representation Encoding Fingerprints for Large Language Models
di: Zhang, Jie, et al.
Pubblicazione: (2024)
di: Zhang, Jie, et al.
Pubblicazione: (2024)
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
di: Yang, Ganlin, et al.
Pubblicazione: (2025)
di: Yang, Ganlin, et al.
Pubblicazione: (2025)
SiamSeg: Self-Training with Contrastive Learning for Unsupervised Domain Adaptation Semantic Segmentation in Remote Sensing
di: Wang, Bin, et al.
Pubblicazione: (2024)
di: Wang, Bin, et al.
Pubblicazione: (2024)
Text-IF: Leveraging Semantic Text Guidance for Degradation-Aware and Interactive Image Fusion
di: Yi, Xunpeng, et al.
Pubblicazione: (2024)
di: Yi, Xunpeng, et al.
Pubblicazione: (2024)
Harnessing Ash for Sustainable CO2 Absorption: Current Strategies and Future Prospects
di: Wen‐Ya Wu, et al.
Pubblicazione: (2024)
di: Wen‐Ya Wu, et al.
Pubblicazione: (2024)
PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding
di: Zhang, Haoze, et al.
Pubblicazione: (2025)
di: Zhang, Haoze, et al.
Pubblicazione: (2025)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
ViPOcc: Leveraging Visual Priors from Vision Foundation Models for Single-View 3D Occupancy Prediction
di: Feng, Yi, et al.
Pubblicazione: (2024)
di: Feng, Yi, et al.
Pubblicazione: (2024)
ZO-SAM: Zero-Order Sharpness-Aware Minimization for Efficient Sparse Training
di: Ji, Jie, et al.
Pubblicazione: (2026)
di: Ji, Jie, et al.
Pubblicazione: (2026)
Documenti analoghi
-
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
di: Yang, Yantai, et al.
Pubblicazione: (2025) -
Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models
di: Ke, Junlong, et al.
Pubblicazione: (2026) -
Sequential Diffusion Language Models
di: Liu, Yangzhou, et al.
Pubblicazione: (2025) -
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
di: Luo, Gen, et al.
Pubblicazione: (2025) -
UniViTAR: Unified Vision Transformer with Native Resolution
di: Qiao, Limeng, et al.
Pubblicazione: (2025)