Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Niu, Junbo, Zheng, Yuanhong, Miao, Ziyang, Dong, Hejun, Ge, Chunjiang, Liang, Hao, Lu, Ma, Zeng, Bohan, Zheng, Qiahao, He, Conghui, Zhang, Wentao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
di: Dong, Hejun, et al.
Pubblicazione: (2026)
di: Dong, Hejun, et al.
Pubblicazione: (2026)
Multimodal Reasoning for Science: Technical Report and 1st Place Solution to the ICML 2025 SeePhys Challenge
di: Liang, Hao, et al.
Pubblicazione: (2025)
di: Liang, Hao, et al.
Pubblicazione: (2025)
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
di: Li, Yifei, et al.
Pubblicazione: (2025)
di: Li, Yifei, et al.
Pubblicazione: (2025)
EVQAScore: A Fine-grained Metric for Video Question Answering Data Quality Evaluation
di: Liang, Hao, et al.
Pubblicazione: (2024)
di: Liang, Hao, et al.
Pubblicazione: (2024)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
di: Liu, Zheng, et al.
Pubblicazione: (2024)
di: Liu, Zheng, et al.
Pubblicazione: (2024)
FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding
di: Liu, Zheng, et al.
Pubblicazione: (2025)
di: Liu, Zheng, et al.
Pubblicazione: (2025)
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
di: Bai, Tianyi, et al.
Pubblicazione: (2025)
di: Bai, Tianyi, et al.
Pubblicazione: (2025)
VABench: A Comprehensive Benchmark for Audio-Video Generation
di: Hua, Daili, et al.
Pubblicazione: (2025)
di: Hua, Daili, et al.
Pubblicazione: (2025)
Multi-Agent, Human-Agent and Beyond: A Survey on Cooperation in Social Dilemmas
di: Mu, Chunjiang, et al.
Pubblicazione: (2024)
di: Mu, Chunjiang, et al.
Pubblicazione: (2024)
MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
di: Niu, Junbo, et al.
Pubblicazione: (2025)
di: Niu, Junbo, et al.
Pubblicazione: (2025)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
di: Dai, Yifan, et al.
Pubblicazione: (2026)
di: Dai, Yifan, et al.
Pubblicazione: (2026)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
di: Lee, Jewon, et al.
Pubblicazione: (2025)
di: Lee, Jewon, et al.
Pubblicazione: (2025)
LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images
di: Xu, Ruyi, et al.
Pubblicazione: (2024)
di: Xu, Ruyi, et al.
Pubblicazione: (2024)
VisionCreator: A Native Visual-Generation Agentic Model with Understanding, Thinking, Planning and Creation
di: Lai, Jinxiang, et al.
Pubblicazione: (2026)
di: Lai, Jinxiang, et al.
Pubblicazione: (2026)
Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling
di: Wang, Yuran, et al.
Pubblicazione: (2025)
di: Wang, Yuran, et al.
Pubblicazione: (2025)
LogicPuzzleRL: Cultivating Robust Mathematical Reasoning in LLMs via Reinforcement Learning
di: Wong, Zhen Hao, et al.
Pubblicazione: (2025)
di: Wong, Zhen Hao, et al.
Pubblicazione: (2025)
UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
di: Lin, Bin, et al.
Pubblicazione: (2025)
di: Lin, Bin, et al.
Pubblicazione: (2025)
Multi-Resolution Codebook Design and Multiuser Interference Management for Discrete XL-RIS-Aided Near-Field MIMO Systems
di: Zhang, Qian, et al.
Pubblicazione: (2025)
di: Zhang, Qian, et al.
Pubblicazione: (2025)
Chiroπ‐Extended Helitwistacene: Resolving the Planarity–Helicity Dilemma for Broadband Circularly Polarized Light Detection
di: Xue Wang, et al.
Pubblicazione: (2026)
di: Xue Wang, et al.
Pubblicazione: (2026)
Chiroπ‐Extended Helitwistacene: Resolving the Planarity–Helicity Dilemma for Broadband Circularly Polarized Light Detection
di: Xue Wang, et al.
Pubblicazione: (2026)
di: Xue Wang, et al.
Pubblicazione: (2026)
LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts
di: Cai, Qifeng, et al.
Pubblicazione: (2025)
di: Cai, Qifeng, et al.
Pubblicazione: (2025)
Resolving the Acquisitions Dilemma: Into the Electronic Information Environment.
di: Smith, Eldred
Pubblicazione: (1991)
di: Smith, Eldred
Pubblicazione: (1991)
TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos
di: Feng, Hengyi, et al.
Pubblicazione: (2026)
di: Feng, Hengyi, et al.
Pubblicazione: (2026)
Asynchronous Credit Assignment for Multi-Agent Reinforcement Learning
di: Liang, Yongheng, et al.
Pubblicazione: (2024)
di: Liang, Yongheng, et al.
Pubblicazione: (2024)
HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models
di: Li, Xu, et al.
Pubblicazione: (2025)
di: Li, Xu, et al.
Pubblicazione: (2025)
Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training
di: Luo, Xiangyang, et al.
Pubblicazione: (2026)
di: Luo, Xiangyang, et al.
Pubblicazione: (2026)
BEATS: Optimizing LLM Mathematical Capabilities with BackVerify and Adaptive Disambiguate based Efficient Tree Search
di: Sun, Linzhuang, et al.
Pubblicazione: (2024)
di: Sun, Linzhuang, et al.
Pubblicazione: (2024)
Gradual Learning: Optimizing Fine-Tuning with Partially Mastered Knowledge in Large Language Models
di: Li, Bozhou, et al.
Pubblicazione: (2024)
di: Li, Bozhou, et al.
Pubblicazione: (2024)
Mamba-UNet: UNet-Like Pure Visual Mamba for Medical Image Segmentation
di: Wang, Ziyang, et al.
Pubblicazione: (2024)
di: Wang, Ziyang, et al.
Pubblicazione: (2024)
ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models
di: Ge, Chunjiang, et al.
Pubblicazione: (2024)
di: Ge, Chunjiang, et al.
Pubblicazione: (2024)
UniViTAR: Unified Vision Transformer with Native Resolution
di: Qiao, Limeng, et al.
Pubblicazione: (2025)
di: Qiao, Limeng, et al.
Pubblicazione: (2025)
Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's Nature
di: Liu, Zheng, et al.
Pubblicazione: (2025)
di: Liu, Zheng, et al.
Pubblicazione: (2025)
Risk-Aware Reinforcement Learning with Bandit-Based Adaptation for Quadrupedal Locomotion
di: Zeng, Yuanhong, et al.
Pubblicazione: (2025)
di: Zeng, Yuanhong, et al.
Pubblicazione: (2025)
Demystify Mamba in Vision: A Linear Attention Perspective
di: Han, Dongchen, et al.
Pubblicazione: (2024)
di: Han, Dongchen, et al.
Pubblicazione: (2024)
Efficient Multi-Person Motion Prediction by Lightweight Spatial and Temporal Interactions
di: Zheng, Yuanhong, et al.
Pubblicazione: (2025)
di: Zheng, Yuanhong, et al.
Pubblicazione: (2025)
SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference
di: He, Yongchao, et al.
Pubblicazione: (2025)
di: He, Yongchao, et al.
Pubblicazione: (2025)
Preparation and thermal shocks of mullite‐based porous ceramic materials using the reaction sintering method
di: Chunjiang Ding
Pubblicazione: (2025)
di: Chunjiang Ding
Pubblicazione: (2025)
Multi-party Agent Relation Sampling for Multi-party Ad Hoc Teamwork
di: Zhang, Beiwen, et al.
Pubblicazione: (2025)
di: Zhang, Beiwen, et al.
Pubblicazione: (2025)
FLARE: Full-Modality Long-Video Audiovisual Retrieval Benchmark with User-Simulated Queries
di: You, Qijie, et al.
Pubblicazione: (2026)
di: You, Qijie, et al.
Pubblicazione: (2026)
Self-Supervised Visual Preference Alignment
di: Zhu, Ke, et al.
Pubblicazione: (2024)
di: Zhu, Ke, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding
di: Dong, Hejun, et al.
Pubblicazione: (2026) -
Multimodal Reasoning for Science: Technical Report and 1st Place Solution to the ICML 2025 SeePhys Challenge
di: Liang, Hao, et al.
Pubblicazione: (2025) -
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
di: Li, Yifei, et al.
Pubblicazione: (2025) -
EVQAScore: A Fine-grained Metric for Video Question Answering Data Quality Evaluation
di: Liang, Hao, et al.
Pubblicazione: (2024) -
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
di: Liu, Zheng, et al.
Pubblicazione: (2024)