VisualRWKV-HD and UHD: Advancing High-Resolution Processing for Visual Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Zihang, Hou, Haowen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VisualRWKV: Exploring Recurrent Neural Networks for Visual Language Models
von: Hou, Haowen, et al.
Veröffentlicht: (2024)
von: Hou, Haowen, et al.
Veröffentlicht: (2024)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
von: Lee, Jewon, et al.
Veröffentlicht: (2025)
von: Lee, Jewon, et al.
Veröffentlicht: (2025)
Can Vision-Language Models Solve Visual Math Equations?
von: Choudhury, Monjoy Narayan, et al.
Veröffentlicht: (2025)
von: Choudhury, Monjoy Narayan, et al.
Veröffentlicht: (2025)
AdaCodec: A Predictive Visual Code for Video MLLMs
von: Hou, Haowen, et al.
Veröffentlicht: (2026)
von: Hou, Haowen, et al.
Veröffentlicht: (2026)
Red Teaming Visual Language Models
von: Li, Mukai, et al.
Veröffentlicht: (2024)
von: Li, Mukai, et al.
Veröffentlicht: (2024)
LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs
von: Sun, Shichu, et al.
Veröffentlicht: (2025)
von: Sun, Shichu, et al.
Veröffentlicht: (2025)
UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
von: Lin, Bin, et al.
Veröffentlicht: (2025)
von: Lin, Bin, et al.
Veröffentlicht: (2025)
Advancing High Resolution Vision-Language Models in Biomedicine
von: Chen, Zekai, et al.
Veröffentlicht: (2024)
von: Chen, Zekai, et al.
Veröffentlicht: (2024)
Visually Descriptive Language Model for Vector Graphics Reasoning
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2024)
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2024)
GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models
von: Li, Mukai, et al.
Veröffentlicht: (2024)
von: Li, Mukai, et al.
Veröffentlicht: (2024)
Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding
von: Chen, Zhanpeng, et al.
Veröffentlicht: (2025)
von: Chen, Zhanpeng, et al.
Veröffentlicht: (2025)
Better Language Models Exhibit Higher Visual Alignment
von: Ruthardt, Jona, et al.
Veröffentlicht: (2024)
von: Ruthardt, Jona, et al.
Veröffentlicht: (2024)
Semantically-Prompted Language Models Improve Visual Descriptions
von: Ogezi, Michael, et al.
Veröffentlicht: (2023)
von: Ogezi, Michael, et al.
Veröffentlicht: (2023)
LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images
von: Xu, Ruyi, et al.
Veröffentlicht: (2024)
von: Xu, Ruyi, et al.
Veröffentlicht: (2024)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
von: Zhang, Wenqiao, et al.
Veröffentlicht: (2024)
von: Zhang, Wenqiao, et al.
Veröffentlicht: (2024)
Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
von: Tartaglini, Alexa R., et al.
Veröffentlicht: (2025)
von: Tartaglini, Alexa R., et al.
Veröffentlicht: (2025)
Unbiased Visual Reasoning with Controlled Visual Inputs
von: Li, Zhaonan, et al.
Veröffentlicht: (2025)
von: Li, Zhaonan, et al.
Veröffentlicht: (2025)
Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers
von: Wen, Yuxin, et al.
Veröffentlicht: (2024)
von: Wen, Yuxin, et al.
Veröffentlicht: (2024)
HAWAII: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models
von: Wang, Yimu, et al.
Veröffentlicht: (2025)
von: Wang, Yimu, et al.
Veröffentlicht: (2025)
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
von: Luo, Jiayun, et al.
Veröffentlicht: (2025)
von: Luo, Jiayun, et al.
Veröffentlicht: (2025)
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
von: Qiu, Yifu, et al.
Veröffentlicht: (2025)
von: Qiu, Yifu, et al.
Veröffentlicht: (2025)
High Efficiency Image Compression for Large Visual-Language Models
von: Li, Binzhe, et al.
Veröffentlicht: (2024)
von: Li, Binzhe, et al.
Veröffentlicht: (2024)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
von: Tang, Zicong, et al.
Veröffentlicht: (2025)
von: Tang, Zicong, et al.
Veröffentlicht: (2025)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
LLM-Optic: Unveiling the Capabilities of Large Language Models for Universal Visual Grounding
von: Zhao, Haoyu, et al.
Veröffentlicht: (2024)
von: Zhao, Haoyu, et al.
Veröffentlicht: (2024)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
von: Zhou, Qiji, et al.
Veröffentlicht: (2024)
von: Zhou, Qiji, et al.
Veröffentlicht: (2024)
Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models
von: Lee, Yi-Lun, et al.
Veröffentlicht: (2024)
von: Lee, Yi-Lun, et al.
Veröffentlicht: (2024)
Visually Guided Decoding: Gradient-Free Hard Prompt Inversion with Language Models
von: Kim, Donghoon, et al.
Veröffentlicht: (2025)
von: Kim, Donghoon, et al.
Veröffentlicht: (2025)
On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models
von: Seo, Hoigi, et al.
Veröffentlicht: (2025)
von: Seo, Hoigi, et al.
Veröffentlicht: (2025)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
von: Zhou, Kaiwen, et al.
Veröffentlicht: (2023)
von: Zhou, Kaiwen, et al.
Veröffentlicht: (2023)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
von: Zhang, Juntian, et al.
Veröffentlicht: (2025)
von: Zhang, Juntian, et al.
Veröffentlicht: (2025)
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
von: Xiong, Guangzhi, et al.
Veröffentlicht: (2026)
von: Xiong, Guangzhi, et al.
Veröffentlicht: (2026)
Griffon v2: Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-Referring
von: Zhan, Yufei, et al.
Veröffentlicht: (2024)
von: Zhan, Yufei, et al.
Veröffentlicht: (2024)
VIALM: A Survey and Benchmark of Visually Impaired Assistance with Large Models
von: Zhao, Yi, et al.
Veröffentlicht: (2024)
von: Zhao, Yi, et al.
Veröffentlicht: (2024)
Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language Models
von: Woo, Sangmin, et al.
Veröffentlicht: (2025)
von: Woo, Sangmin, et al.
Veröffentlicht: (2025)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
von: Huang, Kung-Hsiang, et al.
Veröffentlicht: (2025)
von: Huang, Kung-Hsiang, et al.
Veröffentlicht: (2025)
Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition
von: Choi, Dasol, et al.
Veröffentlicht: (2025)
von: Choi, Dasol, et al.
Veröffentlicht: (2025)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
von: Zhang, Beichen, et al.
Veröffentlicht: (2025)
von: Zhang, Beichen, et al.
Veröffentlicht: (2025)
CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning
von: Li, Kailing, et al.
Veröffentlicht: (2025)
von: Li, Kailing, et al.
Veröffentlicht: (2025)
Euclid: Supercharging Multimodal LLMs with Synthetic High-Fidelity Visual Descriptions
von: Zhang, Jiarui, et al.
Veröffentlicht: (2024)
von: Zhang, Jiarui, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
VisualRWKV: Exploring Recurrent Neural Networks for Visual Language Models
von: Hou, Haowen, et al.
Veröffentlicht: (2024) -
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
von: Lee, Jewon, et al.
Veröffentlicht: (2025) -
Can Vision-Language Models Solve Visual Math Equations?
von: Choudhury, Monjoy Narayan, et al.
Veröffentlicht: (2025) -
AdaCodec: A Predictive Visual Code for Video MLLMs
von: Hou, Haowen, et al.
Veröffentlicht: (2026) -
Red Teaming Visual Language Models
von: Li, Mukai, et al.
Veröffentlicht: (2024)