Small Language Model Meets with Reinforced Vision Vocabulary
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wei, Haoran, Kong, Lingyu, Chen, Jinyue, Zhao, Liang, Ge, Zheng, Yu, En, Sun, Jianjian, Han, Chunrui, Zhang, Xiangyu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
OneChart: Purify the Chart Structural Extraction via One Auxiliary Token
von: Chen, Jinyue, et al.
Veröffentlicht: (2024)
von: Chen, Jinyue, et al.
Veröffentlicht: (2024)
Focus Anywhere for Fine-grained Multi-page Document Understanding
von: Liu, Chenglong, et al.
Veröffentlicht: (2024)
von: Liu, Chenglong, et al.
Veröffentlicht: (2024)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
von: Wei, Haoran, et al.
Veröffentlicht: (2024)
von: Wei, Haoran, et al.
Veröffentlicht: (2024)
Perception-R1: Pioneering Perception Policy with Reinforcement Learning
von: Yu, En, et al.
Veröffentlicht: (2025)
von: Yu, En, et al.
Veröffentlicht: (2025)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
von: Wei, Yana, et al.
Veröffentlicht: (2025)
von: Wei, Yana, et al.
Veröffentlicht: (2025)
Merlin:Empowering Multimodal LLMs with Foresight Minds
von: Yu, En, et al.
Veröffentlicht: (2023)
von: Yu, En, et al.
Veröffentlicht: (2023)
Exploring Recurrent Long-term Temporal Fusion for Multi-view 3D Perception
von: Han, Chunrui, et al.
Veröffentlicht: (2023)
von: Han, Chunrui, et al.
Veröffentlicht: (2023)
Perception in Reflection
von: Wei, Yana, et al.
Veröffentlicht: (2025)
von: Wei, Yana, et al.
Veröffentlicht: (2025)
Unhackable Temporal Rewarding for Scalable Video MLLMs
von: Yu, En, et al.
Veröffentlicht: (2025)
von: Yu, En, et al.
Veröffentlicht: (2025)
DreamLLM: Synergistic Multimodal Comprehension and Creation
von: Dong, Runpei, et al.
Veröffentlicht: (2023)
von: Dong, Runpei, et al.
Veröffentlicht: (2023)
Slow Perception: Let's Perceive Geometric Figures Step-by-step
von: Wei, Haoran, et al.
Veröffentlicht: (2024)
von: Wei, Haoran, et al.
Veröffentlicht: (2024)
Open-Vocabulary Camouflaged Object Segmentation with Cascaded Vision Language Models
von: Zhao, Kai, et al.
Veröffentlicht: (2025)
von: Zhao, Kai, et al.
Veröffentlicht: (2025)
ShapeLLM: Universal 3D Object Understanding for Embodied Interaction
von: Qi, Zekun, et al.
Veröffentlicht: (2024)
von: Qi, Zekun, et al.
Veröffentlicht: (2024)
Training A Small Emotional Vision Language Model for Visual Art Comprehension
von: Zhang, Jing, et al.
Veröffentlicht: (2024)
von: Zhang, Jing, et al.
Veröffentlicht: (2024)
Adapting Vision-Language Model with Fine-grained Semantics for Open-Vocabulary Segmentation
von: Chng, Yong Xien, et al.
Veröffentlicht: (2024)
von: Chng, Yong Xien, et al.
Veröffentlicht: (2024)
Vocabulary-free few-shot learning for Vision-Language Models
von: Zanella, Maxime, et al.
Veröffentlicht: (2025)
von: Zanella, Maxime, et al.
Veröffentlicht: (2025)
QuoVLA: Quotient Space for Vision-Language-Action Models
von: Wang, Xuan, et al.
Veröffentlicht: (2026)
von: Wang, Xuan, et al.
Veröffentlicht: (2026)
Boosting Segment Anything Model Towards Open-Vocabulary Learning
von: Han, Xumeng, et al.
Veröffentlicht: (2023)
von: Han, Xumeng, et al.
Veröffentlicht: (2023)
Bilateral Collaboration with Large Vision-Language Models for Open Vocabulary Human-Object Interaction Detection
von: Hu, Yupeng, et al.
Veröffentlicht: (2025)
von: Hu, Yupeng, et al.
Veröffentlicht: (2025)
SEDEG:Sequential Enhancement of Decoder and Encoder's Generality for Class Incremental Learning with Small Memory
von: Chen, Hongyang, et al.
Veröffentlicht: (2025)
von: Chen, Hongyang, et al.
Veröffentlicht: (2025)
OVER-NAV: Elevating Iterative Vision-and-Language Navigation with Open-Vocabulary Detection and StructurEd Representation
von: Zhao, Ganlong, et al.
Veröffentlicht: (2024)
von: Zhao, Ganlong, et al.
Veröffentlicht: (2024)
LightZeroNav: Zero-Shot Vision Language Navigation in Continuous Environments Based on Lightweight VLMs
von: Luo, Kun, et al.
Veröffentlicht: (2026)
von: Luo, Kun, et al.
Veröffentlicht: (2026)
Swarm Intelligence in Geo-Localization: A Multi-Agent Large Vision-Language Model Collaborative Framework
von: Han, Xiao, et al.
Veröffentlicht: (2024)
von: Han, Xiao, et al.
Veröffentlicht: (2024)
Cascade Prompt Learning for Vision-Language Model Adaptation
von: Wu, Ge, et al.
Veröffentlicht: (2024)
von: Wu, Ge, et al.
Veröffentlicht: (2024)
Beyond-Labels: Advancing Open-Vocabulary Segmentation With Vision-Language Models
von: Rahman, Muhammad Atta ur, et al.
Veröffentlicht: (2025)
von: Rahman, Muhammad Atta ur, et al.
Veröffentlicht: (2025)
Improving Large Vision-Language Models' Understanding for Flow Field Data
von: Zhang, Xiaomei, et al.
Veröffentlicht: (2025)
von: Zhang, Xiaomei, et al.
Veröffentlicht: (2025)
DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation
von: Peng, Yuang, et al.
Veröffentlicht: (2024)
von: Peng, Yuang, et al.
Veröffentlicht: (2024)
Histopathology Image Report Generation by Vision Language Model with Multimodal In-Context Learning
von: Liu, Shih-Wen, et al.
Veröffentlicht: (2025)
von: Liu, Shih-Wen, et al.
Veröffentlicht: (2025)
OVTR: End-to-End Open-Vocabulary Multiple Object Tracking with Transformer
von: Li, Jinyang, et al.
Veröffentlicht: (2025)
von: Li, Jinyang, et al.
Veröffentlicht: (2025)
MarvelOVD: Marrying Object Recognition and Vision-Language Models for Robust Open-Vocabulary Object Detection
von: Wang, Kuo, et al.
Veröffentlicht: (2024)
von: Wang, Kuo, et al.
Veröffentlicht: (2024)
VLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic Manipulation
von: Bian, Jinyue, et al.
Veröffentlicht: (2025)
von: Bian, Jinyue, et al.
Veröffentlicht: (2025)
Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
von: Li, Ling, et al.
Veröffentlicht: (2025)
von: Li, Ling, et al.
Veröffentlicht: (2025)
Adversarial Prompt Tuning for Vision-Language Models
von: Zhang, Jiaming, et al.
Veröffentlicht: (2023)
von: Zhang, Jiaming, et al.
Veröffentlicht: (2023)
Collaborative Vision-Text Representation Optimizing for Open-Vocabulary Segmentation
von: Jiao, Siyu, et al.
Veröffentlicht: (2024)
von: Jiao, Siyu, et al.
Veröffentlicht: (2024)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
von: Cao, Sihan, et al.
Veröffentlicht: (2026)
von: Cao, Sihan, et al.
Veröffentlicht: (2026)
PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
von: Zhang, Jianshu, et al.
Veröffentlicht: (2026)
von: Zhang, Jianshu, et al.
Veröffentlicht: (2026)
Beyond Visual Field of View: Perceiving 3D Environment with Echoes and Vision
von: Zhu, Lingyu, et al.
Veröffentlicht: (2022)
von: Zhu, Lingyu, et al.
Veröffentlicht: (2022)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
von: Cao, Jianjian, et al.
Veröffentlicht: (2024)
von: Cao, Jianjian, et al.
Veröffentlicht: (2024)
Exploring Vision-Language Models for Open-Vocabulary Zero-Shot Action Segmentation
von: Unmesh, Asim, et al.
Veröffentlicht: (2026)
von: Unmesh, Asim, et al.
Veröffentlicht: (2026)
Test-Time Adaptation of Vision-Language Models for Open-Vocabulary Semantic Segmentation
von: Noori, Mehrdad, et al.
Veröffentlicht: (2025)
von: Noori, Mehrdad, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
OneChart: Purify the Chart Structural Extraction via One Auxiliary Token
von: Chen, Jinyue, et al.
Veröffentlicht: (2024) -
Focus Anywhere for Fine-grained Multi-page Document Understanding
von: Liu, Chenglong, et al.
Veröffentlicht: (2024) -
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
von: Wei, Haoran, et al.
Veröffentlicht: (2024) -
Perception-R1: Pioneering Perception Policy with Reinforcement Learning
von: Yu, En, et al.
Veröffentlicht: (2025) -
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
von: Wei, Yana, et al.
Veröffentlicht: (2025)