VisionPangu: A Compact and Fine-Grained Multimodal Assistant with 1.7B Parameters
Fuente:
arXiv
Salvato in:
| Autori principali: | Fan, Jiaxin, Song, Wenpo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants
di: Huang, Haochen, et al.
Pubblicazione: (2025)
di: Huang, Haochen, et al.
Pubblicazione: (2025)
Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
di: Bai, Tianyi, et al.
Pubblicazione: (2025)
di: Bai, Tianyi, et al.
Pubblicazione: (2025)
CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era
di: Cheng, Kanzhi, et al.
Pubblicazione: (2025)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2025)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning
di: Wang, Yeyuan, et al.
Pubblicazione: (2025)
di: Wang, Yeyuan, et al.
Pubblicazione: (2025)
Enhancing Fine-Grained Image Classifications via Cascaded Vision Language Models
di: Wei, Canshi
Pubblicazione: (2024)
di: Wei, Canshi
Pubblicazione: (2024)
MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency
di: Zhang, Junzhe, et al.
Pubblicazione: (2024)
di: Zhang, Junzhe, et al.
Pubblicazione: (2024)
Towards Harmless Multimodal Assistants with Blind Preference Optimization
di: Li, Yongqi, et al.
Pubblicazione: (2025)
di: Li, Yongqi, et al.
Pubblicazione: (2025)
Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization
di: Song, Yuhang, et al.
Pubblicazione: (2024)
di: Song, Yuhang, et al.
Pubblicazione: (2024)
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
di: Cui, Chenhang, et al.
Pubblicazione: (2024)
di: Cui, Chenhang, et al.
Pubblicazione: (2024)
Mipha: A Comprehensive Overhaul of Multimodal Assistant with Small Language Models
di: Zhu, Minjie, et al.
Pubblicazione: (2024)
di: Zhu, Minjie, et al.
Pubblicazione: (2024)
PEFT A2Z: Parameter-Efficient Fine-Tuning Survey for Large Language and Vision Models
di: Prottasha, Nusrat Jahan, et al.
Pubblicazione: (2025)
di: Prottasha, Nusrat Jahan, et al.
Pubblicazione: (2025)
African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification
di: Geigle, Gregor, et al.
Pubblicazione: (2024)
di: Geigle, Gregor, et al.
Pubblicazione: (2024)
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
di: Kim, Jeonghwan, et al.
Pubblicazione: (2024)
di: Kim, Jeonghwan, et al.
Pubblicazione: (2024)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
di: Jiang, Jiachen, et al.
Pubblicazione: (2025)
di: Jiang, Jiachen, et al.
Pubblicazione: (2025)
Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning
di: Zhao, Zhixian, et al.
Pubblicazione: (2026)
di: Zhao, Zhixian, et al.
Pubblicazione: (2026)
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding
di: Tian, Xueyun, et al.
Pubblicazione: (2026)
di: Tian, Xueyun, et al.
Pubblicazione: (2026)
Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization
di: Deng, Haolin, et al.
Pubblicazione: (2026)
di: Deng, Haolin, et al.
Pubblicazione: (2026)
Learning Compact Vision Tokens for Efficient Large Multimodal Models
di: Tang, Hao, et al.
Pubblicazione: (2025)
di: Tang, Hao, et al.
Pubblicazione: (2025)
Do Vision Encoders Truly Explain Object Hallucination?: Mitigating Object Hallucination via Simple Fine-Grained CLIPScore
di: Oh, Hongseok, et al.
Pubblicazione: (2025)
di: Oh, Hongseok, et al.
Pubblicazione: (2025)
You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction
di: Lawrence, Logan, et al.
Pubblicazione: (2025)
di: Lawrence, Logan, et al.
Pubblicazione: (2025)
FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension
di: Liu, Junzhuo, et al.
Pubblicazione: (2024)
di: Liu, Junzhuo, et al.
Pubblicazione: (2024)
Open-Source Image Editing Models Are Zero-Shot Vision Learners
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
di: Jin, Weiyang, et al.
Pubblicazione: (2025)
di: Jin, Weiyang, et al.
Pubblicazione: (2025)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
di: Wang, Zhecan, et al.
Pubblicazione: (2023)
di: Wang, Zhecan, et al.
Pubblicazione: (2023)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
di: Kim, Geewook, et al.
Pubblicazione: (2024)
di: Kim, Geewook, et al.
Pubblicazione: (2024)
ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention
di: Liu, Wenjie, et al.
Pubblicazione: (2026)
di: Liu, Wenjie, et al.
Pubblicazione: (2026)
Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
di: Shen, Yifan, et al.
Pubblicazione: (2025)
di: Shen, Yifan, et al.
Pubblicazione: (2025)
ICM-Assistant: Instruction-tuning Multimodal Large Language Models for Rule-based Explainable Image Content Moderation
di: Wu, Mengyang, et al.
Pubblicazione: (2024)
di: Wu, Mengyang, et al.
Pubblicazione: (2024)
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
di: Liu, Peng, et al.
Pubblicazione: (2025)
di: Liu, Peng, et al.
Pubblicazione: (2025)
Improving Brain-to-Image Reconstruction via Fine-Grained Text Bridging
di: Xia, Runze, et al.
Pubblicazione: (2025)
di: Xia, Runze, et al.
Pubblicazione: (2025)
Real-Time Multimodal Cognitive Assistant for Emergency Medical Services
di: Weerasinghe, Keshara, et al.
Pubblicazione: (2024)
di: Weerasinghe, Keshara, et al.
Pubblicazione: (2024)
ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
di: Feng, Sicheng, et al.
Pubblicazione: (2025)
ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting
di: Fields, Clayton, et al.
Pubblicazione: (2026)
di: Fields, Clayton, et al.
Pubblicazione: (2026)
Image Captioning via Compact Bidirectional Architecture
di: Song, Zijie, et al.
Pubblicazione: (2022)
di: Song, Zijie, et al.
Pubblicazione: (2022)
MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging
di: Bao, Zhijie, et al.
Pubblicazione: (2026)
di: Bao, Zhijie, et al.
Pubblicazione: (2026)
LLM-based Hierarchical Concept Decomposition for Interpretable Fine-Grained Image Classification
di: Qu, Renyi, et al.
Pubblicazione: (2024)
di: Qu, Renyi, et al.
Pubblicazione: (2024)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
di: Lim, Qi Zhi, et al.
Pubblicazione: (2025)
di: Lim, Qi Zhi, et al.
Pubblicazione: (2025)
MMGeoLM: Hard Negative Contrastive Learning for Fine-Grained Geometric Understanding in Large Multimodal Models
di: Sun, Kai, et al.
Pubblicazione: (2025)
di: Sun, Kai, et al.
Pubblicazione: (2025)
BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models
di: Arnould, Ludovic, et al.
Pubblicazione: (2025)
di: Arnould, Ludovic, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants
di: Huang, Haochen, et al.
Pubblicazione: (2025) -
Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
di: Bai, Tianyi, et al.
Pubblicazione: (2025) -
CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era
di: Cheng, Kanzhi, et al.
Pubblicazione: (2025) -
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
di: Li, Yue, et al.
Pubblicazione: (2025) -
ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning
di: Wang, Yeyuan, et al.
Pubblicazione: (2025)